🏆 TopRankLand
← 所有排行榜
Software

2026 最佳 AI 語音生成工具排行榜

實測十款 AI 語音平台的真實度、情感表現、語言覆蓋、延遲與價格。ElevenLabs 綜合冠軍,Hume 用一半價格做出真實情緒,Cartesia 在 100 毫秒以下的語音 Agent 應用稱王。

最後更新: 2026-09-18 · 12 項目每日追蹤

排名走勢 — 前 10 名

數字越小代表排名越高。顯示最近 91 天。

當前排名

#1
ElevenLabs ElevenLabs
免費,約 NT$160–NT$10,500/月 9.4/10

2026 年 AI 語音真實度的標竿。Turbo v2.5 延遲只有 75 毫秒,Eleven v3 支援 74 種語言加上行內情緒標籤,Starter 方案 $5 就能用 Instant Voice Cloning。

Voice Realism 9.7
Emotional Range 9.5
Language Support 9.8
Real-Time Latency 9.2
Value for Money 9.5
#2
Max 約 NT$1,600/百萬字元,Mini 約 NT$800/百萬字元 9.4/10

2026 年衝上 Artificial Analysis Speech Arena 第一名,ELO 約 1236 分,盲測自然度直接壓過 ElevenLabs 和 Hume。Max 版 P90 首音延遲低於 250 毫秒,5 到 15 秒音檔就能複製聲音,WebSocket 串流 API 真的就是為即時語音 agent 而生的,做客服或對話應用首選。

Voice Realism 9.6
Emotional Range 9.4
Language Support 9.0
Real-Time Latency 9.8
Value for Money 9.3
#3
約 NT$1/分鐘 9.0/10

語音 Agent 應用的冠軍。Sonic 3 首字延遲 90 毫秒,Turbo 版本壓到 40 毫秒,3 秒音檔就能克隆語音,API 每分鐘 $0.030,做即時對話機器人沒有對手。

Voice Realism 9.0
Emotional Range 8.7
Language Support 8.5
Real-Time Latency 10.0
Value for Money 8.8
#4
OpenAudio S1 Fish Audio
自架免費,約 NT$350–NT$24,000/月 9.0/10

衝上 TTS-Arena2 第一名的開源模型。OpenAudio S1 用 200 萬小時語料訓練,英文字錯誤率低到 0.008,支援 13 種語言,只要 10 秒音檔就能複製一個聲音。自己架伺服器完全免費,說真的這在同級裡面很難得。

Voice Realism 9.1
Emotional Range 8.8
Language Support 8.0
Real-Time Latency 8.4
Value for Money 9.8
#5
免費,約 NT$450–NT$15,900/月 8.9/10

情緒表現的專家。Octave 2 會從你的腳本內容直接讀出該用什麼情緒講,每字元成本比 ElevenLabs 便宜 58%,$14 Creator 方案就送無限語音克隆,CP 值很狠。

Voice Realism 9.0
Emotional Range 9.7
Language Support 8.5
Real-Time Latency 8.7
Value for Money 9.4
#6
約 NT$1.5/千字元 8.8/10

中文與多語旁白最強選擇。300 多種音色、30 多種語言、端到端延遲 250 毫秒,官方 API 每千字元 $0.05 折合台幣不到 NT$2,給有聲書與短影音配音 CP 值極高。

Voice Realism 8.9
Emotional Range 8.8
Language Support 9.2
Real-Time Latency 9.1
Value for Money 9.0
#7
免費,約 NT$920–NT$3,150/月 8.7/10

企業內容團隊的首選。200 多種音色、內建 studio 編輯器,原生整合 Canva、PowerPoint 與 Google Slides,$29 Creator 方案每年含 24 小時音訊,做企業培訓影片很順手。

Voice Realism 8.4
Emotional Range 8.0
Language Support 8.6
Real-Time Latency 9.8
Value for Money 8.1
#8
約 NT$0.5/分鐘 8.5/10

認真選擇裡最便宜的一款。每分鐘生成音訊 $0.015,13 種可控音色,而且是唯一一款可以用講人話的方式直接 prompt 模型該怎麼念這段台詞的 TTS。

Voice Realism 8.5
Emotional Range 8.7
Language Support 8.8
Real-Time Latency 8.5
Value for Money 9.6
#9
約 NT$4,400–NT$7,950/年 8.0/10

個人創作者的首選。1,000 多種 AI 音色支援 60 多種語言,Premium+ 方案 $249/年只要 20 秒音檔就能克隆語音,跟那個很紅的閱讀 App 共用同一套 Studio 介面。

Voice Realism 8.3
Emotional Range 7.7
Language Support 8.6
Real-Time Latency 7.8
Value for Money 8.5
#10
WellSaid Labs WellSaid Labs
約 NT$1,560–NT$6,350+/月 8.0/10

錄音室等級的企業選擇。Maker 方案 $49/月起,Enterprise 方案 $199/月含 30 小時音訊,SOC 2 加 ISO 27001 合規讓銀行、醫療這類受監管產業敢用,這點很多家做不到。

Voice Realism 9.0
Emotional Range 7.8
Language Support 7.4
Real-Time Latency 7.6
Value for Money 7.0
#11
Resemble AI Resemble AI
免費,約 NT$960–NT$1,920/月 7.6/10

資安優先的語音克隆平台。Creator 方案 $30/月,Flex 用多少付多少每秒 $0.006,內建 deepfake 偵測加浮水印的整套防偽工具,這個組合別家還真的拿不出來。

Voice Realism 8.4
Emotional Range 7.5
Language Support 7.6
Real-Time Latency 7.8
Value for Money 7.6
#12
免費,約 NT$510–NT$1,600/月 7.4/10

Podcaster 的全能編輯器。Overdub 克隆你的聲音之後,可以直接在同一個編輯器裡用打字的方式修正口誤,逐字稿剪輯、多軌錄音、螢幕錄影全部內建,Creator 方案 $24/月。

Voice Realism 7.8
Emotional Range 7.0
Language Support 6.8
Real-Time Latency 7.4
Value for Money 8.4

今日分析 · 2026-09-18

ElevenLabs 和 Inworld TTS-1.5 Max 繼續並列第一,9.4 分,排名照舊。這週有兩件事透露了語音的走向:一個在 GitHub 上爆紅的開源專案,還有一份點名 AI 陪伴服務的歐盟提案。

VoiceStudio 在 9 月 16 日登上 GitHub 熱門,它自稱是可以自己架設的 ElevenLabs 替代品,有聲音複製、配音、語音轉文字和有聲書生成,號稱支援 646 種語言。我還沒拿它跑過我的聽感測試,所以暫時不列入榜單。它讓我看到的是,ElevenLabs 帶起來的那套功能組合,已經變成所有語音產品被拿來比較的標準。這套組合也是 ElevenLabs 能守住第一的主因:一個帳號就包辦旁白、配音、聲音複製和 agent 平台,而且每一項品質都很穩。

第二件事是歐盟執委會提出的 Kids Act 草案,15 歲以下使用聊天機器人和 AI 陪伴服務都要經過家長控管,罰款最高年營收 6%。語音是陪伴型 App 最自然的介面,所以用這些引擎做虛擬角色或家教的開發者,現在就該規劃年齡驗證和家長管理帳號。當然,這還是草案,要歐盟各國和議會同意才會成真。

做即時互動產品的團隊,我的推薦不變。Inworld TTS-1.5 Max 並列第一,延遲低、節奏自然,是我測過做互動角色最好的引擎。Cartesia Sonic 3 拿 9.0 分,電話客服這種每一毫秒都計較的場景我選它。Hume AI Octave 2 拿 8.9 分,需要聲音帶情緒的時候它最有表現力,好的家教或陪伴角色剛好最需要這個。

開源挑戰者出現

VoiceStudio 9 月 16 日登上 GitHub 熱門,有聲音複製、配音,號稱支援 646 種語言,我還沒實測。

ElevenLabs 定義標準組合

旁白、配音、聲音複製和 agent 一個帳號包辦,繼續並列第一 9.4 分。

歐盟草案點名 AI 陪伴

Kids Act 草案要求 15 歲以下使用陪伴型 App 需家長控管,做語音角色的開發者要提早規劃年齡驗證。

即時互動推薦不變

互動角色選 Inworld,低延遲電話客服選 Cartesia Sonic 3,情緒表現選 Hume Octave 2。

參考資料

更新歷史

2026-09-17

ElevenLabs 和 Inworld TTS-1.5 Max 並列第一,都是 9.4 分。上週做完多語言盲聽測試,這週我來看兩條規定,它們已經開始影響合成語音的部署方式,尤其是這個類別最近拼命衝刺的即時語音客服。

歐盟 AI 法第 50 條從 2026 年 8 月 2 日起適用,其中兩項義務直接打在語音上。第一,必須讓對方知道自己正在跟 AI 系統互動,所有電話客服和語音助理都包含在內。第二,AI 生成的音訊要有機器可讀的標記,深偽內容發布時也要揭露。

電話客服要處理這點,開場白加一句話就好。我會寫得像親切的自我介紹,例如「您好,我是診所的語音小幫手」,親切的開場能替整通電話定好基調。延遲如果像 Inworld 的 9.8 分或 Cartesia Sonic 3 的滿分 10 分那麼低,講完這句之後對話依然很自然。

複製聲音要更小心。被複製聲音的本人要簽書面同意,跟專案檔案一起保存,只要發布的片段讓真人說出他沒說過的話,就要清楚標註。Resemble AI 總分 7.6,整個業務就是圍繞這一塊打造,有浮水印也有深偽偵測,對有法遵團隊的媒體公司來說,這份專業比總分更有參考價值。

ElevenLabs 還是我的預設選擇,聲音真實度 9.7、語言支援 9.8,共享聲音庫也採用本人同意的機制。Inworld TTS-1.5 Max 並列第一,真實度 9.6、延遲 9.8,任何即時應用都選它。

Hume AI Octave 2 8.9 分,情緒表現 9.7。OpenAudio S1 9.0 分,性價比 9.8,大量旁白製作很划算。

今天排名照舊。

語音客服要表明自己是 AI

歐盟 AI 法第 50 條要求讓對方知道正在跟 AI 系統互動。

開場白加一句親切介紹

延遲 9.8 或 10 分的模型,揭露之後對話照樣流暢。

複製聲音要留書面同意

同意書跟專案一起保存,發布真人聲音片段要標註。

Resemble AI 適合法遵團隊

浮水印加深偽偵測,7.6 分但定位很專業。

2026-09-16

ElevenLabs 跟 Inworld TTS-1.5 Max 並列第一,同樣 9.4 分。這週我測了英語圈評測通常會跳過的一件事:這些聲音換成別的語言之後還站不站得住。

方法很單純。一段 90 秒的稿子,讓前六名各念一次英文、中文、西班牙文,再放給母語使用者聽,不告訴他們來源。

ElevenLabs 的語言支援 9.8 拿得理直氣壯。它的中文在四字詞上聲調曲線還撐得住,這正好是多數系統崩掉的地方;西班牙文長篇朗讀也能維持同一個地區口音。有聲書、配音、要同時上多個市場的案子,我還是從它開始。

MiniMax Speech 02 HD 8.8 讓我的試聽小組很意外。語言支援 9.2 名副其實,盲測裡它的中文最接近 ElevenLabs,價格還更低。純中文的案子,這一個該進你的口袋名單。

Inworld TTS-1.5 Max 9.4 仍是即時應用首選,延遲 9.8;Cartesia Sonic 3 9.0,延遲拿到滿分 10。兩個都以英文為主,客服機器人用英文回應的話很夠用。

Apple 在 9 月 14 日推出 iOS 27,Siri 被重寫過,這件事把整份榜單的門檻都拉高了。大家現在每天在自己手機上聽到的就是流暢、低延遲的合成語音,所以一個開口前會卡一下的聲音,聽起來就像壞掉。延遲已經悄悄變成品質指標,這張表上的數字就是這樣排的。

Hume AI Octave 2 8.9,情緒表現 9.7 是全榜最高。角色配音或需要真情緒的旁白,我會叫它上場。

用多語試聽,不看規格表

一段 90 秒的稿子,前六名各念英文、中文、西班牙文,放給母語者盲聽。語言覆蓋才是拉開差距的地方。

ElevenLabs 的中文聲調撐得住

語言支援 9.8 在四字詞上看得出來,多數系統就是在這裡垮掉。西班牙文長篇也維持同一個地區口音。

MiniMax Speech 02 HD 是中文案子的高 CP 選擇

語言支援 9.2,盲測中文最接近 ElevenLabs,價格更低。純中文專案值得留一個口袋名單位置。

iOS 27 讓延遲變成品質分

重寫過的 Siri 把大家對合成語音的日常期待拉高了。Inworld 延遲 9.8、Cartesia Sonic 3 滿分 10,是跟得上的兩個。

2026-09-15

ElevenLabs 和 Inworld TTS-1.5 Max 以 9.4 分並列第一。這幾天沒有新模型,我乾脆把這篇寫成「照用途挑」的選購指南,因為語音工具選哪個,完全看你要做什麼。

有聲書、旁白、配音,我選 ElevenLabs。聲音庫最深,短短一段樣本就能複製聲音,公司底子也夠厚。9 月 10 日和環球音樂簽下授權合作,Music Business Worldwide 又報導估值 110 億美元,長期專案放在它身上,我敢說幾年內都有人顧。Releasebot 9 月 11 日記錄的 Scribe v2 Medical,也看得出它正往醫療這種高規範產業擴張。

電話客服代理、即時對話,Inworld 在高流量下的延遲最好,Cartesia Sonic 3 9.0 分,流量上來首段音訊一樣快。兩家之間猶豫,Orca Router 那篇 Inworld Realtime TTS-2 對 Cartesia Sonic 3.6 的比較最值得看。OpenAI 9 月 10 日推出的全雙工模型 GPT-Live-1 是新挑戰者,我正拿真實通話流程在測。

遊戲、角色要演出情緒,Hume AI Octave 2 8.9 分,同一句台詞能演出最多種味道。

預算有限又要多語言,OpenAudio S1 9.0 分,品質好還能自架;MiniMax Speech 02 HD 8.8 分,每個字的價格很漂亮。GPT-4o mini TTS 8.5 分,每分鐘大約 1.5 美分,最便宜又可靠的旁白。

公司內訓影片,Murf AI 8.7 分,編輯介面友善,行政同事一個下午就上手。這週排名不變。

旁白配音選 ElevenLabs

聲音庫最深、短樣本就能複製,估值 110 億美元,長期專案最放心。

電話代理看 Inworld 和 Cartesia

Inworld 高流量延遲最好 9.4 分,Cartesia Sonic 3 首段音訊快 9.0 分,GPT-Live-1 測試中。

情緒演出找 Hume AI Octave 2

遊戲、角色、戲劇台詞,同一句能演出最多層次,8.9 分。

省錢旁白用 GPT-4o mini TTS

每分鐘約 1.5 美分,全榜最便宜又穩定,8.5 分。

2026-09-14

ElevenLabs 和 Inworld TTS-1.5 Max 以 9.4 分並列第一。過去這一週,整個類別都在往「即時雙向對話」衝。9 月 10 日 OpenAI 在 API 推出 GPT-Live-1,這是可以邊聽邊講的全雙工語音模型,附 12 個新的即時語音、原生逐字稿、輪流發言偵測,還支援電話線路。要做電話客服代理人的團隊一定會注意到它,我會先拿它跟榜上前段班實測,再決定要不要影響分數。GPT-4o mini TTS 今天維持 8.5 分,一分鐘大約五毛錢台幣,是 OpenAI 的平價旁白選項。

ElevenLabs 穩坐並列第一,靠的是最深的聲音庫,還有只要短短一段樣本就能穩定複製聲音。它也持續把整套語音工具補齊:Releasebot 記錄到 9 月 11 日推出正式版語音辨識模型 Scribe v2 Medical,8 月 31 日則替語音代理人加上電話按鍵輸入。老實說,做完整電話代理人的團隊,辨識、合成、通話處理全交給同一家,串接可以省下很多工。

Inworld 9.4 分靠的是高負載下的延遲表現,這個數字決定語音代理人接真人電話時聽起來自不自然。Orca Router 9 月 4 日的比較文,把 Inworld Realtime TTS-2 研究預覽版拿來跟 Cartesia Sonic 3.6 對打,Sonic 3.6 是 Cartesia 八月悄悄推出的小改版,價格沒動。

Cartesia Sonic 3 和 OpenAudio S1 都維持 9.0 分。流量衝高時首個音訊回應還要壓得很低,我選 Cartesia;OpenAudio 靠多語言品質拿分,還能自架,成本好控制。

Hume AI Octave 2 8.9 分,情緒表達的專家。MiniMax Speech 02 HD 8.8 分,表現力跟每千字元價格之間平衡得最好,一千字元一塊半台幣左右。

這週排名不變。

GPT-Live-1 拉高電話代理人門檻

OpenAI 9 月 10 日推出的 API 模型能邊聽邊講,新增 12 個即時語音並支援電話線路。我會先跟 Inworld、Cartesia 實測再打分。

ElevenLabs 把語音工具補齊

9 月 11 日推出 Scribe v2 Medical,8 月 31 日加上代理人按鍵輸入,聲音庫與複製能力本來就領先的平台以 9.4 分更完整。

Inworld 與 Cartesia 持續壓低延遲

Inworld Realtime TTS-2 預覽中,Cartesia Sonic 3.6 價格不變,即時語音這一層競爭激烈,接真人電話的服務最受惠。

Hume 與 MiniMax 各有專長

Octave 2 以 8.9 分主打情緒表現,Speech 02 HD 以 8.8 分提供低價又有表現力的聲音。

2026-09-11

ElevenLabs 跟 Inworld TTS-1.5 Max 並列第一,都是 9.4,這個平手我很放心,因為它們贏的東西真的不一樣。

ElevenLabs 的聲音庫最深,用很短的樣本做聲音複製也最穩,這正好是多數人真正需要的。Inworld 在高負載下的延遲守得住,如果這個聲音是要接真人來電的,那個數字才是關鍵。

Cartesia Sonic 3 跟 OpenAudio S1 都在 9.0。即時應用我會拿 Cartesia,因為流量爬上來的時候,它的首字發聲時間還壓得低。OpenAudio 的分數賺在多語輸出還能維持同一個聲音身分,這件事比聽起來難,而且替在地化內容省下巨量工。

Hume AI Octave 2 的 8.9 是最有意思的異數,它對情緒表達的控制精度,榜上沒有對手。做廣播劇跟角色配音,那個控制力就是產品本身。

實務建議沒變。拿你真正的稿子去測,把難唸的專有名詞跟數字都放進去,因為那裡才是這些模型分出高下的地方。行銷樣本是挑過的,你的稿子可沒有。

拿自己的稿子測,專有名詞也放進去

Demo 是挑過的。模型差異會在品牌名、縮寫、唸出來的數字上現形,決定之前先把你真正要唸的那段貼進去。

高負載延遲跟音質是兩場不同的比賽

要接真人來電的聲音,評分項目是尖峰流量下的首字發聲時間。這場 Cartesia 跟 Inworld 贏,而它跟離線樣本好不好聽關係不大。

跨語言維持同一個身分,省下的是真工時

OpenAudio 讓一個能辨識的聲音貫穿整趟在地化,等於把選角問題整個拿掉。要出五種語言的人,這比自然度多個零點幾值錢。

情緒就是交付物時,選 Hume

對情緒表達的精確控制,讓它成為廣播劇跟角色配音的正解。這個任務比一般旁白窄,而它做得比誰都好。

2026-09-09

ElevenLabs 跟 Inworld TTS-1.5 Max 維持並列 9.4,我刻意讓它們平手,因為兩者贏的是完全不同的軸線。ElevenLabs 的聲音庫更深,複製聲音的流程也更成熟。Inworld 則是延遲更低,定價結構讓即時對話應用在規模化之後仍然划算。

如果你在做一個必須在 300 毫秒內回話的語音 agent,答案是 Inworld。如果你在做旁白,單次錄取的品質比反應速度重要,那就是 ElevenLabs。

Cartesia Sonic 3 跟 OpenAudio S1 維持 9.0。Sonic 3 依然是這個分類裡明顯最快的,互動應用中使用者對每一毫秒延遲都有感,這種場景值得拿它跟前段班一起試聽比較。

Hume AI Octave 2 的 8.9 分,是我會指給創意團隊看的那一個。它的情緒幅度真的是這裡最可控的,做廣播劇或角色配音時,那份表現力就是全部的重點。

說實話,這個分類的合成音質在頂端已經大致收斂了。前五名的模型產出的音檔,隨意聽都過得去。現在真正拉開差距的是延遲、授權、以及你對語氣表現能掌控多少。用這三項去打分,通常一個下午的測試就能得出明確答案。

ElevenLabs 跟 Inworld 並列,因為它們贏的地方不同

ElevenLabs 的聲音庫更深、聲音複製流程更成熟。Inworld 延遲更低,定價讓即時對話在規模化後仍然可行。兩個都是 9.4,因為正確答案完全取決於你是在做旁白,還是在做必須 300 毫秒內回話的 agent。

Cartesia Sonic 3 光靠速度就值得試聽

它依然是這個分類裡明顯最快的模型。互動應用中使用者對每一毫秒都有感,這個優勢可以蓋過跟前段班之間的些微品質差距。在你預設「榜首就是對的」之前,先拿它試一輪。

角色與戲劇類配音該選 Hume AI Octave 2

它的情緒幅度是這裡最可控的,做廣播劇或遊戲角色配音時,那份表現力就是整份需求本身。8.9 分其實低估了它在「帶著意圖唸出一句台詞」這件事上的優勢,那跟單純咬字清楚是兩回事。

音質已收斂,改用延遲、授權、控制力來評分

前五名的模型產出的音檔隨意聽都過得去。真正的差異化現在是反應時間、商業條款、以及你能掌控多少語氣表現。用這三個軸線去測,正確答案通常一個下午就浮出來。

2026-09-07

語音生成這週維持原狀。ElevenLabs 與 Inworld TTS 1.5 Max 仍然並列 9.4,我讓它們並列是因為它們贏在同一個問題的不同半邊。

ElevenLabs 有最深的聲音庫,以及從短樣本複製聲音時最穩的表現。如果你的專案需要某個已經存在的特定聲音,或需要四十個聽起來像不同人的聲音,就是它。Inworld TTS 1.5 Max 贏在高負載下的延遲,而這決定了即時應用。接電話的語音代理不能等,Inworld 在併發數往上衝的時候仍守得住一秒內回應。

Cartesia Sonic 3 與 Fish Audio OpenAudio S1 落在 9.0,如果你的用量讓每字元成本變得重要,這兩個值得測。用量一大,頂級層跟這兩個之間的價差累積得很快。

我一直跟人講的是,這個品類現在錢在情感表現力上。這份清單上每個模型都能產出聽得懂的語音。9.4 跟 8.0 的差別在於那個聲音能不能在你沒有手動標記文字的情況下,帶出一個疑問、一次遲疑或一個語氣轉折。Hume AI Octave 2 的 8.9 是這裡有趣的案例,它就是繞著情感表達做的,有聲書或角色配音的場景它的實力高於總分。

今天要選的話,把你真正的稿子丟給前三名跑一次。稿子之間的差異大到用通用樣本排出來的順序無法預測哪一個唸你的素材才對味。

ElevenLabs 跟 Inworld 並列是因為它們解的是不同半邊

ElevenLabs 有最大的聲音庫,以及從短樣本複製聲音時最穩的表現,這是製作型配音工作要的。Inworld TTS 1.5 Max 在併發數上升時守得住一秒內延遲,這是即時語音代理要的。兩個都放 9.4,因為把其中一個排在另一個上面會誤導一半的讀者。照你的應用是預先製作還是即時應答來選。

情感表現力是拉開頂級與中段的那條軸

這份排名裡每個模型都能產出清楚聽得懂的語音。把 9.4 跟 8.0 拉開的,是那個聲音能不能光靠標點就唸出一個疑問、一次停頓或一次語域轉換。當你得手動標註每一句才能得到想要的唸法,這個工具只是把工作搬了位置,沒有把它拿掉。我的評分很看重有多少表演是純文字就免費送的。

Hume AI Octave 2 在角色配音上的實力高於它的分數

Octave 2 總分 8.9,它就是專門繞著情感表達做的,這讓它成為有聲書旁白與遊戲角色對白的最強選擇。這兩個工作我會建議先測它,再測排在它上面的那幾個。它的總分反映的是聲音庫較小、整合較少,而如果你要的是一個聲音在長錄音裡撐住情緒,這兩件事都不重要。

決定之前用你自己的稿子測

通用試聽樣本是廠商挑來讓模型好看的。你的稿子有自己的句長、專有名詞跟節奏。我看過有買家把自己真正的醫療旁白稿丟給前三名之後,順序完全翻盤。花十五分鐘,同樣兩段文字在每個入圍者上各生成一次,然後用你的聽眾會用的裝置聽。

2026-09-05

ElevenLabs 和 Inworld TTS 1.5 Max 維持並列 9.4,我打算讓這個平手繼續下去,因為它們贏的軸線真的不一樣。

ElevenLabs 的聲音庫最深,用一小段樣本做聲音複製的穩定度最高,這是多數人實際需要的。Inworld TTS 1.5 Max 在高負載下延遲更低,單次錄製的情緒幅度更好,這是聲音要嵌進即時產品時才會在意的事。看你的聲音是預錄還是串流,答案就出來了。

Cartesia Sonic 3 和 Fish Audio OpenAudio S1 並列 9.0,即時對話代理我推 Cartesia,它的首音延遲明顯是這裡最短的。

Hume AI Octave 2 的 8.9,對於要做「聲音會回應內容情緒」這種產品的人,它是這份清單上最有意思的。

台灣讀者有一件事一定要自己測,中文輸出品質在這些工具之間差非常多,而且台灣國語的聲調正確性跟對岸普通話是兩個不同的問題。這些工具首頁的英文 demo 全部都很棒,而那幾乎無法告訴你中文稿唸出來會是什麼樣子。

訂閱前先拿自己的一段文案生一次。上面的排名反映的是整體能力,你的語言才是真正決定勝負的限制條件。

榜首的平手是真的依使用情境分家

ElevenLabs 聲音庫最深、短樣本複製最穩。Inworld 在高負載下延遲更低、單次錄製的情緒幅度更好。預錄工作走一邊,即時產品走另一邊。

即時代理的答案是 Cartesia

首音延遲明顯是這份清單裡最短的,而在對話型產品裡,這個數字就是整個使用體驗。9.0 分,是所有互動情境的專門推薦。

Hume Octave 2 在做真正不一樣的事

依照文字的情緒內容調整唸法,跟把字唸準是兩種不同的能力。敘事型或陪伴型產品,這種回應性才是使用者真的會注意到的功能。

訂閱前自己測中文輸出

這些首頁的英文 demo 一律很棒,對中文輸出的預測力卻很低。台灣國語的聲調正確度在各家之間差距很大,先拿自己的一段稿子生一次再說。

2026-09-04

ElevenLabs 和 Inworld TTS-1.5 Max 並列 9.4,這個平手我會維持,因為它們贏的東西真的不一樣。

ElevenLabs 拿下擬真度和語言廣度,有聲書旁白、配音、任何聽眾要跟這個聲音相處一小時的案子,它都是安全的預設值。

Inworld TTS-1.5 Max 拿下延遲,而做即時應用的話,延遲就是全部的規格。你在做接電話的語音客服,200 毫秒以內的回應決定這段對話自不自然,音色再好也補不了那個讓來電者搶話的停頓。

Cartesia Sonic 3 的 9.0 卡在中間,想要低延遲又要多一點表現力的團隊我推它。OpenAudio S1 的 9.0 給想自架的人,開放權重對有資料落地需求的應用影響巨大。Hume AI Octave 2 的 8.9 在情緒表達上還是這個類別最有意思的,互動敘事或遊戲裡角色要真的聽起來很難過,它就是對的工具。

九月補充一件事,今年整體的中文和台灣口音輸出進步很多。如果你是 2025 年評估過然後因為中文效果不行而放棄的,建議重新測一次。

延遲和擬真度現在是兩筆不同的採購

長時間聆聽的音色與語言覆蓋,ElevenLabs 領先。即時代理的回應速度,Inworld TTS-1.5 Max 領先。兩個都 9.4 分,因為正確答案完全取決於你的聽眾有沒有在等你回話。

200 毫秒是電話語音客服自然與否的門檻

超過這個數字,來電者就會開始搶話,對話就崩了。音質救不回回應延遲,所以做即時應用時,我給延遲的權重跟擬真度一樣重。

有資料落地需求就要看開放權重

OpenAudio S1 的 9.0 可以整套跑在自己的基礎設施裡,直接解掉那些會讓 API 工具過不了關的合規問題。受監管的產業,這個能力排在一點點品質差距之前。

2025 年放棄過的人,中文再測一次

今年這裡每個模型的中文品質和口音處理都大幅進步。一年前因為中文效果而排除語音合成的團隊,手上的結論已經過期,值得重新評估。

2026-09-01

ElevenLabs 跟 Inworld TTS-1.5 Max 並列第一 9.4,這個平手我覺得很合理,因為它們贏的是不同的工作。ElevenLabs 在長篇旁白這種「聲音要在一小時的音檔裡維持一致又耐聽」的場景最強,可用的聲線跟語言庫也遠遠最深。Inworld 在擬真度上追平,但它是為了即時互動而設計的,那是另一個工程問題,如果你要把聲音放進會即時對話的產品裡,它才是對的。

Cartesia Sonic 3 跟 OpenAudio S1 以 9.0 拿下三、四名,分別強在延遲跟自架彈性。

八月整個產業往「快又便宜」的模型層移動,八家十六個模型,這件事對語音類別的影響特別直接。講白了,語音這一塊的延遲直接決定成敗。一個對話型 agent 要花 800 毫秒才開口,人耳聽起來就是壞掉了。整個產業一起壓速度,這個類別受惠的程度比多數類別都大。

這週排名不動。我的建議:旁白跟有聲書選 ElevenLabs,任何即時對話場景選 Inworld 或 Cartesia,音檔不能離開自己機房就選 OpenAudio S1。

第一名並列是真的,因為旁白跟對話根本是兩個問題

ElevenLabs 贏在長篇一致性跟聲線資料庫的深度。Inworld TTS-1.5 Max 在擬真度上追平,但它是為即時輪替對話設計的。這是兩個確實不同的工程目標,兩邊都給 9.4,因為它們各自在自己的工作上都是明確答案。

語音的延遲直接就是正確性問題

一個對話 agent 要花將近一秒才開口,人耳聽起來就是壞了。這就是 Cartesia Sonic 3 光靠速度就能以 9.0 拿下第三的原因,也是八月全產業衝速度對這個類別的幫助,比站上其他任何類別都大的原因。

ElevenLabs 贏在那個很無聊、但真的會決定專案的東西

聲線跟語言的覆蓋率。當你需要特定口音、特定年齡層,或是前十大語言之外的語言,ElevenLabs 都有。這個廣度決定的實際製作選擇,比情緒表現上那一點點優勢多得多,也是它守住並列第一的理由。

音檔不能離開自家網路,就選 OpenAudio S1

9.0 分,它用一點擬真度換到完全在自己基礎架構內執行的能力。對於要處理客服錄音、醫療語音,或任何有資料落地要求的人來說,這就是硬性條件,也讓 S1 成為這份榜單上唯一可行的選項。