2026-09-17
ElevenLabs 和 Inworld TTS-1.5 Max 並列第一,都是 9.4 分。上週做完多語言盲聽測試,這週我來看兩條規定,它們已經開始影響合成語音的部署方式,尤其是這個類別最近拼命衝刺的即時語音客服。
歐盟 AI 法第 50 條從 2026 年 8 月 2 日起適用,其中兩項義務直接打在語音上。第一,必須讓對方知道自己正在跟 AI 系統互動,所有電話客服和語音助理都包含在內。第二,AI 生成的音訊要有機器可讀的標記,深偽內容發布時也要揭露。
電話客服要處理這點,開場白加一句話就好。我會寫得像親切的自我介紹,例如「您好,我是診所的語音小幫手」,親切的開場能替整通電話定好基調。延遲如果像 Inworld 的 9.8 分或 Cartesia Sonic 3 的滿分 10 分那麼低,講完這句之後對話依然很自然。
複製聲音要更小心。被複製聲音的本人要簽書面同意,跟專案檔案一起保存,只要發布的片段讓真人說出他沒說過的話,就要清楚標註。Resemble AI 總分 7.6,整個業務就是圍繞這一塊打造,有浮水印也有深偽偵測,對有法遵團隊的媒體公司來說,這份專業比總分更有參考價值。
ElevenLabs 還是我的預設選擇,聲音真實度 9.7、語言支援 9.8,共享聲音庫也採用本人同意的機制。Inworld TTS-1.5 Max 並列第一,真實度 9.6、延遲 9.8,任何即時應用都選它。
Hume AI Octave 2 8.9 分,情緒表現 9.7。OpenAudio S1 9.0 分,性價比 9.8,大量旁白製作很划算。
今天排名照舊。
語音客服要表明自己是 AI
歐盟 AI 法第 50 條要求讓對方知道正在跟 AI 系統互動。
開場白加一句親切介紹
延遲 9.8 或 10 分的模型,揭露之後對話照樣流暢。
複製聲音要留書面同意
同意書跟專案一起保存,發布真人聲音片段要標註。
Resemble AI 適合法遵團隊
浮水印加深偽偵測,7.6 分但定位很專業。