ElevenLabs、最速かつ最も表現力豊かな音声モデル「Eleven v4」を発表
ElevenLabsは2026年9月28日、新音声モデル「Eleven v4」と、会話型エージェント向けの低遅延版「Eleven v4 Turbo」を発表しました。同社が「これまでで最も高速かつ最も感情表現に優れた音声モデル」と位置づけるこのモデルは、ElevenAgents、ElevenCreative、ElevenLabs APIで即日利用可能になっています。
詳細
- 感情表現の強化: 「トーン、間の取り方、感情、キャラクター性、文脈」を読み取り、単調なナレーションではなく、ドラマチック・優しい・切迫した・コミカル・会話的といった多彩な話し方を生成
- インライン指示タグ: 「[laughs]」や「[said angrily in French accent]」のようなタグをスクリプトに直接挿入することで、特定のセリフの読み方を細かく制御可能
- より自然な複数話者の会話: 複数話者のシーンでは、話者同士が会話の文脈に反応するようになり、個別に生成した音声をつなぎ合わせたような不自然さがなくなり、本物の対話のように聞こえる
- 声の一貫性向上: 話者アイデンティティの捕捉方法を改良し、長尺コンテンツ全体を通して各声の個性を保持
- 音声クローンの高速化: インスタントボイスクローンに必要な参照音声が、従来より短い10秒で済むように
- リアルタイム用途向けの速度: Eleven v4 Turboは発話開始までの時間(Time to First Speech)の中央値が約150ミリ秒で、低遅延な会話型エージェント向けに最適化
- 幅広い言語対応: 両モデルとも90以上の言語に対応し、アクセントの再現性や、言語をまたいで同じ声を使った際のネイティブらしい発音が向上
- ベンチマーク結果: ElevenLabsによると、盲検リスニングテストでEleven v4が競合モデルより好まれた割合は約75%、Artificial Analysisのランキングでは1位を獲得
- 想定用途: オーディオブック、キャラクターボイス、ナレーション、吹き替え・ローカライズ、カスタマーサポート向けエージェントなど
その後
Eleven v4は、ElevenAgents・ElevenCreative・APIの各ユーザーに向けて即日提供が開始されており、発表と同時の料金体系の変更は特にアナウンスされていません。今回のリリースは、9月に投入されたMusic v2.5に続くもので、ElevenLabsが競合他社に対して音声モデルの品質そのもので優位性を打ち出す姿勢を強めていることを示しています。感情表現の幅と複数話者での自然さを第4四半期に向けた主要な差別化ポイントとして位置づけています。