xAI、精度2倍の「Grok Voice Transcribe 2.0」を発表
xAIは2026年9月18日、音声認識(音声からテキストへの変換)モデル「Grok Voice Transcribe 2.0」をリリースしました。前バージョンと同じ価格ながら精度はおよそ2倍になったとしており、Grok Voiceを支える音声基盤モデルをベースに構築されています。
詳細
- ランキング首位: Artificial Analysisの公開ストリーミング文字起こしランキングにおいて、32のサービス中で精度トップにランクイン
- 最大の改善は多言語対応: バージョン1.0と比較して、短いフレーズにおける多言語のエラー率が20.6%から6.8%へ低下
- 実際の乱雑な音声に対応: 多様な環境で収録されたライブでノイズの多い多言語音声データで学習し、追加のポストトレーニングで精度を磨き上げ、ノイズの多い通話や複数話者、多様なアクセントを主な対象とする
- 機能セット: バッチおよびストリーミングでの文字起こし、信頼度スコア付きの単語単位タイムスタンプ、話者識別、マルチチャンネル処理、カスタム用語のバイアス設定、インテリジェントな整形、フィラー除去、音声エージェント向けの発話ターン検出
- 価格は据え置き: バッチ処理は引き続き音声1時間あたり0.10ドル、ストリーミングは1時間あたり0.20ドルで、話者分離・タイムスタンプ・キーワードバイアスは追加料金なしで利用可能
- 既存の実績: Grok Voiceはすでに1日あたり数万件のカスタマーサポート通話を処理し、数百万時間分の動画ナレーションを文字起こしし、テスラ車両のGrokアシスタントを含む製品で音声エージェントを稼働させている
その後
Atlassian傘下のLoomはGrok Voice Transcribe 2.0を採用し、これまでの文字起こしソリューションより優れていたとxAIに伝えています。今回のリリースは9月16日のGrok Buildへのメモリ機能追加に続くもので、単一のフラッグシップモデル更新ではなく、Grok製品ライン全体にわたって段階的なインフラ強化を重ねていくxAIのパターンを踏襲しています。xAIは今回のモデルを新規の単独製品としてではなく、既存のVoice Transcribeユーザー向けの乗り換え版アップグレードと位置付けています。