Grok ニュース 2026/09/18 AI判定 重要度:中

xAI、精度2倍の「Grok Voice Transcribe 2.0」を発表

#Grok#xAI#音声認識#Voice#API

xAIは2026年9月18日、音声認識(音声からテキストへの変換)モデル「Grok Voice Transcribe 2.0」をリリースしました。前バージョンと同じ価格ながら精度はおよそ2倍になったとしており、Grok Voiceを支える音声基盤モデルをベースに構築されています。

詳細

  • ランキング首位: Artificial Analysisの公開ストリーミング文字起こしランキングにおいて、32のサービス中で精度トップにランクイン
  • 最大の改善は多言語対応: バージョン1.0と比較して、短いフレーズにおける多言語のエラー率が20.6%から6.8%へ低下
  • 実際の乱雑な音声に対応: 多様な環境で収録されたライブでノイズの多い多言語音声データで学習し、追加のポストトレーニングで精度を磨き上げ、ノイズの多い通話や複数話者、多様なアクセントを主な対象とする
  • 機能セット: バッチおよびストリーミングでの文字起こし、信頼度スコア付きの単語単位タイムスタンプ、話者識別、マルチチャンネル処理、カスタム用語のバイアス設定、インテリジェントな整形、フィラー除去、音声エージェント向けの発話ターン検出
  • 価格は据え置き: バッチ処理は引き続き音声1時間あたり0.10ドル、ストリーミングは1時間あたり0.20ドルで、話者分離・タイムスタンプ・キーワードバイアスは追加料金なしで利用可能
  • 既存の実績: Grok Voiceはすでに1日あたり数万件のカスタマーサポート通話を処理し、数百万時間分の動画ナレーションを文字起こしし、テスラ車両のGrokアシスタントを含む製品で音声エージェントを稼働させている

その後

Atlassian傘下のLoomはGrok Voice Transcribe 2.0を採用し、これまでの文字起こしソリューションより優れていたとxAIに伝えています。今回のリリースは9月16日のGrok Buildへのメモリ機能追加に続くもので、単一のフラッグシップモデル更新ではなく、Grok製品ライン全体にわたって段階的なインフラ強化を重ねていくxAIのパターンを踏襲しています。xAIは今回のモデルを新規の単独製品としてではなく、既存のVoice Transcribeユーザー向けの乗り換え版アップグレードと位置付けています。