xAIの新しい音声認識モデルがArtificial Analysisのストリーミング文字起こしランキングで首位に。多言語の短いフレーズでのエラー率を20.6%から6.8%に削減しつつ、バッチ処理は1時間あたり0.10ドルの価格を維持。
Googleが新しい音声認識モデル「Gemini 3.5 Transcribe」を発表。文字起こしを自動整形し、最大3人の話者をタイムスタンプ付きで識別。単語誤り率をストリーミング4.0%・録音済み2.6%まで下げ、レイテンシも従来比70%改善した。
Alibabaの通義研究院(Tongyi Lab)が新しい音声認識(ASR)モデル「Qwen-Audio-3.0-ASR」シリーズをAPI提供開始。ストリーミング向けとファイル文字起こし向けを用意し、中国語方言7大方言区・20以上の訛りと30言語をカバーします。