Qwen3.8-LiveTranslate、リアルタイム通訳の遅延を2.3秒まで短縮
アリババのQwenチームは2026年9月19日、話者が話している最中に音声(必要に応じて映像フレームも)を聞き取り、翻訳したテキストと音声をリアルタイムで返す同時通訳モデル「Qwen3.8-LiveTranslate」を公開しました。人間の同時通訳者との差を縮めることを狙ったモデルです。
詳細
- 新アーキテクチャ「Interleave」: 遅延と文脈理解のバランスの取り方を根本から見直したアーキテクチャ。長めの音声のまとまりを待ってから翻訳するのではなく、入力音声と翻訳出力を交互に処理する
- 応答の高速化: 平均遅延(LAAL)は従来手法の2.8秒から2.3秒に短縮。Qwenは、正確さや流暢さを犠牲にすることなくこの改善を実現したとしている
- 幅広くも段階的な言語対応: 60言語を理解し、うち29言語(中国語・英語・アラビア語・ドイツ語・フランス語・スペイン語・日本語・韓国語・ヒンディー語など)で音声出力が可能。残りの言語はテキスト出力のみ
- 新機能: 各話者の声質を保持したままのリアルタイム話者識別、原文と訳文を並べて表示する対訳同時表示、会話履歴を踏まえて用語の一貫性を保つ長文脈での曖昧性解消
- 提供状況: API経由のみで提供。Alibaba Cloud Model StudioおよびQwenCloud上で「qwen3.8-livetranslate-flash-realtime」としてWebSocket経由で利用可能
その後
Qwen3.8-LiveTranslateは、Qwen3.8-Omni-Flash発表の翌日という速さで登場しました。アリババのQwenチームがオムニモーダル戦略を、汎用の音声・映像エージェント向けモデルと、ライブ通訳に特化したモデルとに分けて展開していることがうかがえます。遅延短縮に的を絞ったこの取り組みは、ライブ会議や通話など、わずかな遅延でも人間の耳に大きく響く用途を狙ったものです。