Qwen、100万トークン級コンテキストのオムニモーダルモデル「Qwen3.8-Omni-Flash」を発表
アリババのQwenチームは2026年9月18日、ネイティブオムニモーダルモデル「Qwen3.8-Omni-Flash」を公開しました。音声や動画を受動的に説明するだけでなく、そこから計画を立て、ツールを呼び出し、実際にクリエイティブな作業を完了させる方向へと踏み出したモデルです。
詳細
- 幅広い入力と巨大なコンテキスト: テキスト・画像・音声・動画に対応し、コンテキストウィンドウは100万トークン。1セッションで最大1時間の連続音声・映像コンテンツを扱える
- 前世代から大幅向上: 29種類の評価項目でQwen3.5-Omni-Plus比平均25%のスコア向上を達成。音声・映像性能はGemini 3.8 Flashに迫り、音声性能単体ではこれを上回るという
- 大幅な値下げ: 前世代と比較して音声入力のAPI料金を98%、音声・映像入力の料金を93%削減
- 多言語対応: 音声認識は74言語+中国語39方言に対応、音声生成は29言語+7方言に対応
- エージェント向け機能群: 長尺動画のキャプション生成、話者識別付きの会議文字起こし、歌詞・リズムに同期したミュージックビデオ制作、音声を保持したまま行う自動動画翻訳、Video2NoteやOmni Skill Creatorといったツールを搭載
- リアルタイム版も用意: 「Qwen3.8-Omni-Flash-Realtime」はWebSocket/WebRTC経由の連続的な音声・映像会話に対応し、空間音響認識やアクセントを考慮したスピーキング練習も可能
- 提供状況: Qianwen AIプラットフォームでOpenAI互換のChat Completions APIとして即日提供開始。オープンソースツール(Qwen-MM-Plugins、Qwen-Live Harness、Qwen Code)も同時公開
その後
Qwen3.8-Omni-Flashは、Qwenのオムニモーダル系列を「理解」から「エージェント的な実行」へと押し進める動きの一環として登場しました。Qwen3.8-Maxのテキストモデル群に続く発表です。同チームはこの直後、リアルタイム通訳向けの「Qwen3.8-LiveTranslate」とオープンウェイトの画像モデル「Qwen-Image-2.1」を数日のうちに立て続けにリリースしており、9月のマルチモーダル系列は非常に速いペースでの展開となっています。