Qwen-Image-2.1、透過画像をネイティブ生成できる70億パラメータのオープンモデルを公開
Qwenは2026年9月20日、テキストから画像への生成と画像編集を単一のアーキテクチャに統合した画像モデル「Qwen-Image-2.1」をオープンソース化しました。前世代「Qwen-Image-2512」の生成モデルが200億パラメータだったのに対し、今回は70億パラメータへと大幅に軽量化されています。
詳細
- 軽量ながら高い競争力: 32層のシングルストリームDiT構成で生成モデルは70億パラメータ。Qwen独自のベンチマーク「Qwen-Image-Bench」で60.28点を記録し、Googleの「Nano Banana 2.0」(59.82点)を含む、重みをダウンロード可能な他のあらゆるモデルを上回った。ただしQwen自身のクローズドモデル「Qwen Image 3 Pro」(62.36点)にはまだ及ばない
- 透過画像のネイティブ生成: テキストプロンプトから直接アルファチャンネル付きのRGBA画像を生成できるほか、通常の写真から被写体だけをきれいな透過切り抜きとして抽出可能。従来はこの処理に別モデルが必要だった
- 複数参照画像による編集: 1回の編集操作で最大10枚の参照画像を利用可能。円形選択・塗りつぶし領域・マスクといった指定方法により、複数人の肖像や商品写真を組み合わせた合成なども行える
- 効率重視のアーキテクチャ: テキストにはトークン単位の因果マスキング、画像にはチャンク単位のマスキングを用いる「混合粒度アテンション」に加え、KVキャッシュの再利用により、繰り返し入力される画像や指示の計算コストを削減
- 品質面の改善: 前世代と比べ、文字組みの再現性やポートレートの光の表現がより自然に
- ライセンス変更: 「Qwen Research License Agreement」の下で非商用利用限定として公開され、商用利用にはアリババとの別途契約が必要。これまでの一部Qwenリリースで採用されていたApache 2.0からの転換となる
- 提供状況: 重みはHugging Face・ModelScope・GitHub上で「Qwen/Qwen-Image-2.1」として公開
その後
Qwen-Image-2.1は、アリババのQwenチームが3日間で立て続けに行った3件のモデル発表(Qwen3.8-Omni-Flash、Qwen3.8-LiveTranslateに続く)を締めくくるものとなりました。寛容なライセンス条件でオープンソース分野での評価を築いてきたチームだけに、今回のより制限的な非商用ライセンスへの転換は注目に値し、研究以外の現場での採用ペースにも影響を与えそうです。