
本日、通義千問チームは新世代の画像生成モデル「Qwen‑Image‑2.1」を正式にオープンソース化しました。このモデルは、わずか70億パラメータの軽量な視覚生成モジュールを備え、テキストから画像の生成、透過画像の生成、さらには多様な画像編集機能を一つのフレームワークに統合し、生成品質・推論効率・利用コストの新たなバランスを実現しています。
公式発表によると、視覚生成部分には32層のシングルストリームDiT構造を採用しており、パラメータ数はわずか70億です。混合粒度のアテンション構造とKVキャッシュの再利用メカニズムにより、複数画像入力時の推論効率が大幅に向上し、メモリ消費も効果的に抑制されています。今回のアップデートの目玉である透過画像生成では、プロンプトに基づいて通常の画像または透過チャンネル付きのRGBA画像を自動で出力でき、透明背景を維持したまま被写体の表情変更やテキスト編集も可能です。ユーザーが実写写真を入力すると、被写体を自動抽出して透過レイヤーを出力することもでき、後のデザインや合成作業を容易にします。
画像編集面では、Qwen‑Image‑2.1は最大10枚の参照画像入力をサポートし、複数の被写体や素材を組み合わせて調和のとれた画面を生成できます。局所編集では、囲んで選択する方式、塗りつぶす方式、独立マスク方式の3種類を用意しており、編集領域の指定がより柔軟に行えます。特に人物像と商品の整合性を強化しており、修正後も人物の顔の特徴や商品の文字・形状が高度に再現されます。また、テキストのレンダリング、人物の光と影の表現、細部描写も大幅に向上し、パノラマ写真、インフォグラフィック、コマ割り絵など、多様なタスクに対応しています。
現在、Qwen‑Image‑2.1はGitHub、ModelScope、Hugging Faceなどのプラットフォームで同時にオープンソースとして公開されており、開発者やクリエイターが無料で利用できます。今回のリリースは、軽量な画像生成・編集の新たな選択肢を提供するとともに、透過画像や複数画像参照といった応用のさらなる普及を促進することが期待されています。