Stable Diffusion 3の早期プレビューを発表──文字表現とプロンプト理解を強化
Stability AIが、次世代フラッグシップモデル「Stable Diffusion 3」の早期プレビューを発表しました。SoraやGeminiなど他社の画像・動画生成AIが存在感を増すなか、画質・プロンプト追従性に加えて、AI画像生成の長年の弱点だった文字のスペル表現の精度向上を前面に打ち出しています。
詳細
- モデルサイズ: 8億パラメータから80億パラメータまで、複数サイズの派生モデルを用意し開発者が用途に応じて選択・調整できる設計
- 文字表現の強化: 画像内に文字を正確に生成する能力を重点的に改善
- プロンプト理解: 複雑で長いプロンプトへの対応力を高め、意図した構図を再現しやすくした
- 提供形態: まずは早期プレビューとしてウェイトリスト登録者向けに限定公開
その後
この早期プレビューの発表からおよそ4か月後の2024年6月、パラメータ数20億の「SD3 Medium」がオープンウェイトとして一般公開されました。SD3シリーズはStability AIが経営再建を進めるなかで技術面での存在感を示す重要な一歩となりました。