Googleが画像生成AIの制御手法「Diffusion Controller」を発表、LoRAを上回る精度
Google Researchが拡散モデルの生成過程を後付けで細かく制御する「Diffusion Controller」を公開。既存モデルを凍結したまま軽量アダプターを追加する方式で、業界標準のLoRAを性能で上回った。
Google Researchは、テキストから画像を生成する拡散モデルの出力を後付けで細かく制御する新手法「Diffusion Controller」を発表した。既存モデルの重みを一切変更せず、軽量な補正ネットワークを追加するだけでユーザーの意図により正確に従わせる仕組みで、業界標準として使われてきたLoRAを性能面で上回ったという。
生成過程を「制御問題」として捉え直す
Diffusion Controllerの核心は、画像生成を数学的な「滑らかな制御問題」として再定義した点にある。ベースとなる拡散モデルは凍結したまま、Chih-wei Hsu氏とMoonkyung Ryu氏ら Google Research のチームが開発した「ステアリングダンパー」と呼ばれる別のネットワークが、ノイズ除去過程の中間出力を観察しながら微細な補正を注入する。
この方式のポイントは、モデルの内部構造にアクセスできない「グレーボックス」環境や、完全に非公開の「ブラックボックス」モデルにも適用できることだ。従来のファインチューニング手法の多くはモデル内部への深いアクセスを前提としていたが、Diffusion Controllerはベースモデルが持つ既存の知識に小さな補正を組み合わせるだけで機能する。
LoRAに対して勝率90%
性能面では、画像生成の品質を評価する指標「HPS-v2」において、Diffusion Controllerは一貫してLoRAを上回った。グレーボックス環境ではLoRAより少ないパラメータ調整で性能が向上し、完全にファインチューンした版ではベースラインに対して90%の勝率を記録している。複雑なプロンプトを与えた場合でも、視覚的な品質と安定性を保てる点も強みとして挙げられている。
論文はarXivで公開されており(arXiv:2603.06981)、既存の代表的な制御手法を統一的な数学的枠組みで説明できる点が技術的な新規性とされる。
今後の応用先
Google Researchは、この手法の応用先として、より高度なパーソナライゼーションツールの構築、有害コンテンツ生成を抑えるための堅牢な安全機構の開発、そして複雑化する次世代の動画生成モデルへの適用を挙げている。具体的にどの製品に組み込まれるかはブログ記事の時点では明らかにされていないが、既存モデルを改変せずに後付けで精度と安全性を高められる設計は、商用サービスへの実装コストを抑えられる点で注目に値する。
画像生成AIをめぐっては、プロンプト通りの出力を得るための追加学習や複雑なワークフロー構築が開発者の負担になってきた。Diffusion Controllerのような後付け制御手法が実用化されれば、モデルを再学習せずに生成結果の精度を高められるようになり、開発者にとっての導入障壁が下がる可能性がある。