画像生成モデルが、プロンプトから一度で画像を出す処理から、検索、コード実行、自己修正を使って生成案を反復改善する処理へ広がった。追加の推論時計算は、候補数を増やすだけでなく、生成方法を選び直すためにも使われる。
検索結果とコードの描画を生成条件へ戻す
Metaの研究部門Meta Superintelligence Labsが開発した画像生成モデルMuse Imageは、プロンプトを画像へ直接対応付けるだけでなく、検索やコード実行のツールを呼び出すエージェントとして動作する。処理の途中で得た情報や描画結果を、次の画像生成を導く条件として利用する構成だ。
検索ツールは、現実の事実、最新情報、視覚的な参照をWebから取得する。Metaの内部比較では、検索を使うことで、現在の出来事や現実の事実を扱う知識集約型の指示に対する事実性が改善した。
コーディングツールは図表やQRコードを生成し、レンダリングした図をモデルへ渡す。数値や配置をコードで組み立てた描画結果を条件に加えることで、言葉だけの指示を補って画像を生成する。
誤りの範囲に合わせて生成方法を選び直す
最初の生成案に小さな問題があれば、Muse Imageは該当部分を局所的に編集する。修正範囲が大きければ最初から生成し直し、事実に即した材料が必要な場合はツール利用へ切り替える。
この自己修正は、あらかじめ個別の動作として設計されたものではない。Metaによると、良い画像ほど高い報酬を得る強化学習を進めた結果、生成案を点検して改善する振る舞いが現れたという。
追加の計算を候補生成より推論へ振り分ける
推論時計算を増やすと、Muse Imageは推論を深め、ツールの呼び出しと自己修正の回数を増やす。Metaの内部比較では、テキストによる推論と画像生成に使った合計計算量に対し、人間の選好に基づくEloスコアが約対数線形に改善した。
計算量が同じでも、使い方によって評価の伸びは異なった。複数の画像を生成して最良の候補を残すBest-of-N(BoN)は初期に品質を改善したものの早く飽和し、その計算量を意図的な推論へ振り向けた方が評価を継続的に伸ばした。
編集履歴と複数の参照画像を同じ指示系列で扱う
Metaによると、Muse Imageはユーザーが指定した部分を変更しながら、複数回の編集を通じて画像の整合性を維持するという。前の編集結果を受けて次の指示を処理できるため、対話を重ねながら画像を目標へ近づけられる。
入力には、人、物体、衣服、スタイル、環境を含む複数の参照画像を使用し、それぞれの要素を一つの画像へ構成できる。テキストと画像を交互に並べた指示にも対応し、参照する要素とその扱い方を同じ入力系列で指定する。