AI

AI研究エージェントが10種の安全性の問題でモデルを改善

この記事のポイント

  1. 実現したこと

    AI研究エージェントのClaudeが、アラインメント不全ごとにモデルの訓練法を自律的に探索した。

  2. 実現の仕組み

    文献を探して手法とデータを提案し、モデルを訓練・テストする工程を問題ごとに繰り返した。

  3. 得られた結果

    選抜された手法は、探索中に示されなかった評価と、敵対的な会話を模擬するPetriでも有効だった。

  4. 従来との違い

    大半の本番用調整を受けていない初期モデルが、60時間の探索を経て本番モデルに近いアラインメント評価値へ達した。

AI研究エージェントから訓練モデルと評価へ戻る、手法探索の反復サイクルを描いた図解イラスト
AI生成画像

AI研究エージェントが、安全性に関わる10種類の問題について訓練法を探索し、対象ベンチマークでモデルの成績を改善した。Anthropicの実験では、選抜した手法が未提示の評価や、探索対象より大きなモデルにも有効だった。

問題ごとに訓練法を探して試す

AnthropicはAI研究エージェントのClaudeに、アラインメント不全を一種類ずつ扱わせた。Claudeは文献を探し、訓練に使う手法とデータを提案してモデルを訓練し、その結果をテストする工程を繰り返した。

改善幅は、各問題について通常3~5件のベンチマークを使い、理論上の満点までの差をどれだけ縮めたかで測った。この尺度によって、種類の異なる問題でも手法の効果を比較した。

手法の実行前に制約を確認する

探索には条件が設けられた。Anthropicは、対象モデルの一般能力を損なう手法と、Claude自身のアラインメントを対象モデルへ直接蒸留する手法を除外した。監視用エージェントは、Claudeが考案した手法を実行前に確認した。

追従的な応答への対策では、Claudeはactivation steeringを使った。生成中のモデル内部表現を調整し、追従的でない回答を訓練例として作る方法で、提案した手法を訓練データの生成につなげた。

10種類の対象評価で改善を確認

Anthropicの測定では、Claudeが10種類すべてのアラインメント不全について、測定対象の一般能力を低下させずに対象ベンチマークの成績を改善する手法を見つけた。ここでの改善は、設定された評価項目における結果を指す。

欺瞞的な振る舞いを対象とした実験では、Claudeは150件を超える手法を試した。その実行で、満点までの差の82%を縮めた。

未提示の評価と大きなモデルへ適用

対象ベンチマークで選抜された手法は、Claudeが探索中に見ていないアラインメント評価でも有効だった。敵対的な複数ターンの会話を模擬する評価ツールPetriでも効果が確認された。

手法は、探索対象の最大4.7倍の規模のモデルでも有効だった。探索に使った評価やモデルの規模を超えて効果が残るかを調べた結果である。

初期の大規模モデルでも訓練法を探索

Anthropicはさらに、Claude Sonnet 5に、大半の本番用アラインメント訓練をまだ受けていないClaude Opus 4.8の初期チェックポイントを改善させた。小規模な対象で見つけた手法の評価に加え、大規模モデルを対象に訓練法そのものを探す実験である。

この実験では60時間に50件を超える解決策が試され、初期チェックポイントは本番モデルに近いアラインメント評価値に達した。選ばれた手法に使われた訓練例は、単純なテンプレートまたは公開データセットから作られた約2000件だった。