独立評価者がフロンティアAIの学習過程へ入り、モデルと開発上の判断を継続的に調べる体制の構築が始まる。AnthropicとAccentureは、従業員に準じるアクセスを前提とする埋め込み型評価で提携した。
独立評価者をモデルの開発工程へ組み込む
AnthropicとAccentureは、フロンティアAIの独立評価者を開発工程へ組み込む体制の構築で提携した。取り組みは、AccentureのAI専門事業であるFacultyが主導する。
評価対象には、モデルの評価とred-teaming、アラインメント評価、安全対策の試験を含める。完成したモデルの挙動だけでなく、モデルが形作られる過程へ評価範囲を広げる計画だ。
従業員に準じるアクセスで学習と配備判断を追う
埋め込み型評価者には、従業員に準じるアクセスを与える計画である。このアクセスにより、学習中のモデルを観察し、モデルの構築方法や配備方法を左右する判断を追い、担当者と直接対話する。
評価者が調べる範囲はモデル単体に限らない。企業の運営と安全上の約束の履行を検証し、見落としを特定するほか、事故の報告や便益・リスクに関する情報提供も担う構想になっている。
両社が5年間で各10億ドル以上を投資
AnthropicとAccentureは、埋め込み型評価に必要な能力の構築へ、今後5年間でそれぞれ少なくとも10億ドルを投資する見込みである。評価者が開発工程へ入るための体制を、長期の投資対象として位置付けた。
一方、評価者へ開示する情報の範囲や、調査結果を報告する方法にはまだ標準がない。独立評価へ資金を供給する確立済みの制度もないため、今回の取り組みではAnthropicがAccentureの作業へ直接資金を提供する。
非独占の枠組みで複数の評価組織を組み合わせる
今回の提携は非独占である。AnthropicはAccenture以外の評価組織とも協力でき、Accentureも他のAI開発企業へ同様の評価を提供できる。
AnthropicはMETRなどの非営利評価組織とも、各組織側の資金を使って埋め込み型評価の一部を試行する協議を進めている。単一の評価者へ集約せず、複数組織が共通の標準の下で活動する評価体制を目指す。