言語モデルClaudeの内部で、出力されない概念や多段階推論を保持する小規模な表現群「J-space」が見つかった。読み出しと介入の実験は、この表現群が高次の処理に因果的に関与することを示した。
学習中に生まれた単語対応の内部空間
Anthropicは、言語モデルClaudeの内部で特別な役割を持つ小規模な表現群を特定し、「J-space」と名付けた。J-spaceは設計時に組み込まれた部品ではなく、モデルの学習中に自発的に形成されたという。
各パターンは特定の単語と対応する。ただし、パターンの活性化はその単語の出力を意味せず、その概念が内部処理に現れていることを示す。
Jacobianで内部活性を語彙へ写す
内部表現の読み出しには、Jacobian lens(J-lens)を使う。この手法は語彙中の各単語について、その単語を現在ではなく将来出力する可能性を高める内部活動パターンを求める。
公開参照実装では、平均入出力Jacobianを使って各層の残差ストリームを最終層の基底へ線形に写す。その出力をモデル自身のunembeddingへ通して語彙トークンの順位に変換するため、外部の分類器を別途学習させずに内部活性を単語として読める。
層を進む無言の計算を追跡
Jacobian lensをClaudeの複数の層へ適用すると、J-spaceに現れる単語が処理の進行とともに変化する様子を追跡できる。入力や出力に存在しない概念も対象となり、コード中の未指摘の不具合や、数式問題の途中計算に対応する語が内部で現れた。
Anthropicの実験では、J-spaceの内容は他の内部表現よりClaude自身が言語化して報告しやすかった。特定の対象を考えるよう指示した場合にも対応するパターンが活性化し、J-space以外の表現より指示に応じた調整が容易だった。
中間段階への介入で因果関係を検証
多段階問題を解かせると、外部へ書き出されない中間段階が正しい順序でJ-spaceに現れた。これは、表示されたchain of thoughtとは別に、内部活性の段階で推論過程を観察できることを示す。
観察された相関だけでなく、内部パターンを操作する介入実験でも役割が確かめられた。Anthropicによると、J-spaceのパターンは多段階課題の成績を因果的に媒介し、その利用を妨げると通常の対話は続いたものの、高次の認知機能が失われたという。
一つの概念を複数の処理へ共有
J-spaceで活性化した概念は、一種類の出力に固定されず、異なる課題へ柔軟に利用された。例えば「France」に対応する表現が活性化した後には、首都、通貨、所属する大陸といった別々の情報を引き出せた。
Anthropicは、J-spaceがニューラルネットワークの他部分と特に強く接続されている証拠も得たとしている。この接続を通じて一つの情報を複数の処理へ渡せることから、神経科学のglobal workspaceに似た共有経路として位置付けた。
open-weightsモデルで試せる参照実装
Jacobian lensの参照実装は公開されており、open-weightsのdecoder transformerでレンズの学習、適用、層と位置ごとの可視化を実行できる。使用例にはQwenが採用され、他のHugging Face decoderにも適応できる構成になっている。
実装は、事前学習済みのレンズを読み込む経路と、独自のプロンプト集合から平均Jacobianを推定してレンズを作る経路を備える。これにより、Claudeで報告された読み出し手法の中核を、重みが公開された別の言語モデルへ適用できる。