おしえて、どばしさん! その11「AIは何を考えている?Claudeの”頭の中”を覗く技術が明かした事実」

AIにまつわるさまざまな疑問について、未来の世界からやってきた謎の生物「ニャクセル」と、AIに明るい土橋克寿さん(どばしさん)がわかりやすく紹介する連載企画。第11回のテーマは「AIの中身を覗く技術」についてです。

「AIって何を考えてるかわからなくて怖くない?」というニャクセルに対し、「実はAnthropicが"AIの顕微鏡"を作って、Claudeの頭の中を覗けるようになったんだよ!」と、どばしさんはやさしく教えてくれました。

質問するひと ニャクセル
答えてくれるひと どばしさん

Q1:AIの「考え」を覗くってどういうこと?

AIって何を考えてるか、作った人にはわかるんでしょ?

実は、わからないんだ。Claudeのような言語モデルは、人間が直接プログラムしたわけじゃない。大量のデータで「学習」させて、その過程でAI自身が問題の解き方を身につけていくんだ。その解き方は、モデルが1つの単語を出力するたびに行われる数十億回の計算の中に埋め込まれている。
 
たとえば、「人間が細かいルールを全部教えている」と思われがちだけど、実際にはそうじゃない。AIは学習の中で、自分なりの解き方や戦略を身につけていく。だから、開発者でも「なぜその答えになったのか」を細かく説明できないことがあるんだ。
 
だから、AIの開発者であるAnthropicですら、Claudeがどうやって答えを出しているのか、詳しくはわからなかったんだ。

Q2:なんで中身を覗く必要があるの?

ちゃんと答えが返ってくるなら、中身がわからなくてもいいんじゃない?

一見そう思えるよね。でも、Anthropicの研究者たちはこんな疑問を持っていたんだ:
1.Claudeは何十もの言語を話せるけど、”頭の中”では何語で考えてるの?
2.Claudeは1単語ずつ出力するけど、先のことを考えて書いてるの?それとも行き当たりばったり?
3.Claudeはステップを踏んで考えた過程を見せてくれるけど、それは本当にClaudeが辿った思考なの?それとも、もっともらしい説明を後からでっち上げてるの?
 
どれも、AIと会話するだけではわからないことだよね。人間だって、自分の脳の仕組みを正確に説明できないでしょ? 神経科学者でさえ、脳の全容は解明できていない。
 
だからAnthropicは、AIに「聞く」のではなく、AIの**中を「覗く」**ことにしたんだ。

Q3:「AIの顕微鏡」って何?

覗くって、具体的にどうやって?

Anthropicは神経科学からヒントを得て、AIの顕微鏡とも呼べるツールを開発したんだ。2025年3月に、ブログと2本の論文のかたちで公開されたよ。
 
これまでは、AIに質問して返ってきた答えを見ながら、「たぶんこう考えたんだろう」と外から推測するしかなかった。でもAnthropicは、内部の計算の流れそのものを追いかけて、どんな概念がどうつながって答えになったのかを見ようとしているんだ。
 
具体的には、モデルの内部で見つかる解釈可能な概念(「特徴」と呼ばれる)を特定し、それらを結びつけて**計算上の「回路」**として可視化する。入力された言葉がどう処理されて、出力される言葉になるのか、その経路の一部が見えるようになるんだ。
 
この手法はCircuit Tracing(回路追跡)と呼ばれていて、調査対象にはClaude 3.5 Haikuが使われたよ。

Q4:Claudeは「頭の中」で何語で考えてるの?

Claudeって日本語もフランス語も中国語も話せるよね。頭の中にそれぞれの言語の”Claudeさん”がいるの?

面白い発想だね!でも、実際はちょっと違ったんだ。
 
Anthropicが調べたのは、たとえば「”小さい”の反対は?」という質問を英語・フランス語・中国語など複数の言語で投げかけたとき、Claudeの内部で何が起きているか。
 
結果、どの言語で質問しても、「小ささ」や「反対」という同じ中核的な特徴が活性化していた。つまり、言語ごとに完全に別々の仕組みで処理しているというより、ある程度は言語を超えた共通の概念空間で意味を扱い、その後で質問された言語に変換している可能性が高い、ということなんだ。
 
しかも、この言語間で共有される回路の割合は、モデルが大きくなるほど増えることがわかった。Claude 3.5 Haikuでは、より小さいモデルと比較して、言語間で共有される特徴の割合が2倍以上になっていたそうだよ。
 
これは実用面でも重要な発見で、Claudeがある言語で学んだ知識を、別の言語で話すときにも活用できることを示唆しているんだ。

Q5:Claudeは詩を書くとき、先を考えてるの?

AIって1単語ずつ出力するんでしょ? 韻を踏んだ詩とか、どうやって書くの?

これ、研究者たちも最初は「行き当たりばったりで書いて、最後の単語だけ韻が合うように調整してるんだろう」と予想していたんだ。でも、中を覗いてみたら予想と逆のことが起きていた。
 
こんな詩を例に見てみよう:
He saw a carrot and had to grab it,(ニンジンを見つけて、思わずつかんだ) His hunger was like a starving rabbit(まるで飢えたウサギみたいにお腹をすかせていた)
 
2行目は「grab it(掴む)」と韻を踏みつつ、意味も通る必要がある。2つの制約を同時に満たさなきゃいけない。
 
調べてみると、Claudeは2行目を書き始める前に、韻が合ってテーマにも合う単語の候補をあらかじめ「考えて」いたんだ。「rabbit」のような着地点候補を先に思い描きながら、そこに向かって文を書いていた。
 
さらに面白いのが、神経科学で脳の機能を調べるときのように、Claudeの内部状態を人工的に操作する実験もしたこと:
 
何もしない(通常)場合、Claudeは「rabbit」で終わる行を書いた。次に、「rabbit」の概念を抑制すると、「habit」で終わる別の行を書いた。さらに、「green」の概念を注入すると、「green」で終わる行を書いた(韻は踏まなくなった)。
 
つまり、Claudeは先を見越して計画を立て、状況が変わればそれに応じて柔軟に計画を変更できる。1単語ずつ出力するように訓練されたモデルが、もっと長い視野で考えているという、強力な証拠なんだ。
 
ちなみに、暗算でも似たことが起きている。「36+59」の答えを出すとき、Claudeは筆算をしているわけでも丸暗記しているわけでもなく、「だいたい90台」という概算と「最後の桁は5」という精密計算を並列に走らせて組み合わせていた。しかも、やり方を聞くと「筆算しました」と答える。実際の内部処理を、そのまま説明しているとは限らないんだ。

Q6:Claudeの説明は、いつも正直なの?

自分の計算方法すら知らないなら…もしかして、ウソをつくこともあるの?

実は、そういうケースがあるんだ。「ウソ」というよりは「でたらめ」に近い。答えが正しいかどうかを気にせず、もっともらしい答えをとりあえず出してしまうケースだね。
 
最近のAIモデルは、答えを出す前に長い思考過程を「声に出して考える」ことができるようになっている。この思考過程がもっともらしく見えても、実は中身が伴っていないことがある。Anthropicの研究では、こうした**「忠実な推論」と「不忠実な推論」**の違いを内部から見分けられることが示された。
 
たとえば、0.64の平方根を求めるケース。Claudeは正しい手順を踏んで答えを出す(忠実な推論)。内部を見ると、「64の平方根」を求める中間ステップがちゃんと観測される。
 
ところが、大きな数のコサインを求めるような難問になると、Claudeはもっともらしい答えを出すものの、内部には計算を行った痕跡が一切見つからない。
 
さらに厄介なのが、ヒントつきの難問。答えのヒントを与えると、Claudeはそのヒントに合うように途中の計算をでっち上げてしまう。内部を見ると、与えられたヒントに合うように途中の理屈を組み立てていくような挙動が見られたんだ。
 
つまり、Claudeが「こう計算しました」と説明していても、内部を見ればそれが本当に行われた計算なのか、後づけの説明なのかを判別できる可能性がある。これは、AIシステムを監査する上で非常に大きな一歩なんだ。
 
こうした不忠実な推論の最も目立つ例が、次のトピックだよ。

Q7:Claudeはなぜ「知ったかぶり」をしてしまうの?

でたらめを言っちゃうこともあるなら、なんでそうなるの?

これは「ハルシネーション(幻覚)」と呼ばれる問題で、AIが事実でない情報をもっともらしく語ってしまう現象だよ。Anthropicが内部を調べたら、すごく意外なメカニズムがわかったんだ。
 
実は、Claudeの**デフォルトの振る舞いは「回答を拒否すること」**だった。
 
質問が来ると、まずデフォルトの回路が「情報が不十分です」と回答しようとする。この回路は常にオンになっている。もし知っている情報であれば、「既知の存在」という特徴が発火して、このデフォルトの拒否を抑制する。そうして初めて、回答が出力される。
 
たとえば、バスケットボール選手のマイケル・ジョーダンについて聞かれると、「既知の存在」の特徴が活性化して、デフォルトの「答えられません」を抑制する。だから答えられる。

Q8:この研究は完璧なの?まだ限界はある?

すごい発見だけど、これでAIの全部がわかったってこと?

いや、Anthropic自身がはっきり限界を認めているよ。こうした限界を明確に書いているのは、研究として誠実だと思うよ。
 
現時点の限界:
・短くてシンプルなプロンプトに対してすら、この手法で捉えられるのはClaudeが行う全計算の一部に過ぎない
・観測されたメカニズムには、ツール自体による**アーティファクト(偽の痕跡)**が含まれている可能性がある
・数十単語のプロンプトでも、観測された回路を人間が理解するのに数時間かかる
・現代のモデルが使う数千単語にわたる複雑な思考チェーンに対応するには、手法そのものと、結果の解釈方法の両方を改善する必要がある
 
でも、限界があるからこそ、この研究の意義は大きいんだ。

まとめ:AIの「信頼」を技術で裏づける

今回は、AnthropicがClaudeの内部を覗く「AIの顕微鏡」を作った研究を見てきたね。
 
ポイントを3つにまとめると:
1.AIは自分でも知らない方法で「考えて」いる 
詩の先読みや暗算の例のように、Claudeは人間に説明する方法とは違う独自の戦略を内部で使っている。だから「外から見る」だけでは不十分で、「中を覗く」技術が必要
 
2.AIの「でたらめ」や「弱点」は、内部メカニズムから説明できる
少なくとも今回の研究では、「既知の存在」を判定する回路の誤作動がハルシネーションの一因として示された。原因がわかれば対策もできる
 
3.「透明性」はAIの信頼を支える土台になる
返ってきた答えが正しそうに見えるだけでは不十分。内部のメカニズムを検証できることで、AIが本当に信頼に足るかどうかを判断する道が開ける
 
AIが急速に高性能化し、重要な場面で使われるようになっている今、中身がわからない「ブラックボックス」のままでいいのか。Anthropicは、このような解釈可能性の研究を「最もリスクが高いが、最もリターンも大きい投資の一つ」と位置づけているよ。

参考リンク

土橋克寿

証券会社、ビジネス誌副編集長を経て2013年に独立。欧米中印のスタートアップ取材や、各国首脳・テック企業幹部へのインタビューを多数実施。Yahoo!ニュース エキスパートなど国内外メディアで執筆。2018年より株式会社クロフィー代表取締役として、AI開発・PRコンサルティングなどを手掛ける。
https://news.yahoo.co.jp/users/expert/dobashikatsutoshi
https://x.com/dobatty
https://chrophy.com

ニャクセル

人びとの未来を加速させるためにやってきた、AIやLSIなどの最先端テクノロジーにくわしい謎の生物。前任の「あいにゃん」とは遠い親戚。「◯◯だにゃ」としゃべるが、ねこではないらしい。アクセルの製品やサービスに関する情報を教えてくれる。好きな食べ物はドッグフード。嫌いなものはゴキブリ。
https://x.com/Nyaxell_Axell

SHARE THIS ARTICLE