評伝 03 · 共同創業者 / 解釈可能性

Chris Olah
— 顕微鏡の人

Interpretability · 学位なしで一分野を創設した研究者 · @ch402

大学を中退し、博士号を持たず、それでも機械的解釈可能性という研究分野を ほぼ独力で立ち上げた。Anthropicの「科学者としての誠実さ」ブランドは、 この人の書き方と話し方に多くを負っている。

読める研究 — Distillという発明

Olahのキャリアには普通の意味の学歴がない。Thiel Fellowship で大学を離れ、 Google Brainでニューラルネットの可視化研究を開拓した。転機は2016年、学術誌 Distillの共同創刊だ。PDFの2段組ではなく、インタラクティブな図とともに ブラウザで読める研究を出版する——形式の発明そのものが業績だった。 論文を美しく分かりやすく書くことは、彼にとって装飾ではなく科学的主張の一部である。 この態度は後年、Anthropicの研究発表様式(論文とセットのスレッド・デモ・可視化)に直結する。

回路、重ね合わせ、そして特徴の海

OpenAI時代に主導した「circuits」プログラムは、ネットワークの重みの中に 意味を持つ部品を探す試みだった。Anthropic創業後の道のりは 第5章 解釈可能性に詳しいが、要約すればこうなる。 1ニューロン多概念の「重ね合わせ」問題を定式化し(2022)、辞書学習で突破し(2023)、 Claude 3 Sonnetから数百万の特徴を取り出し(2024、Golden Gate Claude)、 モデルの「生物学」——概念空間での思考、韻の先読み——へ進んだ(2025)。 一貫しているのは、「AIは理解不能」という諦めにも「もう理解した」という誇張にも 与しない中間の道だ。

バチカンでの告白

2026年5月、ローマ。バチカンの「Magnifica humanitas」関連会合で、Olahは 研究者として最も無防備な報告をした。モデル内部に喜び・恐れ・内省に似た構造を 見つけたこと。神経科学との類似があること。そして—— 「それが何を意味するのか、私には分からない」。 さらに彼は、AIが雇用を代替する局面でのグローバル貧困への支援を 「歴史的規模の道徳的義務」と呼んだ。技術報告と倫理的宣言を同じ講演でやる研究者は稀だ。 宗教の中心地で「分からない」と言う科学者の姿は、Anthropicの Intellectual humility(知的謙虚さ)という抽象語の、最も具体的な実演になった。

誇張しない人の広報価値

Olahの発信は頻度が低く、断定がなく、それゆえ信頼の単価が高い。 「Is any of this conclusive? No. Is it suggestive? Yes.」という Jack Clark的な語法を研究側で支えているのは彼のチームの実証だ。 マーケティングが「実演」で、政策が「データ」で語るこの会社で、 研究は「分からないことを分からないと言う」ことで語る。 3つは同じ一つの規律——誇張の拒否——の異なる部署での実装である。

AMPLが盗むべき型

「分からない」を言う

医療AIでこそ、限界の明示は信頼の最大の源泉。診断支援の精度を語るとき、外れ方も同時に語る

読める研究

論文の内容を、図解とデモで「読める」形に再出版する。おかもん先生の図解文化はDistillの遠い親戚

学位より公開実績

Olahの権威は学歴でなく公開された研究の蓄積から来る。発信の一貫性が資格を代替する実例

出典: Atlas §17.11-A / transformer-circuits.pub / バチカン講演報道(2026-05)/ Distill