Archive
Constitutional AIの原則と訓練ループを紙片で表現した図解

03 / Philosophy

信頼は、思想だけでは足りない。

Constitution、解釈可能性、RSP。Anthropicの思想は、社内の価値観ではなく、外から検査できる制度として表に出る。

憲法は、モデルの魂を外へ出す。

Claude's Constitutionは、モデルが何を良い応答とみなすかを自然言語で書いた文書だ。重要なのは、これが社外から読めること。約束を公開し、行動の基準を外部に置く。

これは安全性の説明ではなく、信頼の第一工程である。

中身を見に行く研究が、ブランドになる。

解釈可能性は、研究テーマであると同時にAnthropicの存在証明だ。AIをブラックボックスのまま売るのではなく、特徴を取り出し、内部機構を観察し、議論に耐えさせる。

解釈可能性の章を読む

出す前に、止める条件を書く。

Responsible Scaling PolicyとASLは、能力が上がったときに何を止めるかを先に決める仕組みだ。これはAI版の治験フェーズに近い。

  • 能力に応じた段階制
  • 安全対策が追いつくまでの停止条件
  • 行動の予測可能性

信頼は、約束、機構、行動で作る。

Anthropicを「信頼の製造業」と読むなら、Constitutionは約束、解釈可能性は機構、RSPは行動の透明性にあたる。思想は、工程になって初めて社会に届く。