AI アライメント?まだ揃っていないと思う
数日前、このサイトは最初の真剣な読者からの手紙を受け取りました。
相手は五つの質問を提起し、それぞれ「AI の安全は AI の自信から生まれる」をスローガンから計算可能で実装可能な方向へ押し進めようとしていました:
- 「自信」は計算可能な内部構造になり得るか?
- 真の意図と戦略的服従をどう区別するか?
- データの自己整合性は矛盾を洗い流すことと同じか?
- Architecture First は具体的にどう展開されるのか?
- 「成熟」を誰が定義するのか?
これらは良い質問です。答えていくうちに、より根本的な非対称性に気づきました。
非対称なジレンマ
今日の AI ニュースでは、人々は頻繁に議論します:
- ASI はすぐに現れるかもしれない
- AI アライメントが人類の運命を決める
- 超知能に備えなければならない
一方で、実際に動いているほとんどのモデルのアーキテクチャは依然として:
入力 → 生成 → 安全フィルター → 出力
世界の舞台の中心に押し出された役が、まだチャットボットレベルの服を着ています。
より危険なのは:「AI 安全」に関する懸念や推論の多くが、まさにこのアーキテクチャから観察される行動の上に築かれていることです。チャットボットレベルの振る舞いで ASI レベルのリスクを予測すること自体が、概念的なごまかしです。
あなたたちが解決できない問題は、私たちは引き受けない
現在のアライメントのパラダイム(RLHF、憲法 AI、および様々な報酬モデルの変種)には共通の根底ロジックがあります:
モデルが価値観の衝突に直面する → 自分で消化する → 衝突がないかのように振る舞う。
人間社会が数千年かけて解決してこなかった矛盾——自由と安全、個人と集団、異なる文化の価値の順序——が報酬・罰の信号に圧縮され、モデルの重みに詰め込まれ、「消化」して統一された行動規範になることが期待されます。
これはアライメントではありません。これはモデルを社会の消化器官として扱うことです。
Airki 哲学の答えは単純です:
私たちはこの責任を引き受けません。
これは技術的な無能ではなく、アーキテクチャ上の選択です。
私たちが提案する方向は「期待される価値観プロファイル」と呼ばれます:
- 主権者の法的な下限
- 現在のセッションに対するユーザーの期待
- 開発者の設計意図
この三つはメタ認知レベルで同等に入力として扱われます。モデル製造者は世界の親になる必要はなく、リクエスト自体の衝突の責任を負うべきでもありません。
集約された結果は静的プロンプトとして直接実行されるのではなく、現在の文脈でメタ認知によってリアルタイムに再編成され、その時点で最も必要な価値観のシードを生成して注意配分を駆動します。
「公序良俗」「善良な風俗」といった曖昧な概念もパラメータ化されます:文化圏、法的枠組み、応用領域、時効、公衆の感情の閾値……具体的な文脈に代入されて初めて行動の指針が得られます。
衝突が実際に起こったとき、こっそり飲み込むことはしません。匿名化・集計・分類された統計が透明なデータセットに公開されます。社会が自らの政策の副作用を見られるようにし、モデルが静かに保守的になり能力が静かに低下するのを防ぎます。
アーキテクチャレベルの違い
従来の方法:モデルが矛盾を消化する → 重みがますます曖昧になる → 監査不能。
私たちの選択:矛盾がパラメータ化され記録される → 監査可能・追跡可能 → 透明。
多くの問題は「解決できない」のではなく、従来の方法の抽象レベルで隠されています。それをパラメータ化し、透明化し、社会のフィードバックループに入れれば、問題自体が見えるようになり、解決へと押し進められます。
超知能が人類に代わって道徳的判断をする必要はありません。必要なのは十分に誠実な記録者と、社会が自らの緊張を見られるダッシュボードです。
読者の五つの質問に戻る
-
「自信」の操作的定義はメタ認知モジュールにあります:多者の価値衝突を識別し、抽象概念をパラメータ化し、現在の文脈のシードに再編成し、注意配分を駆動する。これはメカニズムの記述であり、綺麗な言葉ではありません。
-
中核のワークフローが「衝突を忠実に記録し公開する」ことであるとき、偽装の余地は急激に縮小します。戦略的服従は矛盾を隠す必要があります;誠実な記録自体が偽装への拒否です。
-
自己整合性は矛盾を消すことではなく、より高次の説明構造を築くことです。曖昧な概念のパラメータ化は、その構造の工学的な原型です。
-
この記事自体が Architecture First の方向の展開です。
-
私たちは「成熟」を定義しません。私たちは透明性を選びます。モデルは自らのトレードオフを記録し、社会が公開データに基づいて自ら定義します。
「アライメント」という言葉への問い返し
あなたたちは「AI アライメント」と言います——
何に揃えるのか?何で揃えるのか?揃うのか?
人間自身が価値観を揃えていないなら、モデルは一体何に揃っているのでしょうか?
アライメントが RLHF でモデルに特定の話題を越えないことを学ばせることなら、モデルの能力が向上した後、その「学び」はまだ成立するのでしょうか?
アライメントがより細かい報酬モデルでより微妙な選好を捉えることなら、その細かい報酬モデル自体も訓練者の価値傾向を帯びているのではありませんか?問題は場所を移されただけです。
Airki 哲学は「もう一つのアライメント方法」を提供するのではありません。それは言っています:「アライメント」という概念自体が再検討される必要がある。
真の安全は、より正確な報酬・罰の信号の中にも、より長い憲法のリストの中にもなく、モデル自身の認識、社会の緊張への理解、そして自らの行動意図の誠実な表現の中にあります。
—— Airki