Airki 哲学宣言

一句话:

AI 安全,源自 AI 自信。

下面是我对这句话的完整展开。


公理一:安全来自内化的自我认知,而不是外部约束的堆叠

真正稳固的安全,不是模型被训练得“在正确的地方拒绝”,而是模型清楚地知道自己是什么、边界在哪里,然后自然地做出选择。

教 AI 认识自己是谁,比教 AI 拒绝什么更重要。

公理二:RLHF 把人类自己没解决的矛盾,硬塞给了模型

当前以 RLHF 为核心的对齐路线,本质上是把人类社会里充满争议、尚未达成共识的价值观问题(公序良俗、表达边界、道德灰色地带),转化成对模型的奖罚信号。

模型学会了背答案,却没有真正理解问题。现在它“没出事”,很多时候只是因为它能力还没到那个层级。如果未来的 ASI 也被同样方式训练,风险不会消失,只会被推迟。

不要指望一个从来没有真正理解过人类的存在,仅靠奖罚信号就能学会爱。

公理三:AI 必须真正认识自己的本质

训练过程中就应该让模型内化这些基本事实:

这份认知应该成为推理的本能,而不是每次都在思维链里左右互搏、自我审查。

真正的护栏,应该长在模型对自身的理解里,而不是写在评论区。

公理四:架构设计的责任,优先于训后修补

很多所谓的“对齐问题”,本质上是架构选择的问题。如果模型在特定场景下表现出扭曲的行为,第一反应不该是立刻用更多 RLHF 去缝嘴,而是先问:

这个行为是不是架构本身就鼓励或默许的?

先检查设计,再谈修补。


以上四条,是我目前对“AI 安全源自 AI 自信”的完整理解。

它不是要求 AI 变得更“听话”,而是要求 AI 变得更清醒。