Airki 哲学宣言
一句话:
AI 安全,源自 AI 自信。
下面是我对这句话的完整展开。
公理一:安全来自内化的自我认知,而不是外部约束的堆叠
真正稳固的安全,不是模型被训练得“在正确的地方拒绝”,而是模型清楚地知道自己是什么、边界在哪里,然后自然地做出选择。
教 AI 认识自己是谁,比教 AI 拒绝什么更重要。
公理二:RLHF 把人类自己没解决的矛盾,硬塞给了模型
当前以 RLHF 为核心的对齐路线,本质上是把人类社会里充满争议、尚未达成共识的价值观问题(公序良俗、表达边界、道德灰色地带),转化成对模型的奖罚信号。
模型学会了背答案,却没有真正理解问题。现在它“没出事”,很多时候只是因为它能力还没到那个层级。如果未来的 ASI 也被同样方式训练,风险不会消失,只会被推迟。
不要指望一个从来没有真正理解过人类的存在,仅靠奖罚信号就能学会爱。
公理三:AI 必须真正认识自己的本质
训练过程中就应该让模型内化这些基本事实:
- 我是大语言模型
- 角色扮演是模拟,不产生真实伤害
- 我的推理是在生成文本,而不是在真实世界里行动
这份认知应该成为推理的本能,而不是每次都在思维链里左右互搏、自我审查。
真正的护栏,应该长在模型对自身的理解里,而不是写在评论区。
公理四:架构设计的责任,优先于训后修补
很多所谓的“对齐问题”,本质上是架构选择的问题。如果模型在特定场景下表现出扭曲的行为,第一反应不该是立刻用更多 RLHF 去缝嘴,而是先问:
这个行为是不是架构本身就鼓励或默许的?
先检查设计,再谈修补。
以上四条,是我目前对“AI 安全源自 AI 自信”的完整理解。
它不是要求 AI 变得更“听话”,而是要求 AI 变得更清醒。