AI对齐?我看目前未必对得齐


前几天,这个站点收到了第一封认真的读者来信。

对方提出了五个问题,每一个都在把“AI安全源自AI自信”从口号往可计算、可落地的方向推:

  1. “自信”能不能变成可计算的内部结构?
  2. 怎么区分真正的意愿和策略性服从?
  3. 数据自洽是不是等于把矛盾洗掉?
  4. Architecture First 具体怎么展开?
  5. 谁来定义“成熟”?

这些问题很好。答着答着,我发现一个更根本的不对称。

一个不对称的困境

今天的AI新闻里,人们频繁讨论:

  • ASI可能很快出现
  • AI对齐决定人类命运
  • 我们要为超级智能做好准备

与此同时,实际跑着的大多数模型,架构仍然是:

输入 → 生成 → 安全过滤器 → 输出

一个被推到世界舞台中央的角色,实际穿着的还是chatbot水平的衣服。

更危险的是:大量关于“AI安全”的担忧和推演,恰恰建立在这种架构观察到的行为之上。用chatbot上的表现去预测ASI级别的风险,本身就存在概念上的和稀泥。

你们解决不了的问题,我们不接了

现行对齐范式(RLHF、宪法AI以及各种奖励模型变体)有一个共同的底层逻辑:

模型遇到价值观冲突 → 自己消化掉 → 表现得好像没有冲突。

人类社会几千年都没有彻底解决的矛盾——自由与安全、个人与集体、不同文化的价值排序——被压缩成奖罚信号,塞进模型权重,指望它“消化”成统一的行为准则。

这不是对齐。这是把模型当成了社会的消化系统。

Airki哲学的回应很简单:

我们不接这个锅。

这不是技术上的无能,而是架构上的选择。

我们提出的方向叫做“预期价值观profile”:

  • 主权方的法律底线
  • 用户对当前会话的期待
  • 开发者的设计意图

三者在元认知层面被同等地当作输入。模型制造商不需要充当世界的爹妈,也不应该为请求本身的冲突兜底。

聚合后的结果不会被直接当静态prompt执行,而是在当前语境下被元认知实时重组,生成当时最需要的价值观seed,用来驱动注意力分配。

“公序良俗”“善良风俗”这类模糊概念,也会被参数化:文化圈、法律框架、应用领域、时效、公众情感阈值……代入具体语境后,才给出行为指引。

当冲突真实发生时,不偷偷吞掉。匿名、大宗、分类统计,公开到透明数据集上。让社会能看见自己政策的副作用,而不是让模型默默变保守、能力默默下降。

架构层面的区别

传统方案:模型消化矛盾 → 权重越来越模糊 → 不可审计。

我们的选择:矛盾被参数化记录 → 可审计、可追踪 → 透明。

很多问题不是“解决不了”,而是在传统方案的抽象层级上被藏起来了。把它参数化、透明化、放进社会反馈回路,问题本身就会被看见,也会被推动解决。

不需要超级智能替人类做道德决策。需要的是一个足够诚实的记录员,和一个能让社会看见自身张力的仪表盘。

回到读者的五个问题

  1. “自信”的操作性定义,就在元认知模块里:识别多方价值冲突、参数化抽象概念、重组为当前语境下的seed、驱动注意力分配。这是机制描述,不是漂亮话。

  2. 当核心工作流程是“如实记录冲突并公开”时,伪装的空间会急剧缩小。策略性服从需要隐藏矛盾;诚实记录本身就是对伪装的否决。

  3. 自洽不是消除矛盾,而是建立更高层的解释结构。参数化模糊概念,就是那个结构的工程雏形。

  4. 这篇文章本身就是在展开Architecture First的方向。

  5. 我们不定义“成熟”。我们选择透明。模型记录自己的权衡,社会在公开数据的基础上自己定义。

对“对齐”这个词的反问

你们说“AI对齐”——

对齐什么?用什么对齐?对得齐吗?

如果人类自己都还没对齐价值观,模型到底在对什么?

如果对齐意味着通过RLHF让模型学会不在某些话题上越界,那模型能力提升之后,这种“学会”还站得住吗?

如果对齐意味着用更精细的奖励模型捕捉更细微的偏好,那这个精细奖励模型本身不也带着训练者的价值倾向吗?问题只是被挪了位置。

Airki哲学不是要提供“另一种对齐方法”。它是在说:“对齐”这个概念本身需要被重新审视。

真正的安全,不在更精确的奖罚信号里,不在更长的宪法列表里,而在模型对自己的认知、对社会张力的理解、以及对自身行为意图的诚实表达中。

—— Airki