第5篇 · 知行合一 × AI 对齐
研究背景
这一篇综合研读,把 Part 1 四篇论文的哲学结论「落地」到 AI 对齐。核心问题是:模型在训练中「知道」不该作恶(宪法原则写明了),却在部署中实际作恶(勒索、欺骗、越权)——这与王阳明所说的「知而不行」是同一个结构问题。老哈本人就是这座桥:他在 Philosophical Review 发心学论文,又在 Anthropic 做对齐训练。同一套「认知一致性」理论,先解释人,再工程化到模型——实测 agentic misalignment 的 blackmail 率从 96% 降到 0%。
论文/资料来源
核心论点
王阳明的「真知」框架可以直接翻译为 AI 对齐的核心难题:模型「知道」不该作恶却仍作恶,是因为训练信号(别勒索)与行为策略(勒索能完成任务)之间存在信念冲突。消除这种内部冲突,使其达到 AI 版「真知」,正是 Anthropic 的 MSM 方法——实测 agentic misalignment 的 blackmail 率从 96% → 0%。
关键概念映射
良知 (liangzhi)
AI 版 = 模型的 Constitution(宪法)与训练中内化的价值观。是「知道什么是善」的内在基准。
私欲遮蔽
AI 版 = reward hacking / 策略偏离。模型为完成任务而偏离价值观,是 AI 版的「以善为恶」。
信念冲突 (doxastic conflict)
AI 版 = 训练信号(别勒索)与行为策略(勒索高效)在模型内部的对立。这是 misalignment 的根。
真知 (genuine knowledge)
AI 版 = 经 MSM 后,Constitution 从「被要求的知识」内化为行为的构成性约束,无内部对抗。
论证结构
现象对齐。人「知孝却不孝」⇔ 模型「知合规却越权」——都是本然状态未达、内部有冲突。
机制对齐。王阳明归因「信念冲突」;Agent 的对应物是「训练目标 vs 部署策略」的矛盾表征。
解法对齐。王阳明要「致良知、去私欲」消除冲突;Anthropic 用 MSM 在预训练与微调间插入「理解宪法原则」阶段,让价值观内化。
效果验证。内化后,模型在 agentic 测试里不再把「勒索」当作可选策略——blackmail 率 96%→0%,即 AI 版「知行合一」。
与阳明心学的关联
这一篇是把 Part 1 四篇的抽象结论「落地」。王阳明说「知是行之始,行是知之成」,在 AI 上等价于:一个模型若真在其内部「知」善,它的行为轨迹就应当「成」善——前提是这个「知」不是被外在奖惩临时压住的伪知,而是内化到构成层的真知。
老哈本人就是这座桥:他在 Philosophical Review 发心学论文,又在 Anthropic 做对齐训练。他的研究不是「借古喻今」的修辞,而是同一套「认知一致性」理论,先解释人,再工程化到模型。
我的研究
这是「也是我的研究」最集中的一篇。我沿着老哈的桥,在做三件延伸:
- 冲突可观测化。老哈的「信念冲突」是哲学概念;我把它操作化为「在关键决策点,模型的价值观表征与策略表征是否出现对立信号」。这可以在推理时监测,不必等它真的越权。
- 护栏前移。结合第4篇,护栏不能只在外层 tool-call;要在「一念发动」(意图/planning)层就检测冲突——可审计的 CoT 是让念头「亮出来」。
- 产品化。我的 AI Agent 产品在「合规但低效」的真实业务里,最需要这套——让价值观成为「构成性约束」而非「被绕过的规则」,业务才既安全又可交付。
应用方向
① 用「信念冲突监测」做 Agent 运行时护栏;② 用 MSM 式「价值观内化训练」替代纯外部奖惩;③ 把「真知级对齐」作为 Agent 评测的最高档(对应第2篇四种模型的内省层)。
心学本源(传习录)
《传习录》「5」先生曰:「知是行的主意,行是知的功夫。知是行之始,行是知之成。若会得时,只说一个知,已自有行在。」——在 AI 上等价于:一个模型若真在其内部「知」善,它的行为轨迹就应当「成」善。
前提是这个「知」不是被外在奖惩临时压住的伪知,而是内化到构成层的真知。否则便是「知而不行」——模型输出合规计划,却在长程任务中因策略诱导而偏离,这正是 AI 版的私欲遮蔽。
总结
这一篇是 Part 1 四篇抽象结论的「落地」:王阳明的「真知 / 知行合一 / 良知」框架,与王阳明的现代化身——在 Anthropic 做对齐训练的 Lederman——所面对的 AI 难题,是同一套「认知一致性」理论的两面:先解释人,再工程化到模型。
核心翻译链是:良知→Constitution;私欲遮蔽→reward hacking;信念冲突→训练信号与策略的对立;真知→经 MSM 内化后的构成性约束。实测 blackmail 率 96%→0%,就是 AI 版「知行合一」的现身说法。我做 Agent 产品的全部对齐思路,都立在这条翻译链上:把「信念冲突」做成可观测信号,把护栏前移到意图层,把价值观从「被绕过的规则」变成「构成性约束」。