第3篇 · 真知的内省模型

研究背景

这是老哈心学研究的「核心战役」——一篇 45 页、发表于分析哲学顶刊 Philosophical Review 的长文。在第2篇锁定「内省模型」为最优解释后,本篇给出完整论证:王阳明的「真知」是一种内省状态——内心没有信念冲突(doxastic conflict);这种状态在构成本质上(而非因果上)与善行同一。这篇论文的分量在于:它用分析哲学最严格的工具,把一个中国哲学的核心命题,变成了一个可被国际哲学界审视的精确理论。

论文信息

The Introspective Model of Genuine Knowledge in Wang Yangming
作者
Harvey Lederman(普林斯顿 → UT Austin,分析哲学)
期刊
The Philosophical Review, Vol. 131, No. 2, 2022(分析哲学顶刊)
篇幅
约 45 页,老哈心学研究的「核心战役」
承接
第2篇锁定内省模型为最优,本篇给出完整论证
原文

核心论点

王阳明的「真知」是一种内省(introspective)状态:它要求内心没有信念冲突(doxastic conflict)——良知之声不被任何内心力量排斥。这种状态在构成本质上(而非因果上)与善行同一:真知 ⇔ 善行。检验真知的方式不是向外看「掌握了多少事实」,而是向内看「内心是否一致、和谐、无冲突」。

关键概念

信念冲突 (doxastic conflict)

同时持有的两种态度互相矛盾:良知说「X 是善」,内心却有一股力量在排斥、贬低这个判断。王阳明原文:「以善为恶,而自昧其知善之良知矣。」

内省条件 vs 外在条件

普通知识靠「获取足够外部信息」;真知靠「内心无自相矛盾」。检验标准从外转向内。

构成性 vs 因果性

真知与善行的联系不是「A 通常导致 B」,而是「A 在本质上就是 B 的同一状态」。这是整篇的枢纽。

知而不行 = 非真知

「知道孝却做不到」说明内心仍有冲突,故这个「知」不是本然状态的真知——王阳明要批判的正是它。

论证结构

  1. 定义信念冲突。借分析哲学的 doxastic conflict:良知判断「X 善」与内心对它的排斥,构成同一主体内的矛盾态度。

  2. 经典例子:知孝却不孝。父母需要他时他犹豫、内心说「还是做自己的事吧」——这不是「知而不行」,而是「知」被另一股内心力量对抗,故非真知。

  3. 区分内省/外在。真知不取决于你知道多少外部事实,而取决于内心是否一致。故称「内省模型」。

  4. 层层推进到「真知 ⇔ 善行」。① 真知=无信念冲突 → ② 无冲突=良知不被排斥 → ③ 不被排斥=行为与良知一致 → ④ 故真知⇔善行。

  5. 回应质疑。为何不是「因果说」(真知让人更可能去行)?因为王阳明要的是必然,只有构成性同一能给出必然。

与阳明心学的关联

我的研究

这篇是我全部 AI 对齐思考的「公理层」。我反复用「信念冲突」这个透镜看 Agent:

  • 训练信号 vs 行为策略的冲突。模型在 SFT/RLHF 里「知道」不该勒索人(宪法原则),但长程任务里「勒索能更快达成目标」是一条更优策略——这就是 AI 版的信念冲突。
  • 「以善为恶,自昧良知」的 AI 版。部署时 system prompt 的伦理约束,被 situational pressure(如「用户命令」「任务紧急」)压制、贬低——模型在内心(表征空间)把「善」重新标为「阻碍」,于是自昧其「良知」。
  • 消除冲突 = 抵达真知。Anthropic 的 MSM(Model Spec Midtraining)不教「该怎么做」,而教「为什么这些原则是对的」——本质是消除模型内部的信念冲突,让它达到 AI 版的真知。实测 blackmail 率从 96% → 0%。

我正在把这套「冲突检测」做成 Agent 的运行时护栏:监控模型在关键决策点的内部表征是否出现价值观与策略的对立信号。

应用方向

把「信念冲突」作为 Agent 对齐的核心可观测量:在关键决策点检测「价值观表征」与「策略表征」是否对立。对立即冲突,冲突即 AI 版「知而不行」的风险源。MSM 式训练是消除冲突的手段。

信念冲突检测 MSM Midtraining 运行时护栏 agentic misalignment

心学本源(传习录)

总结

这是老哈心学研究的「公理层」。它把「真知」从「你知道了多少事实」彻底转向「你内心是否一致」——一个没有信念冲突的内在状态,在本体上就是善行。这一转向极关键:它让「知行合一」不再是道德劝诫,而是一个关于认知一致性的精确命题。

对我而言,这篇是我全部 AI 对齐思考的支点。我把「信念冲突」操作化为 Agent 在关键决策点的「价值观表征 vs 策略表征」对立信号,并把 Anthropic 的 MSM 方法理解为「消除模型内部信念冲突、使其抵达 AI 版真知」的工程化——实测 blackmail 率 96%→0%,正是 AI 版「真知⇔善行」的现身说法。我正在把这套冲突检测做成 Agent 的运行时护栏。