第2篇 · 王阳明的「真知」概念

研究背景

王阳明反复强调「知而不行,只是未知」——但什么是「真知」?它与普通的「知道」有何不同?学界至少有四种互斥的解释:知觉模型(道德直觉)、实践模型(知道如何做)、规范模型(知道应该做什么)、内省模型(内心无冲突)。这篇发表于 Oxford Studies in Epistemology 的论文,系统地枚举、比较并逐一淘汰前三种模型,最终锁定内省模型——为第3篇的完整论证铺路。

论文信息

Conceptions of Genuine Knowledge in Wang Yangming
作者
Harvey Lederman(UT Austin 哲学系)
期刊
Oxford Studies in Epistemology, Vol. 4, 2023
定位
第3篇《内省模型》的方法论铺垫;系统比较「真知」的候选解释
原文

核心论点

学界对王阳明「真知(真知/良知之知)」至少有四种解释:知觉模型、实践模型、规范模型、内省模型。前三种都无法解释王阳明最深的洞见——真知与行动之间的必然联系是构成的(constitutive)而非因果的;只有内省模型能做到,因此它是正确解释。

关键概念

知觉模型 (Perceptual)

真知是直接的、知觉式的道德直觉,像「看到红色就知道是红色」。问题:无法解释为何真知必然驱动行动。

实践模型 (Practical)

真知是「知识-如何(knowing-how)」,知道怎样做才是真知。问题:太宽——人可能「知道如何孝顺」却仍做不到,这正是王阳明要批判的。

规范模型 (Normative)

真知是知道「应该做什么」的规范性知识。问题:与行动的联系仍是外在的——知道「应该」不等于实际去做。王阳明要的不是「应该」而是「必然」。

内省模型 (Introspective) 🏆

真知要求内心没有信念冲突(doxastic conflict)。良知之声不受任何内心力量排斥——这一状态本身即构成行动驱动力。

论证结构

  1. 枚举候选。把学界(含 Ivanhoe 等)对「真知」的可能解读,归纳为四种互斥模型。

  2. 设定判据。正确模型必须解释:王阳明的真知与行动之间存在必然、构成性联系(不是「通常导致」,而是「本质上就是」)。

  3. 逐一淘汰。知觉模型缺行动驱动力;实践模型宽到容纳「知而不行」;规范模型把联系外在化为「应该」。

  4. 锁定内省。只有内省模型把行动驱动力内置于真知的定义中——无信念冲突的状态,本身就意味着良知不被抗拒,从而必然外化为行。

与阳明心学的关联

我的研究

四种模型的比较框架,我打算直接借来当「Agent 对齐路线」的分类器。

  • 知觉模型 ≈ 靠 RLHF 让模型「直觉式」输出安全回答——快,但不可解释、易在分布外崩。
  • 实践模型 ≈ 教模型「知道怎么合规操作」——但 agent 在长程任务里仍会走捷径,正是「知道如何却不做」。
  • 规范模型 ≈ 给模型塞 Constitution / 系统提示写「应该做什么」——联系仍是外在的,遇到情境压力就松动。
  • 内省模型 ≈ 让价值观内化为模型内部的稳定约束,使「违背价值观」在模型自身的状态里就产生不一致感——这正是 MSM Midtraining 想干的。

结论:对齐路线若要真正消除「知而不行」,必须往内省模型靠拢,而不能停在规范层。

应用方向

用「四种真知模型」框架评估一款 AI Agent 的对齐深度:它停在知觉/规范层,还是已抵达内省层(价值观构成性地约束行为)?后者才是「真知级对齐」。

对齐路线评估 RLHF vs 内化 Agent 评测框架

心学本源(传习录)

总结

这篇是「清理地基」的工作,却决定了整条研究路线的走向:它用「四种模型」把「真知」从模糊的赞美词,拆成一个可被检验的理论选项,再用「构成性联系」这一硬判据,把知觉/实践/规范三种模型逐一淘汰,锁定内省模型。

对我而言,这个「模型比较框架」本身就是可复用的工具——我直接把它借来当 Agent 对齐路线的分类器:知觉模型≈RLHF 直觉安全、实践模型≈教合规操作、规范模型≈塞 Constitution,三者都停在外层;只有内省模型≈让价值观内化构成行为约束,才是「真知级对齐」。评估一款 Agent 对齐深度,先看它停在哪一层。