前言 · 为什么做这本研读
缘起
读王阳明,绝大多数材料停在两处:要么是「修养指南」式的通俗解读,要么是哲学史里的「宋明理学一章」。但真正让我兴奋的,是近年来一批研究者——尤其是分析哲学与 AI 安全领域——把心学的核心命题(真知、知行合一、良知)当成一个可被精密拆解、可被实验检验、可被工程实现的对象来对待。
其中最具代表性的是 Harvey Lederman(老哈):一个在Philosophical Review 上发王阳明论文的分析哲学家,同时又在 Anthropic 做对齐训练。他的工作给了我一个关键启示——心学不是博物馆里的标本,而是一套关于「认知一致性」与「行动驱动力」的活理论,可以直接对话今天的 AI 与行为科学。
方法:每篇论文 = 一章统一模板
为了避免「读后感」式的散漫,本书对每篇论文采用统一研读结构:
- 论文信息卡——标题、作者、机构、期刊、年份、原文链接,先锚定出处。
- 核心论点——用一句话说清它到底主张什么。
- 关键概念——把文中术语拆成可对照的小卡片。
- 论证结构——还原它「怎么一步步推出结论」。
- 与阳明心学的关联——它解释了心学的哪一块。
- 我的研究——我自己的延伸、质疑与接法(这是「也是我的研究」的那部分)。
- 应用方向——它能落到 AI Agent 还是行为设计。
- 总结——收口到本文的关键结论与我的立场,避免散漫。
每篇「原文」链接直接指向论文 PDF( hosted on PhilPapers / 作者主页),点击即可在线预览或下载原始论文。论文原文版权归 respective publishers 所有,本站仅做研读引用。
老哈的研究,也是我的研究
本书 Part 1 以老哈的四篇核心论文为骨架。之所以把它们当作「我的研究」而非「别人的文献」,是因为我沿着他的分析哲学路径,正在做两件延伸:
① 应用到 AI Agent。 把「真知 = 没有信念冲突」翻译成 Agent 对齐的可操作目标:模型的训练信号(不该勒索)与行为策略(勒索能完成任务)之间若存在矛盾,就是 AI 版的「知而不行」。Anthropic 的 Model Spec Midtraining 正是在消除这种内部冲突。
② 用行为科学解释心学。 王阳明的「知而不行、只是未知」,在行为科学里对应自欺(self-deception)、认知失调(cognitive dissonance)与内在动机理论。我想用这些工具,把「为什么人知道却做不到」变成一个可测量、可干预的问题。
两个延伸方向
AI Agent 与对齐
知行合一 → 对齐目标;良知 → 宪法/价值观内化;信念冲突 → 训练信号与策略的矛盾。详见 Part 2。
行为科学视角
自欺、认知失调、内在动机、实施意图(implementation intentions)——解释并干预「知而不行」。详见 Part 3。
认知与比较(规划中)
良知的内省神经基础、元认知、以及心学与西方德性伦理/斯宾诺莎的对照。Part 4 持续补充。
如何使用这本书
它不是线性教材,而是一本持续生长的研读。你可以按 Part 进入,也可以从任意一篇开始;左侧目录按研究视角组织。每篇末尾的「我的研究」与「应用方向」是我个人观点的高亮区,欢迎质疑与补充。
本书把前沿研究者与研究主题并列:先读 第 0 篇:Harvey Lederman 研究者档案 认识本书主角,再从 第 1 篇:老哈的 Dao 2022《知行合一中「合一」是什么》 进入具体论文。研究是持续进行并更新的——老哈的 AI 对齐工作、更多比较哲学论文会不断出现,本书将随前沿持续补充(Part 4 留白即为此)。