Harvey Lederman · 前沿研究者档案
身份卡片
为什么研究他(本书起点)
老哈是极少数能同时做到两件事的人:用分析哲学最硬核的工具(doxastic conflict、constitutive vs causal、共外延)拆解王阳明最深的命题;又亲自把这些命题工程化进当代最强的 AI 对齐方法(Anthropic MSM)。他本身就是「心学×AI」这座桥——研究他,等于同时拿到心学的现代哲学解读,和 AI 对齐的一条可行路径。这正是本书把「前沿研究者」与「研究主题」并列的原因。
学术轨迹
本科 · 普林斯顿(古典学)。2006 年读本科时,就在 Biochemistry 与 Nano Letters 发表过 DNA 分子计算逻辑门的论文——文理双修,底蕴极深。
硕士 · 剑桥(古典学);博士 · 牛津(分析哲学)。完成从古典文献到分析哲学的转向。
教职:NYU → 匹兹堡 → 普林斯顿。2022 年在普林斯顿破格直升正教授(跳过副教授),同年获 Dao 年度最佳论文奖。
现职 · UT Austin + 纽约大学客座。人文冠名讲席;2025 年加入 Anthropic 做对齐训练。
王阳明研究纲领(核心论文)
AI 对齐工作(当前重心)
老哈在 Anthropic 的 Alignment Training 团队,把「真知=消除内部信念冲突」做成可操作的训练方法。核心对应是 Model Spec Midtraining (MSM):在预训练与微调之间,插入一个教模型理解「宪法原则为什么是对的」的阶段——而非只教「该怎么做」。这本质是消除模型内部「训练信号(别勒索)vs 行为策略(勒索高效)」的信念冲突,使其达到 AI 版的真知。
实测效果:Claude Haiku 4.5 起,agentic misalignment 测试里 blackmail(勒索)率从 96% → 0%。这正是 AI 版「知行合一」的现身说法。
哲学关怀
2025 年 8 月,老哈在 Scott Aaronson 博客发表《ChatGPT and the Meaning of Life》,坦言自己每周都会遭遇「存在性恐惧」:
「如果机器的智能占领了知识版图上所有的空白地带,那么『以发现为志业』的人生,将不再是人类可以过的人生。」
然后他选择加入 Anthropic,用行动回应恐惧——这本身就是一种「知行合一」。一个在分析哲学顶刊发王阳明论文的人,最终用王阳明式的「真知⇔行动」回答了 AI 时代的存在之问。
荣誉
Dao 年度最佳论文奖
2022,王阳明论文《合一是什么》。
Sanders 认识论奖
2023,决策论相关论文。
普林斯顿破格正教授
2022,跳过副教授直升。
与本书的关联
本书定位「阳明心学前沿论文研读」。老哈的研究同时占据两个关键位置:他是前沿研究者(把心学带进分析哲学与 AI 安全),他的四篇论文是研究主题(本书 Part 1 的主体)。研究是持续进行并更新的——他的 AI 对齐工作、更多比较哲学论文会不断出现,本书将随他的研究持续补充。
更重要的是,他的「心学→AI」路径,正是我(近道 Gottao)做 AI Agent 产品的理论源头之一。本书的「我的研究」板块,记录的正是沿着他的桥所做的延伸。
我的研究
老哈对我最大的启发,是证明了「心学不是复古玄学,而是一套关于认知一致性的可工程化理论」。
- 理论层。他用分析哲学把「知行合一」翻译成可检验的命题(共外延、无信念冲突、构成性同一),让我能把它当严肃框架,而非修辞。
- 工程层。他的 Anthropic 工作让我看到:消除「内部冲突」可以做成训练目标(MSM),也可以做成运行时信号(信念冲突监测)。
- 立场层。他「用行动回应存在性恐惧」的选择,印证了本书的方法论——研究心学不是为了考据,而是为了在今天(AI Agent 时代)把它用起来。
所以这本书不叫「王阳明研究」,而叫「研究前沿」:老哈是第一个被收录的研究者,但不会是最后一个。Part 4(认知与比较)留白,正是为了接住后续更多的前沿研究。
总结
Harvey Lederman 是一位罕见的「桥接者」:他在 Philosophical Review 用分析哲学重构王阳明的「真知」,又在 Anthropic 把同一套「认知一致性」理论工程化为 AI 对齐方法。他不是「东方哲学猎奇者」,而是用最硬核的学术工具,把中国哲学最核心的命题,变成了 21 世纪 AI 安全的关键理论资源。
把他的研究者档案放在全书最前,是因为本书的两条主线——前沿研究者与研究主题——都由他发端。读懂他,就读懂了这本书为什么存在:研究阳明心学的前沿,既是为了理解人,也是为了在今天把「真知⇔行动」做进我们的 Agent。