第 15 章 · 把提示词当资产

老板先看这一句: 你投钱做的智能体,最值钱的那部分(提示词、知识库、业务口径、评估样本)现在存在谁的电脑里?如果只在一个人的聊天记录里,人一走,资产全没。这一章提醒你:这些不是一次性的台词,是要沉淀、能复用的公司资产。你该批一笔预算让团队把资产管理起来,别让每个项目都从零再来一遍——重复造轮子,才是最贵的地方。

藏在某人聊天记录里的提示词

我接手过一个别人做了一半的项目。效果时好时坏,想调,却发现一个荒唐的事:那套让智能体跑起来的提示词,没人说得清最新版在哪。有人从聊天窗口里翻,有人在某个文档里存了一版,线上跑的又是第三版——改了什么、为什么改、改之前效果如何,全无记录。想回退到上周那个「好像更好」的版本?回不去,那版没人存。

这就是把提示词当「一次性台词」的下场:随手写、随手改、随手丢。可提示词不是台词,它是决定智能体行为的核心配置——相当于传统软件里的源代码。你不会把源代码存在聊天记录里,那为什么要这么对待提示词?

Agent 落地工程师戴上 AI 驯化师这顶帽子,要建立一个观念:Prompt、工具、记忆、评估集,都是资产,得像养代码一样养它们——可版本化、可回滚、可演化。 这一章讲怎么养。这套思路,姊妹篇里叫「上下文工程」,是把「喂给模型什么」当成一门工程来经营。

📎 技术深读:上下文工程的原理与实现——上下文怎么组织、如何动态拼装,见 Harness Agent Book · 第 8 章。本章讲 Agent 落地工程师视角的资产管理

跨境家居老板老陈要是遇上这事更糟:他花大价钱做的多语言客服智能体,关键提示词只存在前任供应商的聊天记录里,人一走连调都没法调——所以这几类资产必须攥在自己手里、能回退。

四类要当资产来养的东西

不只是提示词。智能体的行为,由四类资产共同决定,每一类都值得好好经营。

资产是什么不养会怎样
Prompt指令、角色设定、输出格式、few-shot 例子版本混乱,回退不能,改了不知好坏
工具智能体能调的接口、Skill、权限配置加了工具没记录,出问题定位不到
记忆给模型的背景知识、业务口径、历史上下文口径散落各处,改一处漏三处
评估集Golden Dataset、验收样本(第 22 章)无法回归,每次改动都在赌

这四类里,前三类决定「智能体怎么做」,评估集决定「你怎么知道它做得对不对」。四类配套管理,智能体才能持续变好而不是随机漂移。

三条纪律:可版本化、可回滚、可演化

养资产,落到实处就是三条纪律。

第一条,可版本化——把它们从聊天窗口里搬进代码库。 提示词、工具配置、业务口径,统统进 Git(或任何版本管理),一个改动一次提交,写清「改了什么、为什么改」。开头那个「找不到最新版」的惨剧,根子就是没版本化。搬进代码库,「最新版在哪」永远有唯一答案。

第二条,可回滚——每一版都留得住、退得回。 版本化的直接好处:改坏了能一键退回上一版。AI 调优经常是「改了 A 好了、B 却退化了」,没有回滚,你只能带着遗憾往前走;有了回滚,你可以大胆试——反正退得回来。能回滚,才敢大胆调。

第三条,可演化——改动要有依据、可衡量。 资产不是改了就完,每次改动都要对着评估集跑一遍(第 22 章),用数字确认是变好还是变坏,而不是凭「感觉顺眼了」。第 12 章那句「按样本调,而不是凭感觉调」,说的就是这条。可演化 = 版本化 + 回滚 + 评估回归,三者缺一,演化就变成瞎猜。

一套朴素的资产管理约定

不需要什么花哨工具,一套朴素约定就能起步:

  • 一个仓库放资产。 Prompt、工具配置、业务口径、评估集,集中在一个版本库,别散落。
  • 改动走提交,附一句原因。 每次改提示词/口径,提交信息写清动机(如「补充『物流』和『包装』的分类区分,修 Golden Dataset 第 7 条」)。
  • 线上版有明确标记。 永远知道生产环境跑的是哪个版本,出事能立刻定位、立刻回退。
  • 改完必回归。 任何资产改动,合入前对着评估集跑一遍,分数不退才允许上。

这套约定的意义,是把「调 AI」从一门玄学(靠某个人的手感),变成一门可交接、可复现的工程手艺——换个人接手,照样能调、能回退、能验证。这也直接为第 21 章的「交接运营」打底。

一个最小资产目录可以这样放:

assets/
  prompts/
    classifier.md
    report-writer.md
  tools/
    tool-registry.yaml
    permissions.yaml
  policies/
    business-taxonomy.md
    risk-rules.md
  datasets/
    golden-dataset.csv
    failed-cases.csv
  evals/
    metrics-definition.md
    regression-report.md
  release-notes/
    2026-07-06-v0.3.md

每次改动,至少写清这些字段:

字段说明
版本prompt / 工具 / 口径 / 数据集的版本号
改动原因关联哪个失败样本、业务反馈或风险
影响范围影响哪个场景、指标、工具或人审门
回归结果Golden Dataset 跑分是否退化
上线时间哪个版本进入试用或生产
回滚点出问题退回哪个版本

还要记住一条边界:不要把所有控制都写进 prompt。 权限、合规、强规则、危险动作拦截,必须落在系统控制里。Prompt 可以提醒 AI 不要做什么,但不能替代真正的权限和门禁。

📍 场景示例:老陈把「高转化广告提示词」存成了公司资产

老陈每月砸约 $30k 广告费,平均 ACOS 35%,一版广告图要 3–5 天。FDE 帮运营调出一条「高转化标题 + 卖点提示词」,EN 版一跑 ACOS 降到 28%、素材当天出。问题来了:这条提示词只存在运营的个人聊天记录里,DE/FR/ES 想复用却找不到最新版,前任调过的版本也回不去。FDE 把它搬进 Git 目录,标成 v0.3,改坏一键退回,多语靠参数化套用同一份资产。

维度改造前改造后
提示词存放个人聊天记录,版本成谜Git 目录,v0.3 可回滚
多语复用各语言各写各的同一份资产,参数化套用
改坏能否退回回不去一键退回上一版
广告素材周期3–5 天/版当天出,ACOS 35%→28%

老板决策点: 批一笔预算让团队把提示词/口径/评估集管进版本库——别让最值钱的那段「台词」随人离职蒸发。 ——对应 → L3

常见坑

  • 提示词当台词,随手写随手丢。 存在聊天记录/临时文档里,最新版成谜,回退无门。
  • 只版本化,不回归。 进了 Git,但改完不跑评估集,照样在凭感觉赌。
  • 只养 Prompt,忘了口径和工具。 业务口径、工具权限散落各处,改一处漏三处。
  • 线上版本不明。 不知道生产在跑哪一版,出事定位半天、回滚更慢。

本章产出

老板行动点: 问团队:我们现在那套智能体的提示词、知识库、业务口径、评估样本,存在哪、谁管、人走了还在不在?批一笔预算把这类资产管起来(哪怕就一个 Git 目录)。别让每个项目都从零再来——重复造轮子才是最贵的地方,沉淀复用才是省钱的起点。

往交付包里放一份「资产管理约定 + 资产清单」:

为你的项目建一个集中存放 Prompt / 工具配置 / 业务口径 / 评估集的地方(哪怕就是一个 Git 目录),写下四条约定:改动怎么提交、原因怎么记、线上版怎么标、回归怎么跑;并列出当前这四类资产各自在哪、谁负责。这份约定,是让 AI 调优从「手感」变「手艺」的地基。

成熟度自检

  • [ ] 我能把 Prompt / 工具 / 记忆 / 评估集当资产,做到可版本化、可回滚(→ L3)
  • [ ] 我能让每次调优都对着评估集回归、有据可依,而非凭感觉(→ 迈向 L4)