上周六,我在工作室对着屏幕发呆。
一个 AI Agent,搭了两天,提示词改了十几版,知识库塞了三百多份资料。但一问具体业务问题,它还是像个刚入职的实习生。该记的记不住,不该编的瞎编。
我当时的第一反应:模型不够强?换个更强的试试?
后来在复盘营里听了 Truman 讲的《AI 数据第一课》。听到一半突然明白了。不是模型笨,是我喂给它的"食材"根本就没准备好。
数据这道菜,咱们一直用错了炒法
Truman 在课上讲了一件自己家的事。
他儿子 7 岁,喜欢睡前听"汪汪队拯救豌豆射手"这种杂交故事。Truman 讲了三四个版本后江郎才尽了,于是让 AI 代劳。先试 200 字提示词直接生成,比他自己讲的差远了,30 分。
他做了四轮迭代:
- 第一轮:把之前讲的故事录下来转成逐字稿,扔给 AI 临摹 → 50 分,形似神不似
- 第二轮:从故事里萃取出一份《故事创作指南》,加上范文一起喂 → 65 分,但套路越来越像
- 第三轮:让 AI 生成 30 个随机选题策划案作为"灵感库" → 80 分,终于像样了
- 第四轮:指南 + 范文 + 选题 + 儿子每次听完的反馈,迭代回炉 → 90 分以上
一个睡前故事,愣是迭代出了数据工程的完整逻辑。
这个故事让我想起自己这周干的两件事:联大文创的 AI 内容生产线和会员系统的搭建。回头一看,我做的很多事其实踩中了同样的坑。
做联大文创的时候,从选题、脚本、画面到发布,AI 占了 80%。但我是怎么"喂"数据的?基本就是把历史资料一股脑扔进知识库,然后靠反复调整提示词来凑效果。如果用 Truman 的框架回头看——我跳过了最关键的"预判"环节。我没问自己:这条 AI 流水线里的每个环节,分别需要什么样的数据?选题需要的是"冷知识点多维度标签库",脚本需要的是"短视频口播风格案例集 + 起承转合框架",画面需要的是"视觉风格预标注"。而我以为统一知识库就够了。
工具没变,是我对"数据"的理解太粗了。
ADAPTE-D:一个值得反复想六次的框架
这堂课把方法论总结成了六个字母:ADAPTE-D。
- A 预判(Assess):想清楚未来哪些 AI 场景,有了高质量数据价值巨大?
- D 识别(Detect):盘点你手里现存的数据,哪些是长期渴望、短期被忽略的"暗数据"?
- A 收集(Acquire):先把一切可能用到的东西扔进湖里养着,别急着处理。
- P 处理(Process):粗加工(洗菜)→ 精加工(切块)→ 注灵魂(调味)。
- T 使用(Test):先低成本验证,再系统化封装。80% 的问题 RAG 就能解决,别一上来就想微调。
- E 反馈(Evaluate):把使用结果、人工修正、失败案例重新结构化,形成飞轮。
六个字母里,我今儿想重点聊两个:A 预判和 E 反馈。
先说预判。半肥猫的案例是这堂课里最猛的。他做美业和大健康数字化营销,用 AI 把团队从 20 人缩到几个人,效率提了 10 倍。听起来是 AI 牛。但真正扎进去看,他做了一件别的团队根本想不到的事:对每一条数据做五层标注。
一道中药煲汤食谱,他标注了:中医原理 + 西医营养(专业维度)、敏感词替换映射表(平台风控维度)、针对中医受众 vs 西医质疑受众的两套不同话术(受众维度)、配图色调和风格提示词(视觉维度)、当归什么时候放枸杞煮多久(经验边界维度)。
一般人做知识库:把 PDF 扔进去就完了。半肥猫做知识库:把每一张知识卡片当成产品来设计。差距在这儿。
你再想想。那些你觉得自己"搭不好的 AI",差的真是模型吗?多半是差在了你没给自己的行业经验"打标签"。你不是没数据——你是没想过怎么把你脑子里的东西翻译成 AI 能吃的语言。
再说反馈。这一环最容易被跳过。大多数人拿到 AI 生成的结果,能用就用,不能用就手动改。改完就完了。下一轮 AI 还是从零开始。
Truman 打了个比喻:一个没有反馈闭环的 AI,就像一个永远不听劝的实习生。第一天犯的错,第一百天还会犯。
我这周搭的会员系统,AI 帮我写代码写了两天,51 个文件。每次 AI 写错了,我手动修正然后继续。但我有没有把每一次"我为什么改"、"改了什么"、"原来错在哪"记下来?没有。等于 51 个文件里所有的纠偏经验,全丢了。下次换个模型,同样的坑还得再踩一遍。
从今天开始,做三件小事
这堂课不扯宏大叙事。它说了一件很朴素的事:你现在就可以开始攒数据资产,门槛比你以为的低得多。
第一,建立随手存的习惯。湖仓思维,没想清楚先扔进湖里养着。截图、收藏、录音转写、AI 对话记录、人工修改痕迹。别纠结格式,别等想清楚了再存。很多数据,一旦错过就再也找不回来了。
第二,做一次数据盘点。坐下来,拿出纸笔或笔记软件,回答两个问题:未来一年你最想让 AI 帮你干好的三件事是什么?这三件事分别需要什么样的数据?你会发现,你缺的不是更多资料,而是更精准的案例集、更结构化的行业知识卡片、和你自己的判断经验被显性化之后的标注数据。
第三,给 AI 装一个错题本。每次修正 AI 的输出,顺手记下来:原来哪里不对?你怎么改的?为什么这么改?用人和 AI 都能读的工具来记,积累三个月。你的 AI 就从一个啥也不懂的新人,变成了熟悉你判断逻辑的老搭档。
AI 正在从"工具"变成"引擎"。引擎要烧油,油就是数据。但数据不是越多越好。数据是你对业务的理解,被翻译成了 AI 能吃的格式。
这话说起来简单,做起来全是细节。我还在学。