大部分人写 prompt 的方式是:改一改,试一试,感觉好了就上。这节讲怎么脱离这个循环。
可复现前提: 只需要一个表格工具和 20 条真实样本,不需要任何框架。
问题:凭感觉调,会越调越差
我们有过一次真实教训。一个分类 prompt 连续调了两周,每次改完手动试三五条,都"感觉更好了"。两周后接上评测集一跑——准确率比两周前低了 6 个点。
原因是每次只看三五条,改动其实是在过拟合那几条。
最小可用的评测集:20 条就够起步
不需要一开始就搞几百条。20 条真实样本 + 一张表格,就能立刻脱离瞎调状态:
| # | 输入 | 期望输出 | v1 | v2 | v3 |
|---|---|---|---|---|---|
| 1 | ... | 分类A | ✓ | ✓ | ✓ |
| 2 | ... | 分类B | ✗ | ✓ | ✓ |
| 3 | ... | 分类A | ✓ | ✓ | ✗ |
关键是每一版都跑全部 20 条,而不是只跑你正在修的那条。第 3 条那种"修好了 A 却弄坏了 B"的情况,只有跑全量才看得见。
三条工作纪律
- 一次只改一个变量。 同时改角色描述和输出格式,结果变好了你也不知道是哪个起的作用。
- 保留每一版。 存成
prompt-v1.txt、v2.txt,分数记在表里。回退很常见。 - 样本来自真实日志。 自己编的样本会系统性地偏简单。
从 20 条到 120 条
跑顺之后再扩,扩的原则是补盲区:把每次失败的真实案例加进去。我们的评测集就是这么从 20 条长到 120 条的,每一条背后都是一次真实的错误。
下一节
有了评测集,下一步是学会写结构化的 prompt。
评论与复现反馈 0
还没有人评论。复现之后回来说一声,对作者很有价值。