每次模型换代,团队里都要问一遍"prompt 要不要重写"。这节给出我们迁移三次之后的经验。
可复现前提: 用你自己的评测集,先跑旧 prompt + 新模型的基线。这是所有判断的起点。
第一步:先测,别急着改
直接把旧 prompt 跑在新模型上,得到基线。我们三次迁移的基线表现:
| 迁移 | 旧 prompt + 新模型 | 相对旧模型 |
|---|---|---|
| 第一次 | 0.88 | +0.04 |
| 第二次 | 0.91 | +0.02 |
| 第三次 | 0.86 | -0.03 |
前两次根本不需要改 prompt。 花时间重写纯属浪费。
第二步:只有基线下降时才动手
第三次下降的原因很具体:旧 prompt 里有一段针对老模型的"啰嗦补丁"——反复强调"不要输出解释",因为老模型总爱多说。新模型本来就不多说,这段冗余反而干扰了它。
删掉针对旧模型缺陷打的补丁,分数就回来了(0.86 → 0.92)。
哪些一定要重新验证
| 内容 | 是否需要重验 |
|---|---|
| 职责/流程描述 | 一般不用 |
| 输出格式样例 | 不用 |
| 少样本示例 | 建议重跑,数量甜点位可能变 |
| 针对旧模型缺陷的补丁 | 必须删掉重测 |
| 长度/token 相关的硬编码 | 必须重验 |
| 温度等采样参数 | 建议重扫 |
迁移检查清单
- 旧 prompt + 新模型的基线已跑出
- 分桶看过,确认没有某一类大幅退化
- 针对旧模型的补丁已识别并测试删除
- 少样本数量重新扫过
- 成本与延迟重新测算
- 灰度 10% 流量观察 3 天