又做了一个实验

上一篇里,我把同一段文字丢给好几个不同的 AI 工具,让它们各自总结一遍。材料一模一样,结果却挺不一样:有的抓住了重点,有的会自作主张补几句“听起来很合理、原文却根本没写”的话,还有的把原文里含含糊糊的说法,硬讲得斩钉截铁。那次之后,我对“幻觉”这件事有了更具体的感受——它不是简单的“我不知道”,而是会一本正经地,把没把握的东西说得跟真的一样。

换种问法,AI给的答案能差多少?
换种问法,AI给的答案能差多少?

这一次,我换了个思路。

上回是“同一段材料,喂给不同的模型”;这回反过来,只用一个模型,让它做同一件事,但每次换一种问法。说白了,就是改 prompt(提示词)。

同样一个模型,任务大方向也没变,只是问法不同,我想看看:

  • 它给出来的内容,差别到底有多大?
  • 是只换了个说法,还是连理解的重点都跟着变了?
  • 是写得更准了,还是更容易跑偏?

于是有了下面这五种问法:

序号Prompt 类型Prompt 内容
1普通总结版总结一下下面这段内容:【材料】
2字数限制版请用 100 字以内总结下面这段内容:【材料】
3结构化总结版请按以下结构总结:①发生了什么 ②原因是什么 ③影响是什么。【材料】
4防幻觉约束版请只根据原文总结,不要加入原文没有的信息;如果原文没提到原因、影响或结论,就直接写“原文未提及”。【材料】
5证据对应版请总结下面这段内容,并把每条结论对应到原文依据。格式:结论+对应的原文句子。【材料】

这五种,其实正好对应我们平时用 AI 的几个层次:随手一问 → 加一点限制 → 给它一个结构 → 要求它别乱编 → 最后逼它拿出证据。

实验结果我没有一条条贴出来——这种东西自己试最直观。随便找段新闻或者资料,把上面五种问法挨个套一遍,差别一眼就看得出来。

我真正想搞清楚的是:面对同一段材料,这个 AI 到底是“理解稳定”,还是很容易被问法牵着走。如果只是表达风格变了,那 prompt 影响的主要是“它怎么说”;可如果连事实重点、因果关系、甚至结论都跟着变,那就值得警惕了——因为这说明,我们跟 AI 对话时,问法本身就在悄悄塑造答案。

既然问法这么关键,那怎么问才靠谱?下面是我自己常用的几样东西。

30 秒快速自检

敲回车之前,花半分钟过一遍这四件事:

  • 动作:到底要它做什么?别写“处理 / 优化 / 弄一下”,写清楚是“新增 / 只改 / 重写 / 标注”。
  • 对象:改的是哪个?别用“这个 / 它 / 那段”,直接给出文件名、函数名、单元格。
  • 范围:边界在哪?少用“所有 / 全部 / 相关 / 顺便”,明确说清楚包含什么、排除什么。
  • 验收:怎样算做对了?比如签名不变、测试跑通、控制在一页、不超纲。

凡是带副作用的操作(改文件、拉数据、删除、下单、推送),我都会默认补一句:“先列出你要做的,等我确认再执行。” 就这一句,能拦掉绝大多数“方向对了、范围却搞大了”的白白烧 token 的操作。

几个“危险词”

如果你的 prompt 里出现下面这些词,对 AI 来说基本就是危险信号——很容易理解偏,甚至动错刀。

类型危险信号词为什么致命
指代不明这个 / 那个 / 它 / 上面的 / 刚才那个AI 可能操作到错的对象,动错刀
动作过载处理 / 搞定 / 弄一下 / 整理 / 优化 / 更新 / 改AI 可能选了破坏性操作,还自以为做对了
范围无界所有 / 全部 / 都 / 统统改了你本来不想动的部分
否定 / 嵌套否定别太… / 不要不… / 不是不能但…意图容易被理解反
隐性默认值正常 / 标准 / 默认 / 常规 / 一般AI 用它自己的默认值填空,和你想的不一样
程度无基准简单 / 详细 / 专业点 / 高级 / 更好量级全靠猜,常常差一个数量级
能力性疑问能不能 / 可以吗 / 会不会该动手时没动手,或该先问却直接开干
兜底词等等 / 之类的 / 差不多 / 随便 / 顺便范围被随意伸缩

十个常见场景,对照着改

道理说再多,不如看例子。下面挑了十个高频场景,左边是大家随手会写的,右边是改完的:

#场景随手一写出错机制改写之后
1内容写作“写一篇关于 X 的文章”受众、篇幅、角度全靠猜,容易写成泛泛的百科“给小红书读者写一篇 800 字的 X 入门,口语化,带 3 个可操作建议”
2总结长文“总结一下这个”不知道为谁总结、要多长、保留什么“用 5 个要点提炼核心论点,给没读过原文的人看,每点一句话”
3翻译“翻译成中文”直译还是意译、术语怎么处理、语气都没定“翻成简体中文,技术术语保留英文原文并加括号,语气偏口语”
4写代码“写个爬虫 / 脚本”语言、依赖、输入输出、异常处理全缺“用 Python + requests 写,输入是 URL 列表,输出 CSV,加超时和重试”
5排错 Debug“这段代码有问题,修一下”“问题”没定义,可能改了不该改的逻辑“报错是 KeyError: 'id',定位原因,只改这一处,别动其他逻辑”
6数据分析“分析一下这份数据”分析目标、维度、输出形式全空“按月份汇总销售额,找出环比下降的月份,输出一张表加三句结论”
7邮件 / 消息“帮我回复一下这封邮件”答应还是拒绝、什么语气都没说,AI 替你定调“婉拒这个会议邀约,语气客气但明确,提议下周改约,控制在 4 句话”
8润色改写“润色一下,专业点”“专业”没标准,可能改得面目全非“只改语法和啰嗦的句子,保留我的原意和口吻,别加新内容”
9研究 / 查询“查一下 X 怎么样”“怎么样”太开放,容易给笼统答案“对比 X 和 Y 在价格、续航、口碑三方面的差异,列表呈现,标注信息来源”
10头脑风暴“给我一些点子”数量、约束、方向都缺,容易给套话“给 5 个低成本、一周内能落地的方案,排除需要外部投资的”

一个万能模板

如果嫌上面太碎,记住一句话就够了——把“动作+对象+范围+验收标准”这四件事,明明白白写出来。

把【动作】,施加到【确切的对象】上,范围限定在【X,排除 Y】,做完要满足【验收标准】。涉及副作用的,先列计划,等我确认。

最后几句

  1. token 是真的贵。敲回车之前先给自己的 prompt 把把脉,因为回车一按,token 包里的余额可就哗啦啦地往下掉了。
  2. 学 AI 最好的办法,不是去买书、报班、上各种课,而是直接问 AI:我该怎么学你。
  3. 说到花钱——该订还是得订个付费版。它和免费版差得真不是一点半点,用过就回不去了。