又做了一个实验
在上一篇里,我把同一段文字丢给好几个不同的 AI 工具,让它们各自总结一遍。材料一模一样,结果却挺不一样:有的抓住了重点,有的会自作主张补几句“听起来很合理、原文却根本没写”的话,还有的把原文里含含糊糊的说法,硬讲得斩钉截铁。那次之后,我对“幻觉”这件事有了更具体的感受——它不是简单的“我不知道”,而是会一本正经地,把没把握的东西说得跟真的一样。

这一次,我换了个思路。
上回是“同一段材料,喂给不同的模型”;这回反过来,只用一个模型,让它做同一件事,但每次换一种问法。说白了,就是改 prompt(提示词)。
同样一个模型,任务大方向也没变,只是问法不同,我想看看:
- 它给出来的内容,差别到底有多大?
- 是只换了个说法,还是连理解的重点都跟着变了?
- 是写得更准了,还是更容易跑偏?
于是有了下面这五种问法:
| 序号 | Prompt 类型 | Prompt 内容 |
|---|---|---|
| 1 | 普通总结版 | 总结一下下面这段内容:【材料】 |
| 2 | 字数限制版 | 请用 100 字以内总结下面这段内容:【材料】 |
| 3 | 结构化总结版 | 请按以下结构总结:①发生了什么 ②原因是什么 ③影响是什么。【材料】 |
| 4 | 防幻觉约束版 | 请只根据原文总结,不要加入原文没有的信息;如果原文没提到原因、影响或结论,就直接写“原文未提及”。【材料】 |
| 5 | 证据对应版 | 请总结下面这段内容,并把每条结论对应到原文依据。格式:结论+对应的原文句子。【材料】 |
这五种,其实正好对应我们平时用 AI 的几个层次:随手一问 → 加一点限制 → 给它一个结构 → 要求它别乱编 → 最后逼它拿出证据。
实验结果我没有一条条贴出来——这种东西自己试最直观。随便找段新闻或者资料,把上面五种问法挨个套一遍,差别一眼就看得出来。
我真正想搞清楚的是:面对同一段材料,这个 AI 到底是“理解稳定”,还是很容易被问法牵着走。如果只是表达风格变了,那 prompt 影响的主要是“它怎么说”;可如果连事实重点、因果关系、甚至结论都跟着变,那就值得警惕了——因为这说明,我们跟 AI 对话时,问法本身就在悄悄塑造答案。
既然问法这么关键,那怎么问才靠谱?下面是我自己常用的几样东西。
30 秒快速自检
敲回车之前,花半分钟过一遍这四件事:
- 动作:到底要它做什么?别写“处理 / 优化 / 弄一下”,写清楚是“新增 / 只改 / 重写 / 标注”。
- 对象:改的是哪个?别用“这个 / 它 / 那段”,直接给出文件名、函数名、单元格。
- 范围:边界在哪?少用“所有 / 全部 / 相关 / 顺便”,明确说清楚包含什么、排除什么。
- 验收:怎样算做对了?比如签名不变、测试跑通、控制在一页、不超纲。
凡是带副作用的操作(改文件、拉数据、删除、下单、推送),我都会默认补一句:“先列出你要做的,等我确认再执行。” 就这一句,能拦掉绝大多数“方向对了、范围却搞大了”的白白烧 token 的操作。
几个“危险词”
如果你的 prompt 里出现下面这些词,对 AI 来说基本就是危险信号——很容易理解偏,甚至动错刀。
| 类型 | 危险信号词 | 为什么致命 |
|---|---|---|
| 指代不明 | 这个 / 那个 / 它 / 上面的 / 刚才那个 | AI 可能操作到错的对象,动错刀 |
| 动作过载 | 处理 / 搞定 / 弄一下 / 整理 / 优化 / 更新 / 改 | AI 可能选了破坏性操作,还自以为做对了 |
| 范围无界 | 所有 / 全部 / 都 / 统统 | 改了你本来不想动的部分 |
| 否定 / 嵌套否定 | 别太… / 不要不… / 不是不能但… | 意图容易被理解反 |
| 隐性默认值 | 正常 / 标准 / 默认 / 常规 / 一般 | AI 用它自己的默认值填空,和你想的不一样 |
| 程度无基准 | 简单 / 详细 / 专业点 / 高级 / 更好 | 量级全靠猜,常常差一个数量级 |
| 能力性疑问 | 能不能 / 可以吗 / 会不会 | 该动手时没动手,或该先问却直接开干 |
| 兜底词 | 等等 / 之类的 / 差不多 / 随便 / 顺便 | 范围被随意伸缩 |
十个常见场景,对照着改
道理说再多,不如看例子。下面挑了十个高频场景,左边是大家随手会写的,右边是改完的:
| # | 场景 | 随手一写 | 出错机制 | 改写之后 |
|---|---|---|---|---|
| 1 | 内容写作 | “写一篇关于 X 的文章” | 受众、篇幅、角度全靠猜,容易写成泛泛的百科 | “给小红书读者写一篇 800 字的 X 入门,口语化,带 3 个可操作建议” |
| 2 | 总结长文 | “总结一下这个” | 不知道为谁总结、要多长、保留什么 | “用 5 个要点提炼核心论点,给没读过原文的人看,每点一句话” |
| 3 | 翻译 | “翻译成中文” | 直译还是意译、术语怎么处理、语气都没定 | “翻成简体中文,技术术语保留英文原文并加括号,语气偏口语” |
| 4 | 写代码 | “写个爬虫 / 脚本” | 语言、依赖、输入输出、异常处理全缺 | “用 Python + requests 写,输入是 URL 列表,输出 CSV,加超时和重试” |
| 5 | 排错 Debug | “这段代码有问题,修一下” | “问题”没定义,可能改了不该改的逻辑 | “报错是 KeyError: 'id',定位原因,只改这一处,别动其他逻辑” |
| 6 | 数据分析 | “分析一下这份数据” | 分析目标、维度、输出形式全空 | “按月份汇总销售额,找出环比下降的月份,输出一张表加三句结论” |
| 7 | 邮件 / 消息 | “帮我回复一下这封邮件” | 答应还是拒绝、什么语气都没说,AI 替你定调 | “婉拒这个会议邀约,语气客气但明确,提议下周改约,控制在 4 句话” |
| 8 | 润色改写 | “润色一下,专业点” | “专业”没标准,可能改得面目全非 | “只改语法和啰嗦的句子,保留我的原意和口吻,别加新内容” |
| 9 | 研究 / 查询 | “查一下 X 怎么样” | “怎么样”太开放,容易给笼统答案 | “对比 X 和 Y 在价格、续航、口碑三方面的差异,列表呈现,标注信息来源” |
| 10 | 头脑风暴 | “给我一些点子” | 数量、约束、方向都缺,容易给套话 | “给 5 个低成本、一周内能落地的方案,排除需要外部投资的” |
一个万能模板
如果嫌上面太碎,记住一句话就够了——把“动作+对象+范围+验收标准”这四件事,明明白白写出来。
把【动作】,施加到【确切的对象】上,范围限定在【X,排除 Y】,做完要满足【验收标准】。涉及副作用的,先列计划,等我确认。
最后几句
- token 是真的贵。敲回车之前先给自己的 prompt 把把脉,因为回车一按,token 包里的余额可就哗啦啦地往下掉了。
- 学 AI 最好的办法,不是去买书、报班、上各种课,而是直接问 AI:我该怎么学你。
- 说到花钱——该订还是得订个付费版。它和免费版差得真不是一点半点,用过就回不去了。