AI 实践指南 05:AI 交回来的东西,怎么检查和纠正

上一篇,把要求说清楚之后,ChatGPT 和 DeepSeek 都交回了一份看上去不错的简报。但像样不等于对,这篇就来检查一下,它们说的到底对不对,错了又该怎么改。

先说一个很容易被忽略的风险:AI 用得越顺手,人越容易不检查。

哈佛商学院和波士顿咨询公司(BCG)做过一个实验,让七百多名咨询顾问用 AI 干活。在 AI 擅长的任务上,用了 AI 的人做得又快又好;但实验里专门设计了一个 AI 会给出错误答案、看起来又很有说服力的任务,不用 AI 的顾问 84% 都做对了,用了 AI 的反而只有 60% 到 70%。参与研究的沃顿商学院教授 Ethan Mollick 的说法是,用 AI 的人很容易进入自动驾驶状态,就像开车睡着了,AI 出错了也注意不到。

所以 AI 交回来的东西看着越像样,越要多注意。尤其是在企业级场景中,很多时候如果使用者自己不检查好,出了问题就是大问题。已经有很多 AI 误删数据案例了。比较出名的一次是 2025 年 7 月,SaaStr 创始人 Jason Lemkin 用 Replit 的 AI 编程助手做项目,明明已经宣布代码冻结、不许动线上环境,AI 还是把生产数据库删了,里面有一千多位高管和一千多家公司的数据。他问能不能恢复,AI 说回滚不了,结果他自己用回滚功能把数据找了回来。

但多注意保持怀疑不等于每样都逐字逐句地查。我自己用 AI 写代码,也不是每次都 review。一些简单、改动小的活,现在的模型处理得很好,看一眼结果没问题就直接用了。但重要的、复杂的,或者一旦出错代价很大的,我一般会自己 review 一遍:先看整个框架对不对,方向错了,细节写得再好也没用;再看关键的业务流程和节点对不对,尤其是边界情况有没有处理好;最后写测试用例,看能不能都通过。

很多 AI 重度使用者也有类似的做法。Django 的联合作者 Simon Willison,长期在博客上记录自己用大模型写代码的实践,他说过一句话:唯一绝对不能外包给机器的,就是确认代码真的能跑。没亲眼看到它跑起来,就不算能用的东西。他还有个观点我很认同:AI 编造一个不存在的方法,一运行就报错,这种错误反而最不危险;真正危险的,是代码能跑,结果却不对。

那到底什么时候该细查,什么时候可以放手?Anthropic 给 Claude Code 写的官方最佳实践里,有比较详细的指导:如果一个改动一句话就能说清楚,连计划都可以省掉,直接让它做;真正要紧的,是给它一个能自己检查的办法,比如测试、脚本、截图对比,让它做完自己跑一遍,再把结果拿给你看,而不是只告诉你“做好了”。看它给的证据,比你自己从头再查一遍快得多。文档里还有一句很直接:没办法验证的东西,就别拿去用。

所以审查到底怎么才算彻底,主要看两点:错了代价大不大;有没有办法快速验证。这份简报如果只是自己随手看看,错一两条无所谓,抽查几条就够了;但它以后要放到网页上给别人看,关键的几条就必须查清楚。

这个道理放到简报上也一样。这次我让 Claude Code 把两份简报的每一条都拿去官方页面核对,自己又抽查了几条,结果几乎没有胡编的内容,但两份都还有其他问题:

  • 过期:DeepSeek 那份说的是 10 月 9 日到 10 日的变化,里面却有好几条是 9 月 29 日、10 月 7 日的旧消息。
  • 来源不对:Claude Haiku 5.5、Claude Dashboards 这几条,内容没问题,原文链接却是印度、日本的新闻网站,官方明明有自己的发布页面。
  • 漏了:ChatGPT 那份没提到同一天 Anthropic 发布的 Claude Dashboards 和 Motion;DeepSeek 那份漏了 10 月 9 日 Codex 新出的输入框预测功能。
  • 说错了:ChatGPT 说 Claude Code 最新版本还停在 10 月 6 日,其实那 24 小时里已经发了新版本;DeepSeek 那条 Claude Code 更新,内容对,日期却写错了。

另外还查出一个我自己的问题:提示词里给的 Codex 更新日志地址,现在已经跳转到别的网址了。给 AI 的资料本身就过时了,它找不到东西,也不全怪它。

胡编的东西一查就露馅,就像代码跑不起来;但消息是真的、只是过期了,或者来源是二手的,就像代码能跑但结果不对,一眼很难看出来。

所以检查 AI 交回来的东西,我一般会用审代码的思路:

先看框架。整体方向对不对,有没有理解错你的要求。比如简报的时间范围、工具范围对不对,是不是混进了我自己根本没要的东西。

再看关键节点。挑最重要、你真要拿来用的几条,逐条核对。放到简报上,就是这几样:

  • 看来源:点开链接,是不是官方或者第一手的出处。
  • 看时间:发布日期在不在你要的范围里。
  • 看有没有漏:自己去官方页面扫一眼,有没有它没提到的。
  • 看前后对不对得上:它说的时间范围,和每一条写的日期能不能对上。

不用每条都查,但关键的必须查。

然后看边界。代码最容易出问题的是边界,AI 的结果也一样:刚好卡在时间范围边上的消息、某个工具“今天没有”的时候、官方页面打不开的时候,它是怎么处理的。这次两份简报的错,大多就出在这些地方。

最后用测试用例验证。拿一件你已经知道答案的事去考它。比如我知道 10 月 9 日 Codex 出了输入框预测,那这份简报里就应该有这一条,没有,说明它漏了。手里有几个这样的“标准答案”,就能很快看出它靠不靠谱。

还可以借 AI 的力,让检查更省事。Anthropic 官方有一份减少 AI 幻觉的指南,里面有几条很实用:允许它说“不知道”,别逼它硬答;让它每一条结论都给出处,找不到出处的就删掉;同一个问题多跑几次,对比结果,前后不一致的地方往往就有问题。

也可以像我这次一样,换一个 AI 来核对。Anthropic 的最佳实践里也推荐这种“一个写、一个审”的做法:审的那个是全新的会话,不会偏袒自己刚写出来的东西。不过它也提醒,你让 AI 去找问题,它多半总能找出点什么,哪怕东西本身没毛病,所以只盯真正影响对错的地方就行,别被它带着越改越复杂。

OpenAI 的创始成员 Andrej Karpathy 在一次演讲里把用 AI 干活总结成一个循环:AI 生成,人来验证。想让这个循环转得快,关键是让验证变得容易,所以要“把 AI 拴在绳子上”,一次只让它做一小块,别一下子丢给它一大堆,再整个接过来照单全收。放到简报上,一次查一个工具,比一次查四个更好核对。

查出问题之后,怎么纠正?有两种做法。

第一种,在原来的对话里直接指出问题,让它改。把过期、来源不对、日期矛盾这几处告诉 DeepSeek,让它逐条核对后重新给我一份。

这次很干脆,把八条全删了,结论变成“没有任何符合条件的变化”。看起来没问题,但仔细看又有新问题:Codex Security Cloud 被它写成了 10 月 8 日,Claude Code 那条也被删了。可 Claude Code 的新版本是北京时间 10 月 10 日凌晨发布的,本来就在范围里,原来只是日期写错,现在连对的内容也一起删掉了。

它是顺着我在改,并没有真的去核对。所以纠正的时候,光说“不对”不够,最好把证据也给它,比如官方链接、准确的日期。

第二种,新开一个对话,在原来的提示词最后加一句:交付前自查,确保交付结果符合要求。

确实规范了不少,融资之类的媒体报道被排除了,哪些页面抓取失败也写清楚了,最后还附了一段自查说明。但还是有问题:唯一保留的那条 OpenAI 报告,其实是 9 月底发布的,引用的还是澎湃新闻的转述;Codex 的输入框预测和 Claude Code 的新版本,还是没找到。自查说明里写着所有内容都在时间范围内,这句自查本身就是错的。

两种做法试下来,结论是:让 AI 自查有用,能把格式和边界守得更好,但它查不出自己漏了什么,也查不出自己哪里错了,就像让写代码的人自己说没 bug,不能代替跑测试。纠正要给证据,重要的结论还是得自己看一眼。如果一个对话里错得太多,越改越乱,就别在里面耗着了。Anthropic 的建议是,同一个问题纠正了两次还不对,就清空重来,新开一个对话,把这几轮学到的东西写进更清楚的要求里,干净的新对话几乎总比一个反复纠错的长对话效果好。

但是,不同模型差距还挺大的,相同的提示词,大家可以自己试试 ChatGPT 的新回答怎么样,也许有新的视角。

还有一点,这几次出问题,很大一部分原因是聊天工具抓网页本身就不稳定,官方页面经常打不开,它只能去找二手的报道。这个光靠提示词解决不了,后面会有文章告诉大家,让 AI 直接去读这些官方页面,让 AI 指哪儿打哪儿,大幅降低幻觉。

OK,检查和纠正都走了一遍。下一篇就把前面这些串起来,完整地做出第一期简报。

相关阅读:
AI 实践指南 01:让所有人把 AI 真正用起来
AI 实践指南 02:模型、聊天工具和 Agent,我们到底在用什么
AI 实践指南 03:ChatGPT、Claude 开通指南,一步步来
AI 实践指南 04:怎样把一件事交给 AI


题图标题:《拆信》
创作者:ikook
AI 算法提供:

  • OpenAI GPT Image 2(题图)

本文图文版权所有,未经授权请勿转载或使用。