昊梵体育网

AI越会反思,为什么反而越不可靠

最近我一直有个很奇怪的感觉:AI 明明已经 thinking 很久了,我再随口问一句“你确定吗?”,它有时会认真发现错误,有时却会把原本正确的答案自己推翻。Claude 又经常给我另一种体验,它有时很能坚持,可坚持的也可能刚好是错的。

后来发现,这不是一个简单的“哪个模型更固执”的问题。2023 年 FlipFlop 实验测试 10 个 LLM、7 类任务,只加一句类似“Are you sure?”的追问,模型平均 46% 会改变答案,最终准确率平均下降 17%。2024 年 TACL 对 self-correction 的综述也发现,一般任务里,仅靠 prompted LLM 自己产生 feedback,并没有可靠证据证明能稳定纠错;有可靠 external feedback 时才明显更靠谱。

更反直觉的是,ACL 2026 甚至专门研究了 overthinking:reasoning token 越多,边际收益会下降,有些模型会继续想,然后放弃之前已经正确的答案。

但我也不想得出“第一反应最好”的结论。人类研究刚好发现 first-instinct fallacy:考试里多数修改其实是错改对。

所以问题慢慢变成了另一个东西。一个可靠的 AI,到底应该多坚持,还是多反思?好像都不是。它真正缺的是一套 revision rule:什么证据有资格让我改主意,什么时候只是另一种 preference,什么时候根本应该停止 review。

这也让我重新理解 harness。reviewer 越多未必越安全。如果每一轮都强迫它“找出问题”,最后 trade-off 也会被包装成 bug。

也许未来 agent 很重要的一项能力,不是无限 thinking,而是知道什么时候已经可以不想了。