← 所有文章

为什么 AI 模型会出现幻觉——用真实信源进行 Grounding 能解决吗?

左右两幅图:左图是一条未经锚定的断言,其虚线末端延伸至虚空中;右图是一条经过锚定的断言,其实线引向一本翻开的书。题字:Grounding 并没有让它变得正确,而是让它变得可核查。

简短回答: 不能——Grounding 无法根治幻觉。它能大幅减少幻觉,并改变你所遇到的错误类型:从捏造信源变成误读真实信源。剩下的是可核查的内容,而这才是关键所在。单纯依靠检索并不能消除模型去猜答案的动机。

我们构建了一个研究引擎,将圣经经文、词法形态和词典词条作为工具调用结果传递给 AI。因此,我们显然对「Grounding 能解决幻觉」这一说法抱有直接利益关联。本文是对该主张的坦率剖析,其中也包括与该主张唱反调的研究。

什么算作幻觉?

幻觉(hallucination)是以如同陈述事实般的自信说出的看似合理的虚假内容——捏造的引文、根本不存在的经文、从未被分配过的 Strong's 编码。它不是通常意义上的 bug。模型很少拼错词或胡言乱语;它们生成的是具体、结构严密、但完全错误的事实。这种具体性正是其破绽所在,同时也揭示了这种行为的根源。

它们为什么会这样做?

迄今为止发表的最具启发性的答案是:幻觉是一个激励机制问题,而非不可解的谜团。OpenAI 的 Kalai、Nachum、Vempala 和 Zhang 在 2026 年发表于 Nature 的论文 Why Language Models Hallucinate 中阐明了这一点:整个领域用于优化的基准测试评估的是准确率,在这一规则下,说「我不知道」得不到任何分数,而侥幸猜中却能拿满分。在这种评分机制下训练和筛选出来的模型,自然学会了虚张声势。

他们在 SimpleQA 评测上的示例最清晰地说明了这一点。一个模型几乎回答了所有问题,并且有超过四分之三的时间是错的。另一个模型在约一半的问题上选择放弃作答,犯的错误少得多——但在准确率上的得分却更低,因为弃权不得分。如果记分牌奖励猜测,模型就会去猜。

这带来了一个人们在试图用检索作为补救手段时常常忽略的后果。同一批作者明确指出,网络搜索和模型规模扩展无法将准确率推至 100%,因为某些问题根本没有现成答案。即便加入了搜索工具,促使模型去猜的激励机制依然存在。

这种情况实际上发生得有多频繁?

其发生频率高到若不细读定义,头条数据听上去会显得令人难以置信。三个基准测试衡量的是三种不同的东西,脱离定义去引用其中任何一个,正是混乱的开端。

Benchmark What it measures Headline finding
AA-Omniscience (Artificial Analysis) 在模型答错或跳过的问题中,它选择猜测而非拒绝回答的频率——即过度自信率 涵盖 42 个主题的 6,000 道题目。在其 2025 年 11 月发布时,36 款模型中有 33 款在难题上产生幻觉的概率高于正确回答的概率;该指数得分高于零的模型仅有 3 款
Vectara HHEM 在总结提供给它的文档时的忠实度——这是最接近检索流程的直接代理指标 在较新的 7,700 篇文章数据集(法律、医学、金融、教育、技术)上的幻觉率高于较旧且篇幅更短的数据集。拒答单独计为回答率,不计入忠实度——否则完全拒答的模型看起来就会完美无瑕
Stanford RegLab legal study 基于检索进行锚定的商业法律工具是否会产生虚假或缺乏依据的引文 这些工具在超过 17% 的查询中产生了幻觉——而供应商宣称的数字是「接近于零」

2026 年被引用最多的数据则是第四种衡量指标,而且通常被错误引用。Stanford HAI's 2026 AI Index 报告称,26 款顶尖模型中的幻觉率在 22% 至 94% 不等——这并非出自上述三个基准,而是一个探究模型能否区分知识与信念的基准测试。其背后的细节才是真正令人担忧的:当一个虚假陈述被作为其他人所持有的信念抛给模型时,模型处理得很好。但当完全相同的陈述被表述为所相信的内容时,性能便一落千丈。GPT-4o 的准确率从 98.2% 骤降至 64.4%;DeepSeek R1 则从 90% 以上暴跌至 14.4%。

这是一种与前三种截然不同的失败模式,而且在圣经研读中危害最大——因为读者在查考时几乎总是带着某种既定前提。如果你让助手确认某个希腊语词汇的含义,你得到的答案很可能会被你所暗示的预期所左右。

那么,Grounding 到底有没有用?

有用,也没用,而二者的界线正是关键所在。

Stanford RegLab 的研究常被引为打破检索增强生成神话的证据;就营销话术而言,确实如此。但细读它实际衡量的指标:在相同的查询中,基于检索进行锚定的法律工具产生的幻觉确实少于通用 GPT-4。Grounding 确实起到了作用。它只是远远没有卖这项技术的人吹嘘的那么神而已。

检索出现失效的地方十分具体,值得了解:

  • 相关但不充分。 检索到的段落切合主题,但并不包含答案。模型便自行填补空白。
  • 信源冲突。 检索到的两份文档观点相左;模型挑选其一并将其当作定论报告。
  • 迷失在中间。 长上下文将决定性的句子淹没在模型注意力最薄弱的位置。
  • 滚雪球式累积。 在智能体循环中,一个产生幻觉的中间结果变成了下一次检索的输入,导致错误持续扩散。

Grounding 真正改变了什么

这是一个坦诚的表述,而且比营销话术更有力量:Grounding 并没有让 AI 变得正确。它只是让 AI 的错误变得能够被你发现。

一个未经锚定的模型若凭空捏造希腊语词汇的 Thayer 词条,给你的是一份毫无线索可循的编造之词。而一个进行了锚定的模型若误读了真实词条,它给你的则是一个断言、一个词元和一条参考文献——花三十秒核对即可真相大白。第一种错误是隐蔽的。第二种错误则是可审计的。在任何犯错需要付出代价的领域——法律、医学、主日讲道——这种区别构成了其全部价值。

由此得出的设计问题并不是「我们如何阻止它产生幻觉」,而是「我们给模型提供了什么,以及读者能否核查它?」这正是我们让 Darash 返回附带引证的原始材料而非结论的原因。结论无法核查。但 Strong's 编码、词法分析和具体词典是可以核查的。

这也是为什么底层的语料库必须准确无误。当我们根据 1889 年 Harper & Brothers 印刷本重建 Thayer's Greek Lexicon 时,我们从页面图像中转录了全部 716 页正文,并在不同见证文本之间进行了校勘比对:它们在 856,793 个词元中的一致率达到了 98.91%,每一个存疑之处都对照页面图像进行裁定,而不是直接采用读起来更通顺的版本。我们的规则是:页面上没有的字符绝不能存在——一个难以辨认的约瑟夫斯数字至今仍显示为问号,因为将其补全就等于署上我们名字的幻觉。

我们公开发布了测得的 0.19% 误差范围,而不是声称语料库完美无瑕,这与整篇文章所秉持的严谨态度是一致的:明确公布的错误率是可核查的,而声称 100% 完美则不可核查。完整方法已公开发布,包括其中的不足之处。

如果你借助 AI 进行学习,这意味着什么

由此可以得出三点结论,其中没有一条需要你花钱购买任何东西:

  1. 务必索要参考文献。 一个说不出某个说法出处的模型是在背诵,而不是在阅读。要把引证作为交付成果,而非额外的礼貌附带。我们在优先选用哪些研经工具的排序建议也是建立在同一准则之上的。
  2. 将自信视为噪音。 流畅度和笃定感并不包含任何关于正确性的信息。上述基准测试衡量的正是这一点,并且发现模型的综合能力与其事实可靠性之间不存在可靠的相关性。
  3. 给它提供信源,然后去核对。 Grounding 将工作重心从信任转向了验证。验证固然需要费工夫——但比起不知不觉错上一整年,这点工夫微不足道。

常见问题

RAG 能消除幻觉吗?

不能。Stanford RegLab 的研究发现,尽管供应商声称问题已经解决,但基于检索进行锚定的商业法律工具在超过 17% 的查询中仍然存在幻觉。检索能减少幻觉,但无法消除幻觉。

为什么实验室不能直接解决这个问题?

因为激励机制存在于评测方式中,而不仅仅存在于模型内部。只要衡量技术进步的基准测试不对承认不确定性给予任何奖励,模型就会为了自信盲猜而被筛选出来。OpenAI 论文提出的建议是改变评分机制,而不仅仅是调整模型。

较新的模型幻觉更少吗?

有一定程度的改善,但表现并不均衡。通用能力无法预示事实可靠性——Artificial Analysis 发现,有些模型综合智能得分很高但幻觉率很差,反之亦然。请根据你需要的特性进行选择。

低幻觉率总归是好事吗?

未必,这正是数据中的陷阱所在。一个对大多数问题都拒答的模型,可以通过从不冒险回答来刷出漂亮的低幻觉率指标。如果不结合旁边的弃权率来看,这个数字就毫无意义。

研经工具能让 AI 在圣经问题上变得值得信赖吗?

它让 AI 变得可核查,这完全是两码事。你获得了希伯来语或希腊语原文、词法分析以及附带参考文献的词典词条,因此错误的解读可以被揪出来。而解读本身,仍需由你自己来判断。


亲身体验:将 Darash 连接到你常用的 AI——一个 URL,常规登录,45 天免费试用;针对 Claude、ChatGPT 和 Cursor 的分步指南仅需五分钟。或者在连接任何工具前,先阅读 Darash 与 Logos、Accordance 及 Blue Letter Bible 的客观对比

作者:Jørn André Halseth,Publifye AS 创始人——深耕圣经出版及出版系统搭建十年,出版了 4,268 部圣经版本,亦是 Darash、Junifye、Lexifye 和 Tringine 的创作者。关于 · 联系方式

我们发布新内容时给您发邮件。 订阅新闻通讯