GPT
你是否经历过这样的场景:明明知道某个答案就在嘴边,却怎么也说不出来?心理学上将这种现象命名为“舌尖现象”。如今,谷歌的一项研究发现,GPT-5和Gemini 3这两款大模型也面临着类似的困境——它们虽然存储了大量信息,却无法在需要时准确提取。
在谷歌的这项研究中,这两个大模型将95%至98%的测试事实纳入了参数体系,但当直接询问时,它们仍有26%至34%的事实无法回答。即便开启“思考”模式,让模型多花时间思考,仍有11%至12%的事实无法被唤醒。这表明,模型答不出问题,很多时候并非因为缺乏相关知识,而是无法从记忆中有效检索。
这项研究被命名为《空货架,还是丢钥匙?》,并收录于ICML 2026会议。谷歌研究团队提出了一种名为“知识画像”的新框架,用于分析模型对知识的掌握状态。该框架将一条事实在模型中的状态分为五类:存入失败、回忆失败、直接回忆、借助“思考”回忆,以及未存入却通过推理答对。这一分类有助于更精准地定位问题,从而采取针对性的改进措施。
为了验证这一框架,谷歌开发了名为WikiProfile的基准测试集,包含2150条来自英文维基百科的事实,每条事实对应10道题目,总计21500道题。这些题目由Gemini-2.5-Pro生成,并通过Google搜索验证,确保答案的唯一性和题目的清晰性。最终,13个模型在该基准上进行了测试,覆盖了Gemini 3、GPT-5、GPT-4.1和Gemma 3四个家族,每个模型在开启和关闭“思考”模式下各运行一次,每道题采样八次,共收集了约450万条回答。
测试结果显示,前沿模型在事实错误中,“取不出来”已成为主要问题,占比超过了“没学过”。具体而言,冷门知识的存储率与热门知识相差无几,但在回忆率上却存在显著差距。例如,Gemini-3-Pro的冷门事实存储率为94.5%,而回忆率仅为63.3%;热门事实的存储率为99.5%,回忆率则为84.7%。这表明,冷门知识虽然被存储,但更难被唤醒。
另一个常见问题是“反转诅咒”。模型能够轻松回答“汤姆·克鲁斯的妈妈是谁”,却难以回答“这位女士的儿子是谁”。然而,当问题改为四选一的形式时,模型的表现却显著提升,甚至在多数情况下反向问题的回答优于正向问题。这说明模型并非没有建立双向关联,而是难以在问答形式下激活这一关联。
“思考”模式在提升回忆率方面发挥了重要作用。对于已存储但无法直接回忆的事实,开启“思考”模式后,模型能够找回40%至65%的信息。相比之下,对于未存储的事实,“思考”模式仅能找回5%至15%的信息。这表明,“思考”模式并非通过推理得出答案,而是帮助模型在记忆中搜索相关信息。
谷歌的另一篇姊妹论文《思考以回忆》进一步解释了“思考”模式的作用机制:一是计算缓冲,即思考过程中产生的无关token为模型争取了额外的隐式算力;二是事实启动,模型通过先说出相关事实,为正确答案搭建语义桥梁。这种机制与人类的“扩散激活”现象类似,即通过回忆相关信息来激活目标记忆。
尽管检索增强技术可以部分弥补这一缺陷,但参数中的知识仍对模型的流畅度、响应速度和跨语境整合能力至关重要,难以被外部检索完全替代。因此,如何让模型更有效地利用已存储的知识,成为下一个需要攻克的难题。
要让模型在需要时开启“思考”模式,首先需要让它意识到自己无法直接回答问题。这一能力被定义为模型的元认知,即对自身状态的判断。过去两年,提升模型可靠性的主要手段是增加数据和参数,但谷歌的研究表明,前沿模型在事实层面的存储已接近饱和,未来的竞争将聚焦于如何让模型更高效地提取和利用知识。
