✦ 痛点 · PROBLEM

AI 给的参考文献格式完美却查不到

大概率是编的。它不是查错了,是根本没查——生成引文时,模型在续写一段符合引用格式统计规律的字符串,刊名、卷期、页码、DOI 都是照着「长得像真的」拼出来的,所以格式完美与它是否存在无关——那只说明模型很会写引文的样子。下面是当场能跑的五步判别顺序,以及为什么「要求出处」并不等于「能验证出处」。

你遇到的到底是什么

你手上这条是「生成出来的引用」:作者、标题、刊名、卷期、页码、DOI 一应俱全,格式挑不出毛病,但在任何数据库里都检索不到。它还有一种更难识破的半真形态——作者是真人,期刊是真刊,标题也像那个领域会有的题目,只是这几样从未组合在一起:把某个人的研究方向配上另一本刊的卷期,年份和卷号错开一两位。边界要划清楚:这说的是模型自己写出引文的情形。如果它确实做了检索、给了能点开的链接,问题会换一副面孔——链接是真的,但那篇文章里并没有它转述的那个结论。

为什么会这样

因为写这条引文的时候,模型没有查询任何索引。它做的是逐词续写:训练语料里引用格式极其规整(作者、年份、标题、刊名、卷(期)、页码,次序和标点几乎不变),这种规整性恰恰是统计模型最容易学会的东西;而「这一条到底存不存在」不是文本表面的统计特征,模型内部没有一张可以核对的表。所以格式对是必然,存在性对是碰运气——这也正是「格式完美」说明不了任何问题的原因。DOI 尤其容易骗人:它看着像校验码,其实同样只是一串结构固定的字符,模型能拼出结构合法、却从未注册过的 DOI。话题越冷门、你把要求提得越具体(「五篇 2021 年之后的中文核心期刊」),编造的比例越高——可复述的真条目变少了,格式模板却一样好填。

接了联网检索也只是把「有没有查」变成「查了多少」:检索回来的片段仍可能被张冠李戴地归到另一篇上,链接能打开只证明那篇文献存在,不证明它说过模型让它说的那句话。

一次性的缓解

当场能跑的判别顺序是下面五步,按这个次序做最省时间——越靠前的越便宜,也越能一票否决。

代价要说清楚:这套顺序能判定「这一条不存在」,判定不了「这一条存在、而且真的支持我要说的那个论点」,后者只能你把原文调出来读。全部照做,一条引文平均要花几分钟;如果你需要的是二三十条,这比你自己去数据库检索还慢。到那个份上,正确的做法不是继续核它给的引文,而是别让它给引文。

根上的解法

根上的解法是把「产出引文」这件事从模型手里拿走,只留给它真正擅长的那一半:把你的问题翻译成检索策略——同义词、主题词、检索式、先看哪几篇综述、该盯哪几本刊。它不擅长的是记住某一条文献究竟存不存在,那件事没有任何提示词能修好。三条今天就能改的做法:一是反过来用,先让它列出你要论证的主张,再由你去数据库找证据,而不是先要引文、再回头替它的编造找台阶;二是只接受能点开的东西,把「给我参考文献」换成「给我能点开的链接或 DOI,给不出就直接写不确定」,凡是给不出链接的条目一律按不存在处理;三是检索用检索工具,数据库的检索式是确定性的,模型的续写不是。代价是这条路更慢,而且会让 AI 显得没那么能干——你会拿到更少的条目和更多的「我不确定」。那正是你要的结果。

怎么判断真的解决了:随机抽五条引文,每一条都要同时满足三件事——① 用它给的 DOI 或链接当场能打开;② 打开后作者、标题、年份、卷期与它写的逐字对得上;③ 你能在原文里指出支持那句话的具体段落。三条缺一条就不算解决。反过来,「这次格式更规范了」「它说它核对过了」都不是证据:模型对自己有没有查过这件事,同样没有可靠的自我认知。

在 OneOneTalk 里对应什么

要求出处 ≠ 能验证出处。一个能说出「我参考了 X」的系统,和一个能让你点回去看 X 的系统,是两码事,后者才是我们下功夫的地方——范围也一并讲清楚:OneOneTalk 做的是记忆侧的可验证。你在对话里说过或确认过的内容,会带来源、时间、置信度、作用域四项元信息存下来,可以逐条查看、纠正、冻结、恢复、遗忘;所以「刚才这轮回答用到了哪几条记忆」是能点开看的,不对就当场把那一条改掉。

边界(这一页最该记住的一句):这不等于我们能替你核实公开文献是否存在。我们没有文献索引,也不去自动采集外部来源——记忆来自你说过或确认过的内容,不是我们替你抓来的;分身自己推断出来的那部分会单独标成推断,不会混进你确认过的事实里。学术引文能不能用,仍然要你自己去数据库核,上面那五步一步都省不掉。

相关概念见术语表,具体操作见操作指南

常见追问

AI 给的参考文献是编的吗?为什么格式还那么完美?

大概率是编的,而且格式完美恰恰不能当作它查过的证据。生成引文时模型没有查询任何索引,它在续写一段符合引用格式统计规律的字符串——格式是训练语料里最规整、最容易学会的部分,「这一条存不存在」则不是文本表面能看出来的特征。话题越冷门、你把年份和刊物范围指定得越死,编造的比例越高。

参考文献查不到,怎么当场判断它是不是假的?

按这个次序跑:先把 DOI 接在 doi.org 后面打开,解析不出来基本可判死;再用完整标题加引号做精确匹配,别搜关键词,关键词只会给你「长得像的真文献」;然后核对年份与卷号是否自洽;接着单独搜作者,看他是否真在这个方向、这本刊上发表过;最后才逐条进知网、PubMed、Crossref 确认。前四步几分钟就能筛掉大部分,最慢的一步放在最后。

让 AI 联网检索、或者要求它给出处,能解决吗?

能降低,不能消除,而且要求出处不等于能验证出处。接了检索之后仍会出现张冠李戴的归因:链接能打开只证明那篇文献存在,不证明它支持模型说的那句话。更可靠的做法是把「产出引文」换成「产出检索策略」——让它给检索式和关键词,由你去数据库检索;凡是给不出可点开链接或 DOI 的条目,一律按不存在处理。

相关问题

AI 一本正经地胡说八道

AI 编造事实怎么办

看这篇

不知道 AI 说的能不能信

怎么判断 AI 说的是不是真的

看这篇

AI 不懂装懂不说不确定

为什么 AI 从不说自己不确定

看这篇

AI 拒绝或答非所问

AI 拒绝回答或答非所问怎么办

看这篇

延伸来源

下面是这一页所依据的公开一手材料。我们不转述它们的结论当作自己的证据——列在这里是让你能自己去核。