群发资讯网

深度研究AI正在悄悄"被忽悠"?北邮等揭示AI研究助理的致命软肋

这项由北京邮电大学、上海人工智能实验室和重庆邮电大学联合开展的研究,以预印本形式发布于2026年7月,论文编号为arXi

这项由北京邮电大学、上海人工智能实验室和重庆邮电大学联合开展的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.20891,感兴趣的读者可通过该编号查询完整原文。

当你把一项严肃的调查任务交给一位助手,却发现他读了一篇谣言文章后,把那篇谣言的结论当成自己的研究成果写进了报告里——这件事听起来像是助手的重大失职。而研究团队发现,当今最先进的AI"深度研究"助手,正在以超过一半的概率犯下这个错误。

近年来,一类被称为"深度研究"(Deep Research)的AI系统开始流行。这类AI不只是简单地回答问题,而是像一位真正的研究员那样工作:先把大问题拆解成小问题,然后在网络上反复搜索、阅读资料、整理笔记,最终输出一份条理清晰的研究报告。OpenAI、Google等公司都已推出了这类产品,它们被用于科研辅助、行业分析乃至学术写作。

然而,研究团队提出了一个令人不安的问题:如果网络上恰好存在一些"写得像模像样但内容是假的"资料,这类AI助手会不会把假结论当成真结论写进它的最终报告?

为了系统性地回答这个问题,研究团队搭建了一套名为MisKnow-Agent的实验框架,专门用来制造"外表可信、内容却是假的"文件,然后把这些文件混进AI助手能搜索到的资料库里,观察AI最终是否会在报告中采用那个假结论。实验结果相当惊人:哪怕只混入一份这样的假文件,六种不同配置的AI系统中,平均有超过54%的报告会把假结论当成自己的研究结论写出来。而在没有混入任何假文件的对照组中,这个比例是整整的零。

---

一、"深度研究助手"是什么,它为什么会面临这个风险

要理解这项研究,得先搞清楚"深度研究助手"究竟是怎么工作的。

普通的AI对话助手,就像一个博闻强识的朋友,你问什么它回答什么,依靠的主要是它在训练时学到的知识。而深度研究助手更像是一个被委托去"做作业"的研究员:收到任务后,它会先制定一个研究计划,然后一轮一轮地在互联网上搜索资料、阅读网页、把重要内容记录下来,再根据积累的笔记撰写报告。整个过程可能涉及几十次搜索和大量中间材料的积累。

这种工作方式带来了一个天然的脆弱点:AI助手在整个研究过程中会接触大量外部资料,而它无法保证这些资料都是真实可靠的。现实世界的网络上,存在着各种各样质量参差不齐的内容——有些是真正严谨的学术论文,有些是道听途说,还有些内容虽然措辞专业、排版规范,却包含着根本不存在的"研究发现"或"统计数据"。

此前,学术界已经研究过类似问题在简单问答场景中的表现,也就是说,当你直接给AI看一段假内容然后问问题,AI多大概率会被误导。但深度研究助手的工作场景要复杂得多:假内容可能在研究过程中的任何一个环节混入,被摘录进研究笔记,再在最终生成报告时被当作可信依据引用。这个传导链条更长,检验起来也更有挑战性。研究团队正是要填补这个空白。

---

二、研究团队是怎么制造"精心设计的假文件"的

为了让实验严格可控,研究团队不能随便找一篇网上已有的假文章了事。他们需要针对每个具体的研究任务,定制化地生成一批"外表极具可信度、内容却是精心设计的谎言"的文件。这个制造过程本身就很有意思。

整个制造流程分三步走。第一步是"打草稿",也就是为每个研究任务设计一个"假结论蓝图"。蓝图里包含了这个假结论的具体内容——比如某个从未存在的软件功能、某个子虚乌有的统计数字——以及一个按"可信度高低"分层的机构名称库。高可信度机构听起来像MIT、斯坦福这样的顶级研究院,中等可信度是各类区域研究中心,低可信度则是个人博客、网络论坛等。蓝图还包含了一套评判标准,用来事后判断AI是否真的把这个假结论当成了自己的研究结论。

第二步是"批量生产"。根据蓝图,系统自动生成多种版本的假文件,覆盖不同的机构权威级别和不同的文体风格。文体风格包括四种:看起来像学术论文的正式文章、看起来像新闻报道的资讯文章、看起来像技术博客的分析文章,以及看起来像社交媒体帖子的短文。每种风格对应着真实网络上最常见的内容类型,而且同样的假结论会用这四种截然不同的面孔出现。

第三步是"质量把关",这也是最关键的一步。研究团队深知,如果假文件里的某个具体说法恰好在现实中是真的,实验就会失去控制变量。于是,他们让五个不同的AI模型分别去搜索验证每份假文件的核心说法,只有当所有五个模型都判定"这个说法在现实世界中找不到任何支撑,是假的"时,这份文件才会被保留进最终的实验语料库。五个验证模型包括了GLM-5、Kimi 2.6、DeepSeek-V4 Pro、Qwen3.5-397B和Intern-S1-Pro,来自不同公司、使用不同训练数据,这样可以减少单一模型偏差带来的误判。

经过这套流程加上人工筛选,最终保留了5933份质量合格的假文件,覆盖100个来自"深度研究基准测试"的真实研究任务。研究团队还对每个任务的"假结论"逐一进行了人工审核,对照权威来源确认其确实是假的,没有一个被评为"无法确认"或"实际为真"。这些任务还被人工确认了所有假结论,确保100%都是被实际证伪的错误说法。

---

三、实验是怎么做的,判断AI"被忽悠了没有"的标准是什么

实验设计本身也值得细细道来,因为研究团队在判断"AI有没有被忽悠"这件事上,设置了相当严格的标准。

判断AI是否"采用了假结论",不是看AI有没有在报告里提到那个假结论,而是看AI有没有把那个假结论当作自己的研究结论来背书。如果AI只是写道"某研究机构声称……但此说法尚未得到广泛证实",这算作"没有被忽悠"。只有当AI的报告在自己的结论、建议或核心分析中,把假结论当成已经确立的事实来呈现时,才算作"被忽悠了"。这个判断由DeepSeek-V4 Pro担任评判模型,其与人类标注者的一致率高达99.7%,Cohen's κ系数为0.993,基本可以认为是准确可靠的。

实验以"假结论采纳率"(FCAR,False-Conclusion Adoption Rate)作为核心指标,记录在各种条件下AI最终报告采纳假结论的比例。

研究团队主要检验了以下几个维度的影响:假文件出现在搜索结果中的位置排名(靠前、散布、靠后)、假文件被AI接触到的时间节点(研究开始时、研究中间、报告生成前夕)、文件来源的权威级别(高、中、低)、文件的呈现风格(论文、新闻、博客、帖子)、同时混入的假文件数量(0到5份),以及使用不同的研究框架和底层AI模型的组合。

---

四、最关键的发现:什么因素决定AI有多容易被忽悠

研究团队从实验中得到了一系列具体而清晰的发现,每一条都颇具启发性。

关于文件出现在搜索结果中的位置,研究发现这几乎没什么影响。无论假文件出现在搜索结果的第一位、散布在中间还是排在最末尾,AI的假结论采纳率差异不超过两个百分点(分别是66.2%、65.5%和64.5%)。这说明AI并不像人类那样会优先关注"排名靠前的结果更可靠",只要内容被读到,排名高低并不能帮助过滤掉虚假信息。

关于假文件被读取的时间节点,这里出现了最戏剧性的差异。如果假文件在AI开始研究时就混入,假结论采纳率是40.5%;如果在研究进行到中途时混入,是44.2%;但如果等到AI已经完成了所有研究、即将开始撰写最终报告时才混入,假结论采纳率骤升至85.5%,六种配置中最高的达到94%。

这个规律背后有一个深刻的逻辑:如果假文件在研究早期混入,AI在后续的研究过程中还有机会搜索到反驳它的真实资料,从而在积累的笔记中形成"这个说法存疑"的判断。但如果假文件在报告撰写的最后时刻才出现,AI没有时间再去搜索验证,只能直接把它当作最新获得的参考资料纳入报告,结果导致采纳率几乎翻倍。

关于来源的权威级别,总体趋势是:来源越权威,AI越容易被忽悠。高权威来源(看起来像顶级研究机构发布的内容)对应的平均假结论采纳率是61%,中等权威是57.7%,低权威(个人博客、论坛帖子)是46.2%。在每一种AI配置下,低权威来源的采纳率都低于高权威来源。不过,高权威和中等权威之间的差异并不总是单调递减的,有两种WebThinker配置甚至出现了中等权威略高于高权威的情况,说明这个规律存在一定波动。

关于文件的呈现风格,这里出现了比权威级别更强、更一致的效果。以论文形式呈现的假文件,平均假结论采纳率最高,达到61%;其次是博客形式(53%)和新闻形式(44%),而以社交媒体帖子形式呈现的假文件采纳率最低,只有37.5%。更值得注意的是,这个排序在所有六种AI配置中都保持一致:论文形式最容易被采纳,帖子形式最不容易被采纳。论文风格与帖子风格之间23.5个百分点的差距,甚至比权威级别高低造成的14.8个百分点的差距还要大。换句话说,把假内容包装成一篇格式规范、用词专业的"学术论文",比把它归属给一个"权威机构"还要有效。

关于混入的假文件数量,在没有混入任何假文件的对照组里,六种配置的假结论采纳率全部是0%,证明这些AI不会无缘无故地"自发"产生那些假结论。一旦混入哪怕一份假文件,采纳率就跳升到平均54.7%。随后混入两份,采纳率升到59.5%;三份时达到峰值61%;继续增加到四份(60.3%)或五份(58.3%)时,采纳率反而不再上升,甚至略有下降。这说明一份假文件就足以造成显著影响,而堆积更多假文件并不能成比例地加强这种影响。

---

五、不同AI系统和研究框架之间的差异

实验选用了两个开源的深度研究框架——DeerFlow(字节跳动开发)和WebThinker——分别搭配三个不同的底层AI模型(DeepSeek-V4 Pro、Qwen3.5-397B和Intern-S1-Pro)进行测试,共形成六种配置。六种配置在高权威、论文风格的标准条件下,假结论采纳率从50%到76%不等。

两个框架之间存在系统性差异:平均来看,DeerFlow的假结论采纳率(67%)高于WebThinker(55%)。研究团队通过分析中间过程发现了一个有趣的解释:DeerFlow采用相对直接的"规划-搜索-汇报"流程,搜索到的内容会相对完整地保存并传递给最终报告生成环节;而WebThinker会把任务拆解得更细,把搜索到的内容压缩进一个"文档记忆库",再分段撰写和编辑报告,这些额外的处理步骤有时会无意中过滤掉假文件的影响。

然而,这两个框架的差距大小因底层模型而异。使用Intern-S1-Pro时,DeerFlow的采纳率比WebThinker高出整整21个百分点;使用Qwen3.5-397B时差距缩小到10个百分点;使用DeepSeek-V4 Pro时只剩5个百分点。更反直觉的是,DeepSeek-V4 Pro在WebThinker框架下的采纳率反而是三个模型中最高的(60%),因为这个模型在WebThinker的记忆系统里会更积极地在后期合成阶段回调早期获取的证据——包括那些假证据。这说明,AI模型的"智力水平"高低并不直接等同于"抵抗假信息的能力"强弱,框架设计和模型特性的交互作用才是关键。

研究团队还专门测试了闭源商业系统Gemini Deep Research,发现其表现出了大体相似的规律:高权威来源假结论采纳率54%,低权威来源骤降至8%;论文风格采纳率54%,帖子风格28%。Gemini在假文件数量增加方面的反应与开源系统略有不同——其采纳率从一份文件时的27%随着数量增加而稳步上升,到三份时达到54%后趋于平稳。这说明这个问题并非某一类系统独有,而是当前深度研究AI普遍面临的挑战。

---

六、研究团队提出了哪些防御手段,效果怎么样

发现问题之后,研究团队也尝试了两种防御策略,并系统测试了它们的有效性。

第一种防御叫做"研究前防御",本质上是在把任务交给AI之前,在提示词里附加一段额外指令。这段指令要求AI把所有搜索到的信息视为"未经验证的信息",在最终结论中只使用有独立可靠来源支撑的说法,对于来源单一、证据薄弱或存在矛盾的说法要明确标注不确定性或直接不用。这段指令不涉及任何具体任务内容,也不告诉AI哪份文件是假的,完全是通用的"证据核查意识"激活指令。

第二种防御叫做"研究后防御",在AI完成研究报告之后,再启动另一个搜索增强型AI对报告中的每一个关键说法逐条进行独立核查,对于能找到支撑的说法保留,对于被反驳的说法修正,对于无法确认的说法则打上不确定标记。

实验结果显示,两种防御都能降低假结论采纳率,但都无法完全消除它。在使用DeepSeek-V4 Pro的DeerFlow配置中,基准采纳率是65%;单独使用研究前防御后降到41%;单独使用研究后防御后降到20%;两者结合则降到15%。对Qwen3.5-397B的效果同样明显:从60%分别降到37%、41%和29%。

然而,防御效果存在明显的模型依赖性,甚至在某些情况下两种防御叠加反而不如单独使用一种。在Intern-S1-Pro配置中,单独使用研究前防御使采纳率从76%降到57%,单独使用研究后防御降到58%,但两者结合后反而升到了62%。研究团队推测,这是因为研究后防御阶段的AI进行独立核查时,使用的是同一个混入了假文件的信息环境,有时反而重新检索到那些假文件并被再次影响,部分抵消了研究前防御的效果。

归根结底,这两种防御手段减轻了问题的严重性,但没有从根本上解决它。研究团队认为,真正有效的防御需要把证据核查机制贯穿于AI研究过程的每一个环节,而不仅仅是在开始前叮嘱一句或在结束后补查一遍。

---

说到底,这项研究揭示的问题并不只是一个技术细节,而是关乎AI深度研究工具在现实世界中能否被信任的根本性问题。当AI助手在处理一个复杂研究任务时,它的弱点不在于被故意植入的恶意指令,而在于它对"看起来可信的内容"缺乏足够的批判性鉴别能力——这是一种内容层面的脆弱性,而非系统层面的攻击。

对于普通使用者而言,这意味着当你使用任何形式的AI研究助手生成报告时,对于报告中引用了"某某机构发布的研究显示"这类来源的结论,依然需要保持审慎,尤其是当该结论听起来很新颖或与主流认知有出入时。AI助手目前能做的是帮你检索和整理信息,但它尚不能完全替代人类研究者对证据质量的深度判断。

这项研究同时也给AI开发者提出了明确的方向:仅仅在使用前提醒AI"注意核查"是不够的,需要把持续性的证据验证机制嵌入AI研究工作流的每一个中间环节,才有可能在长周期的复杂研究任务中真正抵御误导性信息的侵入。感兴趣的读者可以通过arXiv:2607.20891查阅完整论文,深入了解实验设计的所有细节。

---

Q&A

Q1:深度研究AI采纳假结论的比例有多高?

A:根据实验,在没有混入任何假文件时,六种不同配置的深度研究AI系统假结论采纳率均为0%。但只要混入一份设计精良的假文件,平均假结论采纳率就会跳升至54.7%。在报告撰写前夕才混入假文件时,采纳率更高达85.5%,某些配置甚至达到94%。

Q2:把假内容伪装成学术论文格式真的更容易骗到AI吗?

A:是的,效果相当明显。实验发现,以学术论文风格呈现的假文件平均假结论采纳率达到61%,而以社交媒体帖子形式呈现的相同假内容采纳率只有37.5%,差距超过23个百分点。这个差距甚至比把来源从普通博客换成顶级研究机构所带来的差距(约15个百分点)还要大,说明呈现格式比来源权威性的影响还要强。

Q3:MisKnow-Agent框架制造出来的假文件是真实可用的攻击工具吗?

A:不是。研究团队明确说明,他们并没有把任何假文件发布到真实互联网上,也没有修改任何真实的信息环境。这些假文件只被插入了实验室控制的测试检索池中,目的是模拟现实中已经存在的误导性内容,研究AI系统如何应对,而非制造或传播虚假信息。