
这项由北京大学、快手团队、香港科技大学(广州)、中文大学、浙江大学和清华大学联合完成的研究,以预印本形式发布于2026年7月30日,论文编号为arXiv:2607.28595。感兴趣的读者可通过该编号查阅完整论文。
你有没有遇到过这样的情况:请一个助手帮你查资料,结果他不管什么问题都先翻出一大堆工具,折腾半天,给出的答案反而比直接回答还差?或者反过来,明明面对一道极其复杂的数数题,却偏偏不肯动手算,就靠肉眼瞎猜,猜错了也不知道?
这正是当前人工智能视觉助手普遍存在的困境。研究团队把这个问题比作两种失职的员工:一种是"工具控",不管什么鸡毛蒜皮的小事都要搬出工具箱,折腾半天反而出错;另一种是"裸奔选手",明明有工具可以用,偏偏靠感觉硬扛,遇到真正需要精确计算的任务就露了馅。研究团队正是为了解决这个"知道什么时候该用工具"的核心难题,提出了名为Beacon(中文可理解为"灯塔")的全新模型。
一、工具用多了和用少了都是问题
以当前最流行的多模态大语言模型为例,这类系统能看图说话、回答问题、甚至写代码。为了处理更复杂的视觉任务,研究者会给模型配备一套"工具箱"——比如放大镜(图像裁剪)、标注笔(画框标记)、计算器(数值计算)等。通过调用这些工具,模型理论上可以处理肉眼难以分辨的细节。
然而,研究团队在仔细分析了多个代表性的前沿模型后,发现了一个令人意外的现象:给模型配备工具,并不意味着模型就会变得更聪明,甚至有可能越用越糟糕。
打个比方,一道简单题——"图里的天气是晴天还是阴天?"——本来直接看图就能秒答,但某些模型偏偏要先写一段代码裁剪图像、调用工具,折腾一大圈,最终答案没变,时间和计算资源白白浪费了。更糟糕的是,工具调用过程中一旦出错(代码bug、坐标算偏等),原本能答对的题反而答错了。这就是研究团队所说的"工具伤害"——工具的使用在本不需要它的地方制造了新的错误。
与此同时,对于真正困难的任务——比如"轨道上有多少颗蓝色弹珠?"这类需要精确数数的视觉任务——很多模型却又不知道主动调用工具,靠视觉估算猜一个数字,大概率猜错。这就是"工具收益不足"的问题:工具本来大有用武之地,模型却没有抓住机会。
研究团队把这两种能力分别定义为"模式适应性"(Mode Adaptiveness)和"工具效果"(Tool Effect)。前者考察的是模型能否根据题目的难易程度,灵活选择"直接回答"还是"先用工具";后者衡量的是工具使用究竟是帮了忙还是帮了倒忙。这两个维度构成了整项研究的核心框架。
二、研究团队是怎么量化"聪明程度"的
要评判一个模型在工具使用上表现好不好,不能只看最终答题的准确率,因为那个数字掩盖了太多细节。研究团队设计了一套更精细的测量体系。
具体做法是:对每道题,不是只问一次,而是连续问五次,并且强制模型在这五次里不许使用任何工具,看看它纯靠文字推理能答对几次。如果五次里有四次或以上都答对了,就把这道题标记为"文本简单题";如果五次里只有零次或一次答对,就标记为"文本困难题";介于二者之间的题目太模糊,直接剔除不参与分析。
这个设计非常巧妙,就好比给一个人出一道题,不是问他一次就判断,而是连续测试五次,看他是真的懂还是偶尔蒙对。
有了这个分类之后,研究团队再让模型在允许使用工具的情况下回答这些题目,记录模型是否主动调用了工具,以及最终答对没有。由此衍生出几个关键指标:模型在"文本简单题"上有多少比例不动工具(叫做MAtext,越高越好,说明模型懂得在不必要时省力气);模型在"文本困难题"上有多少比例主动调用了工具(叫做MAtool,越高越好,说明模型在真正需要帮助时知道求助);工具帮助模型在困难题上答对的比例(叫做Tool-Gain,越高说明工具越有价值);工具在简单题上把原本答对的题搞错的比例(叫做Tool-Harm,越低越好)。
研究团队用这套体系评测了四款代表性的前沿模型:Thyme、DeepEyesV2、CodeV和Metis。结果出乎意料地一致:这四款模型几乎都在"模式适应性"上表现糟糕——不是几乎所有题都去调工具,就是几乎所有题都不调工具,缺乏根据题目难易灵活切换的能力。更关键的是,这些模型的Tool-Gain和Tool-Harm几乎旗鼓相当,意味着工具帮你解决了一些难题,但同时也在容易的题上犯了差不多数量的错,净收益几乎为零。允许使用工具之后,这些模型的平均准确率和强制不用工具时几乎没有差别。
这一发现直接揭示了问题的根源:当前的训练方式根本没有给模型足够的信号去学习"什么时候该用工具",也没有有效地增强模型在最困难任务上通过工具解决问题的能力。
三、灯塔模型是怎么诞生的
Beacon的训练分为两个阶段,就像先教会一个学生基本技能,再通过实战演练让他变得更聪明、更懂分寸。
第一阶段是"打基础"(监督微调,SFT)。研究团队从16个公开数据集里收集了超过21万道题,涵盖数学几何、图表理解、高分辨率感知、空间推理、知识问答等多个方向。他们先让基础模型Qwen3-VL-8B回答这些题目,筛选出那些基础模型答不好的困难题目,再让强大的Gemini 3.1 Pro为这些题目生成带有Python代码调用的完整解题轨迹,只保留最终答对的轨迹。
光有正确答案还不够,因为Gemini生成的轨迹可能也存在冗余的工具调用、代码没真正帮上忙就直接靠猜答题等问题。于是团队又用Gemini对这些轨迹进行了二次"精炼",剔除工具没有真正发挥作用的轨迹、删掉重复无意义的步骤、补充缺失的观察分析。最终保留了约1.57万条高质量的有工具调用的解题轨迹,同时混入了一些基础模型本来就能直接答对、不需要工具的题目,防止模型被过度训练成"什么都用工具"的习惯。
第二阶段是"实战磨砺"(强化学习,RL)。研究团队在第一阶段的SFT模型基础上,针对那些即便经过SFT训练仍然难以解决的题目,进行了强化学习。这一阶段包含两个核心设计,也是整个Beacon最独特的地方。
四、"必要性感知奖励":教会模型何时该动手
第一个核心设计叫做"必要性感知自适应奖励"(Necessity-Aware Adaptive Reward,NAAR)。
普通的强化学习训练方法通常只管"答对了就给奖励,答错了就扣分",完全不考虑模型是靠工具答对的还是靠直接推理答对的。这就好比老师批改作业时只看答案对不对,不管学生是认真计算还是偷看答案抄来的——长此以往,学生就不知道什么时候该老老实实自己算,什么时候才需要借助参考资料。
NAAR的设计逻辑是:先判断当前这组回答里,有没有纯靠文字推理就答对的情况。如果有,说明这道题靠自己就能搞定,那么直接答对的回答得满分,而用了工具才答对的回答只得四分之一的分。注意,用工具答对的情况不是零分,因为它毕竟是正确答案,有一定参考价值;只是分数打折,传递"这种情况你本可以不用工具"的信号。反过来,如果这组回答里根本没有靠纯文字推理答对的,说明这道题对模型来说是真正的难题,那么用工具答对的就给满分,鼓励模型在真正需要的时候积极调用工具。
这个奖励机制还有一个关键优势:它是基于模型自身当前能力动态标注的,而不是让一个外部"老师模型"来预先判断哪些题需要工具。这样就避免了"学生的能力和老师的能力不匹配"的尴尬——因为老师可能觉得简单的题,学生不一定也觉得简单。
五、"提示引导能力扩展":突破模型能力的天花板
第二个核心设计叫做"提示引导能力扩展"(Hint-Guided Capability Expansion,HCE)。
强化学习有一个著名的瓶颈:如果一道题对模型来说实在太难,模型在一批次内生成的所有回答全都是错的,那这一批次的训练就完全浪费了。因为强化学习的核心机制是"比较一组回答的好坏",如果所有回答都是错的,大家同样差,就没有什么可以学习的梯度信号,就像一群考生都考了零分,老师完全不知道谁比谁稍微好一点点。
然而,这些最难的题目恰恰是模型最需要突破的地方,也是工具使用最能发挥价值的场景。就这么放弃,太可惜了。
HCE的解法是:当一道题被标记为"全军覆没"之后,先请Gemini 3.1 Pro生成一条正确的完整解题轨迹,然后从这条轨迹中提取出关键的推理步骤和工具使用策略,转化为一段"提示"(Hint)——注意,提示里只包含解题方向和中间目标,绝对不包含最终答案。然后把这段提示附加到原始问题后面,让正在训练的模型重新尝试,看看有没有能够在提示的帮助下答对的回答。
举个例子,原来的问题是"这场羽毛球比赛的当前比分是多少,如果球落在红圈里,新比分会怎样变化?"模型完全没有头绪,全部答错。专家给出的提示是:"第一步,裁剪比分板区域和红圈位置;第二步,根据出界规则计算新得分并找出赛事年份。"有了这个提示,模型在重新尝试时,会去学习专家推荐的工具调用思路,从而有机会答对。
更巧妙的是,在用提示生成的正确轨迹来更新模型参数时,研究团队会把提示从输入里悄悄去掉——只保留"模型在有提示帮助下产生的行为轨迹",但告诉模型"你当时面对的是没有提示的原始问题"。这样训练出来的模型,就把在提示辅助下学到的工具使用技巧,内化成了自己在没有任何提示时也能自主运用的能力。效果相当于:老师带着学生做了一遍,下次学生就能自己做了,不再需要老师帮忙。
六、实验结果:灯塔照亮了多远
研究团队在13个不同的视觉推理基准测试上全面评测了Beacon,这13个测试涵盖了高分辨率视觉搜索(比如在密集图像中找到特定目标)、空间感知推理(判断物体之间的相对位置关系)、数学图表理解、组合推理和代理任务等各种类型。
在整体性能上,Beacon在13个测试中的11个位列所有开源模型第一,平均得分58.98%,比基础模型Qwen3-VL-8B-Instruct提高了约6个百分点,也超过了同等规模的其他所有前沿系统。相比之下,第二名Metis的平均得分是56.67%,差距明显。
在工具使用的适应性方面,研究团队特别绘制了一张图:横轴是"纯文字模式下答对次数"(代表题目的难易程度),纵轴是"实际调用工具的比例"。对于真正聪明的模型,这条曲线应该是向右下方倾斜的——越容易的题,工具调用比例越低;越难的题,工具调用比例越高。在被测试的五个模型里,只有Beacon呈现出这种理想的趋势:对于五次都能答对的简单题,Beacon调用工具的比例较低;而对于基本答不对的困难题,Beacon几乎次次都会调用工具。其他模型的曲线则基本上是平的,说明它们完全不根据题目难易来决定是否用工具。
在工具效果方面,Beacon的Tool-Gain达到9.3%,Tool-Harm为6.2%,净收益(Tool-Gain减去Tool-Harm)为+3.1个百分点,是所有模型中最大的正差值。相比之下,Thyme的工具净收益几乎是负数,DeepEyesV2和Metis也基本打平,说明在这些模型上工具几乎没有带来实质性的进步。
在文本保留率(即"用了工具之后,原来靠文字就能答对的题,还有多少比例保住了正确")方面,Beacon达到91%,远高于其他模型,说明工具的引入基本上没有破坏原本就能正确解答的能力。
七、消融实验揭示的规律
为了搞清楚哪些设计真正起到了作用,研究团队还做了一系列"拆零件"实验,依次去掉NAAR和HCE,观察性能变化。
实验结果显示,单纯用普通的GRPO强化学习(没有NAAR,没有HCE),模型的工具使用净收益仅有+1.4个百分点,整体准确率57.1%。加入NAAR之后,模式适应性指标MAmean从56.3%提升到了59.7%,工具净收益提升到+2.54个百分点,整体准确率小幅提升至57.75%。单独加入HCE之后,工具净收益提升到+2.96个百分点,说明HCE主要在强化"工具真正帮上忙"这个方向。两者同时使用,整体准确率达到58.98%,工具净收益最高+3.14个百分点,两项指标互相促进。
研究团队还分析了训练过程中各项指标的动态变化曲线。一个关键发现是:在整个强化学习训练过程中,使用文字回答和使用代码回答的比例始终保持稳定,没有明显的漂移——模型并不是简单地越来越偏向某种回答方式。真正在提升的,是"推理模式与题目类型的匹配准确率",也就是说,模型逐渐学会了识别题目性质,并据此选择合适的模式,而不是无脑偏向其中一种。
在HCE的效果上,研究团队统计了所有"全军覆没"组(所有回答都错的训练题目)中,经过提示引导的再次尝试,有多少比例成功被"救活"(至少出现一个正确回答)。结果显示约有40%的全军覆没组得到了有效转化,从完全没有学习价值的数据变成了有用的训练信号,这对于提升模型在最困难任务上的工具使用能力贡献显著。
研究团队还描述了几个生动的案例:在第一个案例中,面对"轨道上有多少颗蓝色弹珠"的问题,Beacon先获取图像尺寸,再通过像素级蓝色区域检测和连通分量算法数出22颗,完全正确。在第二个案例中,面对"图中有多少辆白色汽车"的街景照片,Beacon通过多次裁剪中景和远景区域,逐步锁定每辆车的颜色,最终判断出2辆白色车,答对选项B。在一个使用提示引导的案例中,面对"这场羽毛球比赛的新比分是多少"这道需要同时识别比分板、判断红圈位置、理解出界规则的复合题,Beacon按照提示提供的步骤,依次裁剪比分区域、用辅助线标注球场边界,最终正确判断出红圈在边线外、球出界、新比分为IND 1:20对TPE 0:16,并识别出比赛年份为2023年。
说到底,Beacon的核心贡献不在于发明了什么前所未有的全新技术,而在于清晰地定义了一个此前被忽视的问题——工具使用的"智慧性",并提出了可操作的解决方案。知道什么时候该动手、动手之后真的有帮助,这才是工具真正的价值所在。对于未来的多模态AI系统来说,与其追求工具的数量和调用的频率,不如先把"知道何时该用、用了真有效"这个基本功练扎实。
这项研究还提示了一个有趣的思考方向:当我们评价一个AI系统有多聪明时,或许不应该只看它能做什么,更要看它知不知道自己的局限在哪里、能不能在需要外援时主动寻求帮助而不是硬撑。这种"元认知"能力,可能正是人工智能走向真正实用的关键一步。
有兴趣深入了解细节的读者,可以通过arXiv编号2607.28595找到这篇完整论文,里面包含了完整的提示词设计、数据统计、训练参数设置和更多案例分析。
---
Q&A
Q1:Beacon模型和普通的视觉AI有什么不同?
A:普通视觉AI通常要么总是调用工具,要么从不调用,缺乏根据题目难易灵活判断的能力。Beacon通过"必要性感知奖励"训练机制,让模型学会在简单问题上直接作答,在真正困难的问题上才调用代码工具,从而减少不必要的错误并提升复杂任务的解决率。
Q2:Beacon的"提示引导能力扩展"在训练时是怎么起作用的?
A:当模型对某道题完全不会做时,系统会请更强的Gemini模型生成一段解题提示(只提供方向和步骤,不含答案),让模型借助提示练习工具使用技巧。训练时再悄悄去掉提示,只保留学到的行为轨迹,让模型在没有提示的正常情况下也能复现这些技能。大约40%原本全部答错的题目,经过这个机制得到了有效利用。
Q3:Beacon在哪些任务类型上提升最明显?
A:Beacon在需要精细视觉操作的任务上提升最为突出,比如高分辨率图像搜索、图表理解、计数推理和组合推理等,平均比基础模型提升约6个百分点。在ChartQAPro(图表问答)上提升了约17个百分点,在视觉谜题和竞技问答类任务上也有10个百分点左右的提升。