群发资讯网

北大、清华等联合:如何让AI学生也能越学越聪明?

这项由北京大学、清华大学、上海交通大学及快手Kling团队等机构联合开展的研究,于2026年7月30日以预印本形式发布,

这项由北京大学、清华大学、上海交通大学及快手Kling团队等机构联合开展的研究,于2026年7月30日以预印本形式发布,论文编号为arXiv:2607.28022,有兴趣深入了解的读者可通过该编号查询完整原文。

你有没有想过,教一个人学厨艺,最难的部分不是教他怎么切菜、怎么控火,而是告诉他"这道菜应该是什么味道"?如果你教的是做红烧肉,你可以让他尝一口成品说"咸了"或"甜了"——这很好判断。但如果你要教他做一道从未有人规定过标准的创意融合料理,没有参考答案,没有评分标准,那该怎么办?

这个问题,正是人工智能研究者们在大型语言模型训练中长期面对的核心难题。这篇论文提出的方法叫做Flux-OPD,是一种让AI学生在"没有标准答案的开放性领域"中持续进步的训练范式。它的核心思想,是让有经验的AI老师在教学过程中,根据学生当前的真实状态动态调整自己的指导内容——就像一位优秀的厨艺导师,不是照本宣科地背食谱,而是看着学生今天做出来的菜,随时调整今天该讲什么、该纠正什么。

一、当AI遇到"没有标准答案"的世界

要理解这项研究解决的问题,先得了解一个背景:现代AI大模型是怎么学习的。

目前最强大的AI系统,比如那些能回答复杂问题、能写代码、能做数学题的模型,很多都是通过一种叫做"带可验证奖励的强化学习"的方式训练出来的。通俗说,就是给AI出数学题,如果答对了就给奖励,答错了就惩罚——因为数学题有确定的对错,这套方法效果非常好。

然而,现实世界中有大量任务根本没有明确的对错之分。医生给病人解释病情时应该用什么语气?一段视频生成提示词怎么写才算好?这类问题,没有唯一正确答案,也就无法简单地用"答对给糖"的方式来训练。

研究者们曾尝试一种叫做"评分准则作为奖励"的方法,就是先写好一套评分标准,再让AI按标准来打分和训练。但问题是,把复杂的人类偏好压缩成一套死板的评分准则,往往会丢失很多微妙的信息,就像把一位米其林大厨的全部烹饪哲学压缩成一张百字清单,必然会有很多东西说不清楚。

另一种更自然的方法,是使用"情境蒸馏"——给AI老师一些背景信息(比如过去的经验教训、典型案例),让老师参考这些背景信息来指导学生。这种方式能传递更丰富的偏好信息,但问题在于:这些背景信息是在训练开始前就固定下来的,随着学生越学越好,那些最初准备的案例和经验很快就失去了价值,学生已经超过了那个水平,老师却还在讲最初那几个例子,自然帮不上忙了。

所以,研究团队想到一个更聪明的方案:让这些背景信息随着学生的成长而不断更新和进化。老师每隔一段时间就观察一下学生现在的真实水平,从这些新的观察中总结出新的经验,再用这些新鲜的经验来指导下一阶段的训练。

二、直接让"经验"随时更新,为什么会出问题?

这个想法听起来很美好,但实际操作中藏着一个严重的麻烦。

研究团队已经有了一个早期的版本,叫做OEL(在线经验学习)。它的做法是:先让学生跑一段时间,收集学生的各种回答,让老师从中总结新经验,更新背景信息,然后再继续训练。但这套方法是"跑一段、停下来、更新、再跑"这样分阶段交替进行的,不够及时,而且每次更新经验的时候,学生的"学习目标"就会突然发生剧变。

更麻烦的是,研究团队进一步尝试把这个过程变成实时的——每隔很小的步骤就更新一次背景信息——结果发现,训练过程变得极不稳定。论文中有一张图清晰地展示了这个现象:训练损失(可以理解为"学生当前的错误程度")本来应该平稳下降,却一次次地突然剧烈飙升,就像一个学生刚刚适应了新老师的风格,老师又突然换了一套完全不同的教学方式,导致学生一次次被迫从头适应。

除此之外,还有一个更微妙的问题:从不同的学生回答中总结出来的经验,有时候是互相矛盾的。比如,一组回答让老师总结出"要尽量保持原意,别画蛇添足",另一组却总结出"要加入更多细节和深度"。这两条经验放在一起,老师给学生的指导就变成了互相打架的信号,学生不知道该听哪个。

这两个问题——训练目标不稳定和指导信号互相冲突——正是这篇论文要解决的核心挑战。

三、用数学拆解"老师的指导"到底在做什么

为了找到解决方案,研究团队没有靠直觉猜测,而是从数学层面严格分析了"情境蒸馏"这件事到底在做什么。

在AI训练中,有一种叫做"反向KL散度"的数学工具,可以理解为衡量"学生的回答风格与老师的回答风格相差多远"的一把尺子。传统的训练方式就是最小化这个差距——让学生越来越像老师。

研究团队对这个数学量进行了一次关键的分解,得到了一个很有启发性的结果:当老师参考多个不同的背景情境来给学生指导时,这个"学生与老师的距离"其实可以拆成两部分。

第一部分叫"蒸馏项",它衡量的是学生与"多位情境老师的几何平均"之间的距离。什么是几何平均?简单说,就是在所有老师都高概率选择某个词的时候,这个平均值才会高;只要有一位老师觉得某个词不合适,整体平均值就会被拉低。这和算术平均不同——算术平均是把所有意见加总求平均,几何平均则更保守,只在大家一致认可的地方才表现出强烈倾向。这意味着学生被引导去学习那些"所有老师都认同"的做法,而不是某一位老师的个人偏好。

第二部分叫"冲突项",它衡量的是不同情境老师之间意见的分歧程度。当各位老师的意见高度一致时,这个冲突项接近零;当各位老师的意见差异很大、互相矛盾时,这个冲突项就会变大。更重要的是,研究团队证明了这个冲突项对训练过程没有直接的梯度贡献——也就是说,当背景信息固定下来之后,这个"冲突"不会直接影响学生的参数更新,真正在起作用的只有第一部分的蒸馏项。

这个数学发现提供了两个非常实用的洞见:一是可以用这个"冲突项"来判断当前情境下老师们的意见是否一致,作为一个信号指标;二是情境老师在指导时,本质上是把"所有情境老师的几何平均"作为学习目标,这个目标比直接跟随任何单一情境老师要更稳健。

四、Flux-OPD:给学习过程安装"减震器"和"方向盘"

基于上述分析,研究团队设计了Flux-OPD方法。整体框架是一个迭代训练过程:把整个训练拆分成若干轮,每一轮包含两个阶段——"提取经验"和"经验蒸馏"。

在提取经验阶段,老师观察当前版本的学生,收集学生在各种题目上的真实表现,再从这些表现中提取新的经验教训。为了让提取出来的经验更多元,研究团队用了多个不同的随机种子,让同样的学生表现被不同视角的老师分别总结,形成一个包含多条经验的"经验池"。每条经验都是简洁的高层次原则,比如"保留核心意图,避免引入不必要的元素",而不是针对具体某道题的答案。

在经验蒸馏阶段,老师会参考这个经验池来指导学生——但这里就是Flux-OPD最核心的创新所在了。研究团队设计了两个精妙的策略来解决前面提到的两个问题。

第一个策略叫"情境校正",专门用来解决训练目标不稳定的问题。它的思路是:不要直接让学生去模仿"参考了经验的老师",而是把"参考了经验的老师"和"没有参考经验的原始老师"做一个对比,提取出两者的差异——这个差异就是"情境差异信号",代表了经验给老师带来的偏好变化。然后,训练目标被设置为"原始老师的基础上,加入一定程度的情境差异信号校正"。

原始老师(没有参考经验的那个)是一个稳定的锚点,不会随着经验的更新而剧烈变化;而情境差异信号则捕捉了任务特定的偏好信息。通过一个可调节的系数λ(lambda),可以控制这个校正的强度:当λ=0时,目标完全等同于原始老师,非常稳定;当λ=1时,目标等同于参考了经验的老师,充分利用情境信息;介于0和1之间时,则是两者的平滑融合。

第二个策略叫"情境加权",专门用来解决指导信号互相冲突的问题。它利用前面数学分解中发现的"冲突项"作为信号:当从经验池中采样的多位情境老师意见高度一致(冲突项接近0)时,说明这批经验质量较高、方向明确,此时应该加大校正强度,让情境信息充分发挥作用;当各位情境老师意见分歧较大(冲突项较大)时,说明这批经验可能存在矛盾,此时应该降低校正强度,更多依赖稳定的原始老师。

这个权重计算还有进一步的精细化设计:通过一个冲突阈值τ来定义"什么程度的冲突算多、什么程度算少",通过一个缩放系数α来整体控制校正强度的上下限,通过一对裁剪边界λ_min和λ_max来确保校正强度不会降到过低或升到过高。这些参数可以根据具体任务的特点来调节。

把这两个策略结合起来,Flux-OPD既保证了训练目标的稳定性(靠情境校正中的锚点机制),又能够智能地根据经验质量调整学习力度(靠情境加权中的冲突信号),同时还能随着学生成长不断更新经验内容(靠迭代提取机制)。

五、实验:在两个真实世界的困难任务上测试

研究团队选择了两个具有真实应用价值的开放性任务来验证这套方法。

第一个任务是视频生成的提示词优化。这个任务的背景是:现在的AI视频生成系统(比如用文字描述一个场景,系统自动生成对应视频)对输入的提示词非常敏感。一般用户写的提示词往往不够清晰或不符合视频模型的偏好,需要经过优化才能生成高质量的视频。这个任务要求AI学生把用户的原始提示词改写成更适合特定视频生成器的形式。难点在于,"好的提示词"要满足哪些条件,不同的视频生成器有不同的偏好,而且只有看到实际生成的视频才能判断好坏——这是纯粹的文字理解能力无法覆盖的。研究团队使用了两个不同的视频生成器(Wan2.1-VACE-1.3B和CogVideoX-2B)以及两个视频质量评估基准(VBench和Video-Bench)来进行评测,数据集包含10K条提示词。

第二个任务是医疗问答。这个任务要求AI回答各种临床医学问题,评估标准涵盖回答的完整性、情境感知能力、准确性、沟通质量和指令遵循能力,使用的是包含约18K道题的RaR-Medicine数据集,在HealthBench基准上进行评测,该基准包含5000个临床对话场景。

在对比实验中,研究团队设置了多种基准方法:普通的在线策略蒸馏(OPD,只有老师监督,没有情境信息)、固定情境的在线情境蒸馏(OPCD,有情境但不会更新)、以及OEL(情境会更新但采用交替分阶段的方式,且直接用情境老师作为学习目标)。所有方法都在同一个学生-老师组合下进行单次训练运行比较。实验中使用了三种不同的学生-老师规模搭配:Qwen3-VL-Instruct系列的4B学生配8B老师、Qwen2.5-VL-Instruct系列的7B学生配32B老师、以及Qwen3系列的1.7B学生配8B老师。

在视频提示词优化任务上,Flux-OPD在几乎所有评测维度上都取得了最高分。以8B老师配4B学生的设置为例,在VBench上,Flux-OPD达到了80.18的平均分,明显高于OPD的79.28、OPCD的79.02,以及OEL的76.86——OEL不仅没有超过OPD,甚至还不如原始未经训练的学生模型。在Video-Bench上,Flux-OPD同样取得了3.61的最高分。在更强大的32B老师配7B学生设置下,Flux-OPD也以80.24的平均分领先,接近80.29的老师水平。

在医疗问答任务上,Flux-OPD同样表现最佳,在HealthBench上达到20.61的总分,超过OPD的19.63和OEL的19.66,在准确性、情境感知等多个维度上均有明显提升。

为了确认结果的可靠性,研究团队还对OPD和Flux-OPD各独立运行了三次,统计了均值和标准差。结果显示,Flux-OPD在三次运行中始终优于OPD,且波动范围相近,说明这个优势是稳定可复现的,而非偶然。

六、深入验证:每个设计选择都不是多余的

研究团队还进行了细致的消融实验,逐一验证方法中每个设计选择的贡献。

当去掉"动态更新经验"这个功能,改用固定不变的初始经验来运行整个情境校正和加权流程时,性能会有所下降,说明经验随学生成长而演化确实是有价值的,不只是装饰。

当保留动态经验更新,但去掉"情境校正"策略,直接用情境老师作为学习目标(也就是退化成OEL的方式)时,性能也会下降,而且在不同固定校正强度(0.9、0.7、0.5)下,带情境校正的版本始终优于OEL。这证明"把情境老师的差异信号注入到原始老师锚点中"这个思路,比"直接模仿情境老师"更有效。

当保留动态经验更新和情境校正,但把情境加权策略替换为几种固定强度时,性能也不如自适应加权的完整版本。这说明冲突信号确实能指导学习过程选择更合适的校正强度,而不是靠人工固定一个强度就能达到最优。

在参数选择上,冲突阈值τ的设置有一个有趣的规律:当初始学生的表现已经超过老师水平时(比如在CogVideoX-2B上),适当提高τ值能带来更好的结果,原因是此时情境信息能提供超越原始老师的额外指导,应该让情境发挥更大的作用。而当学生表现不如老师时,使用较小的τ即可。关于强度校准策略,研究团队发现:对于情境一致性较低(冲突较高)的8B老师设置,使用"缩放"方式(整体乘以0.9来降低情境影响)效果最好;而对于情境一致性较高(冲突较低)的32B老师设置,使用"裁剪"方式(把校正强度限制在一个范围内)效果更好。这背后的逻辑是:更强大的老师产生的情境经验更稳定可靠,可以让学生更充分地吸收;而较弱的老师产生的经验质量参差不齐,需要整体压低其影响力。

七、稳定性与泛化:意外的收获

除了主要任务上的性能提升,研究团队还观察到了两个令人关注的额外发现。

关于训练稳定性,通过对比训练损失曲线,可以清楚地看到:OPD和Flux-OPD的损失都平稳地持续下降,而OEL则在每次更新经验的节点附近出现明显的损失突增——就像道路上反复出现的减速带,严重干扰了学习过程。Flux-OPD的梯度范数(可以理解为每一步学习的"冲劲大小")也保持相当平稳,说明这套方法从根本上解决了训练不稳定的问题,而不仅仅是掩盖了症状。

关于跨领域泛化,研究团队在用医疗问答数据训练完模型之后,还专门测试了模型在一个完全不同的任务——指令遵循(IF-Eval)上的表现。这个任务没有出现在训练数据中,相当于考察模型学到的能力是否有更广泛的迁移价值。结果显示,Flux-OPD训练出的学生在IF-Eval上的得分(34.38)明显高于OPD(32.90),也高于OEL(34.20)——尤其是OPD的得分甚至低于未经任何在线训练的初始学生(34.20)。这意味着Flux-OPD不仅在训练任务上表现更好,还帮助模型形成了更具迁移价值的通用能力。

说到底,这项研究做了一件很有价值的事情:它把"如何让AI在没有标准答案的领域持续进步"这个问题,从模糊的直觉层面变成了有严格数学支撑的工程方案。通过把"动态更新的情境经验"、"稳定的原始老师锚点"和"基于冲突信号的自适应加权"这三个要素有机地整合在一起,Flux-OPD在提示词优化和医疗问答这两个截然不同的真实任务上,都展现出了超越已有方法的效果。

对于普通用户而言,这项研究的意义在于:未来的AI助手在应对那些没有固定答案的复杂问题时,有可能变得更聪明——不是因为它死记硬背了更多知识,而是因为它学会了从自己过去的经历中提炼出真正有用的原则,并在老师的引导下不断修正自己的判断方式。当然,目前这套方法还需要在更多类型的任务和更大规模的模型上进行验证,且不同任务可能需要不同的参数调节,这些都是后续研究需要探索的方向。

如果你对这套方法的数学细节、实验设置或具体实现感兴趣,可以通过arXiv:2607.28022查阅完整的原始论文。

Q&A

Q1:Flux-OPD和普通的AI知识蒸馏有什么区别?

A:普通知识蒸馏是让小模型(学生)直接模仿大模型(老师)的输出,整个过程中老师是固定不变的。Flux-OPD的不同在于,老师会参考从学生实际表现中提取的动态经验来调整指导方向,而且不是让学生直接模仿参考了经验的老师,而是提取"有经验的老师"和"没有经验的老师"之间的差异,将这个差异注入稳定的基础老师中作为学习目标,同时还会根据不同经验之间的矛盾程度来自动调节这个差异的影响力度。

Q2:情境冲突项是怎么判断老师意见是否矛盾的?

A:在Flux-OPD中,老师会参考多条不同的经验(来自同一批学生表现,但用不同的随机种子提取),对同一个位置的词汇分别给出概率分布。冲突项(用数学符号表示为负对数Z)衡量的是这些分布之间的重叠程度:如果各条经验下老师都倾向于同一个词,Z值接近1,冲突项接近0;如果不同经验下老师各有偏好、分歧大,Z值远小于1,冲突项就会变大。冲突项越大,说明这批经验越不一致,系统就会相应降低情境信息的修正力度。

Q3:为什么视频提示词优化任务比医疗问答任务更能体现Flux-OPD的优势?

A:视频提示词优化任务的特殊之处在于,判断一条提示词是否优秀,需要实际生成视频后才能看出来,这是纯文字层面的老师无法直接感知的信息。Flux-OPD通过让老师观察学生生成的提示词所对应的实际视频结果,从中提炼出"哪类改写方式更能产生好视频"的经验,这种视频层面的偏好信息是固定情境方法无法捕捉的。而医疗问答的偏好主要是文字层面的(准确性、表达方式等),没有参考外部多模态反馈,因此基础的OPD方法也能发挥相当作用,Flux-OPD的额外优势相对较小但依然存在。