[LG]《Tail-Likelihood Reinforcement Learning》S Ramasubramanian, D Arora, F Tajwar, G Zeng... [CMU] (2026)
在生成式强化学习中,策略丧失长尾探索是一个悬而未决的难题。过去的方法受困于采样收益停滞,本质原因是均值优化抹平了罕见高分信号。
本文的核心洞见是:把连续奖励重新看作全阈值二值成功事件族。由此,最大化对数尾部似然以加权高难样本这一关键操作使问题得以解开。
这项工作真正留下的遗产是对齐推理扩展的尾部学习框架。它为后来者打开的新门是用极简优势函数释放采样潜力,但尚未跨过的门槛是零覆盖下的冷启动。
arxiv.org/abs/2609.02987 机器学习 人工智能 论文 AI创造营








