[CV]《RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning》H Qian, Y Chen, Y Xie, K Ren… [Rice University] (2026)
在机器人灵巧操作领域,从海量网络视频中有效检索可用的演示是一个悬而未决的难题。过去的方法受困于依赖视觉或语
[AI]《Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills》J Chen, Y Hu, H Qian, J Liu… [Beijing Academy of Artificial Intelligence] (2026)
在AI自主科研领域,代理因缺乏实操诀窍而效率低下。过去的方法仅依赖通用模型与控制框架,本质原因是它们无法利用散落在代码库中的宝
[LG]《Tail-Likelihood Reinforcement Learning》S Ramasubramanian, D Arora, F Tajwar, G Zeng... [CMU] (2026)
在生成式强化学习中,策略丧失长尾探索是一个悬而未决的难题。过去的方法受困于采样收益停滞,本质原因是均值优化抹平了罕见高分信号。
本文的核心洞见是:把连续奖励重新看作全阈值