群发资讯网

NVIDIA 一项新研究测出一组挺刺眼的数字:技能结构扫描分数跟 LLM 当评委

NVIDIA 一项新研究测出一组挺刺眼的数字:技能结构扫描分数跟 LLM 当评委的质量分,Spearman 相关系数只有 0.14。一个技能能不能过 scanner 上架,跟装上以后 agent 到底有没有变强,关系几乎可以忽略。

研究拿了 58 个生产技能、947 组配对案例,在 4 种 harness 下跑同一任务,分别加载和不加载技能做对照。安全 baseline 已经 97 分,加技能只涨到 98;但同一组任务,正确性从 46 拉到 87,有效性从 39 拉到 78。扫描看起来已封顶的位置,跑起来缺口才暴露,缺口的形状扫描也看不到。

代价很具体:团队以为过 scanner 就等于技能可用,发布后才发现 production 任务里执行不对、行为不对、效率不对。研究里提升最明显的几项过程指标——skill execution、behavior check、skill efficiency——全是跑起来才被照出来的。

方向上,ACES 的核心是以任务级因果对比取代一次性打分:固定任务,看有技能和没技能两条轨迹的差,再拆差落在哪个过程指标上。好处是不绑某一家模型或某一套 harness,可以横比不同版本的技能,也能做上线前回归;短板是成本,947 组配对跑下来算力不便宜,没现成参考集时还得自搭对照任务。

上线后还在救火、复盘老出现“技能装了但没用上”,扫描那道关其实没拦住什么,这时切 ACES 才划算;如果瓶颈是安全合规本身,扫描还值得先留着。

你们团队的技能库现在最后一道卡的是结构分数,还是跑过任务的 Skill Lift?