群发资讯网

ContinualSkillBench 跑出一个有点扎眼的结果:在 5 个领域、

ContinualSkillBench 跑出一个有点扎眼的结果:在 5 个领域、每域 100 个关联任务上让 LLM 智能体顺着做完,15 组模型-领域配对里 14 组归一化奖励被往上抬,平均拉高 16.9%。听起来像技能库把智能体一路推强,但接着看下去,就没那么理所当然。

更值得留意的,是 GPT-5.3-Codex 在 Law、Finance、Healthcare 的消融:纯上下文学习平均 0.605,加上显式技能维护反而是 0.602。把技能库当独立外挂维护,并没有稳定把分数再往上推。

技能数量也不是越多越好。GPT-4o 在流程里累积了 384 个技能,比它更强的模型往往只攒下 205 个左右。一边技能库堆得满,一边能力曲线往别处走,这之间的张力,正是 ContinualSkillBench 想逼着正视的地方。

能解释得通的机制是这样的:智能体在长链路任务里吃到的红利,主要来自上一轮的状态、反馈和约束被原样带进下一轮;显式技能条目更像一份待整理的草稿本,没经稳定压缩之前,既带来冗余,也和实时上下文抢位置。技能整合与复用——而不是技能生成本身——才是当前卡脖子的环节。所以比起一味往里塞条目,先想清楚什么时候删、什么时候合并,比多塞一个更划算。

结论的适用条件要说清:消融目前主要落在这一批模型和领域组合上,自治技能创建在更通用场景里有没有用,还缺稳定证据。可以先把它当一个提醒:技能越多,并不天然等于越强。

你搭智能体时,更想押注不断膨胀的技能库,还是让上下文和反馈自己慢慢长?