今天刷到一条新闻,愣了半天:腾讯开源的大模型,参与了它自己的研发。
下午的事,模型叫Hy4 preview,总参数770B,上下文一百万词元。参数不算新鲜,新鲜的是官方那句话——它首次参与了训练方法、数据策略、评估体系、底层算子的优化:自己提方案,自己跑实验,跑完把代码、日志、结果,统统喂进下一轮。它还顺手把自己脚下的推理系统捋了一遍,吞吐量提了31.8%。打个比方,学生给自己批作业,批完还把错题本印成下学期的新教材。
成绩单拿得出手:代码实测85.4分,跟最强的Claude打平;163位腾讯自家专家盲测,比两个当红的国产模型略高半分。价钱也实在,输入6块钱一百万词元。
我盯着"递归自我改进"这几个字,想起锤子不会造锤子,汽车不会造汽车。几千年来,人负责改进,工具负责等着被改进。这一回,工具第一次伸手,去改工具自己。
启发不玄:模型能自己改自己,是因为训练这件事,早被拆成了能跑、能验证、能复盘的步骤。人也一样,手艺锁在脑子里,就只是手艺;拆成写得下的步骤,才能自己往前走。
先把活儿拆到可验证,你才接得住替你干活的AI。