群发资讯网

MiniMax 闫俊杰这些认知真通透啊。

之前唱衰 MiniMax 的人,昨天被狠狠打脸了吧。人家的中报数据还是远远超出预期。8 月的 ARR 已经达到 8 亿美金。

我强烈推荐所有对 AI 公司感兴趣的同学,可以去听一下昨天晚上的业绩电话会。

闫俊杰还是提到了非常多他的一手判断,这对我们理解整个行业或者至少 MiniMax 这家公司会有特别大的帮助。我写一些我的理解,希望对大家有帮助。

1、接下来模型公司的差距,可能会越来越来自 RL。MiniMax 的判断是,只要一个能力能够被精确评估,同时能够构造出足够强的学习环境,模型基本都能学会这个能力。

如果这个判断成立,那接下来大家会越来越卷后训练。

Coding 能够发展这么快,一个很重要的原因就是代码天然容易验证。所以,RL 的奖励和反馈很容易落地。现在网络安全也开始出现类似的情况。

再往后,芯片设计、制药这些可以建立反馈闭环的领域,都有可能出现突然的能力跃升。

2、推理成本已经不只是商业问题,它开始直接影响模型能力。这个也是我听完整场电话会之后印象最深的地方。以前我们讨论模型推理成本,一般想到的是模型能不能便宜一点.....

但 MiniMax 觉得,推理效率已经开始影响下一代模型能训练到什么程度。因为现在大量后训练,本质上都需要不断调用模型。

合成数据需要推理,强化学习 rollout 需要推理,Agent 在环境里面尝试任务需要推理,模型评测同样需要大量推理。

所以同样一批算力,如果推理效率提高三倍,你就可以跑更多训练轨迹,完成更多实验。

这也是为什么 MiniMax 这次一直在强调单位算力到底能够产生多少智能。他们甚至认为,未来后训练还能不能继续 Scaling,很大程度上取决于推理效率。

我觉得这可能是很多人现在容易忽略的地方。

3、MiniMax 依然非常坚定地押大模型,而且下一代还会继续扩大参数规模。这点其实也挺有意思。

现在行业里有一种声音,觉得模型能力差距正在缩小,继续扩大参数规模的收益已经没有过去那么明显。MiniMax 的选择明显更激进。

闫俊杰说,他们在模型规模上仍然会持续研发行业最大一档,同时通过更高的 MoE 稀疏度和 Attention 架构优化,把推理成本压下来。后面的 M3 Pro,参数规模会接近 3T。