【行业/生态/争议】行业生态与开源之争:
等等,AI实验室囤Mac mini,竟然是按「吨」囤的?! The Information爆料,OpenAI已采购数万台Mac mini和Mac Studio,还在追着苹果要货。Anthropic则从AWS租Mac算力,一台每月五百到九百多美元。 苹果芯片算力打不过英伟达,租买都不划算,但这些机器是拿去训练能自己操作电脑的Computer-use Agent。成千上万台机器同时开着,模型在里面点鼠标、开App、犯错、重来。 macOS虚拟机只能跑在自家硬件上,一台Mac最多同时开两个虚拟机,AWS的EC2 Mac只能整台物理机出租。所以要一万个macOS环境,就得摆下几千台真机。 苹果芯片产品高级经理Doug Brooks解释,Agent要一台完全独立、能几天几夜不关机的机器,Mac mini正合适。这波需求有多凶,看财报就知道:苹果最新一季Mac营收104亿美元,同比涨29%,代价是最受欢迎的配置断货好几个月。 光有macOS环境不够,机器本身得跑得动大模型。苹果的统一内存结构让CPU和GPU共用一个内存池,「装得下」往往比「跑得快」更重要。 M5 Ultra最高512GB统一内存,带宽1.2TB/s;散热上Mac能扛住7×24小时满载,轻薄本跑几十分钟就要降频。EXO Labs的开源方案能把多台Mac串成集群,本地跑671B量级模型。 开发者Octavio Herrera在M4 Mac mini 32GB上实测6款模型:MoE模型如Qwen3-30B能跑24-30 tok/s,稠密模型Qwen3.8-27B只有4.4 tok/s。对照组DeepSeek v4-flash走API约57 tok/s,说明入门设备跑MoE基本可行。 内存是另一道坎,JetBrains本地编程Agent自带27B模型就要求64GB起步。X上有人算过账:5499美元的M5 Ultra 96GB能把27B模型推到48-80 tok/s;11299美元的M5 Ultra 256GB可完整装下DeepSeek V4 Flash,预计80-90 tok/s,已追平云端前沿模型服务速度。 库克在财报会上说,「我们正处在内存定价的百年一遇洪水里」。国行Mac mini一年多前是4499元,现在M6起步已到6999元。 数万台订单摆在面前,苹果却没接。它这些年一直退出企业市场,2011年砍Xserve,2022年停macOS Server,今年3月连Mac Pro都停产。 The Information挖到,苹果压根没有专门服务企业客户的团队。最热的AI需求最后被外包给webAI和Mount Thor两家创业公司,其中一家官网都还没写完。 英伟达DGX Spark趁虚而入,性能比发布时最高提升2.5倍,还能外接加速MacBook Pro。企业和开发者反复提起它,理由是随时有货。 苹果这才有了反应,往年年底才更新的Mac,今年8月25日提前端出新品,宣传语第一次直接对着本地跑大模型写。如今AI实验室把Mac mini当基础设施,苹果却仍把它当台式机。
刚才看了看国产大模型公司智谱的财报,顺便聊一聊。 作为行业头牌,它上半年收入同比增长接近 400%。有人嫌总数不够高,我倒觉得正常,国产模型大规模商用也就最近几个月,高增长还在后面。智谱说,8 月单月收入约 1.33 亿美元,合人民币九亿多,年化下来 ARR 有 16 亿美元。 信息量很大,挑几个重点说。 先说模型。GLM-5.3 的提升全来自后续训练:训练任务从普通写代码,换成接近专家真实工作的完整任务,底座没动,任务完成率就提高五成以上。智谱认为,模型上限由基座规模、有效深度、训练深度、任务环境四要素决定,哪个环节空间大就先做哪个。所以 5.1、5.2、5.3 都长在同一个大基座上,先把底座榨透,收益见顶再换更大的。下一步他们打算同时做大总参数、控制推理时真正激活的参数量、提高有效计算深度。 定价会出现两条曲线。一边,同智商水平的模型持续降价,GLM-5.3 Flash 就用更低成本提供接近甚至超过上一代旗舰的能力;另一边,能打开新任务边界的前沿模型依然有溢价。所以 5.3 冲智能上限,做复杂编程、Agent 和高价值任务;Flash 走性价比,扛高频大规模调用。 还有个指标叫算力乘数,指每投一块钱算力能换回多少 API 收入,上半年同比涨了 14 倍。国产芯片也用起来了,GLM-5.3 Flash 背后是国产芯片集群,六天跑了六十多万亿 Token;重做推理引擎和底层优化后,同样的硬件端到端性能提升三倍,单位 Token 推理成本比年初降八成。智谱也直说算力受约束,只能靠数据、训练和工程效率补,出口管制反而逼出了国内极强的工