【大模型/评测】近期大模型发布与评测要点如下:
开发者 Karl Kahn 每月花 200 美元订了 Claude 最贵的个人计划 Max 20x,冲着「Pro 计划 20 倍用量」去的。 今年 4 月他把主力工作搬到 Claude Code 上,很快发现一个 5 小时的编程会话就吃掉了整周配额的 15%。 6 月 14 日他在加州北区联邦法院提起集体诉讼,称实际到手的用量大约只有 6 到 8 倍。 他的依据是 Anthropic 自己在 2025 年 7 月发给订阅用户的邮件,里面列出了各档计划每周的 Claude Code 使用量参考。 20 倍在哪里? Claude 的付费计划同时受两层限制:5 小时滚动窗口限制单次会话的消耗上限,每周总额度限制 7 天内的总量。 两道限制独立运作,哪个先到就先卡住你。 Anthropic 向 TechCrunch 透露过每周参考数字: Pro($20/月)40 到 80 小时 Sonnet 4; Max 5x($100/月)140 到 280 小时 Sonnet 4 加 15 到 35 小时 Opus 4; Max 20x($200/月)240 到 480 小时 Sonnet 4 加 24 到 40 小时 Opus 4。 只看 Sonnet 4 上限,Pro 80 小时,Max 20x 480 小时,Max 20x 实际上只有 Pro 的 6 倍。 Kahn 去年 6 月注册 Pro,今年 1 月升 Max 5x,4 月再升 Max 20x,升级后反复撞限额,有时不得不额外掏大价钱买用量。 Anthropic 至今未公开回应,法院也未做实质裁决。 Codex 下场,高下立现上周,一篇 Reddit 帖子深度实测拆解 Claude 定价后指出,20 倍只在 5 小时窗口那一层成立,周额度层面 Max 20x 只比 Max 5x 多大约 2 倍。 OpenAI Codex 负责人 Tibo Sottiaux 直接回应了:OpenAI 的 Pro 20x 里 20 倍对应的就是周用量限额,两档 Pro 都没有 5 小时窗口,Pro 20x 就是 Plus 的精确 20 倍。 区别在于,Anthropic 把 20 倍标在 5 小时窗口上,而用户日常碰到的瓶颈往往是周额度;OpenAI 直接标在周额度上。 倍率虚标之外 Token 浪费问题更严重 Anthropic 从来不公布各档计划对应的绝对 Token 数量,只给相对倍率。 用户在产品里看到的是一根百分比进度条,不知道每次对话消耗了多少 Token,也没有办法验证倍率是否兑现。 德勤今年 1 月的分析点过这个问题:订阅制包装把 Token 消耗细节几乎完全抽象掉了,消耗效率对用户而言是黑箱。 在这个黑箱之上还有另一个问题:厂商自身的 Bug 同样会消耗用户配额。 2026 年 3 月 Claude Code 出过一次大规模事故,社区排查发现多个 Bug 同时在捣鬼: Prompt 缓存失效导致 token 消耗膨胀 10 到 20 倍 autocompact 陷入死循环全球每天白烧约 25 万次 API 调用恢复旧会话时整段上下文重新处理有 Max 5x 用户反映平时能撑 8 小时的额度 1 小时就空了。 Anthropic 承认消耗速度远超预期,但没有公布补偿方案。 OpenAI 的 Codex 8 月底也查出 8 个类似 Bug,最严重的情况下一个失控任务吞掉用户 70% 的周配额。 但 OpenAI 修完后给所有付费用户做了全额配额重置,每个 bug 的成因和修复方式全部公开。 Anthropic…
最近两周给做了好几个涉及几十上百个文件的大 PR。 而且一直都是并行推进 2-5 个。 如果人肉 review 代码,根本看不过来。 我的做法是: 1. 每个 Codex 任务都是本地自测,然后推 PR,在 GitHub 再跑一套 workflows 检查和测试 2. 设了 CodeRabbit、Devin 和 Codex 三个自动 review 机器人(因为我们开源,所以都不用额外花钱) 3. 让 Codex 判断收到的 review 靠谱不。该解决的就解决,否则就拒绝 4. 中间随时自动对齐 main 分支 5. 如此往复我完全不看代码细节,只宏观看看有没有不该做的事(GPT 5.6 Sol 太爱给自己加戏),及时纠偏整个过程都靠 AGENTS.md 和 Skills 做了约束与自动化,我基本不用手操。 一次 IDE 也没打开。 最后到可以 merge 的时候,如果我还不是很放心,就再拿出 Manus、Cursor 和 Grok Bot(都是订阅 Lenny 播客送的),让它们分别独立