【大模型/评测】近期大模型发布与评测要点如下:
开发者 Karl Kahn 每月花 200 美元订了 Claude 最贵的个人计划 Max 20x,冲着「Pro 计划 20 倍用量」去的。 今年 4 月他把主力工作搬到 Claude Code 上,很快发现一个 5 小时的编程会话就吃掉了整周配额的 15%。 6 月 14 日他在加州北区联邦法院提起集体诉讼,称实际到手的用量大约只有 6 到 8 倍。 他的依据是 Anthropic 自己在 2025 年 7 月发给订阅用户的邮件,里面列出了各档计划每周的 Claude Code 使用量参考。 20 倍在哪里? Claude 的付费计划同时受两层限制:5 小时滚动窗口限制单次会话的消耗上限,每周总额度限制 7 天内的总量。 两道限制独立运作,哪个先到就先卡住你。 Anthropic 向 TechCrunch 透露过每周参考数字: Pro($20/月)40 到 80 小时 Sonnet 4; Max 5x($100/月)140 到 280 小时 Sonnet 4 加 15 到 35 小时 Opus 4; Max 20x($200/月)240 到 480 小时 Sonnet 4 加 24 到 40 小时 Opus 4。 只看 Sonnet 4 上限,Pro 80 小时,Max 20x 480 小时,Max 20x 实际上只有 Pro 的 6 倍。 Kahn 去年 6 月注册 Pro,今年 1 月升 Max 5x,4 月再升 Max 20x,升级后反复撞限额,有时不得不额外掏大价钱买用量。 Anthropic 至今未公开回应,法院也未做实质裁决。 Codex 下场,高下立现上周,一篇 Reddit 帖子深度实测拆解 Claude 定价后指出,20 倍只在 5 小时窗口那一层成立,周额度层面 Max 20x 只比 Max 5x 多大约 2 倍。 OpenAI Codex 负责人 Tibo Sottiaux 直接回应了:OpenAI 的 Pro 20x 里 20 倍对应的就是周用量限额,两档 Pro 都没有 5 小时窗口,Pro 20x 就是 Plus 的精确 20 倍。 区别在于,Anthropic 把 20 倍标在 5 小时窗口上,而用户日常碰到的瓶颈往往是周额度;OpenAI 直接标在周额度上。 倍率虚标之外 Token 浪费问题更严重 Anthropic 从来不公布各档计划对应的绝对 Token 数量,只给相对倍率。 用户在产品里看到的是一根百分比进度条,不知道每次对话消耗了多少 Token,也没有办法验证倍率是否兑现。 德勤今年 1 月的分析点过这个问题:订阅制包装把 Token 消耗细节几乎完全抽象掉了,消耗效率对用户而言是黑箱。 在这个黑箱之上还有另一个问题:厂商自身的 Bug 同样会消耗用户配额。 2026 年 3 月 Claude Code 出过一次大规模事故,社区排查发现多个 Bug 同时在捣鬼: Prompt 缓存失效导致 token 消耗膨胀 10 到 20 倍 autocompact 陷入死循环全球每天白烧约 25 万次 API 调用恢复旧会话时整段上下文重新处理有 Max 5x 用户反映平时能撑 8 小时的额度 1 小时就空了。 Anthropic 承认消耗速度远超预期,但没有公布补偿方案。 OpenAI 的 Codex 8 月底也查出 8 个类似 Bug,最严重的情况下一个失控任务吞掉用户 70% 的周配额。 但 OpenAI 修完后给所有付费用户做了全额配额重置,每个 bug 的成因和修复方式全部公开。 Anthropic…
sepia 这个去 AI 味的写作工具,我觉得真有点东西,值得单独拿出来说说。 之前分享过一些改词句层面的同类工具,能把那些一眼 AI 的表达替换掉,读起来顺眼不少。但 sepia 做的事情更深一层,它动的是结构。 它的出发点很有意思。团队拿了六万多篇小说做对照实验,人写的和 AI 写的放在一起,光看叙事结构就能把 AI 的认出来,识别率到了 93.2%。这个数字说明一个问题:AI 写东西有一套很固定的结构习惯,藏得比词句深得多。 接下来他们又试了一步,把表面的词句改得干干净净,那些典型的 AI 腔调全部抹掉,再跑一遍识别。结果识别率几乎没降。换句话说,你把皮换了,骨架还是 AI 的,一眼就能看出来。 所以 sepia 就从结构层下手了。它总结了 30 项诊断规则,比如主题不要让叙述者直接讲出来,因果链不要扣得那么紧,留点松动的余地。这些都是 AI 写作里最顽固的毛病,光靠换词根本改不掉。 而且它还针对不同模型做了区分。Claude、ChatGPT、Gemini、DeepSeek、Kimi,