Grok 4.7 xHigh 现在位居榜首,仅以 1 分之差落后于 Claude Fable 5.1 Max!
在 Artificial Analysis 的 AA-Briefcase 基准测试中:Claude Fable 5.1 Max — 59%Grok 4.7 xHigh — 58%
Elo 综合排名:1. Claude Opus 5 —— 约 17202. Claude Fable 5.1 —— 约 1678–16943. Grok 4.7 —— 约 1657(较前代 Grok 4.6 提升约111分)
Grok 4.7 已超越 GPT-6 Astra、GPT-5.6、Gemini、Kimi、GLM 等绝大多数前沿模型,在真实商业知识工作场景(数据科学、产品管理、战略分析等)中进入第一梯队。
AA-Briefcase 是目前衡量 AI 长周期办公与 agentic 能力的重要私有基准之一,包含91个多周任务与数千输入文件,评分综合客观通过率、分析质量与呈现质量。
