群发资讯网

AI 开始给记账算账了,但它还不敢自己签字 最近有一份研究,做得很实在。一家叫 Mercor 的公司找来了 12 位有执照的注册会计师,平均从业五年半,让他们做一批从 APEX 会计基准里抽出来的简化记账题。同一批题,也丢给当下最强的几个 AI 模型做。 结果有点扎心。十八个月前,最好的模型正确

AI 开始给记账算账了,但它还不敢自己签字

最近有一份研究,做得很实在。一家叫 Mercor 的公司找来了 12 位有执照的注册会计师,平均从业五年半,让他们做一批从 APEX 会计基准里抽出来的简化记账题。同一批题,也丢给当下最强的几个 AI 模型做。

结果有点扎心。十八个月前,最好的模型正确率还低于这 12 位会计师的平均分,大概是 37%。今天,模型做同一批题几乎不出错。速度快、准确率高,成本还便宜得多。

如果故事到这里结束,标题就该写"会计师要失业了"。但研究没这么写,因为它自己也承认:这批题专门挑的是 AI 最擅长的那一类——盯细节、严格按指令办事。而一份真实会计工作里,还有大量别的东西:跟客户打电话问清楚一笔报销到底怎么回事,跟同事对一下上个月的数据为什么对不上,凭十几年的经验判断一笔支出该记在哪个科目。这些东西研究根本没考。所以 Mercor 的结论是,会计师不会被替代,但整个行业的生产力会有一波明显的提升。

换个更日常的比方。这就像计算器。计算器在算术上早就碾压人类了,但没有哪家公司因此取消出纳岗。出纳不再需要心算大额数字,但他还得判断发票真不真、流程对不对、这笔钱该不该批。AI 在会计这件事上,现在正从"抢活儿"变成"分发活儿"。

真正值得注意的,是完整版基准给出的另一组数字。APEX 会计基准一共 160 道题,横跨 10 家模拟公司,出题人超过 40 位,平均十一年经验。目前排第一的 Claude Opus 5.5,只满足了 61.8% 的评分标准;后面是 Fable 5.1 的 61.0%,GPT-6 Astra 的 57.9%。接近 60% 的题目,没有任何一个模型能完整做对。也就是说,模型在"把一道干净的题做对"上很强,在"面对一堆乱账还能把账本合上"上,暂时还不行。

这对普通人意味着什么?分两头说。

如果你不是会计,这件事的信号是:AI 正在系统性地吃掉那些"规则清楚、输入整齐、结果可核对"的白领工作环节。会计只是最新的一个样本,前面已经有客服、初级法务、基础编程。判断标准很简单——你的工作里,有多少时间是在处理"格式规范、边界清晰、错了也不难发现"的活儿。那部分,正在被拿走。

如果你就是做财务的,那更实际的建议是:别等着被工具替代,先成为会用工具的那个人。现在就可以做的几件小事:把每个月最重复、最机械的那批分录和核对,试着让 AI 先跑一遍,你再复核;不要指望它替你判断,但要让它替你翻找。模型在"从一大坨材料里精准挑出你需要的那条"这件事上,已经比人快太多。真正拉开差距的,是你会不会把任务拆成它能吃下去的小块——一块一个明确的输入、一个明确的输出,而不是把整本账直接甩给它。

一个坑要提前说:别把"模型做对了题"直接理解成"模型懂业务"。研究里那 12 位都是有执照的人,题目是人为简化过的,正确答案是清楚的。真实工作里,很多时候连"正确答案是什么"本身都要靠人来定。模型能帮你算,不能帮你定义什么叫做对。

所以现在的画面是:AI 已经能熟练地记账、核对、找错,动作比人快,还不知疲倦。但它还没拿到签字权,也不该拿到。这一轮真正的变化,不是会计这个职业消失了,而是这份工作里"动手"的部分正在快速缩水,"判断"的部分正在被推到台前。

写于2026-10-03