The Decoder 转述 Mercor 的一项研究。12 名持证注册会计师参加,平均从业五年半,做的是 APEX 会计基准里被简化过的任务。18 个月前,最好的模型还低于会计师大约 37% 的平均成绩。文章接着说,今天的模型在同样这些任务上几乎无误。这句「几乎无误」指的是这组简化任务,不是下面那套完整基准。报道还说,在结构化记账上,模型比会计师更快、更准,也便宜得多。便宜没有给出金额,这里不补一个价格。对照图印在图片里,正文没有列出各模型的分数,那些分数也不补。

[1]
左边是一本通体发黑、镶着暗红边的册子,右边更高的一叠只有顶部是密线,下面是空白。
左边整本是黑的。右边更高,只有顶上一条是密线,下面一大块空着。对应简化任务和完整账本是两套结果。这是插画,不是表格。, AI 生成插画,不是新闻照片

完整的 APEX 会计基准大得多:160 个任务,分布在 10 家模拟公司,由 40 多名平均从业 11 年的专业人士搭建。目前 Claude Opus 5.5 领先,满足 61.8% 的评分标准,后面是 Fable 5.1 的 61.0%,以及 GPT-6 Astra 的 57.9%。Mercor 说,没有任何模型完整解出将近 60% 的任务。61.8% 是评分标准被满足的比例,将近 60% 是没有被完整解出的任务比例。两个数字口径不同,不能互相换算,也不能把「几乎无误」挪到这套完整基准上。

[1]

Mercor 承认,研究里的任务正好是人工智能最擅长的那一类:找出细节,并且严格按指令做。没有放进去的,是和客户谈话、和同事核对,以及用多年积累下来的上下文做判断。Mercor 因此说,会计师不能被替换。它同时预期这个行业会出现生产率上的提高。报道没有写出提高多少。

这篇是 The Decoder 对 Mercor 研究和 APEX 排行榜的转述,不是原始论文或榜单页面。

[1]

要点

  • 简化任务上,18 个月前最好的模型低于会计师约 37%;文章说今天的模型在同样这些任务上几乎无误。
  • 完整 APEX 有 160 个任务。Opus 5.5 满足 61.8% 的评分标准,Fable 5.1 为 61.0%,Astra 为 57.9%。
  • Mercor 说没有任何模型完整解出将近 60% 的任务。这和「几乎无误」不是同一套结果。
  • 任务不含和客户谈话、和同事核对,以及多年上下文。费用没有数字。