最强的编程智能体只过 38.8%,十道题六道不到 15%

9 月 13 日 Specific Labs 放出 Real-SWE 榜单:十道私有生产代码库的任务,八套模型加命令行工具的组合,640 次评分。最高的一栏是 Fable 5.1 的 38.8%,最低的一栏 16.2%。

最强的编程智能体只过 38.8%,十道题六道不到 15%

9 月 13 日,一家叫 Specific Labs 的机构挂出了一份新榜单,名字是 Real-SWE。它跟以往那些编程基准有一处关键的不同:题目不是从 GitHub 上扒的公开 issue,是从几家真实公司手里买断授权、直接搬出来的生产代码库任务。每一道题原本都派给了一个拿工资的工程师。

十道题,八套「模型 + 命令行工具」的组合,每道题每套跑八次,一共 640 次评分。榜首那一栏是 Claude Code 跑 Fable 5.1,通过率 38.8%。

完整的一份榜单

Specific Labs 把模型和它的原生命令行工具绑在一起评,理由是企业工程师本来就这么干活:

  • Fable 5.1(Claude Code)38.8%
  • GPT-6 Astra(Codex CLI)33.8%
  • Gemini 3.8 Flash(Gemini CLI)31.2%
  • GLM 5.3(Claude Code)28.8%
  • Grok 4.6(Grok Build)23.8%
  • Muse Spark 1.3(Muse Code)23.8%
  • Kimi K3(Kimi Code)18.8%
  • GPT-5.6 Sol(Codex CLI)16.2%

通过率等同于 pass@1,每道题跑八次取平均。

真正该看的不是这个排名,是题目那一侧的分布。十道题里有六道,所有模型合起来的通过率不到 15%。最难的一道叫「分析流归约器」,八个模型各跑八次,64 次尝试一次都没成。倒数第二道是税务辖区判定,通过率 3.1%,全靠 Fable 5.1 和 GLM 5.3 各碰对的那一次撑着。

难的地方不在算法

Specific Labs 公布了两个衡量题目形状的中位数。指令本身的中位长度是 1742 个字符,跟 DeepSWE、Terminal-Bench 那一档差不多。但参考答案的中位数要改 11 个文件,而 FrontierCode 和 DeepSWE 都是 6 个。

一道题的沙箱里挂着什么,也说明了问题。AWS 模拟器、Docker、Kubernetes、GitHub、Linear、PostgreSQL、MySQL、MongoDB、Redis,再加上 Slack、Intercom、Google Drive 和 ClickUp。榜单里那道税务题的指令,讲的是这么一件事:平台上每家商户结税的方式都不一样,有的自己维护税率,有的要按买家收货地去第三方税务服务商那里实时定价,有的干脆不收;已经拿到免税凭证的客户无论商户怎么配置都不能被收税;发票结清之后还要把这笔销售按发票号回报给税务方,好让申报对得上账;欧盟双方之间的发票两边的增值税号都得印上去。

这不是一道算法题。这是一个人在某家公司待够了时间才知道的东西。

失败的分法比通过率更有信息量

Specific Labs 沿用 DeepSWE 的分类,把失败的那 468 次逐条归了类。不同模型栽的地方明显不一样:

Grok 4.6 失败的 61 次里有 41 次是漏需求(67.2%)——指令里写了的行为,交上来的补丁没做。Gemini 3.8 Flash 失败的 55 次里有 27 次是集成错误(49.1%),思路对,接进周围的系统时接错了。GPT-5.6 Sol 失败的 67 次里有 29 次属于「没核实的假设」(43.3%):它对这套系统怎么运作做了一个猜测,然后不去工作区里查一眼,直接往下写。

Fable 5.1 那 49 次失败摊得比较平:漏需求 18 次(36.7%),集成错误 17 次(34.7%),没核实的假设 12 次(24.5%),改坏了原有行为的只有 2 次(4.1%)。

还有一组数字值得单独拎出来。跑不到 10 分钟的 98 次里失败了 70 次,失败率 71.4%;跑满 10 分钟以上的 542 次里失败了 398 次,失败率 73.4%。让智能体多想一会儿,通过率没有变好。

一笔算得出来的账

每次运行的估算成本从 Gemini 3.8 Flash 的 2.50 美元到 Fable 5.1 的 6.96 美元。这条曲线不是单调的:Gemini Flash 花 2.50 美元拿到 31.2%,GLM 5.3 花 5.12 美元拿到 28.8%,多付一倍的钱,通过率反而低了两个多点。

把单次成本除以通过率,可以倒推出「真正做成一道题」的期望花费。Fable 5.1 是 6.96 除以 0.388,约 18 美元;Gemini 3.8 Flash 是 2.50 除以 0.312,约 8 美元。这两个数字是从榜单公布的数据算出来的,不是 Specific Labs 自己给的。

18 美元换一个改动,听上去仍然比一名工程师的一小时便宜得多。但这笔账少了一项:那 61.2% 没做成的运行,输出的不是空白,是一份看起来完整、需要有人读完才能判定它漏了哪条需求的补丁。

真正被抬高的是哪个岗位

Specific Labs 在文章里点了一句:真实企业里 99% 的 token 藏在模型看不到的地方。

这句话解释了为什么榜单上的分数会掉到这个量级,也解释了软件工程这个职业接下来往哪边走。我们 6 月 26 日写过裁员刀口先落在了管理层而不是工程师身上,9 月 9 日写过 Cognition 把工程师挪到监督位。Real-SWE 把那个监督位具体化了:它要监督的是五类失败——漏掉的需求、没核实的假设、接错的集成、改坏的旧行为、改到了根本没被调用的文件。

这五类里没有一类是靠读代码就能发现的。要抓住漏需求,你得先知道这家公司的业务规则里免税客户是怎么定义的;要抓住集成错误,你得知道这个改动下游还有谁在调;要抓住「改错文件」,你得知道生产环境里跑的到底是哪一份。

所以在企业这一侧,价值正在从写代码这个动作,挪到手里攥着公司专属上下文的那个人身上。初级岗位受的挤压最直接。过去积累这份上下文的方式,正是从小改动一点一点做起,而小改动现在多了另一个供给来源。同时被抬起来的是另一类活:能把任务讲清楚到智能体做得对的人,和能在补丁合进主干之前看出它漏了什么的人。

接下来盯什么

Real-SWE 只有十道题、三家公司的代码库,样本小,这一点榜单自己也没藏。它值得追的原因不在分数本身,在方法:一旦有人开始拿授权来的私有生产代码库出题,公开基准上那些好看的数字就有了一个对照面。

我们会盯两件事。一是这份榜单扩到几十家公司之后,38.8% 是往上走还是往下走;二是有没有企业开始把「智能体提交的补丁必须经人复核」写进流程文件。那一步落下来,这份失败分类表才第一次变成一个正式的岗位。

来源

继续读

智能体接棒大模型,2029 年推理占中国算力八成 AI 与就业

智能体接棒大模型,2029 年推理占中国算力八成

9 月 12 日,央视播了中国电信研究院的一份报告:中国 AI 产业的竞争重心正在从「谁的大模型更强」移到「谁的智能体卖得动」。报告里最硬的一个数字是八成:2029 年推理在算力市场里的占比。

#china-telecom#agentic-ai#ai-adoption