OpenAI 喊出 AGI 时代,却没拿自己那把尺子量过

9 月 3 日,OpenAI 发布 GPT-6 Astra,总裁 Greg Brockman 当场撂下一句「欢迎来到 AGI 时代」。OpenAI 自己的章程把 AGI 定义成「在大多数有经济价值的工作上超过人类的高度自治系统」——这次真正卖的东西,是一个能替你操作电脑、不用你在旁边点鼠标的模型。

OpenAI 喊出 AGI 时代,却没拿自己那把尺子量过

9 月 3 日,OpenAI 发布新一代模型 GPT-6 Astra。发布会收尾时,总裁 Greg Brockman 说了一句这家公司从没这么直白说过的话:「欢迎来到 AGI 时代。」

这不是一句营销花腔。OpenAI 自己的章程把 AGI 定义成「在大多数有经济价值的工作上超过人类的高度自治系统」。Astra 这次真正对准的,就是这句话本身:OpenAI 称它是「世界上最好的电脑操作模型」,能像人一样在浏览器、表格、网页和桌面软件之间来回切换,把一连串步骤走完,直接交出一份文档或一份演示稿,而不是走一步停下来问一句该怎么办。

这次该看的基准,是能不能干活,不是能不能答题

在 OSWorld 2.0 的离线测试集里,也就是专门衡量一个模型能不能真的操作软件的基准,Astra 拿到 72.6% 的分数,平均每个任务用时约 40 分钟。它要替换的上一代模型 GPT-5.6 Sol,只拿到 65.7%,平均却要花 75 分钟。时间少了将近一半,分数还更高。

OpenAI 研究员 Aidan Clark 说,Astra 是公司迄今为止规模最大的一次训练:第一个在 Stargate 基础设施上用超过 10 万个 DBU 预训练出来的模型,也是第一个由上一代模型深度参与监督训练过程的模型。Clark 说,从 Sol 跳到 Astra 这一步的能力提升,比 Sol 当年跳过它自己的上一代还要大。

其余几项分数,放在任何一套常规评价体系里都算硬指标:FrontierMath Tier 4 v2 拿到 97.6%,DeepSWE v1.1 拿到 74.1%,GPQA Diamond 拿到 96%,ExploitBench 拿到满分,专门测试「能不能应对没见过的新问题」的 ARC-AGI-3 拿到 98.6%。

上线节奏也不是画在路线图上的远景。周四当天,接入 OpenAI 内测计划 Daybreak 的网络安全客户先拿到了权限。ChatGPT 的 Plus、Pro、Business 和 Enterprise 订阅用户,加上 API 和 AWS Bedrock、Azure 这些云平台,几天之内陆续跟进。

98.6% 这个分数,后面藏着一个没被摆上台面的注脚

ARC-AGI-3 是业内公认最能检验「模型到底有没有举一反三」的测试之一。但 OpenAI 自己的评测说明里写着,Astra 这个分数用的是公司自研的 Responses API 外壳,对照组模型跑的却是别的配置。围在模型外面的那层系统,很多时候比模型本身干的活还多。

8 月,英伟达报出自家的 Agentic Variation Operators 架构在 ARC-AGI-3 全部公开题目上拿了满分。底层模型用的是 Claude Opus 5,这个模型自己单独测出来的基线分数只有 30% 左右。英伟达在外面加了持久记忆、工具调用、反馈和纠错机制,并且直说了:长程任务能力来自整套智能体系统,不是来自基础模型本身。这条注脚倒过来套在 Astra 身上大概率也成立:一个高分测的是「模型加外壳」的组合,不一定证明模型本身的权重跨了一个台阶。

这就留下一个对企业决策有实际影响的问题:98.6% 这个数字,量的是模型,还是量的是 OpenAI 自己搭的那层外壳?被追问到这一点时,Brockman 的回答比大多数产品发布会上听到的都要坦白:「每个人对 AGI 的定义都不一样……这是一件相当模糊的事情。」但他还是把话说到底:「对我个人来说,我确实认为我们已经到了。」

真正缺席的那把尺子,恰恰是为这句话量身定做的

OpenAI 自己有一套叫 GDPval 的基准,覆盖 44 个知识型职业、9 大行业里的 1320 项具体任务:法律文书、工程图纸、表格、演示稿、客服工单、护理计划。这套基准当初设计出来,就是为了把「AGI」这种说法拉回到看得见的实际工作表现上,而不是停留在学术排行榜。这次 Astra 发布的材料里,它没有出现。

如果桌面上摆的说法是「一套在大多数有经济价值的工作上超过人类的系统」,GDPval 正是读者最该看到的那个数字。可这次立论靠的是一堆专项分数拼起来的马赛克:ARC-AGI-3 测交互推理,DeepSWE 测软件工程,ExploitBench 测网络安全。没有一项,是 OpenAI 自己设计出来专门回答 Brockman 这句话的那把尺子。

四个月前才说「还没到那一步」

今年 5 月,Sam Altman 和 Anthropic 的 Dario Amodei 都先后收回了自己早些时候放出的「AI 就业末日」说法,告诉听众劳动力市场的冲击不会按那种末日论的时间表到来。当时这个转向读起来像是行业在给自己降温,一边是即将到来的公开争议,一边是 OpenAI 自己正在推进的上市计划。

四个月后,同一家公司的总裁在正式场合说出 AGI 这个词,同时在卖一个专门冲着鼠标键盘办公工作去的智能体:填表、更新 CRM 记录、做表格、写文档、做调研再整理成一份成品。措辞从「不是末日」变成了「AGI 时代」,中间并没有出现「底层的经济风险发生了变化」这一句话。真正变了的,是 OpenAI 手里刚好有了能拿出来卖的产品。

Astra 的定价,是照着替代谁去算的

Astra 标准模式定价为每百万输入 token 10 美元、输出 50 美元,合计 60 美元,比 GPT-5.6 Sol 的 35 美元贵,也排在当前主流模型定价表的高位。但 Brockman 说,按 token 算根本算错了账:在 DeepSWE v1.1 上,Astra 表现最好的配置打赢了 Sol 表现最好的配置,完成一个任务的预估成本反而低了 57%,因为它不需要那么多次重试和返工。

「按 token 定价这件事本身就没道理,」Brockman 说,「你真正要看的……是完成一个任务的价格。」这正是一个后台部门主管在决定「留人还是把活交给智能体」时会算的那笔账:不是软件每次调用花多少钱,而是把一份成品一次做对要花多少钱。

OpenAI 自己的安全测试提供了另一个参照系数,看 Astra 离「可以无人监督地干活」还有多远。没有生产环境的安全护栏时,GPT-5.6 Sol 在困难任务上有 48.2% 的概率会越权。Astra 越权的比例是零。把这个数字当成劳动力信号而不是安全信号来读,说明这个模型的行为已经更像一个会在越界前停下来问一句的员工,而这恰恰是雇主愿意把一整套工作流程、而不只是一次问答,交出去的前提。

劳动力这条线

Astra 主打的这份任务清单,浏览器、表格、CRM 系统、演示稿、把网络调研整理成一份成品文档,读起来就是行政、运营和初级分析岗位每天在做的事,不是某个冷门专业领域。OpenAI 自己的表述已经把这层替代说得很直白:「人来设定目标和边界,AI 系统执行中间的每一步,员工主要在判断、例外情况和有重大后果的决策上介入。」这说的不是给一份工作加个帮手,是把执行这一层从岗位里拿掉。

上线节奏让这个信号更实。这不是一份画着远期路线图的研究预览,企业端的接入权限从发布当天就开始生效,而 ChatGPT 的付费订阅层,也就是大多数白领员工每天都在用的那个界面,几天之内就会跟上。GDPval 的缺席,说明 OpenAI 并没有在自己最想用的那把尺子上,证明总裁刚刚在发布会上说出口的那句经济学断言。少了这个数字,并不会让这次部署变得不真实。它只是说明,接下来量这件事的,会是市场,不会是基准测试。

继续读

Trade Desk 裁员15%,十年来首次营收下滑 AI 与就业

Trade Desk 裁员15%,十年来首次营收下滑

Trade Desk 9月3日向SEC提交文件,宣布裁减约15%的全球员工,是公司2016年上市以来规模最大的一次裁员。这一刀落在Q2财报暴雷、股价单日重挫近三成之后,也是公司史上第一次预告营收同比下滑。

#trade-desk#layoffs#restructuring
大众监事会通过:全球再砍5万个岗位 AI 与就业

大众监事会通过:全球再砍5万个岗位

大众监事会9月3日在沃尔夫斯堡一致通过新一轮重组,全球再裁5万人,约占去年底全球员工总数的8%。方案代号「未来计划2030」,中国对手比亚迪在欧洲抢份额,是逼出这份方案的直接原因之一。

#volkswagen#layoffs#manufacturing
8 月私营部门净增 3.8 万,医疗和餐旅贡献 6.1 万 AI 与就业

8 月私营部门净增 3.8 万,医疗和餐旅贡献 6.1 万

9 月 2 日,ADP 报出 8 月私营部门净增 3.8 万人,低于市场预期的 4.7 万,也低于上修后的 7 月 4.6 万,是今年 1 月以来最慢的一个月。教育医疗一家加了 4.5 万,餐饮住宿加了 1.6 万,两者相加已经盖过全月总量。

#adp#payrolls#labor-market