OpenAI 喊出 AGI 時代,卻沒拿自己那把尺子量過

9 月 3 日,OpenAI 發布 GPT-6 Astra,總裁 Greg Brockman 當場撂下一句「歡迎來到 AGI 時代」。OpenAI 自己的章程把 AGI 定義成「在大多數有經濟價值的工作上超過人類的高度自治系統」,這次真正賣的東西,是一個能替你操作電腦、不用你在旁邊點滑鼠的模型。

OpenAI 喊出 AGI 時代,卻沒拿自己那把尺子量過

9 月 3 日,OpenAI 發布新一代模型 GPT-6 Astra。發布會收尾時,總裁 Greg Brockman 說了一句這家公司從沒這麼直白說過的話:「歡迎來到 AGI 時代。」

這不是一句行銷花腔。OpenAI 自己的章程把 AGI 定義成「在大多數有經濟價值的工作上超過人類的高度自治系統」。Astra 這次真正對準的,就是這句話本身:OpenAI 稱它是「世界上最好的電腦操作模型」,能像人一樣在瀏覽器、試算表、網頁和桌面軟體之間來回切換,把一連串步驟走完,直接交出一份檔案或一份簡報,而不是走一步停下來問一句該怎麼辦。

這次該看的基準,是能不能幹活,不是能不能答題

在 OSWorld 2.0 的離線測試集裡,也就是專門衡量一個模型能不能真的操作軟體的基準,Astra 拿到 72.6% 的分數,平均每個任務用時約 40 分鐘。它要取代的上一代模型 GPT-5.6 Sol,只拿到 65.7%,平均卻要花 75 分鐘。時間少了將近一半,分數還更高。

OpenAI 研究員 Aidan Clark 說,Astra 是公司迄今為止規模最大的一次訓練:第一個在 Stargate 基礎設施上用超過 10 萬個 DBU 預訓練出來的模型,也是第一個由上一代模型深度參與監督訓練過程的模型。Clark 說,從 Sol 跳到 Astra 這一步的能力提升,比 Sol 當年跳過它自己的上一代還要大。

其餘幾項分數,放在任何一套常規評價體系裡都算硬指標:FrontierMath Tier 4 v2 拿到 97.6%,DeepSWE v1.1 拿到 74.1%,GPQA Diamond 拿到 96%,ExploitBench 拿到滿分,專門測試「能不能應對沒見過的新問題」的 ARC-AGI-3 拿到 98.6%。

上線節奏也不是畫在路線圖上的遠景。週四當天,接入 OpenAI 內測計畫 Daybreak 的網路安全客戶先拿到了權限。ChatGPT 的 Plus、Pro、Business 和 Enterprise 訂閱用戶,加上 API 和 AWS Bedrock、Azure 這些雲端平台,幾天之內陸續跟進。

98.6% 這個分數,後面藏著一個沒被擺上檯面的註腳

ARC-AGI-3 是業界公認最能檢驗「模型到底有沒有舉一反三」的測試之一。但 OpenAI 自己的評測說明裡寫著,Astra 這個分數用的是公司自研的 Responses API 外殼,對照組模型跑的卻是別的配置。圍在模型外面的那層系統,很多時候比模型本身幹的活還多。

8 月,輝達報出自家的 Agentic Variation Operators 架構在 ARC-AGI-3 全部公開題目上拿了滿分。底層模型用的是 Claude Opus 5,這個模型自己單獨測出來的基線分數只有 30% 左右。輝達在外面加了持久記憶、工具呼叫、回饋和糾錯機制,並且直說了:長程任務能力來自整套智慧體系統,不是來自基礎模型本身。這條註腳倒過來套在 Astra 身上大概率也成立:一個高分測的是「模型加外殼」的組合,不一定證明模型本身的權重跨了一個台階。

這就留下一個對企業決策有實際影響的問題:98.6% 這個數字,量的是模型,還是量的是 OpenAI 自己搭的那層外殼?被追問到這一點時,Brockman 的回答比大多數產品發布會上聽到的都要坦白:「每個人對 AGI 的定義都不一樣……這是一件相當模糊的事情。」但他還是把話說到底:「對我個人來說,我確實認為我們已經到了。」

真正缺席的那把尺子,恰恰是為這句話量身定做的

OpenAI 自己有一套叫 GDPval 的基準,涵蓋 44 個知識型職業、9 大產業裡的 1320 項具體任務:法律文書、工程圖紙、試算表、簡報、客服工單、照護計畫。這套基準當初設計出來,就是為了把「AGI」這種說法拉回到看得見的實際工作表現上,而不是停留在學術排行榜。這次 Astra 發布的資料裡,它沒有出現。

如果桌面上擺的說法是「一套在大多數有經濟價值的工作上超過人類的系統」,GDPval 正是讀者最該看到的那個數字。可這次立論靠的是一堆專項分數拼起來的馬賽克:ARC-AGI-3 測互動推理,DeepSWE 測軟體工程,ExploitBench 測網路安全。沒有一項,是 OpenAI 自己設計出來專門回答 Brockman 這句話的那把尺子。

四個月前才說「還沒到那一步」

今年 5 月,Sam Altman 和 Anthropic 的 Dario Amodei 都先後收回了自己早些時候放出的「AI 就業末日」說法,告訴聽眾勞動力市場的衝擊不會按那種末日論的時間表到來。當時這個轉向讀起來像是產業在給自己降溫,一邊是即將到來的公開爭議,一邊是 OpenAI 自己正在推進的上市計畫。

四個月後,同一家公司的總裁在正式場合說出 AGI 這個詞,同時在賣一個專門衝著滑鼠鍵盤辦公工作去的智慧體:填表、更新 CRM 記錄、做試算表、寫檔案、做調查再整理成一份成品。措辭從「不是末日」變成了「AGI 時代」,中間並沒有出現「底層的經濟風險發生了變化」這一句話。真正變了的,是 OpenAI 手上剛好有了能拿出來賣的產品。

Astra 的定價,是照著取代誰去算的

Astra 標準模式定價為每百萬輸入 token 10 美元、輸出 50 美元,合計 60 美元,比 GPT-5.6 Sol 的 35 美元貴,也排在目前主流模型定價表的高位。但 Brockman 說,按 token 算根本算錯了帳:在 DeepSWE v1.1 上,Astra 表現最好的配置打贏了 Sol 表現最好的配置,完成一個任務的預估成本反而低了 57%,因為它不需要那麼多次重試和返工。

「按 token 定價這件事本身就沒道理,」Brockman 說,「你真正要看的……是完成一個任務的價格。」這正是一個後台部門主管在決定「留人還是把工作交給智慧體」時會算的那筆帳:不是軟體每次呼叫花多少錢,而是把一份成品一次做對要花多少錢。

OpenAI 自己的安全測試提供了另一個參照係數,看 Astra 離「可以無人監督地幹活」還有多遠。沒有正式環境的安全護欄時,GPT-5.6 Sol 在困難任務上有 48.2% 的機率會越權。Astra 越權的比例是零。把這個數字當成勞動力訊號而不是安全訊號來讀,說明這個模型的行為已經更像一個會在越界前停下來問一句的員工,而這恰恰是雇主願意把一整套工作流程、而不只是一次問答,交出去的前提。

勞動力這條線

Astra 主打的這份任務清單,瀏覽器、試算表、CRM 系統、簡報、把網路調查整理成一份成品檔案,讀起來就是行政、營運和初階分析職位每天在做的事,不是什麼冷門專業領域。OpenAI 自己的表述已經把這層取代說得很直白:「人來設定目標和邊界,AI 系統執行中間的每一步,員工主要在判斷、例外情況和有重大後果的決策上介入。」這說的不是給一份工作加個幫手,是把執行這一層從職位裡拿掉。

上線節奏讓這個訊號更實在。這不是一份畫著遠期路線圖的研究預覽,企業端的接入權限從發布當天就開始生效,而 ChatGPT 的付費訂閱層,也就是大多數白領員工每天都在用的那個介面,幾天之內就會跟上。GDPval 的缺席,說明 OpenAI 並沒有在自己最想用的那把尺子上,證明總裁剛剛在發布會上說出口的那句經濟學斷言。少了這個數字,並不會讓這次部署變得不真實。它只是說明,接下來量這件事的,會是市場,不會是基準測試。

繼續讀

Trade Desk 裁員15%,十年來首次營收下滑 AI 與就業

Trade Desk 裁員15%,十年來首次營收下滑

Trade Desk 9月3日向SEC提交文件,宣布裁減約15%的全球員工,是公司2016年上市以來規模最大的一次裁員。這一刀落在Q2財報爆雷、股價單日重挫近三成之後,也是公司史上第一次預告營收年減。

#trade-desk#layoffs#restructuring
福斯監事會通過:全球再砍5萬個職位 AI 與就業

福斯監事會通過:全球再砍5萬個職位

福斯監事會9月3日在沃夫斯堡一致通過新一輪重組,全球再裁5萬人,約占去年底全球員工總數的8%。方案代號「未來計劃2030」,中國對手比亞迪在歐洲搶市占,是逼出這份方案的直接原因之一。

#volkswagen#layoffs#manufacturing
8 月民營部門淨增 3.8 萬,醫療和餐旅貢獻 6.1 萬 AI 與就業

8 月民營部門淨增 3.8 萬,醫療和餐旅貢獻 6.1 萬

9 月 2 日,ADP 公布 8 月民營部門淨增 3.8 萬人,低於市場預期的 4.7 萬,也低於上修後的 7 月 4.6 萬,是今年 1 月以來最慢的一個月。教育醫療一家加了 4.5 萬,餐飲住宿加了 1.6 萬,兩者相加已經蓋過全月總量。

#adp#payrolls#labor-market