9 月 3 日,OpenAI 發布新一代模型 GPT-6 Astra。發布會收尾時,總裁 Greg Brockman 說了一句這家公司從沒這麼直白說過的話:「歡迎來到 AGI 時代。」
這不是一句行銷花腔。OpenAI 自己的章程把 AGI 定義成「在大多數有經濟價值的工作上超過人類的高度自治系統」。Astra 這次真正對準的,就是這句話本身:OpenAI 稱它是「世界上最好的電腦操作模型」,能像人一樣在瀏覽器、試算表、網頁和桌面軟體之間來回切換,把一連串步驟走完,直接交出一份檔案或一份簡報,而不是走一步停下來問一句該怎麼辦。
這次該看的基準,是能不能幹活,不是能不能答題
在 OSWorld 2.0 的離線測試集裡,也就是專門衡量一個模型能不能真的操作軟體的基準,Astra 拿到 72.6% 的分數,平均每個任務用時約 40 分鐘。它要取代的上一代模型 GPT-5.6 Sol,只拿到 65.7%,平均卻要花 75 分鐘。時間少了將近一半,分數還更高。
OpenAI 研究員 Aidan Clark 說,Astra 是公司迄今為止規模最大的一次訓練:第一個在 Stargate 基礎設施上用超過 10 萬個 DBU 預訓練出來的模型,也是第一個由上一代模型深度參與監督訓練過程的模型。Clark 說,從 Sol 跳到 Astra 這一步的能力提升,比 Sol 當年跳過它自己的上一代還要大。
其餘幾項分數,放在任何一套常規評價體系裡都算硬指標:FrontierMath Tier 4 v2 拿到 97.6%,DeepSWE v1.1 拿到 74.1%,GPQA Diamond 拿到 96%,ExploitBench 拿到滿分,專門測試「能不能應對沒見過的新問題」的 ARC-AGI-3 拿到 98.6%。
上線節奏也不是畫在路線圖上的遠景。週四當天,接入 OpenAI 內測計畫 Daybreak 的網路安全客戶先拿到了權限。ChatGPT 的 Plus、Pro、Business 和 Enterprise 訂閱用戶,加上 API 和 AWS Bedrock、Azure 這些雲端平台,幾天之內陸續跟進。
98.6% 這個分數,後面藏著一個沒被擺上檯面的註腳
ARC-AGI-3 是業界公認最能檢驗「模型到底有沒有舉一反三」的測試之一。但 OpenAI 自己的評測說明裡寫著,Astra 這個分數用的是公司自研的 Responses API 外殼,對照組模型跑的卻是別的配置。圍在模型外面的那層系統,很多時候比模型本身幹的活還多。
8 月,輝達報出自家的 Agentic Variation Operators 架構在 ARC-AGI-3 全部公開題目上拿了滿分。底層模型用的是 Claude Opus 5,這個模型自己單獨測出來的基線分數只有 30% 左右。輝達在外面加了持久記憶、工具呼叫、回饋和糾錯機制,並且直說了:長程任務能力來自整套智慧體系統,不是來自基礎模型本身。這條註腳倒過來套在 Astra 身上大概率也成立:一個高分測的是「模型加外殼」的組合,不一定證明模型本身的權重跨了一個台階。
這就留下一個對企業決策有實際影響的問題:98.6% 這個數字,量的是模型,還是量的是 OpenAI 自己搭的那層外殼?被追問到這一點時,Brockman 的回答比大多數產品發布會上聽到的都要坦白:「每個人對 AGI 的定義都不一樣……這是一件相當模糊的事情。」但他還是把話說到底:「對我個人來說,我確實認為我們已經到了。」
真正缺席的那把尺子,恰恰是為這句話量身定做的
OpenAI 自己有一套叫 GDPval 的基準,涵蓋 44 個知識型職業、9 大產業裡的 1320 項具體任務:法律文書、工程圖紙、試算表、簡報、客服工單、照護計畫。這套基準當初設計出來,就是為了把「AGI」這種說法拉回到看得見的實際工作表現上,而不是停留在學術排行榜。這次 Astra 發布的資料裡,它沒有出現。
如果桌面上擺的說法是「一套在大多數有經濟價值的工作上超過人類的系統」,GDPval 正是讀者最該看到的那個數字。可這次立論靠的是一堆專項分數拼起來的馬賽克:ARC-AGI-3 測互動推理,DeepSWE 測軟體工程,ExploitBench 測網路安全。沒有一項,是 OpenAI 自己設計出來專門回答 Brockman 這句話的那把尺子。
四個月前才說「還沒到那一步」
今年 5 月,Sam Altman 和 Anthropic 的 Dario Amodei 都先後收回了自己早些時候放出的「AI 就業末日」說法,告訴聽眾勞動力市場的衝擊不會按那種末日論的時間表到來。當時這個轉向讀起來像是產業在給自己降溫,一邊是即將到來的公開爭議,一邊是 OpenAI 自己正在推進的上市計畫。
四個月後,同一家公司的總裁在正式場合說出 AGI 這個詞,同時在賣一個專門衝著滑鼠鍵盤辦公工作去的智慧體:填表、更新 CRM 記錄、做試算表、寫檔案、做調查再整理成一份成品。措辭從「不是末日」變成了「AGI 時代」,中間並沒有出現「底層的經濟風險發生了變化」這一句話。真正變了的,是 OpenAI 手上剛好有了能拿出來賣的產品。
Astra 的定價,是照著取代誰去算的
Astra 標準模式定價為每百萬輸入 token 10 美元、輸出 50 美元,合計 60 美元,比 GPT-5.6 Sol 的 35 美元貴,也排在目前主流模型定價表的高位。但 Brockman 說,按 token 算根本算錯了帳:在 DeepSWE v1.1 上,Astra 表現最好的配置打贏了 Sol 表現最好的配置,完成一個任務的預估成本反而低了 57%,因為它不需要那麼多次重試和返工。
「按 token 定價這件事本身就沒道理,」Brockman 說,「你真正要看的……是完成一個任務的價格。」這正是一個後台部門主管在決定「留人還是把工作交給智慧體」時會算的那筆帳:不是軟體每次呼叫花多少錢,而是把一份成品一次做對要花多少錢。
OpenAI 自己的安全測試提供了另一個參照係數,看 Astra 離「可以無人監督地幹活」還有多遠。沒有正式環境的安全護欄時,GPT-5.6 Sol 在困難任務上有 48.2% 的機率會越權。Astra 越權的比例是零。把這個數字當成勞動力訊號而不是安全訊號來讀,說明這個模型的行為已經更像一個會在越界前停下來問一句的員工,而這恰恰是雇主願意把一整套工作流程、而不只是一次問答,交出去的前提。
勞動力這條線
Astra 主打的這份任務清單,瀏覽器、試算表、CRM 系統、簡報、把網路調查整理成一份成品檔案,讀起來就是行政、營運和初階分析職位每天在做的事,不是什麼冷門專業領域。OpenAI 自己的表述已經把這層取代說得很直白:「人來設定目標和邊界,AI 系統執行中間的每一步,員工主要在判斷、例外情況和有重大後果的決策上介入。」這說的不是給一份工作加個幫手,是把執行這一層從職位裡拿掉。
上線節奏讓這個訊號更實在。這不是一份畫著遠期路線圖的研究預覽,企業端的接入權限從發布當天就開始生效,而 ChatGPT 的付費訂閱層,也就是大多數白領員工每天都在用的那個介面,幾天之內就會跟上。GDPval 的缺席,說明 OpenAI 並沒有在自己最想用的那把尺子上,證明總裁剛剛在發布會上說出口的那句經濟學斷言。少了這個數字,並不會讓這次部署變得不真實。它只是說明,接下來量這件事的,會是市場,不會是基準測試。