
今日凌晨,科技圈再次被一聲巨響吵醒。
「世界上最智能、對齊程度最高」的模型,GPT-6 Astra來了。
前者,無可否認;後者,明顯就不是事實。
具體的後面再說。
更吵的是,OpenAI總裁格雷格·布羅克曼高調宣佈:AGI時代來了。
大部分人的第一反應大概都是,吹牛。
IPO壓力大,吹一吹,可以理解。
但是,目前對AGI本身就沒有統一定義,「進入AGI時代」與「已經完成AGI」也不是一個意思。
從OpenAI的角度出發,這次可能確實沒吹牛。
01
目前,對AGI的定義主要有三個方向。
第一,實用層面。
比如,OpenAI自己的定義是:高度自主、能夠在大多數具有經濟價值的工作中超越人類的系統。
關鍵詞並非「超越人類」,而是:高度自主、經濟價值工作。
第二,最靠譜的,學術層面。
DeepMind提出了一個「Levels of AGI」框架,把AGI拆成性能深度、能力廣度和自主性三個維度。
簡單來說,AGI的形成是一個漸進式能力譜系,而不是達到什麼指標後突然就成了AGI。
也可以理解為進化與基因突變的區別,AI會一點一點獲得越來越強的通用能力。
所以,AGI是一個過程,而非一個節點。
這也能解釋,為什麼同一個模型,有人認為已經接近AGI,有人卻認為還差得遠。
因為他們拿的不是同一把尺子。
第三,科幻層面。
這個就不必介紹了,就是科幻電影裏那種,有意識、能交流、自我迭代的機器人。

科幻層面上,GPT-6 Astra肯定遠遠不是AGI。
那另外兩個層面呢?
先看技術指標,OpenAI這次給出的成績單確實非常誇張:
上下文與生成極限:支持105萬Token超長上下文輸入窗口,單次最大可生成12.8萬Token輸出。
ARC-AGI-3(抽象推理):成績達到99.9%,徹底擊碎了「大模型只是概率填空」的質疑。
FrontierMath Tier 4(前沿數學):98%,甚至在測試期間協助人類數學家推演並解決了個別長期懸而未決的開放問題。
ExploitBench(網絡安全攻防):100%滿分,Astra在沒有任何人類干預的情況下,自主發現了2個此前未知的零日漏洞,併成功構建出鏈式利用代碼突破了高防護系統。
OSWorld 2.0(計算機自主使用/Agent能力):72.6%(上一代GPT-5.6 Sol為65.7%),在完成同等複雜的桌面與瀏覽器跨軟件綜合操作任務時,將耗時從75分鐘壓縮到了 40分鐘,效率提升了約 47%。
……
在性能方面,GPT-6 Astra幾乎全方位碾壓Anthropic啱啱上線的Fable 5.1。
更關鍵的是,OpenAI在公告中多次出現「飽和」一詞,意思就是現有的排行榜測不出新模型的上限
這還真不是吹牛。

ARC Prize指出,Astra出現了一個很有意思的行為:它會把陌生環境壓縮成符號化的世界模型,再根據規則進行規劃。
這一行為的出現,比99.9%這個分數的意義更大。
因為ARC-AGI-3本身就是在測試「陌生環境智能」的能力。
模型面對的是一個此前不熟悉的環境,它需要自己理解規則、構建內部世界模型、規劃行動,然後不斷試錯。
大家過去的質疑沒錯,大模型的本質確實就是「概率填空」,把試錯後的結果呈現出來。
但現在,Astra是先理解新環境的規則,再去行動。
AI正在從「模式匹配器」向「環境建模器」轉變。
這纔是GPT-6 Astra真正有價值的體現,也是OpenAI為什麼有底氣喊出「Welcome to the AGI era」的最大底氣。
從實用層面看來,不能完全否定這句話。
02
GPT-6 Astra在特定的複雜工作流中,確實展現出了極強的實用性。
OpenAI公布的數據非常直觀:
在Agents’ Last Exam上,GPT-6 Astra達到59.3%,GPT-5.6 Sol為53.6%。
在OSWorld 2.0上,Astra達到72.6%,GPT-5.6 Sol為65.7%。
在ScreenSpot-Pro上,Astra達到92.7%,GPT-5.6 Sol為76.9%。
……
在法律科技公司Legora的真實財務審計測試中,Astra將財務報表處理工作流的效率提升了 40%,並且在跨越41份冗長法律文檔的交叉比對中,準確找出了所有隱蔽錯誤。
在量化交易機構Jane Street的內部測試中,Astra不僅大幅減少了代碼迭代次數,還能在發現指令模糊時主動向人類發送異步提問,並繼續處理其他不依賴答覆的子任務。
簡單來說,GPT-6 Astra在特定賽道,真的展現出了超人的生產力。
它不再是一種「軟件功能」,而是實實在在的數字勞動力。

從OpenAI自己定義的實用層面觸發,GPT-6 Astra確實實現了自主、能夠在具有經濟價值的工作中超越人類。
稱之為AGI不能說完全說錯。
當然,也不完全對。
距離真正的「實用」,GPT-6 Astra依然存在很明顯的缺陷。
第一,長期自主性。
它確實已經可以自主完成複雜任務,但「完成一個複雜任務」和「連續數天、數周、數月穩定地承擔一個複雜崗位」,完全是兩碼事。
讓Astra做一次性工作,它可能表現得非常優秀。
但是讓它長時間面對突發情況、制度調整、數據異常、人際溝通、權限變化、目標變化,並且始終保持正確決策,就很難做到。
儘管OSWorld 2.0達到了72.6%,但在面對超過數天的開放式、無明確邊界的現實業務時,Astra依然會在多步長尾調用中累積微小誤差,最終導致決策偏離目標。
第二,成本。
雖然OpenAI宣稱Astra在同等任務下的API成本比GPT-5.6 Sol和Claude Fable 5.1降低了 27%~31%,但在進行上百萬Token上下文與上千步多工具連續調用的複雜作業時,單次任務的計算成本依然高達數十美元。
對於絕大多數工作而言,這一成本遠遠差過了人類的薪水,並不划算。
第三,安全。
OpenAI研究副總裁艾丹·克拉克透露,GPT-6 Astra的訓練消耗了超過10萬張GPU,引入了「隱式遞歸/循環深度」計算機制。
過去的語言模型依賴顯式鏈式思考顯式輸出Token,而Astra允許模型在其內部潛在狀態中進行深度遞歸演算,不需要把思考過程全寫在螢幕上。
這不僅大幅節省了輸出Token(最高減少20%),還極大地提升了多步推理的連貫性。
但是,對AI思維鏈的監控也因此變得極其困難。
Astra可以在許多防護嚴密的系統裏發現此前未知的安全漏洞,並在無需人工逐步指導的情況下設計漏洞利用方式。
OpenAI自己也承認,Astra的安全監管成本極高,甚至達到了威脅級別的「臨界危急」閾值。

以上,結論是什麼?
從技術上、產業應用上,Astra確實表現出了OpenAI對AGI定義的特點。
只是因為無法勝任長期任務、太貴、不安全等等問題,它並不能大規模落地。
既然如此,那它其實就沒有那麼「實用」,當然還不能稱之為AGI。
但這並不妨礙AGI時代的到來。
03
按照上面提到的DeepMind框架,AGI是一個過程,而非節點。
這其實很符合當下的情況。
真正轉變不是某個人宣佈「AGI已實現」,而很多原本需要人類完成的數字工作,逐漸被交給AI,而且AI真的能長期穩定地完成。
過去五年的AI革命,主要是在改造信息生產。
GPT-6 Astra確實帶來了歷史性的變化:AI可以直接作為勞動力使用。
只是這個「可以」,目前並非「普遍」而已。
比如Astra的公開部署,就是逐步進行中的。首先向一部分組織開放,之後才逐步擴大到Plus、Pro、Business和Enterprise用戶,以及API和AWS。
包括後續的模型,當然也是如此。
所以以上討論的一切,本身仍然是技術證明階段,到完整的社會證明仍需要一段時間。
這一段時間,或許就是從可以到普遍的過程。
這可能纔是「AGI時代」的真正含義。
不是AI突然擁有了靈魂,而是它終於開始上班了。(全文完)