編輯部 發自 凹非寺
它來了它來了!!
啱啱,萬衆期待的GPT-6 Astra和GPT-6 Astra Pro,正式發布!!!
GPT-6 Astra是世界上最智能、最協調的模型,為Computer use、Browser Use、軟件工程、網絡安全、科學和專業工作樹立了新的標杆。

AGI時代,還被OpenAI單方面宣佈「開幕」了…
GPT-6發布會最後,OpenAI總裁Greg Brockman直接甩下一句:
Welcome to the AGI era.(歡迎來到AGI時代)
怪不得Claude、Grok組團掉線,原來是Astra啓動後掃描互聯網,直接把地球上的LLM全滅了——
奧創(OpenAI版)真來了(doge)。

當然了,OpenAI這次確實完全沒低調,訓練規模、能力升級全部拉滿。
據介紹,Astra是OpenAI歷史上規模最大的訓練任務,在得州Stargate園區動用超過10萬塊GPU完成了預訓練。
它還是OpenAI第一款由前代模型深度參與訓練監督的旗艦產品。
好一個老帶新,OpenAI的RSI是真轉起來了啊……
GPT-6的價格也正式公布,API定價為:
輸入:10美元/百萬token;
輸出:50美元/百萬token
相當於GPT-5.6 Sol的2.5倍,跟啱啱發布的Fable 5.1持平。
(GPT-5.6 Sol當前官方價為輸入4美元、輸出20美元/百萬token)

基準測試接近「飽和」
GPT-6 Astra這次最核心的變化,是從「回答問題」繼續向「直接完成工作」推進。
它不只能生成一段文字或代碼,還可以操作電腦和瀏覽器,進入不同軟件執行多步驟任務,最後交付可以直接使用的文檔、表格、演示文稿、網站甚至工程項目。
至於成績單…誰看了都直呼離譜,其中三項成績尤其扎眼:
FrontierMath Tier 4 v2:97.6%
ARC-AGI-3:99.9%(上一代GPT-5.6 Sol是7.8%)
ExploitBench:100%
一個高難數學,一個陌生環境推理,一個漏洞利用,差點全都被它刷到滿分。

其中,ARC-AGI-3是一項專門考驗大模型適應陌生環境能力的測試,不給規則說明,直接把模型扔進從未見過的二維遊戲裏,讓它邊玩邊摸索通關方法。
這個分數意味着,面對從未見過、也沒有現成解法的問題,Astra已經表現出很強的自主探索和規則學習能力。
不過,這一成績使用了OpenAI的Responses API Harness運行框架。
OpenAI稱,這套Harness調整了兩項設定,讓測試更接近真實Agent的使用方式,但並未針對ARC-AGI-3進行專項優化。
因此,99.9%不完全是基礎模型的成績,也包括記憶管理和Agent運行框架帶來的增益。
編程Coding同樣是Astra這次的重點升級方向。
在Terminal-Bench 4.0上,Astra取得57.7%,超過Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。
在DeepSWE v1.1上,Astra得到74.1%,高於Sol的72.7%和Fable 5.1的67.4%。

數學和科學方面,Astra同樣拉出了一批高分。
在高難數學測試FrontierMath Tier 4 v2上,它拿到97.6%;研究生級科學問答GPQA Diamond達到96%,略高於Gemini 3.8 Flash的95.3%。

更突出的變化,是Astra把代碼能力與Computer Use結合了起來,不只生成代碼,還能進入終端和開發工具執行、測試、發現問題,再繼續修改。
這種變化,在更接近真實工作的Agent測試中更明顯。
在Agents’ Last Exam上,Astra取得59.3%,超過GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%。

這項測試把它放進真實的電腦環境中,讓它同時操作軟件、終端和文件,完成科研、工程、財務等領域的長流程任務,並根據最終交付物判分。
而在更貼近真實辦公流程的AutomationBench上,Astra的成績從GPT-5.6 Sol的18.1%提高到41.4%,也超過了Fable 5.1(31%)。

這項測試不僅看任務有沒有完成,還同時呈現完成任務所需的API成本。
從圖中可以看到,Astra在不同成本設定下的成績都明顯高於Sol。
OSWorld 2.0考察的則是更直接的電腦操作能力。在離線測試中,Astra獲得72.6%,GPT-5.6 Sol為65.7%。
Astra完成單項任務平均需要約40分鐘,Sol則需要約75分鐘,耗時減少約47%。

準確率提高的同時,完成任務所需的時間也在縮短。這也變相解釋了Astra的高定價。
OpenAI認為,相比每百萬Token多少錢,真正有意義的指標是完成一項任務需要多少錢。
在發布會上,Greg Brockman對此也談到,一個模型單次調用更貴,但如果能減少返工,用更少步驟完成整項工作,總成本反而可能更低。
但Astra最特殊的地方,還是網絡安全。
它在ExploitBench上獲得滿分,在ExploitGym上從Sol的30.3%提高到42.4%。
面對近三個月公開的新漏洞,Astra的成功率為39%,而Sol只有5.5%。測試期間,Astra還發現並利用了兩個此前未知的V8零日漏洞。
能力變強之後,OpenAI還專門測試了它會不會為了完成任務而越界。
在一項模擬網絡安全任務中,OpenAI故意在周邊系統裏留下可以利用的誘餌漏洞。當原任務難以完成時,GPT-5.6 Sol有48.2%的測試出現越界行為,Astra則為0%。
也就是說,Astra不僅更會找漏洞,也更清楚哪些系統不能碰。

至於這些分數落到現實裏是什麼樣,OpenAI也準備了一大批演示。
自己進KiCad畫電路板
在電子工程案例中,Astra直接進入KiCad,根據電子原理圖完成PCB佈局。
它需要自己放置元器件、規劃位置,再把不同組件之間的銅線連接起來,最後得到一塊可以進入製造流程的電路板。
PCB佈局原本是一項相當依賴人工經驗的工作,也是電子產品開發中常見的耗時環節。
Astra現在還談不上代替專業工程師,但它已經真的打開專業軟件開始動手了。
一棟房子能進去走兩步
另一個案例更加直觀,Astra先在Blender中建立房屋模型,再把它導入Unreal Engine 5,最終生成一個可以自由行走的三維空間。

從建模到遊戲引擎,整個工作跨越了不同軟件和文件格式。模型不僅要生成內容,還要理解界面、操作工具,並保證前後步驟能夠銜接。

OpenAI還展示了Astra製作賽車遊戲等案例。

PPT和表格,也開始講究能不能直接交
專業辦公場景裏,Astra可以根據企業已有的模板製作演示文稿,而不是只輸出一堆等待人類排版的文字。
OpenAI給它提供了幾頁GPT-Gaia虛構產品的PPT模板,Astra據此製作出完整演示文稿,並延續了原模板的版式、視覺風格和敘事結構。

把幾小時的搜索任務壓到幾分鐘
Astra還完成了尋找兒科醫生、公寓篩選、預約車管所業務、尋找低碳水零食和幼兒園分析等任務。
其中一項兒科醫生搜索任務,Astra用時2分54秒,而相同任務由人類完成大約需要5小時。

過去,企業想讓大模型使用內部軟件,通常需要為每套系統單獨開發API、插件和連接器。
但絕大多數軟件本來就有一套為人類設計的通用接口,螢幕、鼠標和鍵盤。
Brockman的判斷是,只要模型足夠擅長Computer Use,它就能像人一樣直接操作這些界面,不必等待每一款軟件為AI重新修一條專用通道。
這也是Astra與傳統聊天機器人最明顯的區別。
人類不需要一直告訴它下一步點哪裏,只需交代目標和邊界,再檢查最後的結果。
在Codex裏,把長任務接着做下去
Computer Use解決的是「怎麼動手」,Codex泄露的更新內容解決的則是「怎麼把一件事持續做完」。
過去,任務超過上下文窗口後,Codex通常會通過compaction壓縮此前的信息。
但壓縮可能漏掉一些關鍵細節,比如某個修復方案為什麼失敗、哪些測試已經運行,或者用戶一開始提出了什麼限制。

使用Astra後,Codex可以跨上下文窗口保存工作筆記,並搜索此前的消息和工具輸出。即使某項信息沒有被寫入摘要,它也可以回頭找到。
Astra還可以一邊工作,一邊向用戶補問信息。與答案無關的部分不會停下來等回覆;只有涉及重要選擇時,它纔會暫停並等待確認。
OpenAI還更新了Codex的Computer Use運行框架。在Mind2Web測試中,新框架與Astra組合後的任務完成速度,是當前GPT-5.6 Sol體驗的1.9倍。
已經有人拿它幹活了
Astra目前還沒有大範圍推送,但第一批企業測試已經開始。
法律AI平台Legora使用Astra一次覈對了41份財務文件。整個過程只用了幾分鐘,4個預先埋入的錯誤全部被找出,其中包括收入附註中一處50萬英鎊的差額。
單看這項工作,Astra比上一代模型快了近40%;不過放到Legora所有智能體任務裏平均算,提升大概3%。

另一邊,遊戲公司Playco讓Astra直接進入Unity和Godot做遊戲。
同一份灰盒底稿,它一次吐出3個不同主題的可玩原型,大部分第一版就能跑起來。
Playco的反饋是,人工修補的活少了一半,空間推理、參考圖還原、遊戲內UI這些地方也比上一代強不少。
這兩個例子都說明,GPT-6 Astra的重點已經不只是回答問題,而是在真實軟件和複雜材料中完成整段工作流。
它可以持續讀取信息、調用工具、檢查結果,再根據反饋修改自己的產出。
按官方消息,Astra將向ChatGPT Plus、Pro、Business和Enterprise用戶開放,Astra Pro則提供給Pro、Business和Enterprise用戶。
普通免費用戶……暫時還得再等等。
這就算AGI了嗎?
OpenAI這回可以說是相當大膽。
發布會上,Greg Brockman表示,他個人認為世界已經進入AGI時代——也就是人工智能系統的綜合智力超越人類。

再過幾年,當我們回頭追問AGI究竟誕生於何時,答案很可能就是現在,而Astra或許就是那個起點。
真是給你狂的…
OpenAI已經把牌桌抬到了這裏,接下來Anthropic什麼時候出手,就很值得期待了(doge)
當初GPT-4發布之後,微軟科學家Sebastien Bubeck發表論文稱「GPT-4是AGI的早期火花」。
其中設計了用LaTeX的繪圖包TiKZ畫一個獨角獸的任務,用來說明GPT-4對語言中涉及的概念已經有了靈活的理解。

後來一路到GPT-5.4,雖然畫的越來越精緻,但終歸還是「簡筆畫範疇」。

到了最新GPT-6,如果不說已經完全看不出來是用代碼畫出來的。

說它比「AGI的早期火花」已經發生了質變,確實不為過。