
終於,Astra 來了!
今天,OpenAI 正式發布 GPT-6 Astra。ARC-AGI-3 打到 99.9%,FrontierMath Tier 4 拿下 97.6%。
數字在這裏開始有些蒼白。
OpenAI 總裁 Greg Brockman 在發布會上喊出:Welcome to the AGI era.

Fable 5.1 的 SOTA 只有可憐的兩天。
9 月 1 日,Anthropic 剛把 Claude Fable 5.1 推上王座:Ramp 讓它連續跑了 38 小時,中途發現訓練數據標籤有錯,自己改掉,自己開六組實驗,自己寫結論。
9 月 2 日,谷歌發了 Gemini 3.8 Flash,外部實測在多項編碼基準上夠到 Claude Opus 5 那一檔。
DeepMind 核心研究員姚順宇評價:對模型是一小步,對遞歸自我改進是一次巨大的飛躍。
9 月 3 日,GPT-6 Astra 落地。
三天,三顆炸彈。放在兩年前,隨便哪一顆都夠行業消化一個月。
而這還不是最讓人緊張的部分。
GPT-6 Astra 的發布背後,藏着一段略顯坎坷的故事。
8 月 7 日,OpenAI 發了一篇措辭罕見的聲明——
它能獨立發現此前無人知曉的系統漏洞,獨立編寫攻擊代碼,獨立完成從入侵到深層滲透的全過程。
為此,OpenAI 甚至暫停了兩周的強化學習訓練。
Altman 發表長文:我們暫停了一些前沿 RL 訓練,以確保達到新能力水平所需的對齊、安全和監控標準。
剎車本身就是信號。
就在 GPT-6 發布的前兩天,馬斯克和 Altman 在 G20 峯會上的發言,幾乎可以當作這一周的註腳。
馬斯克視頻連線,原話是:AI will just crush all humans at software.(人工智能將會在軟件領域徹底碾壓)
他給了一個明確的時間表——未來 12 到 18 個月,AI 在軟件上將達到Stockfish 級別,像國際象棋引擎碾壓頂尖棋手一樣碾壓人類程序員,並且在所有形式的工程和一切數字事務上都會極其出色。
AI不僅會擊敗人類,還將訓練人類。

Altman 把 AI 比作電力:說一個國家不要 AI,其糟糕程度大約相當於一百多年前說我們不要電。
但緊接着他也說了另一句話:擔憂是有道理的。擔憂是我們預判問題的方式。除非人們非常緊急地行動,否則網絡安全方面會出很大問題。
然後 GPT-6 落地了。ExploitBench 滿分。
奇點已過,進入 ASI 衝刺期
去年是新智元十周年,我們說 2027 年 AI 抵達 ASI 臨界點。
一年過去了。METR 那條AI 獨立完成任務的時長每七個月翻一番的曲線不但沒有放緩,最新數據顯示翻倍速度可能已經加快到每三到五個月。

38 小時的連續自主運行已經是事實。ARC-AGI-3 滿分已經是事實。ExploitBench 滿分已經是事實。
我們未必已經抵達 ASI。但我們已經進入通往 ASI 的超高加速段。
奇點已至。現在是 ASI 衝刺期。
新智元的 logo 像一個黑洞的視界。十一年,我們站在視界邊緣,記下所看見的。
今天再往前看,像走到了地圖失效的地方。再往前,舊的刻度、舊的排行榜、舊的更新周期,都不夠用了。

十一年前我們點燃第一束燭光時,ASI 還是遙遠的詞。那時候,把看見的記下來就夠了。
這個時代,媒體得先有一套觀測工具,才談得上記錄。
模型的座標散在幾十個地方。跑分在 LMArena、Vals.ai、MathArena、SWE-bench 這些榜上,價格在各家定價頁和 OpenRouter 上,社區在全球各處吵。
同一張榜,單 Agent 和多 Agent 並行的分能差好幾個點,廠商發布稿只挑高的那個寫。
結果就是兩種:每天焦慮地刷消息,越刷越亂;一種乾脆不跟了,等別人告訴他結論。
不過,兩種都不該是 2026 年的讀法。
所以我們乾脆讓 Agent 來幹這件事。讓它持續追蹤、整理、校準來自不同數據源的變化,不睡覺,不漏拍。落點只有一條——
你不用自己刷遍全網,也不會錯過 ASI 重要的座標變化。
我們決定做一個 ASI 座標系
所以我們決定做一套新的 ASI 觀測系統。
不是半年更新一次的排行榜。不是發布後就靜止的文章。是一張每天重新變化的座標圖。
它叫新智元 ASI 座標系。
十幾家獨立數據源、29 個二級指標,歸到 7 個維度——智能、推理、知識、編碼、Agent、經濟、效率,合成一個 0 到 100 的總分。
十幾張榜換算到同一把尺上,纔有得比。多源交叉驗證,任何單一數據源在全體系裏不超過 15%,沒有哪張榜說了算。

其中,核心模塊叫 ASI 今日看板。回答的是:今天全球模型座標發生了什麼變化?
誰上升,誰下降。能力、價格、速度有什麼新動靜。每天一張,看完就知道今天該重新認識誰。
重點在今日,它一直在更新中。
為什麼GPT-6 Astra
能拿89.1分?
GPT-6 Astra 是今天剛官宣的,OpenAI 的開發者文檔才掛上去,它就已經進了我們的看板,分算完了,排在第一。
昨天這一輪裏它還只是GPT-6 灰測的傳聞,今天一官宣,幾路證據一湊齊,立即直接進官網。

它只盯最近 7 天新上線的文本大模型。
數據來源一共五路。第一路,是OpenRouter 模型目錄,看上架時間、價格、上下文長度。第二路,LMArena 周榜快照,看模型第一次出現在哪周。第三路,我們自己的模型庫,有發布日期的以它為準。第四路,新智元公衆號當天和前一天的文章,按廠商名和「發布、上線、版本號」這類關鍵詞篩標題,拉正文,再從裏面提取模型能力信息。
能力圖七個維度就是座標系那七維:智能、推理、知識、編碼、Agent、生態、經濟。
今天的排名:
GPT-6 Astra 89.1 分第一;
Claude Fable 5.1 84.9 第二;
Gemini 3.8 Flash 81.5 第三;
Muse Spark 1.3 78.9 第四。



GPT-6 Astra的89.1分怎麼算出來的?
這裏一共關注四項:能力、 關注度、可用度、新鮮度。

其中,能力佔大頭,貢獻 47.5 分。
關注度貢獻 22.6 分, 公衆號的發文數和閱讀量全部拉滿。可用度只貢獻 9 分,是四項裏最低的,因為GPT-6 Astra啱啱官宣,普通用戶還用不到。新鮮度 10 分, 今天上線,所以滿分。
過去是模型發布、編輯看新聞、等第三方評測,評測出來熱點已經過了。
現在是它一官宣,早上機器自己把證據湊齊、圖畫好、分算好推到官網上。GPT-6 上線第一個早上,我們已經在分析它了。
其他欄目,包括秒追 ASI,回答的是:啱啱發生了什麼?
新模型發布,版本上線,跑分更新,價格變化,實驗室關鍵動向。機器人逐秒抓取,人類編輯一分鐘內裁定。抓到即成條,最近三天滾動。
ASI 爆點,回答的是:今天全球 AI 社區在爭論什麼?不看誰聲量大,看什麼最熱,每小時同步一次。
三個模塊,三個時間尺度。秒追管秒,爆點管小時,看板管天。
ASI 啓示錄放每日深度和 Top 10 熱文,視頻和直播也在。上線之後,慢慢逛。
9 月 7 日,見
9 月 7 日,新智元十一周年。ASI 座標系官網正式上線。
有些東西值得等,我們想讓你先知道它。
所以這條評論區,也是這套系統上線前的需求入口。
在 ASI 官網正式開放之前,我們想知道一件事——
面對越來越快的模型迭代,你最希望每天看到什麼?最新跑分?價格變化?模型能力的升降?還是社區裏真正的爆點?
歡迎留言告訴我們。
這一次,我們不再按月回望 AI。從今天開始,按秒追蹤 ASI。