
見證歷史!
如今,全世界99%的人類,在IQ這方面竟拼不過一個AI。
在Tracking AI最新離線IQ測試中,GPT-5.6全家桶多個版本,齊刷刷地飆到了136分。

這是LLM第一次,把IQ推過了130這道坎。
在人類的智商分佈裏,130分是天才的起跑線,全球僅有大約1%的人能站上去。
換言之,GPT-5.6要比99%的人類還聰明。

GPT-5.6狂刷136分
IQ首破天才線
這個智商,含金量有多高?
實際上,Tracking AI手裏有兩套題。
一套是公開的Mensa Norway風格測試,網上人人能做,模型早就刷到140多分了。
另一套,是它自己攢的離線題庫。不公開、防泄題,專門用來堵住模型提前背過答案的漏洞。
GPT-5.6這次拿下136分,破的正是這套最難、最防作弊的離線題。

在這份離線排行榜上,GPT-5.6的一衆變體(連視覺版都算上)集體衝到136分,把身後所有對手甩開了一大截。
緊咬在後面的,是Claude-5 Fable,130分。
再往下,GPT-5.6 LUNA Max、Claude-4.8 Opus這些名字,還在117到123分之間打轉。
要知道,130這道門檻之前一直沒被跨過去。
過去一年裏,從o3到各家旗艦,一茬又一茬的模型衝上來,全卡在130的門口,誰也沒能真正踏進天才區間。
GPT-5.6,是第一個把門踹開的。
而且它不是單槍匹馬上分,SOL、TERRA一整個家族集體飆到136,連視覺版都沒掉隊。
在Reddit上,一位開發者親自下場測試,最終體感GPT-5.6明顯要比GPT-5.5的智商更高。

在如下的測試題中,GPT-5.6均在最短時間內,拿下了出色的成績。
|
|
|
一個分數可能難以令人信服,那麼,GPT-5.6離開考場、真刀真槍幹活時是什麼樣?
光有分不夠
把GPT-5.6拉去幹活
開發者Amir Bohlooli拿同一個物理模擬prompt,同時餵給Fable 5和GPT-5.6 Sol,本以為會被Fable碾壓,結果反被GPT驚到。
它選了粒子流體模擬,物理按真實時間推進而非每幀盲跑固定運算,CSS、界面、渲染全塞進一個HTML文件,
還自動託管成可分享網頁。一句話,一個成品。

Ramanpal Singh同樣用了一句prompt,造出一個基於RAG的客服工單系統。
四種角色、管理後台、可嵌入組件,還能自動給投訴分類、識別情緒、起草回覆。
這樣的app它一口氣造了5個,成本只有Fable 5的零頭。
最有畫面感的,是Claire Vo的橋段。
幾天前,她卡在一個bug上,以為是自己代碼寫崩了,換到GPT-5.6 Sol後只甩下一句「我就是不信搞不定」。
Sol一次修好,還順手讓別的模型也跑通了。
她的評價一針見血,Fable 死磕技術上的絕對精確,反而作繭自縛,Sol的務實卻把活幹成了。

不得不說,AI會做題,和AI能救場,中間隔着一整個真實項目。
這算AGI嗎?
有網友表示,對99%的人來說,這已經是AGI了。
冷靜下來看,這136分,是Tracking AI一個特定的離線 / Mensa Norway風格測試跑出來的。
它測的,主要是抽象模式識別、邏輯推理這一類標準化認知。
問題在於:IQ測試,本來就不是為大模型量身定做的。
一張Mensa卷子,測不出一個模型的事實可靠性,測不出它的工具調用能力,也測不出它在真實職業場景裏到底靠不靠譜。

它只是切下了「智能」的一個薄片,然後告訴你,這一片有多亮。
不過,人們上手後的實測,恰恰給出了另一半答案:GPT-5.6好像,正在把會做題和會做事這兩件事,慢慢擰到一起。
標準化測試裏的題目,模型多半在訓練數據裏見過千百遍;真正見功夫的,是那些它從沒遇到、也無處抄答案的新問題。
誰能在那兒穩住,誰才配得上智商這兩個字。


