GPT-5.6智商首破130天才線!比99%人類聰明

新智元
07/16

見證歷史!

如今,全世界99%的人類,在IQ這方面竟拼不過一個AI。

在Tracking AI最新離線IQ測試中,GPT-5.6全家桶多個版本,齊刷刷地飆到了136分。

這是LLM第一次,把IQ推過了130這道坎。

在人類的智商分佈裏,130分是天才的起跑線,全球僅有大約1%的人能站上去。

換言之,GPT-5.6要比99%的人類還聰明。

GPT-5.6狂刷136分

IQ首破天才線

這個智商,含金量有多高?

實際上,Tracking AI手裏有兩套題。

一套是公開的Mensa Norway風格測試,網上人人能做,模型早就刷到140多分了。

另一套,是它自己攢的離線題庫。不公開、防泄題,專門用來堵住模型提前背過答案的漏洞。

GPT-5.6這次拿下136分,破的正是這套最難、最防作弊的離線題。

在這份離線排行榜上,GPT-5.6的一衆變體(連視覺版都算上)集體衝到136分,把身後所有對手甩開了一大截。

緊咬在後面的,是Claude-5 Fable,130分。

再往下,GPT-5.6 LUNA Max、Claude-4.8 Opus這些名字,還在117到123分之間打轉。

要知道,130這道門檻之前一直沒被跨過去。

過去一年裏,從o3到各家旗艦,一茬又一茬的模型衝上來,全卡在130的門口,誰也沒能真正踏進天才區間。

GPT-5.6,是第一個把門踹開的。

而且它不是單槍匹馬上分,SOL、TERRA一整個家族集體飆到136,連視覺版都沒掉隊。

Reddit上,一位開發者親自下場測試,最終體感GPT-5.6明顯要比GPT-5.5的智商更高

在如下的測試題中,GPT-5.6均在最短時間內,拿下了出色的成績。

一個分數可能難以令人信服,那麼,GPT-5.6離開考場、真刀真槍幹活時是什麼樣?

光有分不夠

把GPT-5.6拉去幹活

開發者Amir Bohlooli拿同一個物理模擬prompt,同時餵給Fable 5和GPT-5.6 Sol,本以為會被Fable碾壓,結果反被GPT驚到。

它選了粒子流體模擬,物理按真實時間推進而非每幀盲跑固定運算,CSS、界面、渲染全塞進一個HTML文件,

還自動託管成可分享網頁。一句話,一個成品。

Ramanpal Singh同樣用了一句prompt,造出一個基於RAG的客服工單系統。

四種角色、管理後台、可嵌入組件,還能自動給投訴分類、識別情緒、起草回覆。

這樣的app它一口氣造了5個,成本只有Fable 5的零頭。

最有畫面感的,是Claire Vo的橋段。

幾天前,她卡在一個bug上,以為是自己代碼寫崩了,換到GPT-5.6 Sol後只甩下一句「我就是不信搞不定」

Sol一次修好,還順手讓別的模型也跑通了。

她的評價一針見血,Fable 死磕技術上的絕對精確,反而作繭自縛,Sol的務實卻把活幹成了。

不得不說,AI會做題,和AI能救場,中間隔着一整個真實項目。

這算AGI嗎?

有網友表示,對99%的人來說,這已經是AGI了。

冷靜下來看,這136分,是Tracking AI一個特定的離線 / Mensa Norway風格測試跑出來的。

它測的,主要是抽象模式識別、邏輯推理這一類標準化認知。

問題在於:IQ測試,本來就不是為大模型量身定做的。

一張Mensa卷子,測不出一個模型的事實可靠性,測不出它的工具調用能力,也測不出它在真實職業場景裏到底靠不靠譜。

它只是切下了「智能」的一個薄片,然後告訴你,這一片有多亮。

不過,人們上手後的實測,恰恰給出了另一半答案:GPT-5.6好像,正在把會做題和會做事這兩件事,慢慢擰到一起。

標準化測試裏的題目,模型多半在訓練數據裏見過千百遍;真正見功夫的,是那些它從沒遇到、也無處抄答案的新問題。

誰能在那兒穩住,誰才配得上智商這兩個字。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10