SpaceXAI新「殺器」:Grok 4.6智能體測試力壓GPT-5.6、Fable 5,定價僅競品一半

華爾街見聞
08/13

美東時間8月12日周三,馬斯克旗下SpaceXAI正式發布新一代大模型Grok 4.6。SpaceXAI稱,新模型相比Grok 4.5實現顯著提升,重點強化長時間運行的智能體(Agent)、複雜編程、知識工作以及交互式和視覺任務能力。

此次發布最受關注的並非單純的模型迭代,而是Grok 4.6在SpaceXAI公布的多項前沿模型測試中已經躋身第一梯隊,同時API起售價僅為2美元/百萬輸入Token、6美元/百萬輸出Token。SpaceXAI稱,其定價約為其他前沿模型的一半;該模型上線首周在Cursor和Grok Build中還提供2倍包含用量。

SpaceXAI公布的測試數據顯示,Grok 4.6在Artificial Analysis Intelligence Index中取得61分,與OpenAI前沿模型GPT-5.6 Sol Max持平;在GDPVal-AA v2中則取得1753 Elo,超過GPT-5.6 Sol Max的1728分和Anthropic前沿模型Claude Fable 5的1741分。

馬斯克隨後在社交媒體轉發有關Grok 4.6是巨大升級、在所有基準測試中得分均超過Grok 4.5 High的帖子,強調Grok 4.6評分達到1753 Elo,並自誇新模型太牛了。

從知識工作到編程,Grok 4.6全面強化複雜任務能力

Grok 4.6此次升級的核心,不再只是回答問題,而是讓模型能夠持續完成需要多步驟執行的複雜任務

SpaceXAI表示,Grok 4.6重點針對長時間運行的智能體進行訓練,可以連續完成研究主題、分析信息、處理代碼庫,以及把一個模糊的產品想法轉化為可運行的應用或工作成果。公司還稱,新模型在更長的任務軌跡中開始表現出更多自主測試和驗證能力,會在繼續執行之前檢查此前的工作。

在訓練方面,Grok 4.6經歷了比Grok 4.5更長的補充訓練,加入經過篩選的模型生成推理數據、高質量工程數據,並改進優化器和訓練方案。隨後,SpaceXAI利用Grok 4.5生成覆蓋不同推理強度、智能體框架以及STEM、軟件工程和知識工作的SFT軌跡,並進一步通過強化學習訓練模型完成通用編程、知識工作、內核優化、網頁開發和計算機輔助設計等任務。

SpaceXAI特別強調,Grok 4.6在把「想法」變成「產品」方面有所提升。對於一個具體的產品構想,模型可以先研究陌生領域、設計應用結構、實現核心交互,再根據反饋進行多輪迭代;在視覺和交互式項目中,新模型也能夠更快形成較為完整的第一版成果。

低價策略直指開發者市場,首周Cursor等產品加倍放量

相比模型能力本身,Grok 4.6的定價策略可能更加值得AI產業鏈關注

SpaceXAI公布的API價格從每百萬輸入Token 2美元、每百萬輸出Token 6美元起,另有速度更快、價格翻倍的版本。公司同時宣佈,Grok 4.6已經接入Cursor、Grok Build,並通過OpenRouter、Vercel和Cloudflare等合作伙伴提供。

作為對比,SpaceXAI在公告中將Grok 4.6定位為「其他前沿模型的一半價格」。而投資機構Atreides Management首席投資官Gavin Baker的評價更為激進:他認為,Grok 4.6的性能大致相當於Fable 5 Max,但輸入Token價格低80%、輸出Token價格低88%,因此在性能與成本的組合上具有明顯優勢。

科技業分析師、Superintelligence Newsletter主編Kim Monnis也指出,Grok 4.6不僅比Opus 5和GPT-5.6 Sol便宜,甚至低於Sonnet 5,同時性能至少處於頂級模型水平。在他看來,這種「前沿性能+低成本」的組合纔是Grok真正的護城河。

需要指出的是,API單價並不能完全等同於實際使用成本。不同模型的Token消耗、推理強度和任務完成路徑存在差異,因此「便宜一半」主要是對公布API價格的比較,而不是意味着所有具體任務的最終成本都恰好低50%。

首周促銷也進一步強化了這一低價策略:SpaceXAI表示,Cursor和Grok Build用戶在首周可以獲得2倍包含用量,讓開發者可以低成本試用Grok 4.6。

強化長程執行能力,模型可自主測試並持續修正

從測試結果看,Grok 4.6的提升尤其集中在智能體執行真實工作這一正在成為AI模型競爭核心的領域。

SpaceXAI重點展示了Artificial Analysis推出的GDPVal-AA v2。該測試基於OpenAI的GDPval數據集,考察模型在真實世界、具有經濟價值的專業任務中的表現,覆蓋44個職業和9個主要行業;模型需要在智能體環境中使用Shell和網頁瀏覽等工具完成任務,並通過盲測兩兩比較最終產出的文件,由此形成Elo評分。

在SpaceXAI此次公布的對比數據中,Grok 4.6在GDPVal-AA v2取得1753 Elo,排名高於GPT-5.6 Sol Max的1728分和Claude Fable 5 Max的1741分,較上一代Grok 4.5 High的1526分大幅提高。

與此同時,Grok 4.6在Artificial Analysis Intelligence Index中獲得61分,與GPT-5.6 Sol Max持平;該指數是由9項測試綜合而成,用於衡量模型在數學、科學、編程和推理等多個維度的綜合能力。

在SpaceXAI公布的其他測試中,Grok 4.6同樣較上一代有明顯進步:

  • CursorBench v3.2:69.9%,Grok 4.5 High為66.7%;

  • FrontierCode v1.1:61.3%,Grok 4.5 High為56.6%;

  • APEX-Agents:57.5%,Grok 4.5 High為47.1%;

  • APEX-SWE:56.4%,Grok 4.5 High為53.6%;

  • AA-Briefcase:1577分,Grok 4.5 High為1313分;

  • Harvey LAB:15.8%,Grok 4.5 High為12.9%。

但Grok 4.6並非在所有測試中都佔據第一。例如在DeepSWE 1.1和Terminal-Bench v3.0中,SpaceXAI公布的GPT-5.6 Sol Max成績仍高於Grok 4.6。因此,更準確的說法是,Grok 4.6已經在多項智能體和知識工作測試中進入前沿模型第一梯隊,而不是全面擊敗所有競爭對手。

值得注意的是,Artificial Analysis的GDPVal-AA v2排行榜本身會隨着模型新增和評測更新而變化,因此本文標題所稱的「力壓」特指SpaceXAI此次發布時公布的橫向測試結果,而非宣稱Grok 4.6在所有時間、所有評測體系中均排名第一。

從模型到生態,SpaceXAI加速搶佔AI開發入口

Grok 4.6的發布還顯示,SpaceXAI正在把競爭從單純的模型性能比拼,進一步延伸到開發者入口和應用生態

目前Grok 4.6已經同時進入Cursor、Grok Build和API,並接入OpenRouter、Vercel、Cloudflare等渠道。SpaceXAI希望藉助這些平台,讓開發者可以直接把Grok 4.6嵌入編程、網頁開發和智能體工作流,而不只是通過Grok聊天產品使用模型。

馬斯克本人也在X上密集為新模型站台。他先是宣佈「Grok 4.6 is now out」,隨後轉發有關1753 Elo排名的報道,並強調Grok 4.6在GDPVal-AA v2中取得第一;在另一條轉發中,他列出了Grok 4.6在AA-Briefcase、Harvey LAB、CursorBench、FrontierCode、APEX-Agents和APEX-SWE等測試中的排名,最後評價稱:「Grok 4.6 is a banger」。

而Atreides Management的Gavin Baker則進一步把市場注意力引向下一代產品。他預計,Grok 4.7將是規模明顯更大的模型,並可能將Cursor和SpaceX數據納入預訓練。這一說法目前屬於投資人士的判斷,並非SpaceXAI此次發布公告確認的產品路線。

如果Grok 4.6能夠在保持前沿模型級別能力的同時持續維持較低的Token價格,那麼其意義可能不僅是一代模型的性能升級,更可能成為AI大模型價格戰向智能體時代延伸的一個新信號:當不同廠商的模型能力差距逐漸縮小時,性能與推理成本之間的平衡,可能越來越成為開發者和企業選擇模型的關鍵。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10