採編:互聯網的一些事(imyixieshi)

8月28日,騰訊混元發布並開源新一代大語言模型Hy4 preview。
這次模型的總參數量做到7700億,激活參數490億,上下文長度達到100萬Token。上一代Hy3的總參數量為2950億。相比之下,Hy4 preview的規模直接擴大了一大截。

參數變大只是其中一項,騰訊這次公布的測試成績,也有不少變化。
在Terminal Bench 2.1測試中,Hy4 preview拿到85.4分,比Hy3高14.6分。按照騰訊公布的數據,這一成績超過DeepSeek V4 Pro,並與Claude Opus 5持平。
DeepSWE的變化更加明顯,Hy3在這項測試中的成績是28.0分,Hy4 preview提升到64.3分。
這類測試主要看軟件工程能力。簡單說,就是模型不只是寫幾段代碼,還要處理更完整的軟件開發任務。
騰訊混元還公布了Hy4 preview的API價格。輸入價格為6元/百萬Token,輸出價格為18元/百萬Token,緩存命中價格為0.3元/百萬Token。

目前,Hy4 preview已經開源,騰訊元寶、ima、WorkBuddy、CodeBuddy等產品都已經接入。騰訊雲TokenHub和OpenRouter也可以調用相關API。
其中,WorkBuddy給了兩周限時體驗。

騰訊公司公關總監張軍8月28日公布消息稱,Hy4 preview即日起在WorkBuddy開放限時體驗。同時,Hy3的免費體驗時間延長到9月30日。

對於普通用戶來說,這個安排倒是比較簡單。新模型可以直接試,舊模型也還能繼續用。
至於770B參數到底能帶來多大的變化,還是得實際用起來才知道。
騰訊這次重點展示的場景,主要有四個:軟件工程、辦公分析、遊戲開發和科學研究。
軟件工程方面,Hy4 preview增加了對長周期開發任務的理解、規劃、調試和驗證能力。前端代碼生成也進行了優化,包括頁面視覺效果和交互體驗。
辦公方面,騰訊提到了複雜文檔處理、數據分析和跨文件協作。比如把一堆資料交給模型,它可以先提取信息,再繼續生成文檔、表格和演示文稿。
遊戲開發方面,模型支持根據需求生成可運行的遊戲原型,並可以通過多輪交互繼續修改項目,同時支持主流遊戲引擎的操作。輸入需求後,模型可以生成可運行的遊戲原型。後面還可以繼續對項目進行修改。
科研方面,騰訊混元公布了一項比較特殊的測試結果。配合科研智能體Hyra,Hy4 preview參與了三維Blaschke–Lebesgue幾何問題的研究。騰訊稱,相關體積下界從0.380799推進到了0.41104。
另外,騰訊還組織了一輪內部盲測。共有163名內部專家參與,測試覆蓋203個工程任務。Hy4 preview平均得分2.99分,滿分4分。同一輪測試中,GLM-5.3得分2.92分,Kimi K3得分2.94分。
兩兩比較時,Hy4 preview對GLM-5.3的勝率為46.8%,對Kimi K3的勝率為51.2%。
這組數據是騰訊內部測試結果,具體測試任務和評分方式並沒有全部公開,所以更適合當作參考。

騰訊方面表示,Hy4 preview目前仍處於早期版本階段,訓練過程還有優化空間。在部分複雜任務中,模型存在過度自我驗證的問題。
此外,Hy4 preview屬於語言模型,沒有原生多模態生成能力。涉及圖片任務時,平台會自動切換其他模型,並按照對應規則計算積分。
目前,模型已經上線騰訊旗下多個產品。WorkBuddy兩周限時體驗,Hy3則免費到9月30日。
7700億參數看起來很大,但真正用起來怎麼樣,還得看普通用戶自己跑一遍。尤其是寫代碼、處理文件、做數據分析這些任務,實際感受可能比參數數字更直接。
你覺得本次Hy4 preview的升級,能否拉近國產開源大模型與海外頂尖模型的差距?