Hy4Preview,更「姚順雨」了

字母榜
08/31

Hy4 preview纔剛發布3天,騰訊WorkBuddy就針對Hy4 preview推理集群進行了緊急擴容,官方宣稱,將持續動態調配資源。

然而WorkBuddy表示,受限於高端算力總量與高峯併發集中,仍不排除個別時段會繼續出現排隊情況。因此官方推薦用戶在Hy4 preview排隊期間切換至Hy3,並且同時還把WorkBuddy的Hy3限免延長至2026年9月30日23:59。

Hy4 preview總參數770B,激活參數49B,上下文1M,Terminal Bench 2.1得分衝到85.4,開源第一、全球第三,SWE-bench Multilingual得分82.9,同樣是開源第一。

8月28日發布當天,API排隊用戶就超過了5000人。

為什麼Hy4 preview這麼受歡迎?

一方面是WorkBuddy本身的用戶量增長,6月時就有數據顯示,WorkBuddy的MAU突破了2000萬。

但更重要的是,這是騰訊基礎模型部成立之後的第一個新模型,也是一款從頭到尾貫徹姚順雨理念的產品。

在Hy4 preview的技術報告中,騰訊大大方方地標明Hy4 preview使用了哪家的技術,並說明了對其進行修改的具體方式。

有意思的地方是,即使用了別人的技術,Hy4 preview卻形成了獨特的風格。

01

三種「自進化」

一切要從自進化開始說起。

Hy4 preview的README裏,這樣寫道,靈感來自於DeepSeek和GLM(inspired by DeepSeek and GLM)。

Hy4 Preview注意力模塊用的是DeepSeek的Gated以及MTP層做投機解碼;配的是智譜的IndexCache做跨層稀疏索引複用;殘差通路用了字節的iHC(identity Hyper-Connections)。

但如果只看到這些,就錯過了Hy4真正反常的地方。

混元團隊在論文中表示,Hy4 preview第一次全程參與了製造自己的過程,在訓練方法、數據策略、評估體系和底層算子這四個環節,全部引入了模型的自進化機制。

但有意思的是,明明說靈感來自於智譜和DeepSeek,可在自進化的方向上,Hy4 preview又和DeepSeek、GLM完全不同。

智譜的自進化,發生在訓練階段,目標是讓模型本身變聰明。

智譜給GLM-5.3搭了一條「自己出真題自己做」的流水線,讓一個「AI研究員」去真實工程師的工作場景裏觀察,把實際業務提煉成訓練數據。再讓一個「AI判卷員」先閉卷做一遍,只有確認真的有解,纔會把題目放進題庫。

配合SAO和slime框架,GLM-5.3在不更換基座的前提下,比GLM-5.2的長程編碼訓練速度提升了約 2.3 倍。

這套邏輯的本質是生物學意義上的進化,基因在迭代中變得更適應環境。

DeepSeek的自進化,發生在運行階段,目標是通過DSH讓模型的「身體」可以無限重組。

DSH的核心設計原則是「一切皆插件」,Agent發現缺什麼,就現場補什麼,用完再無痕拆下來。官方管這叫self-modification。

這是工具學意義上的進化,人沒變,只是學會使用各種工具,讓自己能幹更多的事情。

騰訊Hy4 preview的自進化,既不在訓練階段,也不在運行階段,它發生在研發流程本身。

Hy4既不是智譜那樣「讓自己變聰明」,也不是DeepSeek那樣「讓自己的工具變多」,它是在定義自己,「我作為Hy4 Preview,我應該是什麼樣?」比如「我」的訓練方法應該怎麼設計、數據策略應該怎麼定、評估體系應該怎麼建。

先定義好自己是什麼,再朝着自己想要的方向去發展。

要想全鏈路自進化,第一件事就是要統一組織。

Hy4 preview自進化的4個環節,其實就是大模型研發的完整鏈條。從最基本的訓練、數據、評估,到最後怎麼把訓好的模型高效地跑起來。

這也就是說,姚順雨能完整地統籌整個大模型的研發了。

過去這些事物是分開的,騰訊將其分成了兩個平行部門,分別為大語言模型部和多模態模型部。各自擁有獨立的訓練數據、技術框架、研發流程和評測標準。

而且當時的騰訊還有AI Infra、AI Data和數據計算平台部分別掌管不同的數據。

7月合併成基礎模型部,姚順雨一個人統管之後,這條鏈路才第一次被打通。Hy4 preview能參與全鏈路,本身就代表着組織現在是一條心了。

姚順雨對工程化非常重視。

三家裏面,只有騰訊混元把「底層算子優化」和「推理吞吐量提升」這些關乎模型實際運行的東西納入自進化的列表裏。

姚順雨入職後第一件事就是重建基礎設施,他在6月與湯道生對談中提到,「我們把Infrastructure重建了,無論是預訓練還是強化學習」。

哪怕是OpenAI和Anthropic,算力都是最稀缺的資源,湯道生曾公開承認「算力嚴重不足拖慢了模型訓練與產品發展」。姚順雨必須把每一分算力都榨乾。

一切的核心在於姚順雨的方法論——Co-design。邊訓邊用,讓產品反饋倒逼模型迭代。

Hy3時期,Co-design主要發生在模型和產品之間,比如將CodeBuddy、WorkBuddy的用戶反饋,迴流到模型訓練當中。

到了Hy4 preview這裏,Co-design的範圍擴大了,整個模型研發流程都遵從這套方法論。

也就是說,姚順雨統一了混元模型,並且讓模型與騰訊的所有條線接軌,將他對AI的理解,完全傾注其中。

02

模型是姚順雨方法論的物質化證明

之所以要將姚順雨的理念貫徹進模型當中,是因為他本身就是語言Agent研究的開創者之一。

ReAct是姚順雨的代表作,論文於2022年10月掛出,發表在ICLR 2023上,被評為notable top 5%,引用量超過10000次。

而ReAct也是如今所有Agent的工作原理。 它的核心是把「推理」和「行動」從兩個分離的步驟放在同一個prompt模板裏的交替循環。想一步、做一步、看結果、再想。

不管是Claude Code還是Codex,底層「思考 - 調用工具 - 觀察結果 - 繼續思考」循環,本質上都是ReAct的變體。

姚順雨的第二大代表作便是Tree of Thoughts(ToT),這是一種增強推理的策略。

在關鍵決策點展開多條思路,分別評估,再選最優路徑繼續。

這個方法在研究層面影響很大,但在實際產品中直接用ToT的其實並不多,因為樹搜索的token成本太高,產品裏更多是簡化版的「多路徑嘗試」或者「遇到岔路時多想一下」。

ToT擴展了模型的「深度思考」能力,尤其是當ReAct循環中遇到關鍵的決策點時,ToT提供了一種「要不你再尋思尋思呢?」的機制。

從Hy3到Hy4 preview,最直觀的感受就是,姚順雨把他的論文完全搬進了模型中。

Hy3的定位是「強Agent型」模型,ReAct循環已經有了基礎,能執行多步驟任務。但Hy3沒有「過度驗證」 的行為特徵,說明它的推理更多是單路徑的,想到一條路就走,走到黑算完,缺乏多路徑探索和評估的機制。

只有模型真的在展開多個候選、逐個評估、確認無誤才落筆,纔會表現出一種「我必須得狠狠驗證對不對」。

Hy4 preview在推理深度上明顯加強了,比如模型能反覆自我驗證、推理過程偏長,這些都是ToT思想在工程中的系統體現。

從Hy3到Hy4 preview,不是簡單的參數變大,是整個產品的邏輯都變了,從「單路徑執行」升級到了現在的「多路徑探索+深度驗證」。

甚至混元官方主動在論文中承認,Hy4 preview複雜任務上可能思考時間過長,並且有過度自我驗證的傾向。

姚順雨算是徹底喫上「老本」了,以前在實驗室裏搗鼓的玩意,現在可算是逮着機會工程化了。

但光有方法不行,還得有訓練數據支持。

大部分大模型的訓練數據是「結果導向」的,給出題目,再給出答案,可中間過程被省略了,模型只能學到「看到這個問題給出這個答案、看到那個問題給出那個答案」。

這種數據訓練出來的模型,做簡單題沒問題,然而一旦遇到需要多步驟、需要試錯、需要根據中間結果調整策略的複雜任務,就容易崩,因為它從來沒學過「邊做邊看邊調整」這件事。

可ReAct和ToT又強調的是模型邊看邊解答的這個循環,那該怎麼辦呢?

Hy4 preview在論文中寫到,通過騰訊內部的軟件工程師、遊戲開發者、金融分析師、安全專家,圍繞他們真正交付的工作共建數據,再和CodeBuddy、WorkBuddy這些真實產品共同設計。

模型進步的每一格,都錨在真實生產力上。模型本身,就是姚順雨方法論的物質化證明。

Hy4 preview要遠比Hy3更加得「姚順雨」。Hy3現在看來更像是姚順雨能力的印證,到了Hy4 preview這裏,姚順雨「轉正」了。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10