中國模型,全球底座

字母榜
09/07

中國大模型被「套殼」,現在已經不是新聞了,這不,前幾天又爆出來一個。

9月2日,沙特AI公司HUMAIN發布了HUMAIN M3模型,發布之初,官方直接宣稱這是「100% Saudi Model」(100% 沙特模型)。

雖說這個公司的名字可能對於我們來說有些陌生,但是M3這個字眼格外很眼熟,畢竟MiniMax才發布MiniMax M3沒過去多久。

再加上其428B總參數,23B激活參數的配置跟MiniMax M3完全相同。於是評論區很快就有人質疑:100%沙特?

發布者蘇丹·阿爾法伊菲(Sultan Alfaifi)隨後不得不親自澄清,稱HUMAIN M3是基於MiniMax旗下的M3開發的。

然而這件事放在中國AI上並非偶然事件,日本樂天用DeepSeek、新加坡國家人工智能計劃用Qwen……中國的模型已悄然成為了全球AI開發者的首選。

以前中國大模型出海,更多是賣API、賣產品,賺的是調用費和服務費。現在,它們正以一種全新的形態出擊。

是好是壞暫且不論,但毫無疑問,這是開源模型真正開始向外擴散的信號。

A

HUMAIN其實並不缺自己的模型。

2025年8月,這家由沙特主權財富基金組建的國家級AI公司,啱啱發布過ALLaM 34B,120多名AI專家、35名博士參與,在沙特境內從零訓練,主打阿拉伯語和本土文化對齊,官方當時強調的就是「從頭構建」。

可到了2026年9月發布旗艦M3的時候,沙特還是把底座押在了中國模型身上,只用自己的語料做後訓練。

正如前文所述,各國使用中國開源模型這事早就不新鮮了。

3月17日,日本樂天集團高調發布Rakuten AI 3.0,官方口徑是「日本國內最大規模的高性能AI模型」,背後站着經濟產業省與NEDO聯合推進的日本國民級AI項目GENIAC,樂天集團創始人、董事長兼CEO,號稱「日本馬雲」的三木谷浩史親自站台。

結果發布不到幾個小時,就有開發者就在Rakuten AI 3.0的配置文件裏看到model_type一欄寫着 deepseek_v3。

更尷尬的是,樂天最初上傳時直接刪掉了DeepSeek的MIT許可證文件,換成自己的Apache 2.0授權。相當於把別人免費贈予所有人的東西,貼上自己標籤並且明碼標價掛牌出售。

被社區扒出來之後,才匆匆補上一個NOTICE文件承認版權歸屬於DeepSeek。

相較之下,東南亞就比較敞亮。

新加坡國家人工智能計劃AISG在SEA-LION項目,此前使用的是Meta的Llama作為基礎模型訓練,隨後改用阿里雲Qwen3-32B作為底座,推出Qwen-SEA-LION-v4。

按照阿里雲的說法,AISG往這套底座裏注入了超過1000億個東南亞語言token做後訓練,模型在SEA-HELM東南亞語言排行榜上位列開源第一。

2025年5月,馬來西亞通信部啓動號稱東南亞首個「主權AI 基礎設施」的項目,基礎模型用的是DeepSeek。這也是DeepSeek首次以國家級規模在海外部署。

印度是最有意思的對照組,因為它的兩個案例性質完全不同。

169PI推出的32B輕量模型Alpie,印度媒體稱其為「印度版DeepSeek」,結果通過開發文檔發現,怪不得叫印度DeepSeek呢,這根本就是DeepSeek R1。

該模型全稱為DeepSeek-R1-Distill-Qwen-32B,這個名稱的含義是以DeepSeek R1為教師模型,輸出高質量推理,再將其蒸餾到以Qwen為模型基座的32B學生模型上。

還有一家公司叫做Sarvam AI,拿了IndiaAI Mission一大筆算力補貼,約9.9億盧比、摺合約1100萬美元,官方口徑是「從零訓練」,可社區拆開配置一看,多頭潛在注意力、GRPO強化學習,鬧了半天,還是DeepSeek。

隨後,Sarvam AI的CEO也承認,團隊「仰慕並學習DeepSeek」。

接下來是韓國,據外媒報道,在其國家級大模型競賽——主權AI基礎模型項目(Sovereign AI Foundation Model Project)中,5支決賽隊伍裏,至少3支使用了中國的開源模型。

比如Naver隊的視覺、音頻編碼器與阿里的Qwen的特徵相似,SK電訊隊的推理代碼與DeepSeek雷同,Upstage隊部分組件乾脆直接從智譜GLM那裏複製粘貼,經調查發現,Upstage隊的項目甚至連智譜的版權標記都沒刪乾淨。

歐洲也有類似的事情。前不久才被馬斯克收購的Cursor,他們在3月發布了編程模型Composer 2,可開發者從API響應裏扒出,模型的實際ID為「kimi-k2p5-rl-0317-s515-fast」。

這才讓Cursor承認Composer 2是基於月之暗面Kimi K2.5構建的。只不過走的是Fireworks AI授權合作。

月之暗面很大氣,官方隨後發帖祝賀,稱「Kimi K2.5為Composer 2提供底座支撐」。

OpenAI前CTO米拉·穆拉迪(Mira Murati)創立的Thinking Machines也算半個。

他們7月發布的975B開源模型Inkling,官方技術文檔明說MoE架構是來自於DeepSeek-V3,

除此之外,西門子雷諾Orange都在VivaTech上公開宣佈採用「中美歐混合模型」策略。

中國的模型已悄然成為全球AI的底座。

B

最淺顯易懂的道理是便宜。

如果從零訓練自己的大模型,光是數據中心就動輒幾千萬美元。

但是像DeepSeek、Qwen這樣的模型,它是開放權重,用的是MIT許可,允許商用、允許改權重、允許本地部署。Meta的Llama雖然也是開源,但不允許大規模使用的,所以對於國家機構、大型公司來說,不可能使用Llama。

而且像是ms‑swift這樣的二次開發開源工具齊全,原生深度適配Qwen、DeepSeek、GLM,這就讓模型所對應的LoRA、QLoRA、DPO、GRPO、量化、分佈式訓練全部封裝好,一條命令完成微調和對齊。

簡單點說就像是預製菜配調料包,拿微波爐熱一下就出鍋了。

DeepSeek所採用的MoE架構,讓每個token只激活37B參數,使得實際的推理成本很低,在部署以後,整個模型的運行成本也就跟着下降。

中國開源模型「規矩」少。

各國發展AI的心態都十分擰巴,既想發展AI,又怕數據出境,還怕閉源API被掐斷。

2026年6月,白宮對Anthropic下達出口管制指令,要求暫停外國用戶訪問其最先進的Fable 5和Mythos 5,Anthropic在收到命令後,宣佈禁用這兩款模型。

禁令發布過了兩周,根據4SAPI的數據,68.4%的中大型企業客戶報告核心AI工作流效率下降,31.6%的小微開發者把部分工作負載遷到了其他模型,遷移期間平均推理費用上漲了27.3%。

還沒完,Anthropic發布禁用令以後,只給了所有用戶90分鐘進行遷移。可想而知,那些身處美國之外的用戶是多麼欲哭無淚。

歐洲企業對此尤其敏感,Llama 4的許可證甚至明確不給歐盟開發者多模態權利,而中國的MIT、Apache 2.0沒有相關的條條框框。

於是「本地可部署、權重可拿走」成了硬需求,開源陣營裏能同時滿足這些要求的,恰恰是DeepSeek、Qwen這一批中國模型。

還不止如此,中國模型恰好長在了別國的需求點上。

使用開源模型的國家往往都有小語種需求,Qwen系列預訓練覆蓋119種語言和方言,天生適配東南亞、中東這些非英語市場。

同時,DeepSeek、MiniMax M3的推理和工具調用能力比較強,符合各國「本國模型+本土Agent應用」的二次開發需求。

反過來講,這也是一場中國式的潤物無聲。

閉源廠商的模型是一種商業性質的模型,強調付費。但中國廠商的態度更像是GitHub,更願意合作。

比如,月之暗面可以把Kimi通過第三方授權給Cursor用,這種「不搶戲」的姿態,在主權敘事當道的今天,比任何市場策略都好用。

所以,與其說是中國模型成了全世界的基座了,倒不如說是「被選中」了。

C

同樣是被別人當底座,在美國,這是一門明碼標價的生意。

2026年1月12日,蘋果和谷歌官宣多年期合作,Gemini將驅動下一代Siri和蘋果的基礎模型。

價格沒有公開,外媒估算合同價格大約每年10億美元。

實際上蘋果和谷歌是存在強競爭關係的,可為了給自家語音助手裝上「大腦」,還是選擇每年向競爭對手付10億美元。

三星和谷歌之間也有合作,雖然沒有直接的現金交易,不過也有綁定。

三星的Galaxy AI的核心模型同樣也選擇了Gemini,2025年覆蓋約4億台設備,2026年的目標是翻倍到8億台,三星則是給谷歌銷售分成,並將谷歌全家桶預設為手機的默認入口。

亞馬遜和Anthropic之間的合作走的是另一種模式。

亞馬遜此前已經累計投了Anthropic 80億美元,2026年4月又宣佈先投50億,視其成果最多再投200億,潛在總額最高能到330億。

作為交換,Anthropic承諾未來10年在AWS上花掉超過1000億美元,主力模型訓練跑在亞馬遜自研的Trainium芯片上。

微軟和OpenAI之間也是如此深度綁定,微軟累計投入超過130億美元,按協議先拿走75%的利潤分成直到收回投資,之後降到49%。2026年4月27日,雙方進一步宣佈終止排他性合作,並給利潤分成設了支付上限。

Bing、Edge、M365 Copilot、GitHub Copilot,這些產品全線建立在GPT之上。

中國開源廠商,對底座生意似乎不是很感冒,他們更注重生態和標準的複利效應。

中國廠商把權重免費交了出去:不收授權費,不做利潤分成,甚至配合對方把模型包裝成本國驕傲。那麼問題來了,不收錢,圖什麼?

模型被越多國家採用,多語言能力就會因此提升。且不同國情會讓模型的使用方向不同,Agent穩定性也就越高。

當越來越多的國家把國家模型建在中國底座上,中國模型也就成了標準。比如在多模態方面,Qwen-VL早就成為了標準。

按Presenc AI對Hugging Face全站下載量的統計,Qwen3-VL-2B-Instruct是全站下載量第二高的模型,僅次於80MB的embedding模型all-MiniLM-L6-v2,也是Hugging Face唯二破億下載的模型

標準的價值,遠在授權費之上。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10