
中國大模型被「套殼」,現在已經不是新聞了,這不,前幾天又爆出來一個。
9月2日,沙特AI公司HUMAIN發布了HUMAIN M3模型,發布之初,官方直接宣稱這是「100% Saudi Model」(100% 沙特模型)。
雖說這個公司的名字可能對於我們來說有些陌生,但是M3這個字眼格外很眼熟,畢竟MiniMax才發布MiniMax M3沒過去多久。
再加上其428B總參數,23B激活參數的配置跟MiniMax M3完全相同。於是評論區很快就有人質疑:100%沙特?
發布者蘇丹·阿爾法伊菲(Sultan Alfaifi)隨後不得不親自澄清,稱HUMAIN M3是基於MiniMax旗下的M3開發的。
然而這件事放在中國AI上並非偶然事件,日本樂天用DeepSeek、新加坡國家人工智能計劃用Qwen……中國的模型已悄然成為了全球AI開發者的首選。
以前中國大模型出海,更多是賣API、賣產品,賺的是調用費和服務費。現在,它們正以一種全新的形態出擊。
是好是壞暫且不論,但毫無疑問,這是開源模型真正開始向外擴散的信號。
A
HUMAIN其實並不缺自己的模型。
2025年8月,這家由沙特主權財富基金組建的國家級AI公司,啱啱發布過ALLaM 34B,120多名AI專家、35名博士參與,在沙特境內從零訓練,主打阿拉伯語和本土文化對齊,官方當時強調的就是「從頭構建」。
可到了2026年9月發布旗艦M3的時候,沙特還是把底座押在了中國模型身上,只用自己的語料做後訓練。
正如前文所述,各國使用中國開源模型這事早就不新鮮了。
3月17日,日本樂天集團高調發布Rakuten AI 3.0,官方口徑是「日本國內最大規模的高性能AI模型」,背後站着經濟產業省與NEDO聯合推進的日本國民級AI項目GENIAC,樂天集團創始人、董事長兼CEO,號稱「日本馬雲」的三木谷浩史親自站台。
結果發布不到幾個小時,就有開發者就在Rakuten AI 3.0的配置文件裏看到model_type一欄寫着 deepseek_v3。

更尷尬的是,樂天最初上傳時直接刪掉了DeepSeek的MIT許可證文件,換成自己的Apache 2.0授權。相當於把別人免費贈予所有人的東西,貼上自己標籤並且明碼標價掛牌出售。
被社區扒出來之後,才匆匆補上一個NOTICE文件承認版權歸屬於DeepSeek。
相較之下,東南亞就比較敞亮。
新加坡國家人工智能計劃AISG在SEA-LION項目,此前使用的是Meta的Llama作為基礎模型訓練,隨後改用阿里雲Qwen3-32B作為底座,推出Qwen-SEA-LION-v4。
按照阿里雲的說法,AISG往這套底座裏注入了超過1000億個東南亞語言token做後訓練,模型在SEA-HELM東南亞語言排行榜上位列開源第一。
2025年5月,馬來西亞通信部啓動號稱東南亞首個「主權AI 基礎設施」的項目,基礎模型用的是DeepSeek。這也是DeepSeek首次以國家級規模在海外部署。
印度是最有意思的對照組,因為它的兩個案例性質完全不同。
169PI推出的32B輕量模型Alpie,印度媒體稱其為「印度版DeepSeek」,結果通過開發文檔發現,怪不得叫印度DeepSeek呢,這根本就是DeepSeek R1。
該模型全稱為DeepSeek-R1-Distill-Qwen-32B,這個名稱的含義是以DeepSeek R1為教師模型,輸出高質量推理,再將其蒸餾到以Qwen為模型基座的32B學生模型上。
還有一家公司叫做Sarvam AI,拿了IndiaAI Mission一大筆算力補貼,約9.9億盧比、摺合約1100萬美元,官方口徑是「從零訓練」,可社區拆開配置一看,多頭潛在注意力、GRPO強化學習,鬧了半天,還是DeepSeek。
隨後,Sarvam AI的CEO也承認,團隊「仰慕並學習DeepSeek」。
接下來是韓國,據外媒報道,在其國家級大模型競賽——主權AI基礎模型項目(Sovereign AI Foundation Model Project)中,5支決賽隊伍裏,至少3支使用了中國的開源模型。
比如Naver隊的視覺、音頻編碼器與阿里的Qwen的特徵相似,SK電訊隊的推理代碼與DeepSeek雷同,Upstage隊部分組件乾脆直接從智譜GLM那裏複製粘貼,經調查發現,Upstage隊的項目甚至連智譜的版權標記都沒刪乾淨。
歐洲也有類似的事情。前不久才被馬斯克收購的Cursor,他們在3月發布了編程模型Composer 2,可開發者從API響應裏扒出,模型的實際ID為「kimi-k2p5-rl-0317-s515-fast」。
這才讓Cursor承認Composer 2是基於月之暗面Kimi K2.5構建的。只不過走的是Fireworks AI授權合作。
月之暗面很大氣,官方隨後發帖祝賀,稱「Kimi K2.5為Composer 2提供底座支撐」。
OpenAI前CTO米拉·穆拉迪(Mira Murati)創立的Thinking Machines也算半個。
他們7月發布的975B開源模型Inkling,官方技術文檔明說MoE架構是來自於DeepSeek-V3,
除此之外,西門子、雷諾、Orange都在VivaTech上公開宣佈採用「中美歐混合模型」策略。
中國的模型已悄然成為全球AI的底座。
B
最淺顯易懂的道理是便宜。
如果從零訓練自己的大模型,光是數據中心就動輒幾千萬美元。
但是像DeepSeek、Qwen這樣的模型,它是開放權重,用的是MIT許可,允許商用、允許改權重、允許本地部署。Meta的Llama雖然也是開源,但不允許大規模使用的,所以對於國家機構、大型公司來說,不可能使用Llama。
而且像是ms‑swift這樣的二次開發開源工具齊全,原生深度適配Qwen、DeepSeek、GLM,這就讓模型所對應的LoRA、QLoRA、DPO、GRPO、量化、分佈式訓練全部封裝好,一條命令完成微調和對齊。
簡單點說就像是預製菜配調料包,拿微波爐熱一下就出鍋了。
DeepSeek所採用的MoE架構,讓每個token只激活37B參數,使得實際的推理成本很低,在部署以後,整個模型的運行成本也就跟着下降。
中國開源模型「規矩」少。
各國發展AI的心態都十分擰巴,既想發展AI,又怕數據出境,還怕閉源API被掐斷。
2026年6月,白宮對Anthropic下達出口管制指令,要求暫停外國用戶訪問其最先進的Fable 5和Mythos 5,Anthropic在收到命令後,宣佈禁用這兩款模型。

禁令發布過了兩周,根據4SAPI的數據,68.4%的中大型企業客戶報告核心AI工作流效率下降,31.6%的小微開發者把部分工作負載遷到了其他模型,遷移期間平均推理費用上漲了27.3%。
還沒完,Anthropic發布禁用令以後,只給了所有用戶90分鐘進行遷移。可想而知,那些身處美國之外的用戶是多麼欲哭無淚。
歐洲企業對此尤其敏感,Llama 4的許可證甚至明確不給歐盟開發者多模態權利,而中國的MIT、Apache 2.0沒有相關的條條框框。
於是「本地可部署、權重可拿走」成了硬需求,開源陣營裏能同時滿足這些要求的,恰恰是DeepSeek、Qwen這一批中國模型。
還不止如此,中國模型恰好長在了別國的需求點上。
使用開源模型的國家往往都有小語種需求,Qwen系列預訓練覆蓋119種語言和方言,天生適配東南亞、中東這些非英語市場。
同時,DeepSeek、MiniMax M3的推理和工具調用能力比較強,符合各國「本國模型+本土Agent應用」的二次開發需求。
反過來講,這也是一場中國式的潤物無聲。
閉源廠商的模型是一種商業性質的模型,強調付費。但中國廠商的態度更像是GitHub,更願意合作。
比如,月之暗面可以把Kimi通過第三方授權給Cursor用,這種「不搶戲」的姿態,在主權敘事當道的今天,比任何市場策略都好用。
所以,與其說是中國模型成了全世界的基座了,倒不如說是「被選中」了。
C
同樣是被別人當底座,在美國,這是一門明碼標價的生意。
2026年1月12日,蘋果和谷歌官宣多年期合作,Gemini將驅動下一代Siri和蘋果的基礎模型。
價格沒有公開,外媒估算合同價格大約每年10億美元。
實際上蘋果和谷歌是存在強競爭關係的,可為了給自家語音助手裝上「大腦」,還是選擇每年向競爭對手付10億美元。
三星和谷歌之間也有合作,雖然沒有直接的現金交易,不過也有綁定。
三星的Galaxy AI的核心模型同樣也選擇了Gemini,2025年覆蓋約4億台設備,2026年的目標是翻倍到8億台,三星則是給谷歌銷售分成,並將谷歌全家桶預設為手機的默認入口。
亞馬遜和Anthropic之間的合作走的是另一種模式。
亞馬遜此前已經累計投了Anthropic 80億美元,2026年4月又宣佈先投50億,視其成果最多再投200億,潛在總額最高能到330億。
作為交換,Anthropic承諾未來10年在AWS上花掉超過1000億美元,主力模型訓練跑在亞馬遜自研的Trainium芯片上。
微軟和OpenAI之間也是如此深度綁定,微軟累計投入超過130億美元,按協議先拿走75%的利潤分成直到收回投資,之後降到49%。2026年4月27日,雙方進一步宣佈終止排他性合作,並給利潤分成設了支付上限。
Bing、Edge、M365 Copilot、GitHub Copilot,這些產品全線建立在GPT之上。
中國開源廠商,對底座生意似乎不是很感冒,他們更注重生態和標準的複利效應。
中國廠商把權重免費交了出去:不收授權費,不做利潤分成,甚至配合對方把模型包裝成本國驕傲。那麼問題來了,不收錢,圖什麼?
模型被越多國家採用,多語言能力就會因此提升。且不同國情會讓模型的使用方向不同,Agent穩定性也就越高。

當越來越多的國家把國家模型建在中國底座上,中國模型也就成了標準。比如在多模態方面,Qwen-VL早就成為了標準。
按Presenc AI對Hugging Face全站下載量的統計,Qwen3-VL-2B-Instruct是全站下載量第二高的模型,僅次於80MB的embedding模型all-MiniLM-L6-v2,也是Hugging Face唯二破億下載的模型
標準的價值,遠在授權費之上。