炒股就看金麒麟分析師研報,權威,專業,及時,全面,助您挖掘潛力主題機會!
晚點獨家丨智譜 API 用戶數近 700 萬,新啓用超 5 萬塊國產算力芯片
來源:晚點LatePost
相比七月初增長約 200 萬,開發者產品 ZCode 上線 1 個月用戶突破百萬。
文丨申遠
編輯丨趙磊
《晚點 LatePost 》獨家獲悉,智譜 MaaS 開放平台註冊用戶(即 API 用戶)近 700 萬,相比七月初增長約 200 萬,其中包括 2.3 萬家企業客戶,對標 Codex 的開發者產品 ZCode 上線 1 個月用戶突破百萬。
今年以來,智譜 ARR 增長 15 倍,根據我們了解,在 Kimi 和阿里新模型發布後,智譜 ARR 增速沒有受影響。有投資人透露目前 ARR 來到 20 億美元,但智譜官方已經否認,接近公司的人表示,實際數字應該更高。
若按 20 億美元口徑計算,註冊用戶當月平均在智譜開放平台花費約 160 元人民幣。
7 月 21 日,市場傳出智譜已建成規模 1 GW 的國產 AI 算力基礎設施,據《晚點 LatePost》了解,有超過 5 萬塊國產算力芯片已經啓用,以緩解日益增長的推理需求,7 月 31 日,智譜長期限售的 Coding Plan 在大幅漲價後已開放購買。
算力受限,但 Infra 效率還有很大的提升空間
ARR 迅猛增長受益於編程場景需求的快速攀升和前沿模型的強大引力。作為對比,智譜 2026 年 2 月初 GLM-5 模型發布前 ARR 約為 1 億美元左右,根據《晚點 LatePost》了解,GLM-5 發布後智譜 ARR 在短期內即實現翻倍。根據 Artificial Analysis 的評測,GLM-5 發布時位居全球第四,僅次於 Claude 當時最先進的兩款模型以及 OpenAI 的 GPT-5.2。
通過先進模型發布牽引收入抬升的劇本在中美兩國都已跑通。
Anthropic 年化收入在 2025 年底為 90 億美元,半年後已迅猛增長到 500 億美元(根據 SemiAnalysis 的測算,7 月已超過 600 億美元)。除了編程場景需求跑通之外,Anthropic 連續推出超過 OpenAI 的領先模型被認為起到重要作用。
智譜是第一個把這個劇本在中國複製的公司,類似的故事月之暗面和阿里隨後都經歷了一遍。7 月 16 日 Kimi 發布 K3,次日 API 就因過載中斷近六個小時,而 Kimi 甚至停止了新用戶註冊。8 月 3 日阿里發布 2.4 萬億參數的 Qwen3.8-Max,港股當天漲 7%,市值重回 2.4 萬億港元,從 6 月低點算起反彈超過四成。
但在 Anthropic 走通 coding 這條路之前,幾乎沒有人對算力供應瓶頸有充分的估計,甚至 Anthropic 自己也是如此。對中國大模型公司,算力緊缺更加嚴峻。
在物理硬件無法快速擴展的情況下,工程師們轉而聚焦在通過算法提升已有模型的推理效率上,特別是針對長程任務的處理——這是編程需求的痛點。
過去智譜被認為在 Infra 上缺乏經驗,但隨着 GLM-5 帶來的先發優勢,智譜在過去半年飛速彌補 Infra 效率上的短板。智譜在 7 月已完成對中科加禾的收購,在此之前,雙方已經聯合辦公了數月。
在技術博客中智譜表示,一個 Agent 幹活時平均要往模型裏塞 7 萬多 token 的上下文,遠超日常聊天內容,而通過分拆 KV 緩存,智譜和中科加禾的研究成果可以將單個推理服務吞吐隨長程任務增長而最高提升達 132%。
在另一項名為 ZCube 的大模型推理網絡架構方案中,智譜宣稱它的研究成果可以提升整個生產集群的吞吐量高達 15%,同時降低 AI 基建中交換機與光模塊需求多達三分之一。
5 月下旬,智譜推出了高速版 API,每秒生成 token 數達到 400,相比常規 API 服務速度提升約 8 倍,官方稱其 「刷新當前全球大模型廠商 API 的速度上限」。這項研究成果來自與 TileRT 團隊的合作,後者與 TileLang 來自同一團隊——就是那份廣為流傳的梁文鋒講話裏,被認為有潛力瓦解英偉達 CUDA 護城河的編程語言。
不少研究員都同意, Infra 上值得優化的東西實在太多。6 月 9 日,TileRT 團隊又公布了與小米合作的成果,把 MiMo-V2.5-Pro 這個擁有 1 萬億參數的模型的速度推到了 1000 token/s。
隨着編程需求的爆發,智譜新模型訓練也越來越朝着長程任務的方向進行,同時在模型架構上儘可能照顧推理的需求,TileRT 在介紹與智譜合作的那篇博客上,把它列為下一階段的任務:模型、編譯器與硬件開始重新耦合。
5.2 的幾項核心架構改動,幾乎都在圍繞推理成本設計。技術報告公開的包括 IndexShare——通過複用稀疏注意力層的索引器把百萬 token 場景下單位 token 的計算量降低 2.9 倍;以及改進後的 MTP 草稿層,接受長度提升 20%,生成速度隨之快約兩成。
後訓練階段,智譜重新採用了 PPO(Proximal Policy Optimization,近端策略優化),並配套了名為 SAO (Single-rollout Asynchronous Optimization,單軌跡異步優化)的異步方法,讓每條任務跑完立刻進入學習——行業方法通常在約一百六十步就崩潰的地方,它穩定訓練了一千步;自研框架 slime 則能在約兩天裏把十幾個專家模型合併成一個。
技術報告中沒有公開的是推理引擎層面的配套改造,所有這些優化的最終結果是一張歸一化圖,如果把 GLM-5.1 處理 3.2 萬 token 上下文時的吞吐看作基準的話,20 萬上下文長度時,GLM-5.2 的吞吐能力為 4.7 倍,而 GLM-5.1 則為 2.77 倍,幾乎高了 70%。

圖片來源:智譜 GLM-5.2 技術報告 https://z.ai/blog/glm-5.2
這也是目前模型公司共同的優化方向。Kimi 的 K3 在模型架構上更激進,它把四分之三的注意力層改成了所謂 「線性注意力」,相比於智譜的方法,這是一種 「有損」 的改動,帶來的好處也是立竿見影:緩存體積大幅減少,吞吐能力同步提高。
一位投資人對《晚點 LatePost》表示,Infra 層優化將是未來一兩年 AI 投資的重要主題:模型能力趨同之後,誰能把同樣的卡跑出更多 token,誰的賬就更好看。這讓 Infra 人才的薪資增長飛快,1% 的效率提升放在大規模部署的算力設備中,節省下來的錢也是天文數字。
API 毛利率持續改善,讓賣 token 變成一門好生意
一道簡單的計算題可以側面說明大模型規模化部署效率提升的空間:即使是高速版 API 的 400 tokens/s,按照 8 卡 H200 服務器的內存帶寬計算,也只用到硬件理論能力上限的四成。一位行業人士對《晚點 LatePost》估算,大模型 Infra 每輪優化仍有 15% 到 30% 的效率提升,而對智譜來說就更是如此,它本來就不以 Infra 優化見長。
這件事的商業價值比技術意義更大,讓賣 token 這件事更像一個好生意:成本端推理效率有持續的優化空間,收入端用戶需求持續增長。同時,編程的規模越來越大,項目越來越複雜,消耗的 tokens 越來越多。
智譜比別人更早看出來這是一門好生意,它是中國最早喊出 「模型即服務」 的公司, MaaS 開放平台的域名 bigmodel.cn 早在 2022 年 ChatGPT 發布之前就已經註冊,但它失誤的地方在於沒有在更早以更合適的價格鎖定更多算力——哪怕拿不出最先進的模型,僅僅有能立刻使用的算力,轉租出去也同樣是門好生意,馬斯克就是這麼做的。
目前,AI 在生產力場景的擴散程度還不夠高,因此 token 是一個純粹的增量市場。
根據《晚點 LatePost》了解到的情況,7 月中旬 Kimi 發布 K3 時,智譜 API 用戶增長情況幾乎沒有受到影響,ARR 增速也沒有放緩。當下的時間點,每一個模型廠商的增長都不是以別家的萎縮為代價。
這給了各家提價的底氣。
智譜在 7 月 31 號放開了 Coding Plan 的購買限制,除了引入積分制的計算規則之外,最引人注目的是價格上漲:推出時的入門價格每月 20 元,而現在 Lite 版已經來到 118 元一個月。
Coding Plan 本來是早期為了吸引用戶而制定的策略,當時誰都沒有料到 token 需求會井噴爆發。現在,智譜需要優先保供 API ,只能對個人用戶提價。
即便如此,按照輸入、緩存命中、輸出大約 7:2:1 的價格計算,GLM-5.2 的混合價格大約是 8.8 元/百萬 token,這顯著低於美國同性能的模型。
不同的分析機構給出了各個模型廠商 API 毛利率的估算,SemiAnalysis 估計 Anthropic API 毛利率超過 80%,The Information 的獨家報道中指出 DeepSeek 的 API 毛利率大約在 70% 到 80% 之間。據《晚點 LatePost》了解,智譜 API 毛利率在理想狀況下,於自有算力設施上運轉時可達 50% 到 60%。
這些毛利率的計算方式不涉及 API 服務的前期投入,而在大模型領域,前期投入恰恰是大頭——海量的算力採購,加上龐大的人員成本。
7 月智譜宣佈新一輪港股配售,這發生在基石投資人港股解禁的第二天,智譜股價不降反升。據一位接近智譜的人士說,整個配售認購的時間一下午就完成,最後募資超過 300 億港元。根據智譜的公告,55% 用於研發,既包括算力採買,也包括人才隊伍擴充。
API 靜態毛利率得以維持的另一個前提是模型廠商提供的智能是有區別的,模型領先纔有定價權。但許多人認為,開源會直接影響先進模型的定價權,從而影響廠商收入。
因此,不少廠商正在給開源上鎖。智譜在 GLM-5.2 上仍沿用最寬鬆的 MIT 協議,而不止一家廠商正在醞釀或推行把開源授權變成一份商業合同,條款包括:開源版本是 「殘血」 的,滿血版只在官方 API 提供;年收入超過 2000 萬美元的企業需單獨申請授權;為模型提供託管服務的第三方,定價不得低於官方 API,部分方案還要求分成,比例最高可超過 30%。
另一些人則不這麼認為。開放權重模型是免費的,理論上任何人買幾台服務器就能部署,但第三方的價格無法把模型廠商的毛利打穿,原因如前所述:模型的結構、訓練過程和推理效率日益緊密地結合在一起,第三方只能在模型之外做優化,而模型廠商則掌握最深的推理效能 know-how。
以 DeepSeek 為例,一個公開信息是,許多第三方提供的 DeepSeek 模型其效率無法達到官方宣稱的程度,而 DeepSeek 已經是相對來說對技術最開放的模型廠商了。
獨立模型廠商的短暫窗口期
大模型的機會看上去正在重新回到創業公司手裏,半年多前這一切還難以想象。Kimi 的估值徘徊在 30 億美元左右,智譜和 MiniMax 的招股書則難以論述自身商業模式的合理性:一家 85% 的收入來自項目制的本地化部署交付;一家收入依賴 C 端訂閱、二十多億元收入對應十幾億元虧損。
C 端的戰場看上去更是早已與獨立模型廠商無關:豆包砸出了國民級的用戶量,但字節每天都在以千萬計地虧錢——免費換規模的移動互聯網打法,找不到盈利閉環。
窗口期來自編程。Coding 浪潮把按 token 計費的需求真正引爆,算賬的方式徹底改變了。
根據智譜 2025 年的年報,定價提高一倍,調用量反而漲了八倍,與海外前沿模型的價差也在逐漸縮小。Kimi 比智譜更激進,K3 模型 API 輸出價為每百萬 token 15 美元,與 Claude Sonnet 5 的標準定價一模一樣。
窗口期的另一面是大廠的缺位:在長達半年的時間裏 BAT 拿不出一個第一梯隊的 coding 模型——2 月時,人們津津樂道的敘事甚至還是春節紅包大戰,而智譜在 2025 年春天就已經決定把研究方向聚焦到編程上來。
從這個角度講,窗口期甚至還在拉長,字節已宣佈不做蒸餾,等於親手放棄了短期內快速追趕前沿模型的機會。
但窗口期不會一直敞開,對沒有歷史包袱的獨立模型公司來說,更容易跟上新技術是它的優勢,但這是一場關於速度的一遍遍重複的競賽,大廠只要贏一次,整個敘事就可能重新改寫,而字節在視頻模型上已經拿出了 SOTA 的成果。如今它們對 Coding 的投入已肉眼可見地堅定。
更不用說大廠在算力採購與人力成本上的優勢。今年 5 月的財報電話會上,阿里巴巴的吳泳銘表示對算力中心的投入規模將遠超之前承諾的三年 3800 億;騰訊 2026 年第一季度經營性資本支出按年增長了 18%,按月增長了 84%,「加快了對服務器基礎設施的投資」。
與之相對照的是,獨立模型廠商至今還囿於算力瓶頸,有時甚至向潛在的對手租用算力來應付龐大的訓練和推理需求。
模型要保持在第一梯隊,這樣的投入沒有一天能停。
更重要的是, coding 的商業模式本身也在發生快速變化。越來越多的公司開始搭建所謂 「內部路由」,按照任務的複雜程度把不同價位、不同性能的模型組合起來使用。Palantir 們則在教育每一個企業客戶只用 API 而不要使用模型廠商提供的更多工具——這些工具本來是增強用戶粘性的重要環節。
Palantir 的邏輯是,模型最終會大宗商品化,而數據和工作流是企業最珍貴的資產,企業不應該把珍貴的業務數據源源不斷餵給模型廠商,等於出資供養一個終將替代自己的智能系統,因此更好的方式是把數據、業務邏輯和工作流留在公司內部,模型只是個隨時可以插拔更換的零件。
這是 toB 生意的邏輯決定的:一切為效率讓位。想在企業服務領域守住溢價,除了控制技術標準與格式、控制客戶關係,就只能提供獨一無二的服務——而大模型 API 的商業模式,看上去一條都不滿足:領先模型守住位置的時間越來越短,用戶在多個平台之間自由遷移,幾乎沒有壁壘。
假如 Scaling Law 的提升真的沒有盡頭,那意味着超級人工智能的實現,屆時值得討論的就不再是誰的毛利率高几個點了。但在 ASI 到來之前,眼下可以確定的似乎只有一件事,那就是以越來越快速度不斷刷新的頂尖模型排行榜,這似乎是大模型玩家們目前能做的唯一應對策略。
窗口還開着,算力依舊緊缺,人們依然渴望新的頂尖模型出現——最好能趕上乃至超過美國前沿的閉源模型,而下一次發布,已經排上了日程。智譜和 DeepSeek 預計都將在 8 月發布新模型,戰況會更加激烈。
題圖來源:《挽救計劃》
新浪聲明:此消息系轉載自新浪合作媒體,新浪網登載此文出於傳遞更多信息之目的,並不意味着讚同其觀點或證實其描述。文章內容僅供參考,不構成投資建議。投資者據此操作,風險自擔。