8月31日,智譜發布港股上市後首份中期業績後,隨即召開「中期業績發布會」以及面向分析師的「Call back深入交流會」。兩場會議給出了財報之外的幾個關鍵信息:
ARR指引首披露:8月末ARR已達16億美元,「Call back會」上首次給出年底24億美元官方指引;
量價同步爆發:API均價提升約101%的同時,token調用量較年初增長超40倍;
毛利率目標:董祕肖磊在「Call back會」上首次給出明確毛利率方向性指引,12-18個月內奔向50%;
國產代替:GLM-5.3 Flash六天調用超過62萬億token全程跑在國產芯片上;
大客戶披露:中國前十大互聯網公司中,有4家已將GLM模型列為全球首要選擇;此前已與AWS在分發層面啓動初步合作,並表示正在與歐美兩家較大的雲服務商及獨立模型公司洽談;
技術路徑:首席科學家唐傑在業績發布會問答環節首次披露下一代模型的核心方向——「Fully Self Training」。他將其定義為模型從預訓練到後訓練全程自主進行,並能自我糾錯、自我停止。
此外,智譜董祕肖磊坦言,「今天大概16億美金相當於Anthropic在2025年3月份的水平,所以我們還落後它大概17個月的時間。但是我們已經從24個月的起步縮短了整整7個月。」
當日智譜股價小幅上漲,市場對這份首份中報的反應總體平穩。
ARR首次完整披露:年底官方指引24億美元,落後Anthropic約17個月
在「Call back交流會」上,董祕肖磊首次系統梳理了智譜ARR的完整增長路徑,並主動與Anthropic進行對標。
肖磊說,「我們只有過三次ARR的官方披露。第一次是3月31日年報時的2.5億美元,第二次是7月份的10億美元,今天是第三次——16億美元。」
他同時給出年底指引:「我們今天是第三次正式披露ARR,同時也會給一個負責任的到年底的ARR指引,我們會把這一次指引按照線性關係定在24億美元。」
肖磊坦承,智譜的ARR曲線並不平滑,呈現「脈衝式」增長,主要擾動來自算力供給的階段性錯配。他以6月底數據為例:「6月底的時候我們的ARR就是在5.3億到5.4億美金這個水平。」這一數字此前從未公開披露。
在與Anthropic的對標上,肖磊直接點出差距:「今天大概16億美金相當於Anthropic在2025年3月份的水平,所以我們還落後它大概17個月的時間。但是我們已經從24個月的起步縮短了整整7個月。」
他同時解釋了ARR與財務確認收入之間的差異,指出ARR是管理層口徑的訂單收入,並非財務意義上的確認收入,兩者之間存在分攤差異。以Anthropic為參照,其ARR與確認收入的比例大約在2:1至4:1之間,取決於觀察時點。
量價齊升:漲價沒有壓制需求,調用量較年初增長超40倍
這部分數據由肖磊在業績發布會上首次披露,call back會上進一步做了補充說明。
業績發布會上,肖磊說,API平均售價提高約101%,但token調用量較年初增長超40倍,兩者同步放大。call back會上,肖磊進一步補充:「按收入計,前十大用戶的日均調用量較年初增長了98倍。」
這個組合在商業上不尋常——價格翻倍,用量卻沒有萎縮,反而爆發。
Coding Plan的情況更極端。call back會上,肖磊披露,這款編程訂閱產品上線365天,調用量增長了234倍。關鍵背景是:上半年它實際處於限售狀態,也就是停止銷售——「直到7月份我們的算力出現了階段性的顯著改善」,才重新放開。
放開之後,套餐還漲了價。「雖然有一定的價格上漲,我們的套餐調用量在漲價之後,8月份依然增長了15倍。」肖磊說。
對此,肖磊的解釋是:收入結構的變化「不是我們主動設計的一個結果,而是模型能力本身的提升帶來的自然演進」。
毛利率目標:12-18個月內奔向50%
針對分析師對開放平台毛利率(上半年為24.6%)與海外頭部模型公司差距的追問,肖磊在call back會上給出了明確的方向性指引。
「12個月到18個月之間,我們的整個毛利的空間奔着50以上的這個價格帶寬去努力,這個肯定是我們的方向。」
他將當前毛利率偏低的原因拆解為四點:
第一,國產大集群尚處爬坡期。「新的算力基礎設施上線之後,它要經歷模型部署、流量遷移、利用率爬坡的完整過程,這個階段成本先行,收入和Token後面才慢慢填滿這個集群。」
第二,模型迭代速度快帶來切換損耗。「技術迭代越快,早期一定會有一部分的資源冗餘和遷移成本,這個是不可避免的。」
第三,Infra優化仍有空間。他透露,過去半年單位推理成本已下降約80%,但這是「模型層、系統層、組網層、芯片層共同作用的結果」,仍有進一步提升空間。
第四,產品定價結構的精細化。「旗艦模型服務高價值任務,Flash模型服務高頻普惠場景,兩者的智能路由越來越成熟,錯配會逐步減少。」
下一代基座已在訓練,唐傑詳解「Fully Self-Training」
針對高盛分析師姜廣平(Ronald Keung)關於下一代模型方向的提問,首席科學家唐傑在業績發布會上給出了迄今最為詳細的技術路線闡述。
「Scaling從沒停止,我們的目標就是做這個智能的上限,」唐傑說。他明確表示,下一代基座模型參數規模將繼續擴大,但不披露具體數字。
在技術路徑上,唐傑提出了三個方向:
一是繼續擴大基座規模,同時通過Loop Transformer等架構創新提升模型的有效推理深度,「通過loop的方式,使這個激活能夠更深度的推理,這樣的話就可以把推理成本也做的比較低」。
二是大幅加強後訓練,「我們必須想用新的一些技術的方法,包括一些工程的方法,在後訓練方面我們現在有我們的優勢」。他提到,GLM-5.3之所以效果大幅提升,關鍵在於「我們在數據環境上搭建了幾十倍的數據環境」。
三是邁向「Fully Self-Training」。唐傑將其定義為模型從預訓練到後訓練全程自主進行,並能自我糾錯、自我停止。「這個很大的挑戰最大的問題是什麼?就是這個模型它能自己判斷自己,自己能夠什麼時候停止自己,什麼時候能夠糾正自己,這其實最大的難題。」
他將這一概念與海外的RSI(Recursive Self-Improvement)對應,並表示這將是未來模型研究的重點方向。
參數策略:為何「相對剋制」,海通分析師追問獲正面回應
針對市場上「智譜只會後訓練」的質疑,以及部分競品向萬億級參數推進的背景,唐傑在業績發布會上回應海通分析師楊琳的提問時作出了正面解釋。
「這是一個選擇,」唐傑說。他指出,國內大模型訓練數據普遍在30至50萬億token區間,「在這個訓練規模下,如果我們用scaling law來探討的話,你訓特別大,它的收益並不是特別大」。
他透露,GLM-5系列所用的7440億參數基座模型是在今年1月確定的,「我們當時訓這個大小的時候,我們當時就決定了這個模型它要用半年以上」,並在此基礎上依次規劃了5.1、5.2、5.3的中訓練和後訓練路線。
「下一代的模型,我們現在其實已經開始預演它的推理,而且我們有信心下一代模型,大模型一出來的第一天,它一定就能讓大家滿量的用得上。」
用戶深度數據首次披露:前十大客戶日均調用增長98倍
業績發布會上,肖磊首次披露了一組此前未曾公開的用戶深度數據。
截至8月末,MaaS平台註冊用戶超過740萬,較年初增長144%;付費日活用戶增長603%。更值得關注的是,以收入計算的前十大用戶,本月日均調用量較年初增長了98倍。
call back會上,肖磊進一步補充:「這前十名用戶在日均調用量上,在這40萬億當中超過了15萬億,也就是接近40%的水平,」肖磊說。
他還透露,中國前十大互聯網公司中,有4家已將GLM模型列為全球首要選擇,「也就是跟海外模型相比,GLM已經成為他們的第一選擇」。
Coding Plan方面,肖磊披露,該產品上線整整365天,調用量增長了234倍,「目前已經是全球最大的編程服務之一,也是增速最快的編程服務之一」。他還透露,7月份在算力改善後重新開放限購,漲價後8月份調用量依然增長了15倍。
海外擴張:1-2個月內或有進展,堅持開源路線
針對出海業務,肖磊表示,公司正積極推進與海外CSP平台的合作,並透露「很快在1到2個月的時間內,應該會有比較好的進展來跟大家去做具體的分享」。
call back會上,他提到,此前已與AWS在分發層面啓動初步合作,並表示正在與歐美兩家較大的雲服務商及獨立模型公司洽談,「即使是開源模型,也有機會在開源的基礎上採取類似於OA的方式跟我們進行合作」。
在開源與閉源的選擇上,肖磊態度明確:「我們覺得市場足夠大,弱水三千取一瓢飲,所以不需要通過閉源的方式去換取更大的市場份額。」他將開源定位為智譜的「初衷」,甚至「某種程度上是我們的使命」。
國產芯片:從「能不能跑」到「經濟性驗證」
業績發布會還披露了一個細節:GLM-5.3 Flash在正式發布前,以匿名模型「Ox-Alpha(牛來模型)」的身份上線OpenRouter和OpenCoder進行測試,「歷史性的超大流量」——六天調用量超過62萬億token,上線首日衝至OpenRouter榜首。
這次測試的另一層意義在於算力:GLM-5.3 Flash是「第一次在超大規模真實流量中全面使用國產芯片集群提供服務的模型」。公司已實現10萬卡級國產芯片的規模化推理,單位token推理成本較年初下降80%。
智譜的董事長劉德斌在業績發布會上說:「成本曲線已經開始掌握在我們自己手裏。」
肖磊在問答環節補充,下一階段的重點不是「國產卡能不能跑」,而是「怎麼去驗證國產卡的經濟性」。他預計未來三到六個月,先進國產芯片廠商可能開始放量,異構並行計算環境有望顯著改善。