三個月連融兩輪,日賣數萬億Token!獨家對話魔形智能創始人

智東西
08/10

智東西

作者 | 李水青

編輯 | 漠影

智東西8月10日報道,今日,成立兩年多的「Token超級工廠」魔形智能,再次拿到一筆新孖展。

魔形智能宣佈完成A輪孖展,本輪由毅達資本領投,並引入多家戰略資源方,老股東繼續追加投資,部分股東還進行了超比例跟投。距離該公司今年5月公布數億元Pre-A輪孖展,過去僅三個月。

三個月連融兩輪,在當前的孖展環境下並不多見。更不尋常的是這家公司的體量——成立兩年,日均Token調用量已達到數萬億級別,客戶與合作伙伴覆蓋互聯網公司、大模型廠商及各行業頭部企業

資本追逐的,是一個看起來門檻似乎在降低的市場。

DeepSeek、Kimi、GLM、MiniMax等開源模型密集發布,企業可以直接下載權重,通用推理框架也越來越成熟。有人放言,大模型推理正在變成一門「有卡就能幹」的生意。

但事實並非如此。「模型是開源的,但高效的部署方式不會全部開源。」魔形智能創始人、CEO徐凌傑告訴智東西,模型能夠運行,只代表生產出了Token;能否在大規模併發下守住延遲、吞吐、成功率成本,才決定這些Token能不能賣出去。

▲魔形智能創始人金琛(左)和徐凌傑(右)的合影

這正是Token工廠走紅的深層原因

2026年,從芯片廠商、雲服務商到運營商和AI基礎設施公司,幾乎人人都在講Token工廠的故事,大額孖展不斷。行業競爭的焦點,正從擁有多少算力,轉向每元錢、每瓦電力究竟能生產多少可用Token

魔形智能提供了一個頗具代表性的商業樣本。該公司目前每天賣出的Token已經達到數萬億級,收入已達數億元,客戶及合作伙伴包括互聯網頭部企業、大模型廠商等大B企業。其部分模型已經實現盈虧平衡,整體業務正在向規模化盈利靠近

開源模型提供了共同的原料,高效部署則決定工廠之間的產量、質量和利潤。

今年初不到三個月,魔形智能稱其業務完成了「從1到10」的擴張Token超級工廠為何突然得到資本追捧?熱門概念怎樣變成一門可以持續增長的生意?人人都能部署開源模型,真正的產業門檻又藏在哪裏?

為了探討這些問題,智東西與魔形智能兩位創始人——CEO徐凌傑、CTO金琛進行了一次深入對話。

一、模型越開放,Token工廠為什麼越受資本追捧?

Token工廠的走紅,首先源於推理需求快速膨脹

過去一年,國內開源模型從少數頭部產品一枝獨秀,轉向多家廠商密集發布。模型能力持續增強,AI編程、辦公智能體等應用也開始進入企業生產流程。模型越好用,消耗的Token越多。

徐凌傑告訴智東西,從行業公開數據和魔形智能自己的業務變化看,Token需求在半年多時間裏經歷了數倍乃至數量級增長。尤其是AI編程,已經成為國內外都較為確定的商業方向,Agent對模型的高頻、連續調用,又進一步放大了推理需求。

「對於Token工廠來說,幾乎每半年都需要實現數倍甚至一個數量級規模提升。如果沒有這樣的加速度,公司很可能會落後於市場。」徐凌傑說。

這也是魔形智能連續孖展的產業背景。

魔形智能今年5月對外公布Pre-A輪孖展,但該輪孖展實際在春節前已經確定。春節之後的幾個月裏,公司的業務又向前跨了一步。

徐凌傑將春節前的階段稱為「從0到1」。公司通過技術能力獲得首批大客戶認可,驗證了Token可以作為AI算力的高階產品形態進行大規模售賣,也更確信了能把這套商業模式做大做強。

此後的「從1到10」,意味着客戶和業務面同時擴張。魔形智能開始從一個客戶拓展到多個客戶,在同一客戶內部,又從單個模型延伸到多個模型、多個業務場景。隨着公司增加算力投入,Token銷量和收入同步上升,並出現了營收增速快於算力投入增速的跡象。

「我們投入了更多資源,業務帶來了相應比例甚至超比例的增長。投資人關心的核心問題,是資本投入能否帶來更高的回報。」徐凌傑告訴智東西。

新股東的結構也釋放出另一層信號。多家戰略資源方入局,意味着魔形智能獲得的不只有財務資金,還可能包括算力、數據中心和區域產業資源。老股東超比例跟投,則體現了早期投資者對公司下一階段增長的預期。

融來的錢很快將變成Token產能。據悉,魔形智能計劃繼續擴充算力資源和技術團隊,迭代自研推理引擎,推進國產超節點及相關硬件研發,同時覆蓋更多開源模型和AI算力芯片的組合

公司下一個目標,是將日均Token產量推向10萬億級。

開源模型的繁榮擴大了Token工廠的市場,也重新劃定了產業分工。模型權重越容易獲得,單純「擁有模型」的稀缺性越低。資本開始把注意力投向模型之後的生產環節,誰能把相同模型運行得更快、更穩、更便宜,誰就更有機會獲得客戶和利潤。

這也是魔形智能三個月內連續完成孖展的底層邏輯。

二、日均賣出萬億Token,這門生意怎麼跑通?

開源模型讓Token生產的原料變得更加充足,卻沒有自動解決生產效率問題。

一家企業擁有服務器和GPU,可以從開源社區下載模型,也可以使用通用推理框架將模型運行起來。但模型成功啓動,只代表能夠生產Token,距離把Token穩定賣給大客戶還有很長一段路。

魔形智能將開源模型、自研推理引擎、算力硬件運營系統組合起來,再把底層複雜性封裝成企業能夠直接調用的Token產品

魔形智能披露的日均數萬億Token,指客戶已經調用併產生收入的實際用量,並非部署完成後的理論產能。按照目前業務增速,公司2026年營收預計將達到數億元

其市場策略是先服務大B客戶。

大型互聯網企業對穩定性和性能的要求極高,供應商通常要經過多輪測試,才能進入正式生產環境。一旦服務質量得到驗證,客戶可能增加採購份額,並將更多模型和業務遷移到同一平台。

「從0到1,是用技術實力獲得客戶認可,把商業模式走通。從1到10,是我們有了多個客戶,並且能在一個客戶內部持續擴展模型和業務。」徐凌傑告訴智東西。

魔形智能的Token已經進入部分互聯網企業的核心業務,主要用於研發團隊日常工作、AI編程內部辦公流程。

金琛告訴智東西,科技互聯網公司的核心生產力很大一部分來自開發者。Token服務進入開發者的編程工具和研發流程,相當於直接支撐企業核心團隊的日常生產。

這類客戶對價格敏感,但質量排在價格之前。

首先要守住接口成功率。AI編程和白領辦公集中發生在工作時間,一旦接口頻繁失敗,工具就很難真正進入工作流。

其次是首Token延遲和解碼速度。如果模型遲遲沒有響應,或者生成速度跟不上人的閱讀和操作節奏,使用效率會大幅下降。金琛認為,首Token延遲超過3秒,很多企業客戶已經難以接受。

P50和P99延遲、KV Cache命中率、併發吞吐、模型精度,以及突發流量下的穩定性,也會影響客戶選擇。

「質量要求滿足之後,雙方纔會進一步談性價比。」徐凌傑說。

以某些公開的項目為例,有人使用80張桌面顯卡運行最新的大模型,單路速度只能達到每秒20個Token。模型雖然跑起來了,速度難以滿足商業場景要求,成本也很難支撐有競爭力的Token價格。

這正是Token生意的關鍵。

在部分業務場景中,算力採購和運行成本可以佔Token總成本的八成甚至九成。選擇哪種硬件運行哪種模型,怎樣切分Prefill和Decode任務,如何提高單機吞吐和集群利用率,都會直接改變毛利。

魔形智能目前已有相當比例的模型已經達到盈虧平衡模型受歡迎程度也會影響盈利水平。調用率高的模型可以充分利用算力,利用率較低的模型則更容易形成閒置。

徐凌傑在採訪中對魔形智能的盈利預期保持樂觀。他表示,國產算力芯片、國產AI基礎設施、國產大模型已經進入了協同發展的階段,國產生態的良性循環已經形成。通過堅月供入國產生態,他們已經獲得了可觀的收入。此外,他認為,AI基礎設施企業只有採取穩健的擴張策略,注重資本效率,迅速實現自我造血,才能支撐起百億營收、千億市值的成功企業。

三、部署方式不會全部開源,真正的門檻藏在超節點裏

Token工廠與傳統算力租賃、大模型API平台究竟有什麼區別?

徐凌傑認為,真正的差異來自全棧系統優化能力

模型是開源的,模型的高效部署方式並不會全部開源。」他說,簡單採購硬件並部署通用框架,往往很難實現盈利。Token吞吐、響應延遲、穩定性和硬件成本需要同時優化,這要求團隊同時理解模型、軟件、芯片、集群和供應鏈。

第一層門檻是推理引擎。

魔形智能圍繞Prefill和Decode分離、數據傳輸、內存管理、負載均衡、KV Cache感知調度及多硬件適配進行優化。

不同模型的負載特徵差異明顯。有的模型更依賴顯存帶寬,有的更依賴計算能力。長輸入短輸出和短輸入長輸出的成本結構也不同。Decode階段通常更難提升利用率,短輸入、長輸出任務的單位成本往往更高。

魔形智能會根據模型特點選擇不同硬件,也會將不同的計算任務部署到成本最合適的芯片上。其PD分離方案可以適配不同卡型和集群規模,調度系統則結合KV Cache狀態和實時負載分配請求,儘量提高緩存命中率。

對於企業客戶,彈性同樣重要。客戶不願為一個模型同時接入大量供應商,因此供應商既要具備足夠大的初始容量,也要在需求突然上升時快速擴容。

新模型發布後,魔形智能往往一至兩天、甚至Day0就可以啓動客戶接入。在引入國產芯片時,魔形智能團隊會深入分析硬件架構、遷移算子並跑出性能,迅速完成部署。

第二層門檻是超節點。

隨着模型參數和Agent任務複雜度增長,單機八卡服務器逐漸遇到顯存容量和卡間通信瓶頸。超節點將更多加速芯片通過高帶寬、低時延互聯組織起來,可以承載更大規模的並行計算。

金琛告訴智東西,人機交互場景達到每秒100至200個Token,已經能提供較流暢的體驗。複雜Agent需要連續規劃、調用工具和執行任務,未來可能追求每秒上千Token的生成速度。

「要面向Agent場景做極致優化,超節點是必須研究的硬件平台。我們的目標是達到每秒千Token。」金琛說。

魔形智能目前已有部分模型達到每秒數百Token,每秒千Token仍處於攻關階段。

更強的互聯也會帶來新的問題。

傳統八卡服務器中,一張卡發生故障,影響範圍通常侷限在單台機器。到了數十卡乃至更大規模的超節點,一顆芯片發生故障,可能干擾整個互聯域,金琛將其稱為更大的「爆炸半徑」。

因此,超節點的競爭既要拼極致性能,也要拼故障隔離容錯能力。魔形智能已經圍繞相關問題推出部分PoC產品,並在真實客戶負載中持續驗證。

「很多實驗室裏的優化可以宣稱提升40%、50%,甚至兩三倍,但放到真實業務中未必能夠落地。」金琛告訴智東西,「我們有客戶和真實場景,可以直接找到最尖銳的問題,再用較小的代價解決它。」

第三層門檻是軟硬件協同。

魔形智能已經適配多家國產及海外芯片,同時與芯片廠商、AIDC、能源和冷卻方案夥伴共同推進定製硬件。隨着模型繼續變大,硬件採購、互聯、液冷和系統集成能力對Token成本的影響還會提高。

這與徐凌傑過去20年的經歷有關。從英偉達AMD到阿里雲GPU基礎設施、壁仞科技,再到創辦魔形智能,他長期處於芯片、系統和雲計算交叉地帶。金琛則擁有高性能計算、芯片軟件棧和推理優化經驗。

徐凌傑將公司的技術演進總結為三個階段:從0到1主要依靠軟件優化,從1到10依靠規模落地精細運營能力,長期競爭則要落在軟硬件全棧協同上。

下一階段,緩存系統可能成為新的降本重點。

長上下文和Agent任務中,大量輸入內容會被重複使用。相比每次重新計算,將高頻內容寫入緩存並提高命中率,可以明顯降低算力消耗。硬件選型、模型路由和超節點架構創新,則會繼續提高單位機器的有效Token產量。

模型越大,並行規模越高,超節點的價值也會越明顯。

徐凌傑總結道,全球AI產業的競爭格局已經從單純的模型競賽轉向實際應用部署能力的比拼,作為智能時代的基礎生產要素,Token生產能力正在成為衡量每個國家AI產業發展水平和競爭力的關鍵指標。未來基於超節點硬件集群和軟硬件協同優化的算力基礎設施將會呈現完全不同的技術範式與市場格局,而牽引這一變革正是魔形智能的願景與責任所在。

結語:模型開源潮之後,Token工廠的競爭才真正開始

開源模型降低了AI應用的起點,也把競爭推向了更深的基礎設施層。

之前,客戶購買服務器、GPU卡時或算力集群,而如今他們更希望直接獲得可調用、可計量、質量穩定的Token。評價一家Token工廠的標準也隨之改變。它擁有多少張卡依然重要,更重要的是,在相同成本、功耗和服務質量下,這些卡究竟能夠生產多少有效Token。

魔形智能已經完成了第一階段驗證。日均數萬億Token實際銷量、頭部客戶和數億元收入,說明Token可以被加工成一門規模化生意。接下來的考驗仍然具有挑戰。當日均產量邁向10萬億級,模型數量、硬件類型和客戶負載將同步增加。公司能否繼續守住成功率、延遲、成本和穩定性,決定其商業閉環能否持續放大。

徐凌傑希望,魔形智能最終成為一家軟硬件全棧的AI基礎設施公司,在Token供應和超節點產業鏈中同時佔據關鍵位置。Token超級工廠的競爭,已經越過了爭奪概念定義權的階段。

真正的較量,是誰能把工廠穩定地開起來,並讓每一台機器持續產出可銷售的智能。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10