克雷西 發自 上海
量子位 | 公衆號 QbitAI
先說一件有意思的事。
就在今天的WAIC論壇上,MiniMax和階躍星辰,同時出現在了一家AI Infra公司的論壇現場,前者參加戰略合作簽約,後者發布主旨演講。

苗頭其實更早就出現了。4個月前的中關村論壇上,智譜張鵬和Kimi楊植麟就曾與這家公司聯合創始人兼CEO同框,參與圓桌論壇,並被現場點名該公司已為Kimi、智譜提供服務。

四家國產頭部基模公司,先後跟同一家AI Infra達成了深度合作。開句玩笑話——集齊四家,就可以召喚神龍了。
這家AI Infra公司,正是無問芯穹。
這個身位有點像「電池領域的寧德時代」——造車的人可以「兄弟登山,各自努力」,但電池這一層,繞不開就是繞不開。無問芯穹想做的,就是大模型時代的共同選擇。
問題也因此變得更有趣了:
他們到底看中了這家公司什麼?
答案要從兩頭找。
需求端,2026年推理開始反超訓練,成為AI算力消耗的主戰場,推理成本兩年降了280倍,企業的AI總支出卻沒降反升,中國日均Token調用量已經突破140萬億,一年漲了四成,需求呈指數級往上衝。
供給端卻完全是另一副面孔。物理算力的擴產邏輯還是線性的,多修幾個機房、多買幾張卡,缺口卻在三五年內都填不平。
一邊指數增長,一邊線性爬坡,中間那道口子,就是無問芯穹想站進去的位置。
更難的是,模型部署得好不好,外人很難判斷。
一個請求發下去,模型正常回復了,但輸出的精度可能已經悄悄掉了三成,這種問題常規監控查不出來。
等到用戶在業務裏察覺到不對勁,模型的招牌已經砸了。
這道看不見的門檻,纔會真正決定哪家供應商能留在牌桌上。
為什麼國產大模型優選無問芯穹?
Token經濟全面爆發以來,推理需求正在加速,算力缺口也在持續擴大。
但MaaS這門生意的門檻,比外界想象的高得多。
Kimi、智譜、MiniMax、階躍星辰為什麼都點了頭,自然有他們自己的算盤,但本質上是同時把三件事押了上去——
比如:模型效果會不會打折,成本燒不燒得起,出了問題穩不穩得住。
先說效果。
前面提到的那種隱蔽滑坡,是這個行業最讓人頭疼的地方。
有第三方供應商部署模型後,精度比原廠掉了30%,客戶自己甚至察覺不到,直到業務指標開始下滑纔回頭排查。
無問芯穹在這件事上的做法,是定了一套准入測試標準。
這套標準,會從工具調用的一致性,到推理模式的精度對齊,逐項進行覈驗,每一個新模型上架前都要過這道關。
結果是,客戶無論走無問芯穹還是原廠API,體驗幾乎感覺不到差別。
再來是成本。
無問芯穹在今年WAIC官宣了一項自研的硬技術——跨集群異構PD分離。

大模型推理裏的Prefill和Decode是兩個負載完全不同的階段,硬件需求也不一樣,拆開部署能讓不同類型的芯片各自幹最擅長的事。
但拆到不同機房後,會撞上一個新問題。
PD分離之後,需要在異構芯片之間用廣域網以太網傳輸KV Cache,面臨着帶寬低、延遲高的情況,等於兩個接力選手各自都跑得很出色,但在交棒的時候,卻掉了鏈子。
為此,無問芯穹首先把Decode實例設計的Radix Cache技術,創新性地遷移到了這套跨集群架構裏,讓傳輸的數據量直接降低一個數量級。
接着,他們又首創了PDD架構,把傳統的PD鏈路拆成P、RelayDecode、MainDecode三級。

遇到傳輸延遲高的請求,RelayDecode先頂上去把Token吐給用戶,用戶完全感覺不到這段實際長達數十秒的延遲,等數據傳完,再無縫切給MainDecode接手。
實測顯示,該架構在首Token延遲(TTFT)降低51.5%的同時,單Token成本可降低37.5%。
最後是穩定性。
集群規模一大,故障往往藏得很深。
大模型推理背後要管理數十上百個集群,扛住全國每天上T規模的流量分發,服務器一旦宕機,靠人盯着螢幕根本來不及反應。
無問芯穹這次發布了「智算集群運維智能體系統」,能夠端到端地解決實際生產場景中的運維難題,7×24小時全天候值守,讓智算集群的運維從「人找問題」轉變為「問題找人」,和「問題自己解決」,實現了運維人效提升5倍以上,關鍵故障處理效率提升6倍。
前店後廠一中心,構建系統競爭力
三件事都解決了,僅僅只是構成了Token工廠這一層的地基。
無問芯穹真正要交出去的答卷,是把算力、Token、生產力串成一個完整的系統,對應它自己提出的那個公式——
AI生產力 = 智能資源規模 × Token轉化效率 × AI生產力轉化效率。

一中心,指的是「算力集散中心」,即Agentic Infra自主式基礎設施平台。
國產芯片生態天然碎片化,無問芯穹把散落各處的算力資源統一匯聚、彈性調度、按需利用,為模型與應用層築牢充足、穩定、可擴展的算力底座。核心目標非常明確:實現智能資源規模最大化。
這個集散中心已部署觸達37000P算力,覆蓋接入16種主流芯片。

跨集群強化學習的挑戰,同樣是在這一層被啃下來的。無問芯穹認為,在Post-training的Scaling Law持續發展的當下,強化學習成為解鎖智能的關鍵。
其算力需求的硬件種類更加複雜,規模量級也更加龐大,基於異構和超大算力規模的雙重剛需,跨集群強化學習因此成為智能規模化及持續進化的新錨點,這也是無問芯穹Agentic Infra自主式基礎設施平台重點佈局與攻克的核心場景。
無問芯穹把網絡、平台、框架三層的優化貫穿到底,成功實現了跨域強化學習訓練連續一周0中斷穩定運行,讓大規模跨域強化學習不僅可以「跑得通」,還能「跑得快、跑得穩」。

未來,無問芯穹還將針對並行策略、通信融合、智能算子、極致容錯等核心技術持續深耕,將跨域計算資源的支撐規模,持續拓展至十萬卡級以上。
後廠,也就是「Token工廠」,即Agentic MaaS大模型服務平台。
這是前面講的效果、成本、穩定性三重優勢真正兌現的地方,核心思路是「在規模之上向效率要產能」,也是一整套從網關、路由到底層推理實例的完整服務技術棧,「層層可優化、處處有增量」。
在這個「工廠」裏,除了上文提到的新技術「跨集群異構PD分離架構」,無問芯穹還和多家頭部大模型公司深度合作,在真實業務場景裏持續打磨推理效率和服務穩定性,業務規模又反過來推動技術迭代得更快。

公司官宣:截至7月,無問芯穹Agentic MaaS平台的日均Token調用量,較去年12月漲了40倍。
它還與上海移動聯合打造了「天問」模型服務門戶,聯合觀猹做了一個面向開發者的「TokenDance」,對標OpenRouter。
前店,是把攢下的能力覆蓋千行百業的「AI生產力商店」,即Agentic Infra行業解決方案。
這套解決方案已覆蓋文娛遊戲、醫療健康、法律終端、能源電力等多個行業領域,把技術勢能全面轉化為各行業能用、好用、可複用的落地價值。
比如:和VAST做了3D遊戲解決方案,幫上海瑞金醫院探索醫療大模型的落地場景,給幾家律所做了AI合夥人產品,還在和南方電網琢磨智算中心的能耗預測。
在支撐千行百業智能升級的另一面,無問芯穹也持續將智能體的能力應用到AI Infra本身。

公司打造了一套基礎設施智能體蜂群,目前已包含——
面向用戶的平台管家智能體系統:可以獨立解決80%日常問題,剩下20%深度問題再轉交對應垂類Agent;
面向集群的運維智能體系統:讓智算集群的運維從「人找問題」轉變為「問題找人」,和「問題自己解決」。可實現運維人效提升5倍以上,關鍵故障處理效率提升6倍;
面向芯片的算子生成智能體系統:可在真實編譯試錯與知識沉澱中持續自迭代,穩定交付可直接落地的高質量工業級算子。在GLM 5.2模型的實測中,對比行業基線該系統在NVIDIA旗艦卡中實現了端到端7.3%的性能提升,在AMD旗艦卡中,更帶來39%的整體性能躍升。
三塊拼在一起,前店在各行業裏攢下的經驗,會反過來優化後廠的推理策略和一中心的調度,三者互相反哺。
Token只是入口
如果只把無問芯穹理解成一家賣Token的公司,會漏掉它完整的商業模式。
「Token工廠」只是入口,它真正在鋪的,是面向Agent時代推出的「前店後廠一中心」的完整Agentic Infra戰略佈局。
這些方向拼在一起,纔是它想講的完整故事。
這套故事有沒有說服力,上文提到的深度合作方是最直接的佐證。
把目光放到海外,無問芯穹對標的是Baseten、Together AI、Fireworks AI,估值都在130億到150億美元區間。
但這三家的底層都建在英偉達單一生態之上,而無問芯穹面對的是一個遠比海外碎片得多的國產芯片生態,也因此把多元異構和更完整的架構佈局,做成了自己的護城河。
回到開頭那個問題——這幾家頭部模型廠,為什麼都在Infra這件事上點了頭——答案可能並沒有那麼複雜。
懂算力、懂模型結構、懂訓推優化、懂應用場景,這四件事同時做到,就是這條賽道真正稀缺的能力。