不同模型廠同一家Agentic Infra,AGI時代的地基終於浮出水面

量子位
07/20

克雷西 發自 上海

量子位 | 公衆號 QbitAI

先說一件有意思的事。

就在今天的WAIC論壇上,MiniMax和階躍星辰,同時出現在了一家AI Infra公司的論壇現場,前者參加戰略合作簽約,後者發布主旨演講。

苗頭其實更早就出現了。4個月前的中關村論壇上,智譜張鵬和Kimi楊植麟就曾與這家公司聯合創始人兼CEO同框,參與圓桌論壇,並被現場點名該公司已為Kimi、智譜提供服務。

四家國產頭部基模公司,先後跟同一家AI Infra達成了深度合作。開句玩笑話——集齊四家,就可以召喚神龍了。

這家AI Infra公司,正是無問芯穹

這個身位有點像「電池領域的寧德時代」——造車的人可以「兄弟登山,各自努力」,但電池這一層,繞不開就是繞不開。無問芯穹想做的,就是大模型時代的共同選擇

問題也因此變得更有趣了:

他們到底看中了這家公司什麼?

答案要從兩頭找。

需求端,2026年推理開始反超訓練,成為AI算力消耗的主戰場,推理成本兩年降了280倍,企業的AI總支出卻沒降反升,中國日均Token調用量已經突破140萬億,一年漲了四成,需求呈指數級往上衝。

供給端卻完全是另一副面孔。物理算力的擴產邏輯還是線性的,多修幾個機房、多買幾張卡,缺口卻在三五年內都填不平。

一邊指數增長,一邊線性爬坡,中間那道口子,就是無問芯穹想站進去的位置。

更難的是,模型部署得好不好,外人很難判斷。

一個請求發下去,模型正常回復了,但輸出的精度可能已經悄悄掉了三成,這種問題常規監控查不出來。

等到用戶在業務裏察覺到不對勁,模型的招牌已經砸了。

這道看不見的門檻,纔會真正決定哪家供應商能留在牌桌上。

為什麼國產大模型優選無問芯穹?

Token經濟全面爆發以來,推理需求正在加速,算力缺口也在持續擴大。

但MaaS這門生意的門檻,比外界想象的高得多。

Kimi、智譜、MiniMax、階躍星辰為什麼都點了頭,自然有他們自己的算盤,但本質上是同時把三件事押了上去——

比如:模型效果會不會打折,成本燒不燒得起,出了問題穩不穩得住。

先說效果

前面提到的那種隱蔽滑坡,是這個行業最讓人頭疼的地方。

有第三方供應商部署模型後,精度比原廠掉了30%,客戶自己甚至察覺不到,直到業務指標開始下滑纔回頭排查。

無問芯穹在這件事上的做法,是定了一套准入測試標準。

這套標準,會從工具調用的一致性,到推理模式的精度對齊,逐項進行覈驗,每一個新模型上架前都要過這道關。

結果是,客戶無論走無問芯穹還是原廠API,體驗幾乎感覺不到差別。

再來是成本

無問芯穹在今年WAIC官宣了一項自研的硬技術——跨集群異構PD分離。

大模型推理裏的Prefill和Decode是兩個負載完全不同的階段,硬件需求也不一樣,拆開部署能讓不同類型的芯片各自幹最擅長的事。

但拆到不同機房後,會撞上一個新問題。

PD分離之後,需要在異構芯片之間用廣域網以太網傳輸KV Cache,面臨着帶寬低、延遲高的情況,等於兩個接力選手各自都跑得很出色,但在交棒的時候,卻掉了鏈子。

為此,無問芯穹首先把Decode實例設計的Radix Cache技術,創新性地遷移到了這套跨集群架構裏,讓傳輸的數據量直接降低一個數量級。

接着,他們又首創了PDD架構,把傳統的PD鏈路拆成P、RelayDecode、MainDecode三級。

遇到傳輸延遲高的請求,RelayDecode先頂上去把Token吐給用戶,用戶完全感覺不到這段實際長達數十秒的延遲,等數據傳完,再無縫切給MainDecode接手。

實測顯示,該架構在首Token延遲(TTFT)降低51.5%的同時,單Token成本可降低37.5%。

最後是穩定性

集群規模一大,故障往往藏得很深。

大模型推理背後要管理數十上百個集群,扛住全國每天上T規模的流量分發,服務器一旦宕機,靠人盯着螢幕根本來不及反應。

無問芯穹這次發布了「智算集群運維智能體系統」,能夠端到端地解決實際生產場景中的運維難題,7×24小時全天候值守,讓智算集群的運維從「人找問題」轉變為「問題找人」,和「問題自己解決」,實現了運維人效提升5倍以上,關鍵故障處理效率提升6倍。

前店後廠一中心,構建系統競爭力

三件事都解決了,僅僅只是構成了Token工廠這一層的地基。

無問芯穹真正要交出去的答卷,是把算力、Token、生產力串成一個完整的系統,對應它自己提出的那個公式——

AI生產力 = 智能資源規模 × Token轉化效率 × AI生產力轉化效率。

一中心,指的是「算力集散中心」,即Agentic Infra自主式基礎設施平台。

國產芯片生態天然碎片化,無問芯穹把散落各處的算力資源統一匯聚、彈性調度、按需利用,為模型與應用層築牢充足、穩定、可擴展的算力底座。核心目標非常明確:實現智能資源規模最大化。

這個集散中心已部署觸達37000P算力,覆蓋接入16種主流芯片

跨集群強化學習的挑戰,同樣是在這一層被啃下來的。無問芯穹認為,在Post-training的Scaling Law持續發展的當下,強化學習成為解鎖智能的關鍵。

其算力需求的硬件種類更加複雜,規模量級也更加龐大,基於異構和超大算力規模的雙重剛需,跨集群強化學習因此成為智能規模化及持續進化的新錨點,這也是無問芯穹Agentic Infra自主式基礎設施平台重點佈局與攻克的核心場景。

無問芯穹把網絡、平台、框架三層的優化貫穿到底,成功實現了跨域強化學習訓練連續一周0中斷穩定運行,讓大規模跨域強化學習不僅可以「跑得通」,還能「跑得快、跑得穩」。

未來,無問芯穹還將針對並行策略、通信融合、智能算子、極致容錯等核心技術持續深耕,將跨域計算資源的支撐規模,持續拓展至十萬卡級以上。

後廠,也就是「Token工廠」,即Agentic MaaS大模型服務平台。

這是前面講的效果、成本、穩定性三重優勢真正兌現的地方,核心思路是「在規模之上向效率要產能」,也是一整套從網關、路由到底層推理實例的完整服務技術棧,「層層可優化、處處有增量」。

在這個「工廠」裏,除了上文提到的新技術「跨集群異構PD分離架構」,無問芯穹還和多家頭部大模型公司深度合作,在真實業務場景裏持續打磨推理效率和服務穩定性,業務規模又反過來推動技術迭代得更快。

公司官宣:截至7月,無問芯穹Agentic MaaS平台的日均Token調用量,較去年12月漲了40倍。

它還與上海移動聯合打造了「天問」模型服務門戶,聯合觀猹做了一個面向開發者的「TokenDance」,對標OpenRouter。

前店,是把攢下的能力覆蓋千行百業的「AI生產力商店」,即Agentic Infra行業解決方案。

這套解決方案已覆蓋文娛遊戲、醫療健康、法律終端、能源電力等多個行業領域,把技術勢能全面轉化為各行業能用、好用、可複用的落地價值。

比如:和VAST做了3D遊戲解決方案,幫上海瑞金醫院探索醫療大模型的落地場景,給幾家律所做了AI合夥人產品,還在和南方電網琢磨智算中心的能耗預測。

在支撐千行百業智能升級的另一面,無問芯穹也持續將智能體的能力應用到AI Infra本身。

公司打造了一套基礎設施智能體蜂群,目前已包含——

  • 面向用戶的平台管家智能體系統:可以獨立解決80%日常問題,剩下20%深度問題再轉交對應垂類Agent;

  • 面向集群的運維智能體系統:讓智算集群的運維從「人找問題」轉變為「問題找人」,和「問題自己解決」。可實現運維人效提升5倍以上,關鍵故障處理效率提升6倍;

  • 面向芯片的算子生成智能體系統:可在真實編譯試錯與知識沉澱中持續自迭代,穩定交付可直接落地的高質量工業級算子。在GLM 5.2模型的實測中,對比行業基線該系統在NVIDIA旗艦卡中實現了端到端7.3%的性能提升,在AMD旗艦卡中,更帶來39%的整體性能躍升。

三塊拼在一起,前店在各行業裏攢下的經驗,會反過來優化後廠的推理策略和一中心的調度,三者互相反哺。

Token只是入口

如果只把無問芯穹理解成一家賣Token的公司,會漏掉它完整的商業模式。

「Token工廠」只是入口,它真正在鋪的,是面向Agent時代推出的「前店後廠一中心」的完整Agentic Infra戰略佈局

這些方向拼在一起,纔是它想講的完整故事。

這套故事有沒有說服力,上文提到的深度合作方是最直接的佐證。

把目光放到海外,無問芯穹對標的是Baseten、Together AI、Fireworks AI,估值都在130億到150億美元區間。

但這三家的底層都建在英偉達單一生態之上,而無問芯穹面對的是一個遠比海外碎片得多的國產芯片生態,也因此把多元異構和更完整的架構佈局,做成了自己的護城河。

回到開頭那個問題——這幾家頭部模型廠,為什麼都在Infra這件事上點了頭——答案可能並沒有那麼複雜。

懂算力、懂模型結構、懂訓推優化、懂應用場景,這四件事同時做到,就是這條賽道真正稀缺的能力。

海量資訊、精準解讀,盡在新浪財經APP

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10