兩周前剛說CUDA神話鬆動,SemiAnalysis轉頭讚好英偉達vLLM——AMD追趕的不只是硬件

華爾街見聞
07/14

7月13日,半導體研究機構SemiAnalysis在社交平台發布推文,高度評價英偉達在vLLM推理引擎上的性能優化成果,同時明確指出AMD在部分模型的vLLM支持上仍有較大追趕空間。

華爾街見聞提及,該機構兩周前指出,英偉達"CUDA護城河正遭緩慢侵蝕",公司最大的競爭壓力是越來越多超大規模雲廠商和AI模型公司開始採用自研ASIC,針對訓練或推理等特定場景構建專用芯片體系。

兩則判斷將AI芯片競爭的焦點從"誰的硬件更強"拉回到一個更根本的問題:在推理時代的規模化部署中,軟件生態的深度可能比單代GPU的硬件領先更具決定性。

對於每天運行數十億次推理調用的AI企業而言,"部分模型支持良好"與"所有模型穩定優化"之間的鴻溝,在規模效應下會被急劇放大。

在硬件競爭日趨白熱化、自研ASIC不斷蠶食推理份額的背景下,英偉達在推理軟件棧上的積累深度,正在成為比硬件參數更持久的競爭壁壘。

vLLM的差距是生態閉環

vLLM是當前大語言模型推理領域應用最廣泛的開源引擎。

SemiAnalysis選取vLLM作為評判基準,本身即傳遞了一個判斷,開源推理生態正在成為衡量AI芯片真實性能的關鍵戰場。

以Kimi K2.5這一千億參數級混合專家(MoE)模型為例,差距尤為突出。

英偉達GB200 NVL72通過機架級NVLink將72張GPU高速互聯,支持寬專家並行(Wide EP)達8至16的規模。

這一架構使每張GPU承載的專家權重大幅減少,HBM帶寬壓力隨之降低,All-to-All通信也得以在高速NVLink域內完成,而非經由較慢的InfiniBand網絡。

最終每GPU吞吐量可達12,000 token/s以上。相比之下,AMD MI355X在同一測試中表現明顯遜色,主要原因在於其難以實現同等規模的專家並行與機架級互聯。

在軟件層面,英偉達推出的Dynamo分佈式推理框架將vLLM深度集成,專門針對MoE模型實現了預填充與解碼分離(Disaggregated Serving)、高效KV緩存傳輸以及雙批次重疊等優化。

這套框架在NVL72上能夠充分發揮硬件潛力,而AMD方面目前仍主要依賴標準vLLM與DISAGG版本,針對超大MoE模型與寬並行場景的深度優化尚未跟上。

"部分模型"措辭背後的全覆蓋鴻溝

SemiAnalysis將AMD的落後限定在"部分模型"上,這一措辭包含兩層信息。

第一,AMD並非全面落後。在通用計算場景中,其MI系列GPU已具備一定競爭力,Meta近期簽署的鉅額採購訂單也驗證了這一點。

第二,"部分"這一限定恰恰凸顯了當前差距的實質,全面性軟件生態覆蓋的缺失。

在AI推理場景中,企業客戶追求的是穩定、可預期的部署體驗。維護兩套軟件棧以覆蓋不同模型的成本,往往是決策時的決定性因素。

AMD要完成從"部分領先"到"全面可用"的跨越,所需的軟件工程投入可能比硬件迭代更為耗時。

這不僅是寫更多驅動和適配層的問題,它意味着要在數以千計的模型架構、不斷演進的開源框架、以及分散的開發者社區中建立廣泛的兼容性和信任。

推理時代,軟件纔是真正的護城河

當AI產業重心從訓練向推理遷移,軟硬件的戰略價值正在發生結構性重估。

訓練任務集中、可控,硬件性能差距可憑資本投入彌補;推理則是分佈式、持續性的,微秒級延遲差異在每天數十億次調用中被成倍放大,直接轉化為成本結構的分化。

英偉達的軟件生態壁壘由三個層面疊加構成

  • 覆蓋約400萬開發者的CUDA工具鏈及其二十年積累;

  • 對所有主流機器學習框架的優先適配;

  • 以及cuDNN、TensorRT、NCCL等優化庫形成的深度綁定。

三者疊加產生的遷移成本,遠超任何單一硬件參數的差距。這一判斷與SemiAnalysis兩周前的分析形成呼應。

彼時,該機構指出Anthropic已形成由谷歌TPU、亞馬遜Trainium和英偉達GPU共同構成的多平台算力架構,大量Claude模型訓練運行於TPU,Claude Code推理則越來越多部署於Trainium,英偉達GPU的份額正遭自研ASIC緩慢侵蝕。

然而此次對vLLM性能的正面評價表明,英偉達在推理軟件棧深度優化上的領先幅度,並未隨硬件競爭格局的演變而同步收窄。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10