知名分析師郭明錤發文表示,就在市場已經開始相信Rubin CPX已被英偉達從產品路線圖中剔除之際,其最新的產業調研顯示,英偉達已重啓該項目,預計將於2027年第一季度(1Q27)開始生產。與先前設計相比,重啓後的Rubin CPX提供更強的預填充(prefill)性能,並對GPU規格與機架架構均作出重大改動,凸顯出英偉達對預填充解決方案的高度重視。
主要變動如下:
1.Rubin CPX GPU規格 CPX提供接近Rubin的計算性能,並匹配Rubin每顆GPU最高2,300瓦的額定功耗上限。CPX改用168GB的HBM4(Rubin為288GB,此前CPX設計為128GB的GDDR7)。
2.機架設計 新版CPX採用獨立的MGXETL機架,而非此前設計中與Rubin共用機架。客戶可根據需求選擇64、128、192或256顆CPX GPU。在單個CPX機架內,每64顆CPX GPU構成一個機架模塊(rack module),該模塊由八個計算托盤(每個托盤8顆CPX GPU)和一個交換托盤組成。
3.縱向擴展與橫向擴展 NVLink僅用於每個托盤內8顆CPX GPU之間的縱向擴展(scale-up),每顆CPX的NVLink帶寬為1–1.5TB/s(相比之下,每顆Rubin為3.6TB/s)。每個機架模塊內各托盤之間的橫向擴展(scale-out)通過Spectrum-6以太網運行,採用全銅L1鏈路。跨機架模塊的橫向擴展則由各模塊的Spectrum-6交換機經OSFP光鏈路處理。
4.工作原理 CPX必須與Vera Rubin NVL72搭配使用,英偉達建議CPX與Rubin GPU按1:1的比例配置。CPX負責預填充並構建KV緩存,隨後通過以太網RDMA將KV緩存傳輸給Rubin進行解碼(decode)。
5.產品定位:長上下文預填充場景下的單位成本最佳性能 如今超過50%的AI推理工作負載來自對輸入上下文的處理及相應KV緩存的構建。因此,CPX提供了一種更靈活、成本更低的預填充處理方式。每個八顆CPX的托盤擁有約1.34TB的HBM4,足以滿足大多數長上下文預填充工作負載及相應的KV緩存需求。