快科技9月11日消息,高通在其官網介紹了全新一代NPU,即Hexagon NPU,這款NPU專為下一代AI智能體打造。
據悉,高通第六代驍龍8至尊版系列引入了全新的Hexagon NPU和兩項關鍵特性,包括全新Element Accelerator和更大的共享內存系統。
Element Accelerator專為賦能當今生成式AI和智能體AI的Transformer工作負載而打造。結合向量計算單元和標量計算單元,它能夠加速大模型中最關鍵的運算,幫助智能體更快地響應、更高效地推理,並在保證移動端能效的前提下,提供更豐富的體驗。
同樣重要的是,Hexagon NPU大幅擴展了大容量共享內存。通過讓多模型狀態、上下文信息和KV-cache數據存儲在更靠近加速器的位置,該平台能夠緩解內存瓶頸,讓智能體在處理更長上下文、調用更多工具以及執行更多併發任務時,始終保持流暢響應。
上述技術創新共同定義了新一代Hexagon NPU的角色,即直接在終端側運行更多智能體AI體驗。
Element Accelerator、向量與標量擴展單元和更大的共享內存,組成一套協同架構,助力NPU加速Transformer工作負載、處理控制邏輯複雜的智能體任務.
並將更多上下文數據保留在靠近計算單元的位置。值得注意的是,Hexagon NPU同樣面向下一代模型架構而打造。
高通表示,公司正與領先的內存和模型廠商合作,引入混合專家模型(Mixture-of-Experts,MoE)構建新一代終端側AI架構。這意味着一個300億參數的MoE模型在保持數百億參數可用的同時,在NPU上每次生成一個詞元僅需激活約30億個被路由選中的參數。
與每次推理都需要更大部分網絡參與的密集模型不同,MoE會根據輸入動態選擇專用專家網絡,從而減少實際計算負載和內存帶寬需求。
結合智能的專家模塊閃存到內存加載管理機制與緩存技術,這種方法能夠以低功耗和低內存需求的方式實現更大模型級別的AI體驗,為智能手機帶來響應迅速且注重隱私保護的生成式AI。
混合專家模型通過選擇性激活專用專家網絡,能夠提升效率和質量,無需每次請求都調用整個模型。
