業(yè)界首個!記憶張量 × 商湯大裝置:國產(chǎn)GPGPU推理成本反超 A100-當(dāng)前資訊
記憶張量科技有限公司與商湯科技大裝置團隊聯(lián)合宣布,成功在國產(chǎn)GPGPU集群上實現(xiàn)了業(yè)界首個以“記憶—計算—調(diào)度”一體化為核心的PD分離商用推理集群,并在真實生產(chǎn)環(huán)境中穩(wěn)定運行。測試數(shù)據(jù)顯示,該方案綜合推理性價比達到同代英偉達A100的150%,標(biāo)志著國產(chǎn)算力體系在大模型商業(yè)化落地方面首次具備了體系級競爭力。
此次突破為國產(chǎn)算力生態(tài)找到了差異化突破路徑。PD分離從硬件優(yōu)化升級為記憶中心的設(shè)計范式。在MemOS體系中,分離架構(gòu)可延伸至行為預(yù)測、上下文規(guī)劃、記憶布局等更高維度,成為整體架構(gòu)的有機組成部分。這也預(yù)示著C端場景正式進入“記憶推理”時代。
(資料圖)
突破性能天花板
在過去一年中,“PD分離”(Prefill與Decode分離)已成為大模型推理優(yōu)化的關(guān)鍵技術(shù)方向。然而,單純依靠硬件層面的隔離,其性能提升存在天然上限。隨著DeepSeek-R1等高性能模型從B端走向C端大規(guī)模應(yīng)用,“記憶”已成為影響用戶體驗與成本結(jié)構(gòu)的核心變量。
記憶張量旗下核心產(chǎn)品MemOS作為業(yè)內(nèi)首個以記憶為中心的系統(tǒng)級基礎(chǔ)設(shè)施,創(chuàng)新性地將大模型認知結(jié)構(gòu)劃分為參數(shù)記憶、激活記憶、明文記憶三類,形成了跨時間尺度的智能調(diào)度鏈路。該系統(tǒng)能夠精細決策哪些計算應(yīng)前移至Prefill階段,哪些必須留在Decode環(huán)節(jié),以及任務(wù)的保留、降級或淘汰策略。
“只有當(dāng)PD分離與記憶結(jié)構(gòu)深度耦合,重構(gòu)‘記憶—計算—調(diào)度’整體體系,才有機會真正突破傳統(tǒng)性能上限。”記憶張量技術(shù)負責(zé)人表示。MemOS與PD分離的結(jié)合,本質(zhì)上是為高速算力通道配上了一套精密的“交通指揮系統(tǒng)”,將分離架構(gòu)的潛力發(fā)揮到極致。
從優(yōu)化技巧到推理范式
本次合作中,商湯大裝置提供了系統(tǒng)級基礎(chǔ)設(shè)施支撐,其IaaS層高效算力池與智能調(diào)度能力為模型推理提供了穩(wěn)定底座。Ignite框架則實現(xiàn)了多后端推理適配、KVCache優(yōu)化、關(guān)鍵算子加速等性能增強,形成了完整推理優(yōu)化鏈路。
算豐信息為集群提供了核心算力支持,管理所有高性能GPGPU計算資源、大規(guī)模存儲及高速互聯(lián)網(wǎng)絡(luò),確保了PD分離架構(gòu)的高效穩(wěn)定運行。
在這一聯(lián)合架構(gòu)中,MemOS的記憶體系映射為了清晰的物理分工:
P域(Prefill Domain) 成為“記憶工廠”,專注于影子上下文預(yù)測與KV Cache批量預(yù)生成,這類吞吐敏感型任務(wù)得以集中處理,不再干擾實時交互;
D域(Decode Domain) 則扮演“實時交互前臺”,專注于用戶請求解碼,確保首字生成時間(TTFT)的超低延遲;
跨節(jié)點KV Cache 通過高帶寬互聯(lián)與零拷貝路徑實現(xiàn)“即產(chǎn)即用”,MemOS的激活記憶機制與商湯大裝置的通信優(yōu)化形成互補,極大降低了傳輸開銷。
“這是一次體系級的結(jié)構(gòu)共振,”商湯大裝置架構(gòu)師指出,“PD分離為MemOS提供了高速算力通道,而MemOS則為PD分離注入了精細到記憶單元的業(yè)務(wù)調(diào)度邏輯。”
全面超越傳統(tǒng)架構(gòu)
在嚴格的生產(chǎn)級評測環(huán)境下(包括2k輸入、1k輸出、TTFT<2s的SLA約束、72小時穩(wěn)態(tài)運行),該聯(lián)合方案交出了令人矚目的成績單:
集群整體吞吐量提升75%,從基礎(chǔ)部署的107.85 tokens/s躍升至189.23 tokens/s;單卡并發(fā)能力提升20%,從每卡25.00并發(fā)提升至29.42并發(fā),顯著增強了C端高并發(fā)場景的承載能力;TTFT全程穩(wěn)定小于2秒,Decode域因職責(zé)單一化而避免了資源搶占……綜合推理性價比達到同代英偉達A100的150%,在相同負載與SLA約束下實現(xiàn)了體系級正面超越。
“這些數(shù)據(jù)表明,國產(chǎn)GPU已不再只是‘能跑大模型’的替代選項,而是真正具備了承載R1級C端業(yè)務(wù)的體系能力。”記憶張量商業(yè)化負責(zé)人說。
打造記憶原生AI基礎(chǔ)設(shè)施
基于此次成功實踐,記憶張量與商湯科技計劃在以下方向深化合作:
一方面,將圍繞更大規(guī)模國產(chǎn)GPGPU集群,構(gòu)建完整的記憶驅(qū)動流水線推理底座,形成“影子上下文—激活記憶—PD分離—多級緩存—AIOps”的可觀測、可演進基礎(chǔ)設(shè)施體系。
另一方面,雙方將在Prefill行為預(yù)測自治化、多級記憶管理、跨任務(wù)長時記憶一致性、Agent軌跡記憶等前沿方向持續(xù)探索,為伴隨式AI、具身智能及復(fù)雜任務(wù)編排提供支撐。
從更宏觀視角看,此次突破標(biāo)志著國產(chǎn)算力體系正從“參數(shù)計算”走向“記憶計算”,從“靜態(tài)推理”走向“動態(tài)流水線”,從“模型中心”走向“記憶中心”。在AI技術(shù)快速演進的下半場,國產(chǎn)算力基礎(chǔ)設(shè)施不再僅是追趕者,更有機會成為下一代推理范式的定義者之一。
原標(biāo)題:《業(yè)界首個!記憶張量 × 商湯大裝置:國產(chǎn)GPGPU推理成本反超 A100》
欄目主編:戎兵
本文作者:文匯報 沈湫莎
題圖來源:本報資料圖

焦點熱議:中國石油簽署400.16億元合同 收購三家儲氣庫公司股權(quán)