Google突破AI記憶體牆!TPU v8首度訓練、推論分流 KV Cache壓縮6倍仍不夠|壹蘋新聞網
記者 綜合報導
【記者呂承哲/台北報導】AI模型規模邁向兆級參數,運算瓶頸也從算力逐步轉向記憶體。Google供應鏈基礎設施資深總監Nikhil Cherian於SEMICON Taiwan 2026記憶體高峰論壇表示,Google已從受限於FLOPS算力,轉向受記憶體頻寬限制,記憶體更成為AI伺服器總持有成本(TCO)的主要驅動因素。為突破「記憶體牆」,Google同步從硬體、軟體及供應鏈著手,今年更首度同年推出訓練、推論兩款TPU,並透過TurboQuant演算法將KV Cache記憶體需求壓縮6倍。
Google供應鏈基礎設施資深總監Nikhil Cherian。呂承哲攝
Google供應鏈基礎設施資深總監Nikhil Cherian。呂承哲攝

Cherian指出,隨生成式AI從文字走向圖片、音訊、影片及AI Agent,運算及記憶體需求快速攀升。Google持續投資TPU等客製化加速器,從TPU v1、v6 Trillium、v7 Ironwood到最新v8,數學運算效能呈指數成長,但AI擴展能力逐漸受到實體記憶體容量及頻寬限制,「我們已正式從受FLOPS限制,轉向嚴格受到記憶體頻寬限制」。

他分析,記憶體需求爆發主要來自三大因素。首先是Gemini等模型採用混合專家模型(Mixture of Experts,MoE),將大型模型分散至數百個專家,但各專家權重仍須常駐記憶體;其次是Agentic AI讓使用者與模型互動從一次性問答,轉向持續數天甚至數月的自主多輪推理,大量上下文必須留在記憶體。

第三則是KV Cache快速膨脹,可保存已計算過的Token,避免每次生成內容時重新運算,但也會與模型權重爭奪記憶體容量。在高併發推論環境下,若昂貴處理器因等待記憶體頻寬而閒置,等同大量AI資本支出無法充分利用,使現有成本結構難以支撐生成式AI發展。

面對記憶體牆,Google今年首度將TPU硬體策略分流,同年推出訓練用TPU v8t及推論用TPU v8i。呂承哲攝
面對記憶體牆,Google今年首度將TPU硬體策略分流,同年推出訓練用TPU v8t及推論用TPU v8i。呂承哲攝

面對記憶體牆,Google今年首度將TPU硬體策略分流,同年推出訓練用TPU v8t及推論用TPU v8i。Cherian表示,業界預估2027年約80%運算需求將來自推論,預訓練僅占20%,訓練與推論的硬體需求已明顯不同。

其中,TPU v8t可將9600顆晶片串聯成單一Superpod,提供121 ExaFLOPS運算能力及2PB記憶體;推論用TPU v8i則將晶片內SRAM提高3倍至384MB,HBM容量增加50%至每顆288GB,使活躍KV Cache能留在晶片端,降低晶片外資料搬移。

軟體方面,Google從共用基礎函式庫、記憶體配置器、資料庫快取及資料處理框架著手優化,並降低Agentic AI模型記憶體使用量。Cherian並點名今年於ICLR發表的TurboQuant技術,透過KV Cache壓縮演算法,可將記憶體需求壓縮至原本六分之一,同時維持模型準確度。他笑稱,即使壓縮6倍,「對Google的企圖而言,記憶體仍然不夠」。

供應鏈方面,Google也與記憶體供應商透過長期合作共同投資產能,同時翻新退役伺服器、回收可用零組件,甚至開發特殊硬體介面轉接器,讓DDR4等舊世代記憶體導入新一代AI伺服器。

Cherian指出,Google Cloud上季營收約248億美元、年增80%,已簽約、等待部署的訂單積壓金額(backlog)更達5140億美元。即使透過軟體壓縮、TPU訓練與推論分流及零組件循環利用,Google記憶體需求仍持續攀升,未來超大規模雲端業者與供應商須深化長期合作,加速產能爬坡,共同掌握AI多年成長浪潮。

loading