Story Text
Arm(安謀)全球儲存業務負責人John Xavier Lionel周三(23日)在GMIF 2026全球記憶體產業創新高峰會上拋出重磅觀點:隨著生成式AI從雲端向終端規模落地,記憶體已不再是配角,而是直接決定AI系統能力上限的關鍵變數。
Lionel指出,AI推理的解碼(Decode)階段需要持續、高頻存取KV Cache,這意味著記憶體的容量、頻寬與資料傳輸效率,將直接決定係統響應速度與吞吐量。
更驚人的是,Token正成為AI營運成本的硬指標,以100萬台設備每天進行20次AI互動、每次產生500個Token估算,單日產生的Token量就高達100億。每一次互動背後,都對應著運算、記憶體、網路和能耗的複合成本,儲存效率每提升一點,整體開銷就能大幅下降。
面對海量的邊緣AI需求,Lionel提出清晰的工作負載分層架構:喚醒詞檢測、異常檢測等輕量級任務,適合在低功耗終端直接運行;AI助手、多模態交互等複雜任務,則由手機、PC、XR設備和機器人等高性能邊緣設備承接;行業模型與智能端服務AI服務可靠邊緣本地化;而超大模型訓練、推理使用;這種「端—邊—雲」協同,本質是把儲存壓力合理分散,避免資料在單一節點堵塞。
Lionel的演講為記憶體產業指明新方向:未來AI競爭不僅是算力之爭,更是儲存架構之爭。誰能解決邊緣側的KV Cache存取效率、降低Token成本,誰就能在AI終端浪潮中搶得先機。