新闻正文
Arm(安谋)全球保存业务负责人John Xavier Lionel周三(23日)在GMIF 2026全球内存产业创新高峰会上抛出重磅观点:随着生成式AI从云端向终端规模落地,内存已不再是配角,而是直接决定AI系统能力上限的关键变量。
Lionel指出,AI推理的解码(Decode)阶段需要持续、高频访问KV Cache,这意味着内存的容量、带宽与数据传输效率,将直接决定系统响应速度与吞吐量。
更惊人的是,Token正成为AI营运成本的硬指针,以100万台设备每天进行20次AI交互、每次产生500个Token估算,单日产生的Token量就高达100亿。每一次交互背后,都对应着运算、内存、网络和能耗的复合成本,保存效率每提升一点,整体开销就能大幅下降。
面对海量的边缘AI需求,Lionel提出清晰的工作负载分层架构:唤醒词检测、异常检测等轻量级任务,适合在低功耗终端直接运行;AI助手、多模态交互等复杂任务,则由手机、PC、XR设备和机器人等高性能边缘设备承接;行业模型与智能端服务AI服务可靠边缘本地化;而超大模型训练、推理使用;这种「端—边—云」协同,本质是把保存压力合理分散,避免数据在单一节点堵塞。
Lionel的演讲为内存产业指明新方向:未来AI竞争不仅是算力之争,更是保存架构之争。谁能解决边缘侧的KV Cache访问效率、降低Token成本,谁就能在AI终端浪潮中抢得先机。