存储“反客为主”,大模型推理硬件迎来反向定义时刻

2026-09-28 19:45:24 来源: 科技日报 点击数:

科技日报记者 罗云鹏

日前在深圳举办的第五届GMIF2026创新峰会上,寅谱CTO熊巍提出,大模型推理时代的核心痛点正从算力瓶颈转向存储瓶颈,业界需要考虑以存储为优先级,来反向定义推理硬件。

2023年以来,大语言模型从训练走向推理并加速商业化。熊巍表示,训练时代GPU“一枝独秀”,算法不断适配GPU架构;推理时代逻辑变了,拼的是高质量Token下的速度与成本,越贴合大模型计算模式的专用硬件,越符合降本增效的“第一性原理”。

然而,Decode阶段自回归输出,每算一个Token都要搬运大量权重,单纯堆算力解决不了带宽瓶颈。MoE模型体积庞大,单次计算却只激活少量权重,全放HBM成本过高,全放SSD又离计算单元太远。

Agent又带来新变量。熊巍说,Agent框架会向上下文注入大量内容,KV Cache迅速膨胀,如何安放成为新的存储挑战。“推理时代的很多痛点是在存储层面上。”

存储的规律是:离计算单元越近越贵,越远搬运代价越高。把模型全放进SRAM,成本注定难以在端侧落地。同时,数据没有天然的“冷与热”,如何用数学方法量化冷热,是分级存储的技术难点。一旦建模成功,系统就能预判下一阶段的“热”数据,提前从SSD预取进HBM。

对于KV Cache,CXL正成为重要扩展路线。Meta尝试通过CXL将旧服务器内存资源池化,阿里则借助CXL Switch统一管理SSD与内存,扩展KV Cache容量。另一条路径是控制器侧压缩。

熊巍表示,KV Cache本质是张量,缺乏日志数据的明显规律,往往需要先重排再压缩,因此传统SSD日志压缩技术难以直接套用。

带宽问题同样待解。“HBM够快但太贵,3D NAND技术成熟后可以通过提升并行度提高带宽。”熊巍表示,“HBF能堆叠NAND解决KV Cache与模型权重的存放,良率等问题短期内未必好解决,但想象力已经打开。”

MoE模型则给了AI SSD另一条可行路径。以千问3.5的397B模型为例,BF16精度下权重接近800G,单次计算却只激活17B参数,约30G。熊巍说,专家权重体积大、激活少,若近存计算甚至存内计算能够实现,有望省下大量搬运成本。

熊巍给出寅谱的技术路线:软件定义硬件设计。以KV为中心,就要池化多级存储、做内存语义调度;以专家为中心,硬件则是另一套思路。不同算法策略,将定义出截然不同的硬件。

责任编辑:冷媚
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览