科技日报记者 李禾
近日,高效推理模型DeepSeek-V4.1-Flash正式发布。云天励飞依托自研IFWA软件栈实现该模型Day 0(零等待)快速适配,并基于真实量化权重完成全链路数值精度与执行一致性验证,以可复用的底层软件能力,适配模型全新推理机制,持续夯实国产算力软件底座。

作为DeepSeek-V4系列迭代版本,V4.1-Flash在推理架构上实现多项升级,对算力软件栈综合能力提出更高要求。本次适配IFWA秉持“能力复用、差异迭代”思路,复用5项成熟原生接口,仅新增2项接口,针对性适配模型缓存量化、Sinkhorn(一种计算方法)语义等全新特性,大幅降低新模型接入成本。

低精度模型具有体积小、速度快和省显存的优点。测试结果显示,IFWA对低精度模型的支持,从“可运行”升级为可精准加载、可正确传参数、可落地低精度计算的全链路稳定能力。
稀疏计算可减少无效运算、降低内存占用并提升算力效率。在稀疏计算领域,IFWA新增专属缓存量化接口,全面适配大模型推理加速框架DSpark草稿模型与主模型协同推理流程,覆盖Token(词元)生成、模型验证、连续自回归续写全场景,保障多轮推理状态传递与计算逻辑的高度一致性。
依托可复用的编译器、自研算子、低精度计算与测试验证体系,IFWA无须为新模型重构底层能力,就可以快速适配各类大模型架构迭代。截至目前,该软件栈已完成DeepSeek全系列、Kimi(智能助手)、Qwen(通义千问)等十余款主流先进模型适配,全面覆盖稀疏计算、MoE(混合专家模型)、投机解码、混合精度等前沿推理机制。

据介绍,未来,云天励飞将持续迭代IFWA软件栈核心能力,持续推进先进AI模型在国产GPGPU(通用图形处理器)平台的快速适配与规模化落地,持续完善国产算力软件生态,为AI产业高质量发展筑牢底层技术支撑。
(受访单位供图)

网友评论