科技日报记者 马爱平
近日,是石科技依托自研Meta-Infer高效推理引擎,通过纯软件优化突破算力瓶颈,让普通商用显卡性能大幅跃升,部分场景下1.5张优化后的6000D显卡即可媲美高端B300显卡,为算力降本增效提供新路径。
目前,多数非主流、国产GPU不在开源框架官方验证范围内,默认部署方案存在诸多适配缺陷:高性能算子自动降级、高速互联参数适配错位、显存与并行配置固化,导致硬件算力被严重禁锢,出现“能跑但低效”的普遍问题。
据介绍,该引擎构建四大核心优化能力,形成完整算力释放体系。通过内核补齐修复硬件与框架适配偏差,解锁静默失效的高性能算子;依托算子融合、计算通信重叠重构适配PCIe架构的通信逻辑,消解带宽瓶颈;针对模型预填充、内容生成阶段实施差异化并行显存调优,适配不同业务场景;搭载风险感知缓存复用机制,在不损失生成质量的前提下减少重复计算。
实测数据显示,这套优化方案效果显著。在DeepSeek-V4.1-Flash模型推理任务中,8卡PCIe(高速外设部件互连总线)显卡集群吞吐量从基线1932 tok/s(每秒令牌数)飙升至13274 tok/s,性能提升近7倍,同时支持百万级超长上下文。该优化方案通用性极强,GLM5.3、MiniMax H3视频生成等主流模型均实现性能翻倍,模型响应时延大幅降低、上下文承载能力显著提升。
在顶级硬件对标测试中,优化后的普通显卡大幅缩小与高端B300显卡的性能差距。视频生成场景下,经精细化调优的6000D显卡,仅需1.5台整机即可持平1台B300的吞吐能力。同时,这套优化体系完美适配国产GPU,仅优化专家任务并行提交逻辑,就实现超11%的吞吐量提升,有效破解国产算力适配难题。
业内人士表示,此次技术突破印证了算力应用的核心逻辑——软件优化决定实际算力效能。在高端算力稀缺的行业现状下,该技术打破了算力升级唯硬件论,盘活了海量存量异构算力,为大模型规模化落地、算力产业降本增效提供了低成本、可复用的新解决方案。

网友评论