科技日报记者 沈唯
随着人工智能不断发展,AI大模型训练、科学计算、产业智能化升级带动算力供给缺口持续扩大,传统智算中心建设往往遵循“土建先行、设备后装”的路径,整体交付周期动辄一年以上,滞后于当前AI算力爆发式增长的需求节奏。如何破解供不应求的难题?不少国产算力企业正在探索一条新路。
为有效化解大型算力基础设施建设周期长、能耗高、场景单一、扩容低效等行业痛点,太初(杭州)集成电路有限公司(以下简称“太初元碁”)日前在杭州人工智能大会暨长三角人工智能发展大会上,推出了分布式算力解决方案,通过标准化集装箱算力产品,实现24小时极速上线供算。
今年以来,AI大模型商业化加速、推理算力需求全面爆发,国产高端算力需求持续高增。工业和信息化部数据显示,截至今年6月底,我国智能算力规模达2185EFLOPS(每秒百亿亿次浮点运算),围绕算力枢纽建成70余条算力大通道,算力底座持续夯实,算力网规划建设不断加快。
太初元碁首席产品官兼高级副总裁洪源告诉记者,国产算力行业正从“可用”向“好用、高效、低碳、快速落地”全面跃迁,而算力基础设施也正由“规模扩张”转向“效能深化”。
“根据我们对市场的观察和调研,我们看到算力需求正从中心云端向全域边缘扩散,金融、能源等行业中小规模算力需求激增。”洪源介绍,新建大型智算中心耗时很长,且投入成本高,短时间内很难满足垂直行业的算力需求。分布式算力解决方案中,所有整机装配、液冷管路调试、设备检测均在工厂内标准化完成,预制化率在90%以上。整机出厂后,现场仅需接通水电、绿电即可部署落地,相较传统集群交付效率提升70%。

除了要快速部署外,“预制算力”还需要解决效能深化的问题。在“双碳”目标与新型电力系统建设背景下,算力低碳化、算电协同化是行业必然趋势。洪源表示,传统算力机房对园区配套、电力条件要求严苛,无法贴近新能源场站部署,绿电消纳能力弱、能耗偏高。太初元碁新一代预制算力集装箱实现了硬件体系全面升级,可直接部署于光伏、风电等新能源电站周边,实现绿电就地取材、就地消纳。设备搭载集成式高效液冷系统,整机PUE(电源使用效率)低至1.12,大幅降低了算力运行能耗。
“市面上多数预制算力集装箱只是简单地将通用GPU机柜集成入箱,仅能满足基础AI训练与推理,无法以高度集成化的产品形态支撑包括科学计算在内的各种计算任务需求。”洪源告诉记者,同质化的通用算力方案,难以满足科研前沿、工业仿真、生命科学、气象模拟等高精度、长周期的复杂任务需求。
太初元碁的解决方案差异化搭载SuperPod128液冷HCU(异构融合计算架构)整机柜,实现高性能计算与AI智能计算异构融合,是真正的超智一体化算力基础设施。该系统既可以支撑万亿参数大模型集中训练与推理业务,也可高效承载气象模拟、材料仿真等AI4S(人工智能驱动的科学研究)长周期科学计算任务。依托冷板式液冷散热优势,可保障设备长时间高负载稳定运行,杜绝芯片过热降频问题,大幅提升高端复杂科研任务的稳定性与效率。
洪源表示,此前,太初元碁就已携手生态伙伴就集装箱式算力产品开展了探索与验证。今年初,太初元碁联合汉腾科技在内的企业打造移动国产算力方舱,采用800伏直流供电架构,全链路能源转换效率超过98.5%。
“基于前期的探索,分布式算力解决方案已有较高的成熟度。目前我们已经接到不同垂直领域的多个客户前来洽谈咨询。可以看到,AI真正走进并赋能千行百业,为中国实体经济的发展贡献力量。以教育科研领域为例,今年我们的订单相比去年同期增幅达到26.1%,这也反映出行业对国产算力的热情持续增加。”洪源说。

网友评论