科技日报记者 华凌
近日,在2026世界人工智能大会(WAIC)展会上引发广泛关注的中关村科学城创新企业——月之暗面Kimi,在其北京办公区,即海淀区知春路京东科技大厦召开媒体沟通会。现场,企业业务负责人黄震昕围绕亮相的Kimi K3这款当前全球体量最大的开源基座模型的商业化落地路径,展开详细解读,并针对算力供给压力、开源发展策略、海外同业竞争等行业热点议题作出回应。

Kimi K3拥有2.8万亿参数,依托自研KDA混合线性注意力、注意力残差等底层架构创新,搭载100万Token超长上下文窗口与原生视觉理解能力,在编程、智能体、长文本推理等场景性能跻身全球第一梯队,前端开发测评表现超越多款海外闭源头部模型,发布后迅速引发全球AI行业、科研机构与海外资本广泛关注。
黄震昕表示,不同于以往依靠后天技能堆砌的模型,K3原生具备超长距离深度推理能力,可仅凭一句话复刻完整游戏、整合二十余份研报生成图文并茂的深度分析报告,在芯片设计、金融投研、法律文书、程序开发等专业场景实现落地,多项金融评测成绩位居全球第二。
谈及模型的技术突破,他用通俗的比喻解释创新逻辑:传统大模型遵循算力、数据、参数的缩放定律,但一味堆砌算力早已遇到瓶颈。团队自研的MoonClip优化器、线性注意力等底层技术,能让同等训练数据发挥翻倍效果,把模型训练功耗降低一半,同时实现百万Token超长上下文记忆,解决了大模型长文本易遗忘、跨复杂任务执行力不足的痛点。并且依靠智能体协同校验机制,有效降低了内容幻觉问题。
针对SpaceX首席执行官埃隆·马斯克在社交平台对该模型技术论文点赞、海外同行借鉴其技术的话题,黄震昕表示,团队早在模型发布前就把核心技术全部公开,还风趣回应,欢迎对方加入2万亿参数模型的赛道同台竞技。他还表示,模型性能的提升,根源来自对Attention等经典基础架构的迭代革新,而非简单的工程优化。
月之暗面取名源自平克弗洛伊德的经典专辑《月之暗面》,企业将自身的目标比作“登月”,立志攻克AGI领域难而正确的问题。扎根于北京海淀的科创沃土,企业充分依托区域的人才集聚优势稳步发展。在商业化选择上,团队坚持“模型公司先要把基座模型做好”,不盲目跟风扎堆做智能体应用,选择反过来用C端、B端的应用场景迭代优化模型。
(受访者供图)

网友评论