Kimi K3、Unlimited OCR包揽全球前二  中国开源模型吸引全球目光

2026-07-29 16:10:22 来源: 科技日报 点击数:

科技日报记者 都芃

7月27日晚,中国人工智能企业月之暗面正式将其自主研发的大模型Kimi K3的完整模型权重开源,并发布技术报告。开源后不久,Kimi K3便迅速登上国际开源AI模型社区Hugging Face总趋势榜第一,受到全球开发者热捧。值得注意的是,紧随其后的,同样是来自中国、此前已多日位列榜首的百度开源模型 Unlimited OCR,两者共同组成了中国开源模型“双子星”。

中国模型登顶并不罕见,此前已有包括DeepSeek系列模型在内的多个中国开源模型先后登顶。但Kimi K3和 Unlimited OCR 都是在发布后极短时间内便引发大量关注。Kimi K3在发布后一小时内即登顶Hugging Face趋势榜,刷新平台纪录;Unlimited OCR 则是首发即登顶Hugging Face、Github等四个榜单,并且在发布一个月后仍热度不减,二次冲上Hugging Face榜首。截至目前,Unlimited OCR 在HuggingFace的下载量已达265万。

中国开源模型包揽榜单前两位,是技术持续蓄力的结果。作为当前全球参数规模最大的开源大模型,Kimi K3采用混合专家架构,总参数量达2.8万亿,依靠自主研发的底层模型架构和一整套科学训练方法,其不仅原生支持视觉理解,具备100万词元上下文窗口,还面向软件工程、知识工作、深度研究、多模态理解等复杂任务场景进行了优化,进一步提升了大模型处理复杂任务的能力。

Unlimited OCR作为OCR(光学字符识别)领域专业模型,则推动了长文档解析技术向前迈出关键一步。过去,OCR模型面对书籍、论文、报告等长文档时,通常需要采用“逐页解析+结果拼接”的方案。但随着输出内容不断增长,模型的“瞬时记忆量”逐渐膨胀,导致推理速度和显存成本也随之增加。

针对这一行业痛点,百度提出参考滑动窗口注意力(R-SWA)机制,借鉴人类阅读和抄录长文档时的工作方式,仅保留最近一段生成内容作为“工作记忆”,而不是无限累积全部历史信息。基于这一设计,模型能够在一次前向推理中连续完成数十页文档解析,实现从第一页到最后一页的连贯输出,减少“瞬时记忆量”,使计算成本和显存占用不随输出长度持续增长。

这一突破不仅让OCR解析更快、更准,还为大模型长程推理和记忆管理提供了新的思路,更切实解决了开发者长期面临的痛点问题,这也是其发布一个月后仍能多次“霸榜”的重要原因。图灵奖获得者、著名AI科学家杨立昆还曾转发推荐该模型。

在不断贡献原创技术的同时,中国人工智能企业坚持走开源发展路线。例如,百度长期坚持开源理念,不仅是模型,其先后将PaddlePaddle深度学习框架、Apollo自动驾驶平台等系列AI创新产品开源,并将多个成熟的通用AI工程项目捐赠给国际开源基金会Apache,积极融入全球开源体系。

随着中国人工智能企业在推理、多模态、长文本、文档智能等大模型关键方向不断取得突破,并坚持开放共享的开源发展路线,中国正成为推动全球人工智能事业开放发展的重要力量。

(受访单位供图)

责任编辑:李梦一
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览