语料创新生态联盟在京成立  为科学智能发展打造高质量科技语料底座

2026-09-29 20:09:55 来源: 科技日报 点击数:

科技日报记者 陆成宽

当前,人工智能正加速从“读数据”走向“做科研”。高质量科技语料,成为支撑人工智能赋能科学研究的关键底座。9月29日,以共建语料生态·共创智能未来为主题的语料创新生态联盟启动暨学术交流会在北京举行。

会上,全国性语料创新生态联盟正式启动,语料标准规范、敖仓·语料社区服务平台及英文学术期刊《人工智能语料研究》等系列成果集中发布,中国科学院文献情报中心代表敖仓·科技语料库,与语料应用关键机构、国家人工智能应用中试基地签署合作协议,推动科技语料与科研、产业应用场景加速衔接。

全国性科技语料生态加快成型

科技语料连接原始科研资源与人工智能模型,是支撑模型训练、科学推理和知识发现的重要基础。会上,中国科学院科技基础能力局局长卢方军表示,当前高价值科技资源仍较分散,标准规范、专业加工、质量评价和安全流通能力仍需加强,语料供给与模型研发、科研任务及产业场景之间需要更紧密的协同机制。这些问题难以靠单一机构解决,需要供给方、研发方、应用方共同参与。

今年7月,中国科学院牵头建设的敖仓·科技语料库在世界人工智能大会上正式发布。该语料库聚焦科学智能发展中的语料供给瓶颈,着力夯实人工智能数据基座。在此基础上,中国科学院文献情报中心发起成立全国性语料创新生态联盟,旨在打造跨机构、跨领域、跨产业链的协同平台,推动科技语料资源共建共享、协同开发和创新应用。

联盟首批50家共建单位,覆盖科研院所、科学数据与文献机构、地方政府、人工智能与数据基础设施企业、出版与知识服务机构等,贯通资源供给、技术研发、平台建设、模型训练与行业应用全链条。

联盟发起人、中国工程院院士孙凝晖表示,联盟要推动科技语料资源和加工能力的基础设施化,建设国家高质量科技语料资源的战略保障基地、国家智能就绪语料集成服务的协同枢纽。

中国科学院文献情报中心主任曲建升介绍,联盟将以任务为牵引,探索“共建、共享、共赢”协同模式,成员以资源、能力、专业、场景四类投入参与共建,重点聚焦联合共建高质量科技语料、推进智能就绪语料集成服务、深化基础设施协同、强化标准质量与可信治理、开展科学智能模型与应用场景联合验证五大任务。

服务矩阵赋能科学智能全链路

“欲筑室者,先治其基。”标准规范是保障科技语料规模化建设和高质量应用的关键基础支撑。

会上,五类42项科技语料标准集中发布,覆盖数据采集、加工处理、质量评价、标注治理、存储管理、开放共享和应用服务等全生命周期。标准采用“指导层—体系层—操作层”三级架构,包括总则、语料规范、工具平台、流程、运营服务五个子体系,对语料本体结构、分类分级、质量溯源、工具平台、加工标注、开放运营等作出规定。这些标准将率先依托联盟先行先用,并逐步上升为行业标准、国家标准。

大会还发布敖仓·语料社区服务平台。平台以“面向语料创新生态,建设开放协同的语料社区”为目标,汇聚科研机构、高校、企业、开发者等多方力量,打通正式语料与社区语料双轨供给共享渠道,在统一规范、统一接口下对外服务,并以“同标准、严审核、有认证、可溯源”机制,实现数据有来源、过程可追溯、访问有记录。同时,建立激励共建机制,让使用者、贡献者和建议者都能参与社区共建。

国际英文学术期刊《人工智能语料研究》同期宣布创刊。该刊面向科学智能新科研范式前沿,聚焦人工智能语料理论创新、技术突破、应用成效等方向,推动知识传播、成果交流和产业应用。

曲建升说,联盟将构建“一库·一刊·一会·一生态”,由敖仓·科技语料库、敖仓·语料社区服务平台及国际期刊共同组成综合立体服务体系,为打造开放协同、繁荣共生的科技语料创新生态、赋能科学智能发展提供系统性保障。

(中国科学院文献情报中心供图)

责任编辑:冷媚
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览