科技日报记者 崔爽
数据是人工智能时代重要的生产资料。当全球AI竞争从算法演进转向“数据质量”的比拼,一个现实命题摆在超大城市面前:海量、杂乱的原始数据,如何变成通用大模型和行业AI看得懂、用得好的“高纯度燃料”?
近日,记者走进中国电信北京公司,探访这个以数据要素赋能大模型的实践样本。
“四大基地”撕掉数据标注“低端”标签
数据标注常被外界误解为“数字流水线上的打工人”——依靠大量人工进行简单的框选与标记。在大模型时代,这种“小作坊”式的粗放模式早已无法适应极其复杂的场景需求。
“业内常说,算法决定了AI的下限,而高质量的数据才决定AI的上限。”中国电信北京公司大数据专家李翔表示。
为了给AI产业提供稳定、高质、规模化的“高能燃料”,中国电信北京公司系统化打造四大数据标注基地,将数据加工升级为“现代化精炼厂”。
坐落在北京西城的“中国数据街”智能数据标注基地是国家数据要素综合试验区(北京)的关键载体。该基地由西城区政府、中国电信北京公司等共同发起,依托自主研发的智能标注引擎,构建全链条服务能力。
把目光投向北京石景山,“京西数据标注基地”于2025年底正式启用。这是由中国电信北京公司联合多方打造的开放式数据服务中枢,致力于将数据直接转化为实体生产力。
此外,中国电信北京公司还在门头沟、山西大同搭建数据标注基地,并与门头沟区政数局、北京邮电大学等单位建设“行业数据智能标注创新中心”。
四大基地布局形成智能数据标注产能矩阵,让数据从“原材料”变成“工业化生产的标准产品”,为大模型训练提供稳定、高效、安全的“燃料”供应链。
“联合实验室”变原料为资产
如果说标注基地是“生产车间”,那么联合实验室就是精炼高纯度数据的“科技智脑”。
中国电信北京公司联合北京邮电大学共建“行业数据智能标注联合实验室”,双方针对大模型数据集海量、多源、多模态的特点,构建起从采集、存储到加工的全流程治理体系。
今年4月,在国务院国资委及北京市政数局的共同见证下,中国电信北京公司与北京数据集团联合运营的“央国企数智创新联合实验室”正式揭牌。

该实验室针对央国企数据“不敢放、打不通、难变现”的痛点,搭建了“1套共识规则体系、2级可信数据空间、N个应用场景”的总体架构。国资央企领域可信数据空间与北京城市可信数据空间分别与国家级全域节点对接,实现两大可信数据空间互联互通,进一步打造央国企数据与北京政务数据汇聚、融合的数据创新模式。
让“沉睡数据”活化为区域新动能
数据要素的真正价值,终究要落在具体的产业土壤和城市治理中。
中国电信北京公司展开“一区一策”精准赋能。如在密云区,与密云区政数局、北京国际大数据交易所三方共建“密云数据要素服务中心”,让远郊区企业也能享受数据资产化的红利。
在实体产业侧,中国电信北京公司推行的“模数共振”行动掀起一场智能化变革。如联合中交集团打造交通基建三维构件数据集,研发BIM(建筑信息模型)全流程智能辅助智能体,攻克设计效能低、合规校验难等难点。
在算力底座领域,公司还全程参与打造京算Token工厂,搭载国产自主可控算力配套,为各类科创主体开放全链条技术服务。
(主办方供图)

网友评论