科技日报记者 张梦然
美国加州大学伯克利分校团队创建了基因组语言模型GPN-Star,可解读30亿碱基的“语法”,在识别人类遗传变异方面更快更准。该模型利用全基因组比对数据从进化中学习内容,并以远低于大型模型的计算成本完成训练。团队同步发布全基因组预测注释,供生物学家筛选优先实验的致病变异与调控元件。相关论文9日发表于《自然》杂志。

人类全基因组约30亿个碱基对中,仅1%—2%编码蛋白质,其余包含不编码的“垃圾DNA”及控制基因表达时间、位置和强度的调控序列。非编码区域与癌症、心脏病、自闭症等疾病性状相关。要对变异基因逐个开展实验不现实,GPN-Star以DNA序列为训练对象,把4种碱基A、C、G、T作为“字母”,通过模式识别学习基因组语法,预测变异致病性并标注功能性与非功能性元素。
多数基因组语言模型直接用未比对的单基因组或跨物种未比对序列训练,计算负担大。今年早些时候发布的Evo2覆盖逾10万个物种,可从零生成完整基因组,训练使用2000余块高性能NVIDIA处理器并耗时数月。GPN-Star改用以人类、小鼠、鸡、果蝇、秀丽隐杆线虫和拟南芥分别锚定的全基因组比对:算法把多物种序列与人等参照基因组对齐,突出进化中保守与变化区域。借助这种已筛选功能信号的数据,模型只需数台处理器,训练可压缩至几天甚至数小时,并减少非功能序列干扰。
人类部分使用3种以人为锚定的比对,分别对应不同进化尺度:仅其他灵长类、广义哺乳动物、更广泛的脊椎动物。研究显示,长进化尺度的比对更擅长预测蛋白质中罕见变异的影响,这类变异进化慢、跨物种保守;短进化尺度的比对更擅长预测复杂性状相关变异,例如精神分裂症风险所涉及的大量非编码突变。小鼠、鸡、果蝇、秀丽隐杆线虫与拟南芥的模型训练证明框架可迁移至其他物种。
团队表示,他们的工作目标是用生物学先验帮助模型聚焦功能元素,而非单纯扩大参数和语料。他们已发布基于模型的全基因组评分,突出可能影响性状的变异,用于优先安排致病性实验。
总编辑圈点
我们已经可以更聪明地“读”基因组。因为现在AI不是靠蛮力堆算力,而是借助进化筛选出的信息来学习。它大大降低了门槛,让更多实验室能用得起,并加速疾病变异筛查,尤其能帮助理解“垃圾DNA”在癌症、自闭症等复杂疾病中的角色。更重要的是,它向科研人员示范了一种新思路——用生物学规律引导模型,而不是只追求更大参数规模。这可能推动整个科学领域里AI应用的转变。随着这类工具普及,未来科学家也能更快锁定致病位点,缩短从基因研究到药物开发的周期,让精准医疗真正落地。

网友评论