科技日报记者 金凤
如何高效、低功耗地完成视觉信息的同步获取与词元化,是当前物理人工智能(AI)硬件领域亟需解决的关键难题。近日,南京大学教授缪峰、梁世军团队联合新加坡国立大学团队,在国际上率先研制出能够直接将光转换为词元的超低功耗新型智能视觉传感器芯片“光语芯”。该芯片生成的词元可直接输入编码器,实现图像识别。相关研究成果19日在线发表于国际学术期刊《自然·传感》。

复杂环境下物理AI的自主感知、推理与决策能力,高度依赖于边缘端设备高效运行视觉大模型的能力。然而,边缘设备由于受限于功耗与算力,难以在本地完成实时视觉认知。
“传统视觉感知链路中,光信号需经过图像传感器采集、模数转换、缓存搬运、数字分块与嵌入等多道工序,才能生成模型可处理的词元,海量冗余数据的频繁搬运导致边缘端能耗居高不下。”缪峰介绍,“我们希望在传感器中直接完成词元化,从物理层面绕过这条路径。”
此次研究中,团队率先在国际上提出,将生成词元的过程前移到传感器,在传感器中直接完成图像采集、图像分块和图像块嵌入等功能。
梁世军表示,团队研制的“光语芯”芯片由光敏存储阵列和外围寻址电路构成。团队首先基于单层二硫化钼浮栅光电晶体管,构建了光敏存储阵列。阵列中的每个像素兼具感光、存储与模拟计算三重功能。光信号写入后,以浮栅电荷形式被原位保存。外围寻址电路可选择性激活像素区域完成图像分块。对于被选中的图像块,芯片进一步施加特定的电压序列,使图像块中存储的光信息与嵌入矩阵在模拟域中完成乘加运算,输出的电流即为词元。
“我们在芯片上实现了‘光进来,词元直接出去’的物理计算,从根本上消除了数据搬运这个最大的能耗来源。”梁世军介绍,这种“物理词元化”方法使芯片从被动的图像记录仪,转变为主动的视觉语义生成器。基于“光语芯”的视觉转换架构系统的识别准确率达到87.3%,接近传统软件的识别率基线,相较传统方案,词元化阶段能效提升超10倍。
缪峰表示,这一成果从根本上颠覆了“先感光、再缓存、后计算”的串行范式,为后摩尔时代突破边缘AI算力与功耗天花板开辟了全新维度。该技术有望为具身智能、低空无人机、智能安防等领域,提供高能效、近零延迟的视觉认知基座,加速物理AI走向大规模应用。

网友评论