科技日报记者 吴叶凡
在技能教学、比赛中,评价打分一直是个“老大难”问题。不过,随着人工智能技术发展,技能评价领域迎来了“火眼金睛”的“AI判官”。
AI技术如何影响技能评估?AI加入后如何实现人机协作?9月24日,2026年世界技能大会“AI驱动的技能评估”会议举行,多位专家就此展开分享。
为什么技能项目难评分?看看第48届世界技能大赛赛项就知道了。大赛共有64个比赛项目,分为创意艺术与时尚、运输与物流、社会与个人服务等六大类。
“技能项目千差万别,这意味着评价的‘尺子’和‘量规’非常丰富,很难让评委们给出完全一致的打分。”华东师范大学教授匡瑛说。
以车身修理项目为例,最核心的考核指标是准,选手不是修得“差不多”就行,而是要精准把握零点几毫米的修复误差。另一把“尺子”是快,选手要在规定时间内完成修理。对于酒店接待、时装技术等相关项目来说,考核标准还多了人文关怀、审美等内容。
技能操作稍纵即逝、不可重复,这就需要裁判全神贯注。正因为标准复杂、操作的“一过性”等因素,技能评价环节需要大量人员参与,耗时耗力。日常的技能教学往往难以投入大量人力资源参与评价,这也影响了技能培训效果。
人工智能技术为解决上述难题提供了新窗口。会上,华东师范大学教授袁振国介绍了职业技能智能化测评系统(以下简称“智能测评系统”)。该系统解决了传统技能评价过程中高成本、低效率的问题,由华东师范大学教育学部、智能教育研究院联合上海人工智能实验室自主研发。
匡瑛告诉记者,智能测评系统由两部分组成——记录选手动作的“眼睛”和评价选手操作的“大脑”。
然而,要让AI当一个好裁判并不容易。系统开发初期,错判现象时有发生。团队总结发现,这一方面是因为镜头难以精准而清晰地捕捉全部动作,另一方面是因为“AI幻觉”的存在,对难以识别的操作进行误判。
“因此,我们确定了人机协作模式,推动评估工作更高效、准确。”匡瑛说。在这一模式下,第一步,研发团队把复杂技能逐个拆解为小任务,请行业专家为每个小任务制定清晰可操作的评分标准。智能眼镜负责全面采集数据,系统记录学生实时操作路径、时间顺序,为后续评分奠定基础。
第二步,对照标准找证据,给出能回溯的评价结果。袁振国介绍,智能测评系统不是看一眼动作就打分,而是把画面、操作顺序、动作轨迹等信息综合起来,逐项分析。同时生成可回放、可核对的数据链条。该系统还能指出错误操作和薄弱点。如果判别中遇到难题,系统就自动提醒专家介入,避免“AI幻觉”造成错判。
智能测评系统还能实现自我学习、自我进化。“它把每一次测评记录、专家打分和行业经验沉淀成为知识库。这也让系统越用越聪明,越评越可靠。”袁振国说。
记者了解到,目前智能测评系统已推广到汽修、护理、酒店服务等日常教学评价中,与人类专家评分一致性约为80%。
会上不少专家指出,面对AI的加入,技能教师、评委要持续提高人机协作能力。“面对AI给出的结果,教师不能简单地排斥或是盲从,而要解读AI的判断逻辑,与之对话。”袁振国表示,这要求未来的技能教师、评委不仅要精通本专业,还要熟练运用AI。
不过,有专家表示,AI不是万能的,尤其是在学生的心理、情绪、职业素养等方面,还需要教师指引。因此,对学生的评价不能完全依靠AI,教师要发挥主观能动性,积极发掘学生特点,因材施教,让技术之光照亮学生成长之路,实现人工智能与技能发展的双向赋能。