
科技日报记者 张佳欣
在信息不完整、对手意图难以判断的情况下,人工智能(AI)如何作出可靠的战略决策?据最新一期《自然》杂志报道,来自美国麻省理工学院、卡内基梅隆大学、纽约大学和斯坦福大学的研究人员联合开发出一种AI系统,在棋盘战争游戏《西洋陆军棋》中大败顶尖人类玩家,且训练成本远低于此前的同类系统。
不完全信息问题广泛存在于现实世界。例如,金融交易者可能无法了解其他交易者的决策依据,军事行动中也可能无法完全掌握对手的位置。
《西洋陆军棋》是一种典型的双人不完全信息博弈。玩家能够看到自己的棋子,却不知道对手棋子的身份,只有双方棋子发生碰撞时,相关信息才会揭晓。由于可能的棋子配置超过1066种组合,该游戏的决策难度远高于国际象棋,因此常被用于检验AI处理隐藏信息和复杂战略决策的能力。
新开发的AI系统名为“Ataraxos”,采用“自我博弈强化学习”进行训练。系统通过与自身反复对弈,学习形成一套基础策略。与此同时,团队设计了更高效的训练算法,使系统不必尝试预测所有可能行动,从而减少训练所需的计算资源。
在实际对弈过程中,Ataraxos还会利用“决策时规划”进一步调整策略。系统通过生成模型,根据概率推测对手隐藏棋子的身份,再结合当前棋盘状态评估不同选择,最终确定下一步行动。团队认为,将生成模型用于决策时规划,是Ataraxos实现超越人类表现的关键。
测试显示,Ataraxos的表现超过此前最强的《西洋陆军棋》AI系统“深度纳什”。由“深度思维”公司于2022年开发的“深度纳什”曾在《西洋陆军棋》中达到顶尖人类玩家水平。相比之下,Ataraxos训练所使用的样本不到“深度纳什”的百分之一,自我博弈次数不到其1/30。
在与世界顶尖《西洋陆军棋》选手的比赛中,Ataraxos取得15胜1负4和的战绩;在该棋世界锦标赛与顶尖人类玩家的对决中,则取得39胜2负的成绩。而将Ataraxos应用于其他不完全信息游戏时,系统均实现了超越人类的表现,显示一定的通用性。
未来,这类AI系统或可用于辅助商业谈判、网络安全等需要在信息不完整情况下进行战略决策的场景。

网友评论