Bunn (@BunnHack)MazeBench基准测试发布:最强模型得分仅13% 中发帖

MazeBench是一个规模庞大的开放世界基准测试,外形酷似错综复杂的三维迷宫,专为评估AI智能体在长时间运行的代理循环中的综合能力而设计。该基准测试的核心在于考察智能体能否具备足够的视觉空间推理能力,不仅要感知周围环境,还要制定并执行复杂的行动计划。 
MazeBench在整个世界中嵌入了大量推箱子(Sokoban)风格的解谜关卡。箱子形状各异、大小不一,智能体必须正确理解其结构,才能规划出如何加以利用。这些谜题往往需要超过一百步的长远规划,要求智能体将箱子作为工具,开辟新通道,进入迷宫的更大区域。
此外,MazeBench还引入了多种简单机制,包括电梯砖块、可切换墙壁以及冰面斜坡,旨在促使智能体进行真正意义上的三维立体思考。
开发团队在200余个房间中设置了艰巨挑战。所有谜题均经过内部测试并已验证可解,但开发者刻意不设难度上限。房间按课程式结构排列,最极端的谜题位于最深处,但即便是...