Peter_Liu (@lk67) 在 一个简单有效【并非】测试模型搜索能力,逻辑能力的方法 中发帖
前言
要想验证这两个能力,搜索能力需要测试题目可以源源不断地更新,后者需要题目的逻辑链足够复杂(长且多分支)。
巧了,游戏王卡牌游戏,就刚好满足这两个要求!不过我也仅仅会一两种卡组玩法,所幸有一个哥们很喜欢,他自己基本也用这样的方式来测试大模型,可以说一测一个准!附上鲸鱼的一个在复杂度上的一个说明:
[图片]
个人体验来说,一个卡组在有动点 (无动点的意思就是抽的很差,无法一口气召唤强力卡来进行有效的攻击或者防守)的情况下,很多卡组需要进行十几手的连锁,并且连锁的顺序也不是唯一的,通常有两三种以上,其中背后的考虑都是可以通过卡牌的效果明确其背后的战略意义的。这无疑对大模型的情报收集能力以及逻辑能力有很大的一个挑战!
更别说 K 社(游戏王母公司)为了卖卡,一直出新的卡片,来给过去的卡组添加新的玩法,使得每一两个月,一个补了新卡的卡组展开就完全不一样了!
有的佬,可能就要说了,...