游戏王masterduel吧 关注:202,148贴子:9,363,440
  • 7回复贴,共1

核弹爆炸震惊瘫坐,原来LLM打牌已经强大了这等程度

取消只看楼主收藏回复

和小伙伴@扛把子魔王一起搞了将近一个月的基于强化学习的ygo agent的研究,过程中也烧了将近2000刀订阅的token,胜率打基于规则的winbot也到了60%,但始终很难解决泛化问题,长程任务奖励的信用分配问题也很难,导致一直在和一些奇奇怪怪的任务较劲,比如模型会反复攻击-取消-攻击-取消直到超时等等。
也参考github上开源的ygo agent的研究以及konami写的日文masterduel论文,但说实话,上限都不高,也就是勉强强于基于规则的winbot水平。
今天偶然试了下,直接接入gpt6-astra,把ygo规则卡牌效果直接喂给他让他直出和winbot打闪刀内战,这是第一次尝试,自然也不可能有任何后训练,本来只想着能证明下llm打牌是更好的方向,之后打算拿qwen做下rl后训练。
但没想到第一次就震惊到我了,下面发全流程和录像。


IP属地:北京1楼2026-09-10 21:03回复
    可以看到,gpt6在没有任何后训练和针对ygo的rl训练的前提下,自发的学会了ygo核心的规则和闪刀的技巧(我用的是老构筑,因为winbot只会这个)。
    包括对面丢g了,我方尽量不要特招。对面回合闪刀变火刀回交闪,墓地凑三魔。
    跳楼机送抓锚抓的怪,空出主要区,然后获得不能连锁的效果后再用抓锚抓对面零一解决对面。
    虎鲨拿对面灰拼水机出魔皇后出访问,其中一些很细节的链接箭头的问题也有考虑掉。
    思维链同时还考虑了如果水机被无效主区还是空着可以更优从而改变了策略。
    每一步行动都有完整的reason,真的就和人打牌一样,我们在用类似alphago类的强化学习中很难解决问题,在llm这边天然都不存在了,就是速度有点满,一局5回合打了50分钟,烧了我200刀额度的10%。


    IP属地:北京4楼2026-09-10 21:13
    收起回复
      2026-09-19 16:08:23
      广告
      不感兴趣
      开通SVIP免广告
      上面的是总结的对局流程,下面是实际模型每步看到的信息,包含了场面上的信息,可选的合法行动列表等等,以及选择的reason等等。
      也能看到prompt就是喂了ygo的规则和卡牌效果,不过我还是很难完全相信,gpt6是只靠这些前置信息就学会了并完美掌握了这么多闪刀的技巧,也可能之前有人教过被openai拿去训练了。



      IP属地:北京6楼2026-09-10 21:28
      回复
        之前搞了几周已经上千commit也训了几百个GPU时的项目基本就直接废了,当时项目里还有些遗产能复用。
        后面打算尝试用qwen27B做RL后训练试试了,不知道国模在本地能否达到类似的效果,
        不过至少指明了一条方向,llm+思维链,天然就更适合ygo这种纯文字的游戏,
        alphago/katago/muzero这条路线其实对文字类的语言游戏不太适合,虽然我们也尝试了很多把卡牌效果做embedding等尝试,但embedding不等于可解释,模型也不能天然理解卡牌的规则,所以一切只能建立在终局的奖励或者MCTS的搜索训出来的V,Q上。


        IP属地:北京8楼2026-09-10 21:33
        回复
          录像链接如下:https://www.bilibili.com/video/BV1K6YM69Eyv/?spm_id_from=333.1387.homepage.video_card.click&vd_source=9cfc116002196afa8d307b3339cc40fb
          感觉还不能说完美,但第一次裸出效果就是这样,再做一些agent工程以及让他自己总结一些prompt,应该对实力还会有进步。关键就是,人可以用可解释的语言去和agent沟通了,这点比传统的强化学习一直为一些莫名其妙的奖励费劲不知道强了多少


          IP属地:北京10楼2026-09-10 21:48
          回复
            问了下第3回合为啥要浪费风刀再出火刀的问题,结果被gpt教育了,不过gpt连这种细节都能注意到,我确实看的时候还有点奇怪


            IP属地:北京14楼2026-09-10 22:42
            回复
              补充下最后AI斩杀的思考,可以看到AI意识到对方只剩一张手牌,果断交了神宣。
              又用跳楼机送墓链装抽卡同时防灰
              之后主动意识到了存在斩杀路线,同时注意到链接箭头等一系列细节,实际gpt6在这里计算了半天,感觉就像人一样在算斩杀路线。另外,AI头一次通过思考改变了自己的斩杀路线,他本来是想苏生灰后直接通招零一。
              但他考虑到如果水机被对面灰打断的情况下主区无法空出来,改变路线先等水机通过,再通招零一,这就说明AI具备像人一样防备对面可能的手坑的能力。
              最终斩杀也没啥说的,其实人看着简单,但对于AI来说,魔皇后的位置,访问的效果选择,都有不少容易犯错的地方,但看起来这里处理得都很完美,思考也很充分。






              IP属地:北京32楼2026-09-11 09:07
              收起回复
                本地用h20部署glm5.3 flash试了下,发现效果也还行,看来有思维链的模型基本都能基于规则书+卡牌信息+模拟器就能打牌


                IP属地:北京40楼2026-09-11 14:39
                回复