【问题标题】:Evaluate different poker strategies评估不同的扑克策略
【发布时间】:2018-08-25 21:40:35
【问题描述】:

不确定 SO 是否适合提出这个问题,但无论如何我都会尝试。

我正在玩神经网络和扑克,我面临的问题是如何评估不同的玩家。我所说的扑克变体是 6 名玩家的无限德州扑克。有没有比模拟 X(从几十万到几百万)手牌更好的方法来找出玩家的准确(或至少以某种方式准确)胜率?问题是模拟百万手有点费时,因为每一步都意味着计算神经网络输出。生成所有可能的牌面和牌面选项似乎不是一个好主意,因为它们有很多。

有没有可能做得更好?

【问题讨论】:

  • 这些试炼只是一次性的吗?也就是说,模型没有考虑到对手的打法、历史等等。 ?由于扑克程序中几乎所有的优势都来自于玩家间的策略,我还不确定你所说的“胜率”是什么意思 [原文如此]。
  • 对不起,应该澄清一下。我的意思是每个玩家平均每手赢/输多少筹码。所以如果玩家 A 在玩了 100 手后赢了 1000 筹码,那么他的胜率就是每手 10 筹码

标签: algorithm neural-network brute-force poker


【解决方案1】:

总结:

  • 无论如何您都不想直接计算此指标。
  • 您将无法以当前的计算能力模拟所有可能的手。

主要的问题是变量的数量:你不仅有六张两牌手和五张连续的上牌,而且你必须处理五种外国下注策略。除非您知道所有这些策略的详细信息,否则您无法直接计算概率平均结果。

假设您也有自适应策略,那么这些自适应会增加计算的复杂性,因此 100 手试验必须考虑所玩手牌的序列 - 的“大爆炸”组合爆炸。


因此,我们似乎受困于蒙特卡罗方法(例如随机抽样)。尝试一些试验,看看你需要多少试验才能对你的需求进行合理的评估。你真的需要 10^6 手牌才能做到这一点,还是 100 或 1000 手牌会给你一个很好的近似值?如果您只是想训练和调整您的模型,我猜每 100 手牌的 20 次试验将超过您获得 99% 准确率(获胜率)所需的数量。

【讨论】:

    猜你喜欢
    • 2022-01-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-05-02
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多