POKER Q'z

訓練思考力的撲克學習 App

Product
  • 特色
  • 課程
  • Pricing
  • 評價
  • 常見問題
  • 部落格
  • 更新資訊
Tools
  • 勝率計算
  • 翻前範圍表
  • 計算底池賠率
  • MDF 計算
  • 撲克術語表
Company
  • 關於我們
  • 通知
  • 聯絡我們
Legal
  • 使用條款
  • 隱私權
  • Privacy choices
  • Refund policy
  • 特定商業交易法標示
© CLOViZ, Inc. All Rights Reserved.
從撲克開啟的賽局理論軌跡――馮·諾伊曼、納許,以及AI的進化
返回文章列表
專欄10 分鐘可讀完
1635

從撲克開啟的賽局理論軌跡――馮·諾伊曼、納許,以及AI的進化

2025年2月5日
Hikaru
Hikaru

東京大学教養学部理科一類在籍。高校時代にポーカーと出会い、現在も活動中。CLOViZ株式会社にて

目錄
  1. 前言
  2. 賽局理論是什麼?
  3. 黎明期――諾伊曼的1928年論文
  4. 《賽局理論與經濟行為》――1944年的巨著
  5. 納許登場與「納許均衡」
  6. 應用於演化生物學與經濟學的深化
  7. 撲克與賽局理論的關係――GTO這個關鍵字
  8. GTO的背景――雙人零和遊戲
  9. CFR登場――計算納許均衡的嘗試
  10. AI的進步――Libratus與Pluribus
  11. Libratus 的衝擊
  12. Pluribus 的進化
  13. 賽局理論仍是「未完成的學問」
  14. 總結與展望
  15. 結語:如何活用賽局理論

前言

打撲克的時候,是不是常聽到「GTO」或「賽局理論」這類詞彙呢?撲克是玩家之間互相爭奪籌碼的遊戲,與賽局理論有著密不可分的關係。接下來,就讓我們一起回顧賽局理論的誕生、發展,以及它與撲克的關聯。無論是第一次接觸賽局理論的人,還是透過撲克而對賽局理論產生興趣的人,希望這篇文章都能對各位有所幫助。


1. 賽局理論是什麼?

看到「賽局理論」這個名稱,或許很多人都會聯想到撲克牌、桌遊等「娛樂用遊戲」。然而,作為一門學問的「賽局理論」所處理的「遊戲」,範圍其實更廣。多位玩家在考量彼此行動的同時做出決策,試圖獲得某種「報酬(像是分數或利益)」——這種情境整體就被稱為「遊戲」。因此,它的應用範圍不只是桌遊、紙牌遊戲等娛樂,還擴及競標、企業間的價格競爭、國際關係的較勁,甚至生物的演化過程。

「賽局理論」會將這類「遊戲性」情境以數學建模,用算式表現玩家的策略與報酬,進而探討最佳策略與均衡狀態。這需要用到高深的數學方法,而最初建構這套理論的,正是20世紀上半葉的天才數學家們。約翰·馮·諾伊曼與約翰·納許——這些在多個領域奠定基礎的巨擘,在賽局理論的脈絡中同樣不可或缺。


這部分內容可以用答題來練習

在 POKER Q'z 一題一題練習實戰局面。免費開始使用。

免費試試

2. 黎明期――諾伊曼的1928年論文

追溯賽局理論的歷史,第一個被提到的名字就是約翰·馮·諾伊曼(John von Neumann)。1928年,諾伊曼以德文發表了一篇題為「論社會遊戲的理論」的劃時代論文,運用數學分析方法,將多位玩家之間交換分數的情境加以模型化。提起諾伊曼,他在量子力學的數學基礎、現代電腦架構的概念化,乃至核武開發的參與等20世紀科學技術的各個角落都留下名字,可說是「超級天才」。他留下了極其多元的成就,而其中也包括「確立賽局理論」。

1928年當時的諾伊曼,將機率型遊戲(例如輪盤、猜拳,或簡單的紙牌遊戲)做數學性的整理,並歸納了其中出現的用語與概念。例如「策略(Strategy)」「報酬(Payoff)」這類至今仍是賽局理論基礎的詞彙,在當時就已經被探討。然而,正因為過於先進,諾伊曼的想法在當時的學界並未受到太多關注。據說光聽到「用數學研究遊戲」,會判斷這件事值得認真投入的研究者其實寥寥可數。此外,論文以德文撰寫,也成為阻礙它以英語圈為中心的國際擴散的其中一個原因。


3. 《賽局理論與經濟行為》――1944年的巨著

在諾伊曼萌生構想十多年後,1944年,賽局理論終於迎來大幅躍進的轉捩點。那就是他與經濟學家奧斯卡·摩根斯坦(Oskar Morgenstern)合著出版的《賽局理論與經濟行為(Theory of Games and Economic Behavior)》。這是一部超過600頁的鉅作,諾伊曼與摩根斯坦主張「經濟學中的互動問題,可以賽局理論為主軸進行數理分析」。

在經濟學界,此前雖然也有將市場與競爭情境公式化的嘗試,但要正面處理玩家之間彼此影響的「策略性互動」,仍顯不足。相對地,諾伊曼與摩根斯坦的這部鉅著,從兩位或多位玩家爭奪分數或金錢的「零和遊戲」這個單純模型出發,再擴展到「非零和遊戲」的討論,提出了一套系統性的架構。「零和遊戲」「極小化極大原理」「期望報酬」等沿用至今的用語與定理,在當時就已登場。藉此,賽局理論一口氣滲透進經濟學界,逐步確立了作為一門學問的穩固地位。


4. 納許登場與「納許均衡」

提到賽局理論,不少人應該會想到「納許均衡」這個詞。這是由約翰·納許(John Forbes Nash)在1950年發表的論文所建立的概念。納許是年輕的天才數學家,在攻讀博士期間就證明了「在任意的有限人數遊戲中,全體玩家的策略組合必然存在至少一個均衡點」。這就是所謂的「納許均衡(Nash Equilibrium)」。在納許均衡中,假設其他玩家的策略固定時,任何人即使想改變策略,也無法改善自己的期望報酬。可以說,那是所有玩家同時做出最佳反應之後,沒有人有動機改變策略的平衡點。

納許的成就之所以具有劃時代意義,在於他證明了「必然存在」的存在定理。例如猜拳這種無論出什麼都是五五波決勝負的簡單遊戲,能否在數學上斷言「任何遊戲都存在某種均衡點」,完全是另一回事。納許漂亮地克服了這個難題,為此使用了「不動點定理」這個高深的工具。據說這項不動點定理的建構有日本數學家角谷靜夫的重大貢獻,而納許想到「只要有這種定理就能證明」,提供者正是角谷。


5. 應用於演化生物學與經濟學的深化

賽局理論在經濟學中嶄露頭角後,進一步往更多領域應用。其中特別值得一提的是應用於生物學。從1970年代前後開始,用賽局理論分析生物之間的鬥爭、合作行為,或雄性爭奪雌性的策略等,變得相當盛行。這個領域被稱為「演化賽局理論」,並誕生了「演化穩定策略(ESS:Evolutionarily Stable Strategy)」等新概念。ESS展現的是一種演化上的穩定性:當採取某種策略的個體在群體中成為多數時,少數的突變策略無法擊敗多數的策略。生物並不是靠理性思考來行動,但要數學化模擬在淘汰壓力下「策略」自然被琢磨的過程,賽局理論非常契合。

另一方面,在經濟學中,以「納許均衡」與「非合作賽局理論」為中心,設計複雜市場競爭與拍賣機制的理論蓬勃發展。以拍賣理論獲得諾貝爾經濟學獎的研究者,其核心正是運用賽局理論。今日電子商務與廣告投放的競價系統背後,也活躍著賽局理論的思想,這句話一點也不為過。


6. 撲克與賽局理論的關係――GTO這個關鍵字

說到「賽局理論」,或許也會想到將棋、西洋棋等。不過這些是所謂的「完全資訊遊戲」,屬於雙方共享棋盤上所有資訊後再擬定策略的遊戲類型。另一方面,撲克被歸類為「不完全資訊遊戲」,存在著看得到自己的手牌、卻看不到對手手牌的資訊不對稱。在不完全資訊遊戲中,必須一邊推測對手的手牌與動向,一邊思考下注(Bet)與加注(Raise)的時機與金額。雙方互相虛張聲勢(Bluff)、運用機率論計算期望值,策略的幅度明顯寬廣許多。

針對這種「不完全資訊遊戲」,在數學上「不會再被剝削(Exploit)」的其中一個策略目標,被稱為「GTO(Game Theory Optimal)」。不過,這並非賽局理論的嚴謹用語,而是撲克玩家從玩家視角看待雙人零和遊戲中的「納許均衡策略」時,用來表達「自己所採取的行動本身就是不會被對手剝削的策略」而愛用的說法。

GTO的背景――雙人零和遊戲

撲克理論中所謂「鑽研GTO」,追根究底接近於「將納許均衡內化為自己的策略」的想法。假設撲克是兩位玩家爭奪籌碼的零和遊戲,必然存在「構成納許均衡的策略組合」,而且只要一方採取它,對方就無法提高期望值。不過,當撲克實際上是6人或9人等多人進行時,納許均衡的討論就會複雜許多,也有很多地方無法直接套用雙人零和理論。但在實戰中,理解單挑(Heads-up,1對1)情境下的GTO,也能近似應用於3人以上的情況。


7. CFR登場――計算納許均衡的嘗試

1950年代納許證明「納許均衡的存在」之後,一直到現代,許多數學家都在挑戰「具體該如何計算納許均衡」這個問題。但遊戲越複雜——也就是玩家人數越多、選項越龐大——即使理論上知道它存在,實際上要找出均衡點依然非常困難。

在此帶來重大衝擊的,是2007年前後提出的「CFR(Counterfactual Regret Minimization)」方法,日文則譯為「反事實後悔最小化演算法」等。這是一個反覆運算的演算法:在遊戲的每個局面回顧「如果當初採取其他行動會怎樣?」(稱為反事實),並朝減少當下「後悔」的方向改善策略。CFR最大的優點是,在雙人零和遊戲中,理論上保證會逐步接近「ε-納許均衡(帶有少許誤差的納許均衡)」。它對於高速模擬撲克(尤其是單挑情境)極其有用,也成為AI擊敗撲克玩家的關鍵。


8. AI的進步――Libratus與Pluribus

Libratus 的衝擊

2017年,卡內基美隆大學的研究團隊開發的撲克AI「Libratus」引起了極大關注。它在單挑無限注德州撲克(No-Limit Hold'em)中與人類頂尖撲克職業選手對戰並獲勝。雖然在將棋、西洋棋、圍棋等完全資訊遊戲中,AI超越人類的例子早已存在,但在屬於不完全資訊遊戲的撲克中誕生「能打敗職業選手的AI」,對賽局理論與AI研究雙方而言都是劃時代的事件。

Libratus發展了CFR系列的方法,投入大量計算資源,同時採取逐步抽象化策略的機制。撲克中存在接近無限多的下注金額與情境,於是把被視為「(就期望值而言)細節影響不大」的局面歸類起來,減輕計算負擔,再對重要局面進行詳細計算。如此一來,它就能在探索龐大局面之餘,於有限的時間內更準確地導出接近納許均衡的策略。

Pluribus 的進化

2019年,同一個研究團隊開發的「Pluribus」在6人無限注德州撲克中對戰職業選手,並取得壓倒性勝利。6人這樣多人進行的撲克,遊戲結構遠比單純的單挑複雜。雙人零和的理論保證不再適用,無論CFR運算多少次,都無法保證嚴格收斂。儘管如此,它在實驗上展現出凌駕人類頂尖職業選手的實力。撲克玩家之間雖然也有「選人並非真正的頂尖職業選手」之類的議論,但「即使是多人撲克,光套用既有AI方法就能凌駕人類」這個事實,依然帶來了非常巨大的衝擊。實際上,許多職業選手已開始認為「或許再也贏不了AI了」。


9. 賽局理論仍是「未完成的學問」

如同目前所見,賽局理論已累積許多成果,實際應用於撲克、將棋、經濟學、拍賣、演化生物學等非常廣泛的領域。但即便如此,賽局理論並沒有解開一切。目前的賽局理論仍有以下課題。

  1. 多人遊戲中納許均衡的性質
    在雙人零和遊戲中,只要找到一個納許均衡,採用該策略就不用擔心被對手剝削,還能確保一定以上的勝果(期望值)。但3人以上時,納許均衡的性質就複雜許多,可能同時存在多個納許均衡,也可能難以比較孰優孰劣。這在理論上仍有許多未解明之處,更別說實際計算需要耗費龐大的工夫。

  2. 完全解析一般的不完全資訊遊戲極其困難
    撲克是看不到手牌的不完全資訊遊戲的代表,使用CFR的AI登場後,或許會讓人覺得這個領域已經「被攻克」。但實際上,過去是逐步加上「單挑」「限注(Limit)」「固定籌碼深度」等限制來分析的,限制越拿掉,計算就越呈爆炸性困難。此外,如同Pluribus的例子,對於非零和要素或多人互動,至今仍只是在缺乏充分理論保證的情況下,打造出「經驗上很強的AI」。

  3. 人類不一定理性
    賽局理論假設每位玩家都會「理性地追求報酬最大化」。然而,現實中的人類不一定會理性行動。心理偏誤、損失趨避等非理性因素,經常滲入決策過程。這些要素可以說在賽局理論的框架之外,不過近年來隨著行為經濟學的發展,試圖量化「人類如何不理性」的研究也正在推進。

10. 總結與展望

賽局理論的歷史始於諾伊曼1928年發表的論文,並透過1944年的《賽局理論與經濟行為》大幅擴展。1950年,約翰·納許證明了「納許均衡」的存在,為以數學處理多人策略決策奠定了強大基礎。之後,應用範圍不僅限於經濟學,也擴及演化生物學、政治學等;進入21世紀後,更與AI技術結合,誕生了即使在不完全資訊遊戲(如撲克)中也能戰勝人類頂尖職業選手的電腦。其背後有「CFR」這個演算法,以及巧妙調度大規模計算資源的實作技術。

不過,賽局理論並非「能解決所有策略問題的萬能理論」。玩家人數越多、玩家之間加入合作要素、人類的非理性越糾纏其中,理論就越複雜,計算上的困難也隨之劇增。因此,至今仍有許多研究者在挑戰「如何更快、更準確地解出更大的遊戲」。

另一方面,撲克圈「理解並實踐GTO策略」的風氣日益普及,多數頂尖玩家都在以某種形式運用Solver或CFR為基礎的研究工具。特別是在線上撲克世界,接近單挑的情境或短桌(Short-handed,少人數)高額對局頻繁出現,研究AI式方法正逐漸成為必備。在此基礎上,實際玩家會依對手程度靈活切換:混入「Exploit(針對對手弱點的策略)」,或反過來「採取偏向GTO的防守性打法,避免自己被Exploit」。完美的GTO打法需要電腦進行大量試行與計算,人類玩家要百分之百重現相當困難,但GTO已確實滲透為學習的指導方針。

這樣的情況,可說是賽局理論跨越學術領域、實際應用於社會的最佳例子。不只是賭場等賭博世界,我們身邊也處處用得到賽局理論。例如企業間的價格競爭與競標系統自不必說,日常的較勁、在SNS上的資訊發布等,都存在多位玩家追求報酬的「遊戲性情境」。其實,我們或許每天都在不知不覺中進行著賽局理論式的較勁。


結語:如何活用賽局理論

回顧賽局理論的歷史,它從少數天才數學家的構想出發,變革了經濟學、推進了生物學理論,甚至改變了撲克與AI研究的世界。從古典理論開始,如今已邁入以超級電腦進行龐大模擬來磨練策略的時代。不過,人類並非只在玩「理論說得清楚的遊戲」。可以說,理論不足之處,正是研究與創新空間最大的地方。今後隨著AI進一步發展,或許還會開闢出意想不到的新局面。例如,AI介入「人類的心理偏誤」或「在不完全資訊中多方利害交錯的情境」,在多人同時對戰的遊戲中催生出新策略,也並非不可能。

單看撲克,至今仍留有「6人以上到底能計算到什麼程度」「是否能以納許均衡以外的途徑打造出更強的策略」等大量研究空間。將來若超級電腦的效能再提升,或出現新的數學突破,或許連更多人的不完全資訊遊戲,都能高速求出嚴謹的均衡策略。

聽到「賽局理論」,有些人或許乍看會覺得它像是一門譁眾取寵的學問。但它根本的精神是「企圖以數學理解多位玩家彼此影響的世界」。無論是商業、政治、社會問題還是生態系——在形形色色的領域中,我們可以說都在進行著無數的「遊戲」。試著把賽局理論的思考方式套用上去,會浮現出乎意料的事實,讓你體會到人類行為與策略的妙趣。

如果因為了解賽局理論而對撲克產生興趣,請務必挑戰看看撲克。其中不只是運氣成分,還深深存在著人與人之間的較勁,以及以機率計算為基礎的策略思考。一開始光是學習手牌強弱與下注尺寸(Bet Size)的基本就足夠有趣,而當你逐漸理解Bluff的時機與GTO策略的精髓後,還能看到更深奧的世界。

另一方面,想從學術面正式踏入賽局理論的人,不妨接觸納許、諾伊曼的原典,挑戰大學經濟學或數學課程中使用的理論書籍。書中或許會出現抽象的算式,但撥開面紗之後,你會感動於現實人類社會的各種較勁,竟能以數學這個工具模型化。

賽局理論是至今仍持續進化的「未完成的學問」。但追溯它的歷史,我們會再次看見自己生活的世界充滿了多少「策略」與「互動」。正在讀這篇文章的你,或許從明天開始,也會在生活中越來越常浮現「這感覺很像賽局理論的情境」的念頭。此時只要用自己的方式回想「納許均衡是什麼意思來著?」,視野就會稍微開闊,世界也變得更有趣——這或許正是賽局理論的醍醐味。

App · POKER Q'z

把剛讀到的內容,用實戰題目練起來

在 POKER Q'z,你可以用答題的方式練習實戰中容易猶豫的局面,還能透過解析弄懂正確答案背後的理由。免費開始使用。

下載 AppApp Store
下載 AppGoogle Play
在網頁上開始

如果這篇文章對你有幫助,請按讚!

查看更多 專欄 的文章

目錄

  1. 前言
  2. 賽局理論是什麼?
  3. 黎明期――諾伊曼的1928年論文
  4. 《賽局理論與經濟行為》――1944年的巨著
  5. 納許登場與「納許均衡」
  6. 應用於演化生物學與經濟學的深化
  7. 撲克與賽局理論的關係――GTO這個關鍵字
  8. GTO的背景――雙人零和遊戲
  9. CFR登場――計算納許均衡的嘗試
  10. AI的進步――Libratus與Pluribus
  11. Libratus 的衝擊
  12. Pluribus 的進化
  13. 賽局理論仍是「未完成的學問」
  14. 總結與展望
  15. 結語:如何活用賽局理論

來下載 POKER Q'z App

讓撲克變得更有趣

查看更多專欄的文章 →