前言
打撲克的時候,是不是常聽到「GTO」或「賽局理論」這類詞彙呢?撲克是玩家之間互相爭奪籌碼的遊戲,與賽局理論有著密不可分的關係。接下來,就讓我們一起回顧賽局理論的誕生、發展,以及它與撲克的關聯。無論是第一次接觸賽局理論的人,還是透過撲克而對賽局理論產生興趣的人,希望這篇文章都能對各位有所幫助。
1. 賽局理論是什麼?
看到「賽局理論」這個名稱,或許很多人都會聯想到撲克牌、桌遊等「娛樂用遊戲」。然而,作為一門學問的「賽局理論」所處理的「遊戲」,範圍其實更廣。多位玩家在考量彼此行動的同時做出決策,試圖獲得某種「報酬(像是分數或利益)」——這種情境整體就被稱為「遊戲」。因此,它的應用範圍不只是桌遊、紙牌遊戲等娛樂,還擴及競標、企業間的價格競爭、國際關係的較勁,甚至生物的演化過程。
「賽局理論」會將這類「遊戲性」情境以數學建模,用算式表現玩家的策略與報酬,進而探討最佳策略與均衡狀態。這需要用到高深的數學方法,而最初建構這套理論的,正是20世紀上半葉的天才數學家們。約翰·馮·諾伊曼與約翰·納許——這些在多個領域奠定基礎的巨擘,在賽局理論的脈絡中同樣不可或缺。
2. 黎明期――諾伊曼的1928年論文

追溯賽局理論的歷史,第一個被提到的名字就是約翰·馮·諾伊曼(John von Neumann)。1928年,諾伊曼以德文發表了一篇題為「論社會遊戲的理論」的劃時代論文,運用數學分析方法,將多位玩家之間交換分數的情境加以模型化。提起諾伊曼,他在量子力學的數學基礎、現代電腦架構的概念化,乃至核武開發的參與等20世紀科學技術的各個角落都留下名字,可說是「超級天才」。他留下了極其多元的成就,而其中也包括「確立賽局理論」。
1928年當時的諾伊曼,將機率型遊戲(例如輪盤、猜拳,或簡單的紙牌遊戲)做數學性的整理,並歸納了其中出現的用語與概念。例如「策略(Strategy)」「報酬(Payoff)」這類至今仍是賽局理論基礎的詞彙,在當時就已經被探討。然而,正因為過於先進,諾伊曼的想法在當時的學界並未受到太多關注。據說光聽到「用數學研究遊戲」,會判斷這件事值得認真投入的研究者其實寥寥可數。此外,論文以德文撰寫,也成為阻礙它以英語圈為中心的國際擴散的其中一個原因。
3. 《賽局理論與經濟行為》――1944年的巨著
在諾伊曼萌生構想十多年後,1944年,賽局理論終於迎來大幅躍進的轉捩點。那就是他與經濟學家奧斯卡·摩根斯坦(Oskar Morgenstern)合著出版的《賽局理論與經濟行為(Theory of Games and Economic Behavior)》。這是一部超過600頁的鉅作,諾伊曼與摩根斯坦主張「經濟學中的互動問題,可以賽局理論為主軸進行數理分析」。
在經濟學界,此前雖然也有將市場與競爭情境公式化的嘗試,但要正面處理玩家之間彼此影響的「策略性互動」,仍顯不足。相對地,諾伊曼與摩根斯坦的這部鉅著,從兩位或多位玩家爭奪分數或金錢的「零和遊戲」這個單純模型出發,再擴展到「非零和遊戲」的討論,提出了一套系統性的架構。「零和遊戲」「極小化極大原理」「期望報酬」等沿用至今的用語與定理,在當時就已登場。藉此,賽局理論一口氣滲透進經濟學界,逐步確立了作為一門學問的穩固地位。
4. 納許登場與「納許均衡」

提到賽局理論,不少人應該會想到「納許均衡」這個詞。這是由約翰·納許(John Forbes Nash)在1950年發表的論文所建立的概念。納許是年輕的天才數學家,在攻讀博士期間就證明了「在任意的有限人數遊戲中,全體玩家的策略組合必然存在至少一個均衡點」。這就是所謂的「納許均衡(Nash Equilibrium)」。在納許均衡中,假設其他玩家的策略固定時,任何人即使想改變策略,也無法改善自己的期望報酬。可以說,那是所有玩家同時做出最佳反應之後,沒有人有動機改變策略的平衡點。
納許的成就之所以具有劃時代意義,在於他證明了「必然存在」的存在定理。例如猜拳這種無論出什麼都是五五波決勝負的簡單遊戲,能否在數學上斷言「任何遊戲都存在某種均衡點」,完全是另一回事。納許漂亮地克服了這個難題,為此使用了「不動點定理」這個高深的工具。據說這項不動點定理的建構有日本數學家角谷靜夫的重大貢獻,而納許想到「只要有這種定理就能證明」,提供者正是角谷。
5. 應用於演化生物學與經濟學的深化
賽局理論在經濟學中嶄露頭角後,進一步往更多領域應用。其中特別值得一提的是應用於生物學。從1970年代前後開始,用賽局理論分析生物之間的鬥爭、合作行為,或雄性爭奪雌性的策略等,變得相當盛行。這個領域被稱為「演化賽局理論」,並誕生了「演化穩定策略(ESS:Evolutionarily Stable Strategy)」等新概念。ESS展現的是一種演化上的穩定性:當採取某種策略的個體在群體中成為多數時,少數的突變策略無法擊敗多數的策略。生物並不是靠理性思考來行動,但要數學化模擬在淘汰壓力下「策略」自然被琢磨的過程,賽局理論非常契合。
另一方面,在經濟學中,以「納許均衡」與「非合作賽局理論」為中心,設計複雜市場競爭與拍賣機制的理論蓬勃發展。以拍賣理論獲得諾貝爾經濟學獎的研究者,其核心正是運用賽局理論。今日電子商務與廣告投放的競價系統背後,也活躍著賽局理論的思想,這句話一點也不為過。
6. 撲克與賽局理論的關係――GTO這個關鍵字
說到「賽局理論」,或許也會想到將棋、西洋棋等。不過這些是所謂的「完全資訊遊戲」,屬於雙方共享棋盤上所有資訊後再擬定策略的遊戲類型。另一方面,撲克被歸類為「不完全資訊遊戲」,存在著看得到自己的手牌、卻看不到對手手牌的資訊不對稱。在不完全資訊遊戲中,必須一邊推測對手的手牌與動向,一邊思考下注(Bet)與加注(Raise)的時機與金額。雙方互相虛張聲勢(Bluff)、運用機率論計算期望值,策略的幅度明顯寬廣許多。
針對這種「不完全資訊遊戲」,在數學上「不會再被剝削(Exploit)」的其中一個策略目標,被稱為「GTO(Game Theory Optimal)」。不過,這並非賽局理論的嚴謹用語,而是撲克玩家從玩家視角看待雙人零和遊戲中的「納許均衡策略」時,用來表達「自己所採取的行動本身就是不會被對手剝削的策略」而愛用的說法。
GTO的背景――雙人零和遊戲
撲克理論中所謂「鑽研GTO」,追根究底接近於「將納許均衡內化為自己的策略」的想法。假設撲克是兩位玩家爭奪籌碼的零和遊戲,必然存在「構成納許均衡的策略組合」,而且只要一方採取它,對方就無法提高期望值。不過,當撲克實際上是6人或9人等多人進行時,納許均衡的討論就會複雜許多,也有很多地方無法直接套用雙人零和理論。但在實戰中,理解單挑(Heads-up,1對1)情境下的GTO,也能近似應用於3人以上的情況。
7. CFR登場――計算納許均衡的嘗試
1950年代納許證明「納許均衡的存在」之後,一直到現代,許多數學家都在挑戰「具體該如何計算納許均衡」這個問題。但遊戲越複雜——也就是玩家人數越多、選項越龐大——即使理論上知道它存在,實際上要找出均衡點依然非常困難。
在此帶來重大衝擊的,是2007年前後提出的「CFR(Counterfactual Regret Minimization)」方法,日文則譯為「反事實後悔最小化演算法」等。這是一個反覆運算的演算法:在遊戲的每個局面回顧「如果當初採取其他行動會怎樣?」(稱為反事實),並朝減少當下「後悔」的方向改善策略。CFR最大的優點是,在雙人零和遊戲中,理論上保證會逐步接近「ε-納許均衡(帶有少許誤差的納許均衡)」。它對於高速模擬撲克(尤其是單挑情境)極其有用,也成為AI擊敗撲克玩家的關鍵。
8. AI的進步――Libratus與Pluribus

Libratus 的衝擊
2017年,卡內基美隆大學的研究團隊開發的撲克AI「Libratus」引起了極大關注。它在單挑無限注德州撲克(No-Limit Hold'em)中與人類頂尖撲克職業選手對戰並獲勝。雖然在將棋、西洋棋、圍棋等完全資訊遊戲中,AI超越人類的例子早已存在,但在屬於不完全資訊遊戲的撲克中誕生「能打敗職業選手的AI」,對賽局理論與AI研究雙方而言都是劃時代的事件。
Libratus發展了CFR系列的方法,投入大量計算資源,同時採取逐步抽象化策略的機制。撲克中存在接近無限多的下注金額與情境,於是把被視為「(就期望值而言)細節影響不大」的局面歸類起來,減輕計算負擔,再對重要局面進行詳細計算。如此一來,它就能在探索龐大局面之餘,於有限的時間內更準確地導出接近納許均衡的策略。
Pluribus 的進化
2019年,同一個研究團隊開發的「Pluribus」在6人無限注德州撲克中對戰職業選手,並取得壓倒性勝利。6人這樣多人進行的撲克,遊戲結構遠比單純的單挑複雜。雙人零和的理論保證不再適用,無論CFR運算多少次,都無法保證嚴格收斂。儘管如此,它在實驗上展現出凌駕人類頂尖職業選手的實力。撲克玩家之間雖然也有「選人並非真正的頂尖職業選手」之類的議論,但「即使是多人撲克,光套用既有AI方法就能凌駕人類」這個事實,依然帶來了非常巨大的衝擊。實際上,許多職業選手已開始認為「或許再也贏不了AI了」。
9. 賽局理論仍是「未完成的學問」
如同目前所見,賽局理論已累積許多成果,實際應用於撲克、將棋、經濟學、拍賣、演化生物學等非常廣泛的領域。但即便如此,賽局理論並沒有解開一切。目前的賽局理論仍有以下課題。
- 多人遊戲中納許均衡的性質
在雙人零和遊戲中,只要找到一個納許均衡,採用該策略就不用擔心被對手剝削,還能確保一定以上的勝果(期望值)。但3人以上時,納許均衡的性質就複雜許多,可能同時存在多個納許均衡,也可能難以比較孰優孰劣。這在理論上仍有許多未解明之處,更別說實際計算需要耗費龐大的工夫。 - 完全解析一般的不完全資訊遊戲極其困難
撲克是看不到手牌的不完全資訊遊戲的代表,使用CFR的AI登場後,或許會讓人覺得這個領域已經「被攻克」。但實際上,過去是逐步加上「單挑」「限注(Limit)」「固定籌碼深度」等限制來分析的,限制越拿掉,計算就越呈爆炸性困難。此外,如同Pluribus的例子,對於非零和要素或多人互動,至今仍只是在缺乏充分理論保證的情況下,打造出「經驗上很強的AI」。 - 人類不一定理性
賽局理論假設每位玩家都會「理性地追求報酬最大化」。然而,現實中的人類不一定會理性行動。心理偏誤、損失趨避等非理性因素,經常滲入決策過程。這些要素可以說在賽局理論的框架之外,不過近年來隨著行為經濟學的發展,試圖量化「人類如何不理性」的研究也正在推進。
10. 總結與展望
賽局理論的歷史始於諾伊曼1928年發表的論文,並透過1944年的《賽局理論與經濟行為》大幅擴展。1950年,約翰·納許證明了「納許均衡」的存在,為以數學處理多人策略決策奠定了強大基礎。之後,應用範圍不僅限於經濟學,也擴及演化生物學、政治學等;進入21世紀後,更與AI技術結合,誕生了即使在不完全資訊遊戲(如撲克)中也能戰勝人類頂尖職業選手的電腦。其背後有「CFR」這個演算法,以及巧妙調度大規模計算資源的實作技術。
不過,賽局理論並非「能解決所有策略問題的萬能理論」。玩家人數越多、玩家之間加入合作要素、人類的非理性越糾纏其中,理論就越複雜,計算上的困難也隨之劇增。因此,至今仍有許多研究者在挑戰「如何更快、更準確地解出更大的遊戲」。
另一方面,撲克圈「理解並實踐GTO策略」的風氣日益普及,多數頂尖玩家都在以某種形式運用Solver或CFR為基礎的研究工具。特別是在線上撲克世界,接近單挑的情境或短桌(Short-handed,少人數)高額對局頻繁出現,研究AI式方法正逐漸成為必備。在此基礎上,實際玩家會依對手程度靈活切換:混入「Exploit(針對對手弱點的策略)」,或反過來「採取偏向GTO的防守性打法,避免自己被Exploit」。完美的GTO打法需要電腦進行大量試行與計算,人類玩家要百分之百重現相當困難,但GTO已確實滲透為學習的指導方針。
這樣的情況,可說是賽局理論跨越學術領域、實際應用於社會的最佳例子。不只是賭場等賭博世界,我們身邊也處處用得到賽局理論。例如企業間的價格競爭與競標系統自不必說,日常的較勁、在SNS上的資訊發布等,都存在多位玩家追求報酬的「遊戲性情境」。其實,我們或許每天都在不知不覺中進行著賽局理論式的較勁。
結語:如何活用賽局理論
回顧賽局理論的歷史,它從少數天才數學家的構想出發,變革了經濟學、推進了生物學理論,甚至改變了撲克與AI研究的世界。從古典理論開始,如今已邁入以超級電腦進行龐大模擬來磨練策略的時代。不過,人類並非只在玩「理論說得清楚的遊戲」。可以說,理論不足之處,正是研究與創新空間最大的地方。今後隨著AI進一步發展,或許還會開闢出意想不到的新局面。例如,AI介入「人類的心理偏誤」或「在不完全資訊中多方利害交錯的情境」,在多人同時對戰的遊戲中催生出新策略,也並非不可能。
單看撲克,至今仍留有「6人以上到底能計算到什麼程度」「是否能以納許均衡以外的途徑打造出更強的策略」等大量研究空間。將來若超級電腦的效能再提升,或出現新的數學突破,或許連更多人的不完全資訊遊戲,都能高速求出嚴謹的均衡策略。
聽到「賽局理論」,有些人或許乍看會覺得它像是一門譁眾取寵的學問。但它根本的精神是「企圖以數學理解多位玩家彼此影響的世界」。無論是商業、政治、社會問題還是生態系——在形形色色的領域中,我們可以說都在進行著無數的「遊戲」。試著把賽局理論的思考方式套用上去,會浮現出乎意料的事實,讓你體會到人類行為與策略的妙趣。
如果因為了解賽局理論而對撲克產生興趣,請務必挑戰看看撲克。其中不只是運氣成分,還深深存在著人與人之間的較勁,以及以機率計算為基礎的策略思考。一開始光是學習手牌強弱與下注尺寸(Bet Size)的基本就足夠有趣,而當你逐漸理解Bluff的時機與GTO策略的精髓後,還能看到更深奧的世界。
另一方面,想從學術面正式踏入賽局理論的人,不妨接觸納許、諾伊曼的原典,挑戰大學經濟學或數學課程中使用的理論書籍。書中或許會出現抽象的算式,但撥開面紗之後,你會感動於現實人類社會的各種較勁,竟能以數學這個工具模型化。
賽局理論是至今仍持續進化的「未完成的學問」。但追溯它的歷史,我們會再次看見自己生活的世界充滿了多少「策略」與「互動」。正在讀這篇文章的你,或許從明天開始,也會在生活中越來越常浮現「這感覺很像賽局理論的情境」的念頭。此時只要用自己的方式回想「納許均衡是什麼意思來著?」,視野就會稍微開闊,世界也變得更有趣——這或許正是賽局理論的醍醐味。

