【科學講堂】「以牙還牙」是最佳博弈策略?

  互相合作,或許是群體生活與文化建立的基石。然而,在合作之中,個體未必每次都能獲益。因此,從「物競天擇、適者生存」的演化觀點來看,個體間的合作並非總是必然有利的策略。那麼,在演化過程中,物種(尤其是人類)究竟如何發展出合作的習慣?這次就讓我們一同探索這個課題。

  博弈論中的「囚徒困境」,大家或許早已聽聞;在物種合作的場景下,它也能派上用場。簡單來說,兩位「囚徒」必須在合作與出賣對方之間抉擇。若信守承諾未出賣對方,卻遭對方背叛,將得到最差的待遇,而對方則獲得最佳回報;即使雙方都選擇背叛,各自所得雖不理想,但至少比單方面受騙來得好。

  由此觀之,出賣對方似乎是理性的選擇——能確保自己獲得較佳的結果。不過,雙方合作或許無法拿到最高報酬,但每個人都能保障不錯的收益,達至雙贏。

  模擬「囚徒困境」 15程式策略混鬥

  為了研究自然中合作如何演化,科學家假設兩個參與者反覆面對「囚徒困境」,並探討何種策略能帶來較佳回報。

  1980年代,學術界舉辦了兩次公開電腦競賽,邀請博弈論學者提出各種策略,並以模擬方式比較其成效。博弈論學者提交了14個不同的電腦程式策略,這些策略五花八門,從永遠合作到永遠背叛都有,此外再加上一個純隨機策略(Random),由此模擬出15個參賽者。

  比賽採用循環賽制,每個程式都要和其他所有程式(包括自己的複製體)反覆對戰。由於雙方會在多次回合中互動,是否建立長期和諧關係,就成為重要的考量。結果發現,回報最優的策略竟是「模仿」:第一回合先選擇合作,之後每一回合的行動,完全仿照上一回合對手的作法——若上一回合對方背叛,下一回合便同樣背叛;反之亦然。

  此外,模擬比賽中還加入了「演化」,即得分高的策略「繁衍」,得分低的「消亡」,模擬自然選擇。「模仿」策略在這種動態環境中也能穩定存活並擴散。

  細想之下,此策略從不先發制人出賣對手,因此單回合通常不會比對方獲得更高回報,但這一策略能夠鼓勵合作,在與各種策略交手時,可取得非最高但穩定的總收益,故而長遠成為最成功的策略。相較之下,某些策略或許偶爾能贏得極高報酬,卻在其他情境下慘敗。

  運用博弈論,有助於理解相互合作為何能在自然界中出現。在簡化模擬中,「以牙還牙」策略相對具有優勢,關鍵在於它具備善良(不首先背叛)、報復(對背叛做出回應)、寬容(在對方合作後恢復合作)和清晰(行為模式易於被理解)這四個特性,這樣的結論似乎與古人「以牙還牙」的智慧不謀而合。

  ●杜子航 教育工作者 早年學習理工科目,一直致力推動科學教育與科普工作,近年開始關注電腦發展對社會的影響。