Tinalo ng AlphaGo si Lee Sedol sa ikatlong magkakasunod na pagkakataon noong Sabado, kung saan napanalunan nito ang limang-laro na laban laban sa isa sa pinakamalakas na manlalaro ng Go sa mundo at nalampasan ang hangganan na pinaniniwalaan ng maraming mananaliksik ng artificial intelligence na ilang taon pa ang layo.
Nagbitiw si Lee pagkatapos ng 176 na galaw sa Seoul, na nagbigay sa programang binuo ng DeepMind unit ng Google ng isang hindi malalampasang 3-to-0 na kalamangan habang may dalawang laro pang natitira. Ang resulta ay higit pa sa isa pang panalo ng makina sa isang board game. Ang napakaraming posibleng posisyon ni Go at ang pag-asa nito sa paghatol tungkol sa hugis, impluwensya, at pangmatagalang balanse ay lumaban sa mga pamamaraan ng brute-force na sumakop sa chess.
Iniulat ng Reuters mula sa Seoul na ikinagulat maging ng mga taga-disenyo ng AlphaGo ang tagumpay at nag-iwan kay Lee na humingi ng tawad para sa tinatawag niyang kawalan ng kapangyarihang pagpapakita. Ang 33-taong-gulang na kampeon ng South Korean ay may hawak na 18 internasyonal na titulo at pumasok sa laban na may kumpiyansa na ang karanasan at intuwisyon ng tao ay maglalantad ng mga limitasyon sa software.
Bakit Natalo ang Konbensyonal na Paghahanap
Ang Go board ay may 19 na linya por 19 na linya, na lumilikha ng 361 posibleng lokasyon para sa pambungad na galaw at isang astronomikal na espasyo ng mga susunod na konfigurasyon. Hindi tulad ng chess, ang laro ay hindi nag-aalok ng simpleng bilang ng materyal para sa pagsusuri kung sino ang nangunguna. Ang isang kumpol ng mga bato ay maaaring buhay, mahina, maimpluwensya, o maaaring maubusan depende sa mga pag-unlad sa iba't ibang panig ng board. Kadalasang inilalarawan ng mga magagaling na manlalaro ang kanilang mga pagpipilian bilang madaling maunawaan dahil imposible ang masusing pagkalkula.
Dahil dito, ang Go ay naging isang hindi pangkaraniwang mahirap na pagsubok para sa pagkalkula. Ang mga tradisyonal na sistema ng paglalaro ay naghahanap sa isang puno ng mga posibleng galaw at binibigyan ng marka ang mga nagresultang posisyon. Sa Go, ang puno ay lumalawak nang napakabilis at ang mga posisyon ay napakahirap pahalagahan nang tumpak. Ang mga programa ay napabuti sa pamamagitan ng mga pamamaraan ng Monte Carlo — pagkuha ng sample ng maraming posibleng pagpapatuloy — ngunit hanggang kamakailan lamang ay hindi nila matalo ang pinakamahusay na mga propesyonal nang walang kapansanan.
Pinagsasama ng AlphaGo ang paghahanap at ang natutunang paghatol. Ang sistemang inilarawan sa papel ng DeepMind noong Enero sa Nature ay gumagamit ng isang "policy network" upang pumili ng mga magagandang galaw at isang "value network" upang tantyahin ang posibilidad na manalo mula sa isang posisyon. Pinakikitid ng mga network na iyon ang paghahanap, na nagpapahintulot sa programa na gumastos ng pagkalkula sa mga linyang itinuro ng karanasan na posible ito.
Ang karanasan ay dumating sa dalawang yugto. Unang natuto ang AlphaGo ng mga padron mula sa mga naitalang laro na nilalaro ng malalakas na tao. Pagkatapos ay naglaro ito ng milyun-milyong laro laban sa mga bersyon nito, gamit ang reinforcement learning upang mapabuti sa pamamagitan ng mga panalo at pagkatalo. Ang pamamaraan ay nagbibigay-daan dito upang matuklasan ang mga estratehiya na epektibo kahit na hindi ito kahawig ng kumbensyonal na propesyonal na paglalaro.
Tatlong Laro ang Nagpapalawak ng Ebidensya
Ipinakita ng unang laro na kayang tiisin ng AlphaGo ang pressure ng isang live na laban laban sa isang 9-dan champion. Nagbitiw si Lee pagkatapos ng halos tatlo at kalahating oras. sa ulat ng Reuters noong unang laro noong Miyerkules na hawak ni Lee ang mga black stone at libu-libo ang nanood ng live online stream habang paulit-ulit na nakakahanap ang makina ng mga tumpak na sagot.
Ang ikalawang laro ay mas nakakabahala para sa mga propesyonal dahil ang AlphaGo ay gumawa ng mga galaw na sa una ay mukhang kaduda-duda at kalaunan ay napatunayang makapangyarihan. Isang tama sa balikat sa simula ng laro, na nilaro sa ikalimang linya, ay ikinagulat ng mga komentarista na sanay sa mga itinatag na prinsipyo ng pagbubukas. ng pagsusuri ng Wired sa Ikalawang Laro ang paglalaro ng programa bilang malikhain sa halip na tumpak lamang, isang mahalagang pagkakaiba para sa isang sistemang kadalasang inilalarawan bilang isang calculator.
Sinubukan ng ikatlong laro noong Sabado ang ibang kahinaan. Naghanap si Lee ng mga komplikasyon at nagpasimula ng laban na "ko", isang paulit-ulit na taktikal na labanan kung saan kailangang sagutin ng mga manlalaro ang mga banta sa ibang bahagi ng board. Ang ganitong mga posisyon ay nangangailangan ng pandaigdigang paghatol at maaaring makabuo ng mahahabang at sanga-sangang mga pagkakasunod-sunod. Pinanatili ng AlphaGo ang kontrol, pinasimple kung saan kapaki-pakinabang at pinilit ang pagbibitiw ni Lee.
ng salaysay ng Wired tungkol sa mapagpasyang laro na ang programa ay hindi lamang nakayanan ang kumplikadong taktika; napamahalaan nito ito habang pinapanatili ang isang paborableng pangkalahatang posisyon. Ang pagganap na iyon ay nagpapahina sa teorya na maaaring talunin ng isang kampeong tao ang sistema sa pamamagitan ng pagtulak sa laro tungo sa kaguluhan.
Ang Intuwisyon ng Makina ay Estadistikal, ngunit Makapangyarihan Pa Rin
Ang pagtawag sa AlphaGo bilang intuitive ay hindi nangangahulugang iniisip o nararanasan nito ang laro tulad ng iniisip ng isang tao. Ang mga network nito ay nagko-code ng mga istatistikal na ugnayang pang-estadistika sa pagitan ng mga posisyon ng board, mga galaw, at mga resulta. Hindi nito inilalagay ang kahulugang kultural sa Go, hindi nakakaramdam ng pressure mula sa isang kalaban, o naiintindihan kung bakit itinuturing ng mga manonood na maganda ang isang galaw.
Gayunpaman, hindi ginagawang hindi gaanong mahalaga ng pagkakaiba ang mga desisyon nito. Ang kadalubhasaan ng tao ay nakasalalay din sa pagkilala ng mga pattern na nabuo sa pamamagitan ng paulit-ulit na pagkakalantad, bagama't isinama ito sa wika, emosyon, karanasang kinakatawan, at malay na pangangatwiran. Ipinapakita ng AlphaGo na ang isang mas makitid na sistema ay maaaring kopyahin ang isang mahalagang bahagi ng ekspertong paghatol nang sapat na mahusay upang malampasan ang isang dalubhasa sa isang larangan kung saan ang mga tahasang patakaran ay hindi tumutukoy sa mahusay na estratehiya.
ng Google na inilathala bago magsimula ang laro ay nagpakilala sa paligsahan bilang ang sukdulang hamon para sa isang programa na nakapagtalo na sa European champion na Fan Hui ng limang laro laban sa wala. Si Lee ay kumakatawan sa isang mas mataas na pamantayan. Samakatuwid, ang pagkapanalo sa unang tatlong laro ay nagbibigay ng ebidensya na ang pamamaraan ay lumalagpas sa kalaban na ginamit upang mapatunayan ang orihinal na pananaliksik.
Ang layunin ng sistema ay bahagyang naiiba rin sa pagnanais ng tao na mangibabaw sa board. Pinipili ng AlphaGo ang mga galaw na nagpapalaki sa tinatayang posibilidad nitong manalo, hindi ang laki ng huling margin nito. Ang isang tahimik na galaw na nagpapanatili ng isang makitid ngunit ligtas na kalamangan ay maaaring mas mainam kaysa sa isang agresibong galaw na nag-aalok ng mas maraming puntos na may mas malaking panganib. Maaari nitong gawing konserbatibo ang paglalaro nito sa isang sandali at nakakagulat na hindi pangkaraniwan sa susunod.
Mula sa Mga Laro Hanggang sa Pangkalahatang-Layunin na Pagkatuto
Ang mas malawak na pahayag ng DeepMind ay ang mga pamamaraan sa likod ng AlphaGo ay maaaring matugunan ang mga problema kung saan ang mga kapaki-pakinabang na desisyon ay hindi maaaring ganap na ma-program nang maaga. Sinusuportahan na ng mga neural network ang pagkilala sa pagsasalita, pag-uuri ng imahe at mga sistema ng rekomendasyon. Ang reinforcement learning ay nag-aalok ng isang paraan para mapabuti ng software sa pamamagitan ng feedback sa halip na umasa lamang sa mga halimbawang may label.
Ang Go ay nananatiling isang limitadong kapaligiran: malinaw ang mga patakaran, bawat galaw ay nakikita at ang tagumpay ay natutukoy sa pamamagitan ng pagkapanalo. Ang medikal na diagnosis, robotics, pamamahala ng enerhiya at siyentipikong pananaliksik ay naglalaman ng hindi tiyak na datos, nagbabagong mga layunin at mga kahihinatnan na hindi maaaring bawasan sa isang iskor. Hindi pinatutunayan ng AlphaGo na ang isang sistema ay maaaring direktang lumipat mula sa isang board patungo sa mga gawaing iyon.
Gayunpaman, ipinapakita nito na ang kombinasyon ng mga natutunang representasyon, kunwang karanasan, at piling paghahanap ay kayang tugunan ang isang problemang dating inaakalang nangangailangan ng natatanging intuwisyon ng tao. ng ulat ng The Guardian pagkatapos ng Game One ang agarang paghahambing sa kasaysayan sa Deep Blue ng IBM, ngunit ang teknikal na pagsulong dito ay iba: Ang AlphaGo ay hindi gaanong umaasa sa pag-eenumerate ng mga posibilidad at higit na umaasa sa pag-aaral kung aling mga posibilidad ang mahalaga.
Dalawang laro na lang ang natitira, at sinabi ni Lee na gusto niya ng kahit isang panalo. Ang resulta ng mga ito ay maaaring magbunyag ng mga kahinaan sa programa o iba pang mga halimbawa ng hindi pamilyar na estratehiya. Ang pangunahing resulta ay sigurado na. Natalo ng isang makina ang isang piling tao sa isang paligsahan na nakabatay sa paghatol sa ilalim ng labis na kasalimuotan, at hindi lang ito aksidente kundi tatlong beses nang magkakasunod.