Nakumpleto ng AlphaGo ang 4-to-1 na tagumpay laban sa Lee Sedol noong Martes, nakabawi mula sa isang maagang pagkakamali sa huling laro at tinalo ang isa sa pinakamalakas na manlalaro ng Go sa mundo sa isang laban na nagpakita ng parehong abot ng modernong machine learning at ang kahalagahan ng paglalantad nito sa isang malikhaing kalaban na tao.
Ang programang binuo ng DeepMind unit ng Google ang nagsiguro sa serye sa pamamagitan ng pagkapanalo sa unang tatlong laro. Pagkatapos ay nagtala si Lee ng isang pambihirang tagumpay sa ikaapat na laro, na nagtulak sa AlphaGo sa sunod-sunod na pagkakamali bago bumalik ang makina upang manalo sa isang nakakapagod na ikalimang laban. Ang resulta ay mas nagpapakita ng galing kaysa sa isang sweep: Napatunayang nangingibabaw ang AlphaGo sa iba't ibang posisyon, ngunit hindi naman ito hindi tinatablan.
Iniulat ng Reuters na ang huling iskor ay kasunod ng ikalimang laro kung saan sinamantala ni Lee ang isang maagang pagkakamali bago nabawi ng AlphaGo ang inisyatiba. Ang lahat ng limang laro ay nilaro sa Seoul sa ilalim ng mga propesyonal na kondisyon, na may premyong $1 milyong laban at pandaigdigang live coverage.
Apat na Tagumpay ang Nagtatag ng Higit Pa sa Lakas na Taktikal
Matagal nang itinuturing na hangganan ng artificial intelligence ang Go dahil lumalaban ang laro sa masusing kalkulasyon. Ang 19-by-19 board nito ay nakakagawa ng mas kapani-paniwalang mga pagkakasunod-sunod ng galaw kaysa sa kayang bilangin kahit ng makapangyarihang mga computer, at ang pagsusuri sa isang posisyon ay nangangailangan ng paghatol tungkol sa impluwensya, teritoryo, buhay at kamatayan na hindi maaaring mabawasan sa pagbibilang lamang ng mga piraso.
Tinutugunan ng AlphaGo ang mga limitasyong iyon sa pamamagitan ng pag-aaral kung aling mga posisyon at galaw ang nararapat pansinin. Ang arkitektura na inilarawan sa papel pananaliksik ng DeepMind sa Nature ay pinagsasama ang mga network ng patakaran, na nagraranggo ng mga magagandang galaw, kasama ang isang network ng halaga na tinatantya ang pagkakataon ng isang posisyon na makagawa ng panalo. Pagkatapos ay sinusuri ng paghahanap sa puno ng Monte Carlo ang mga piling baryasyon sa halip na subukang kalkulahin ang lahat.
Ang mga network ay unang natuto mula sa mga ekspertong laro ng tao at pagkatapos ay umunlad sa pamamagitan ng paulit-ulit na paglalaro sa sarili. Mahalaga ang ikalawang yugtong iyon dahil ang software ay hindi limitado sa panggagaya sa kumbensyon. Maaari nitong tuklasin ang mga galaw na bihirang piliin ng mga propesyonal, suriin ang kanilang mga kahihinatnan sa pamamagitan ng kunwaring karanasan at panatilihin ang mga estratehiya na nagpapataas ng posibilidad ng tagumpay.
Ipinakita ng laban ang pamamaraang gumagana sa iba't ibang pagsubok. Nanalo ang AlphaGo ng mga tahimik na estratehikong laro, hinarap ang mga komplikasyon sa taktika at, sa katapusan, nakabawi mula sa isang kawalan. ng ulat ng Nature tungkol sa natapos na serye ang 4-to-1 na iskor bilang kumpirmasyon na ang naunang tagumpay laban sa kampeong Europeo na si Fan Hui ay hindi ang limitasyon ng lakas ng sistema.
Ang Panalo ni Lee sa Ikaapat na Laro ay Naging Isang Diagnostic Event
Matapos ang tatlong pagkatalo, nanalo si Lee sa ikaapat na laro noong Linggo gamit ang puting bola. Ang kanyang galaw na 78 — isang pagtama sa gitna ng posisyon ng AlphaGo — ay unang ikinagulat ng mga komentarista at tila nakagambala sa pagsusuri ng programa. Hindi maganda ang naging tugon ng AlphaGo, pinalala ang problema at kalaunan ay nagbitiw.
ng salaysay ng Time tungkol sa tagumpay ni Lee ang panalo bilang isang pagbibigay-katwiran para sa isang kampeon na pumasok sa laban na humuhula ng isang malinaw na tagumpay, pagkatapos ay hinarap ang paglalaro nang mas malakas at mas kakaiba kaysa sa inaasahan niya. Para sa mga mananaliksik, ang kahalagahan ay hindi gaanong nakasalalay sa pagpapanumbalik ng iskor ng tao kundi sa paghahanap ng isang posisyon kung saan nasira ang natutunang paghatol ng sistema.
Ang mga sistema ng machine-learning ay maaaring mabigo nang iba kumpara sa kumbensyonal na software. Ang isang programang naka-hand-code ay kadalasang kumikilos nang hindi tama dahil mali ang isang panuntunan o implementasyon. Ang isang neural network ay maaaring gumanap nang mahusay sa mga pamilyar na distribusyon ng mga halimbawa at pagkatapos ay makagawa ng mahinang paghatol kapag ipinakita ang isang hindi pangkaraniwang pattern. Ang panloob na representasyon nito ay ipinamamahagi sa maraming natutunang parameter, na nagpapahirap sabihin ang eksaktong dahilan ng isang error.
Tila lumikha ng ganitong uri ng sorpresa ang hakbang ni Lee. Nang lumala ang posisyon ng AlphaGo, ang mga sumunod na desisyon ay nagmukhang hindi magkakaugnay sa mga propesyonal, na nagmumungkahi na ang mga pagtatantya ng halaga na gumagabay sa paghahanap nito ay naging hindi maaasahan. sa pagsusuri ng Wired sa Game Four na ang makina ay nakagawa ng serye ng mga pagkakamali pagkatapos ng hindi inaasahang wedge, na nag-aalok ng pinakamalinaw na ebidensya sa laban na ang malikhaing paglalaro ay maaaring magtulak dito palabas ng mahusay na pagkakalibrate ng paghatol.
Sinusubukan ng Huling Laro ang Pagbangon
Ang paligsahan noong Martes ay nagbigay ng isang komplementaryong aral. Nakagawa ang AlphaGo ng isang kapansin-pansing pagkakamali noong unang bahagi ng laro at nahuli, ngunit hindi ito nakabawi. Nagtayo ito ng impluwensya sa gitna, nagtanggol laban sa mga atake ni Lee at unti-unting nakabawi hanggang sa siya ay nagbitiw pagkatapos ng humigit-kumulang limang oras.
ng ulat ng Wired tungkol sa huling laro ang pagbabalik. Ang isang sistemang sinanay upang mapakinabangan ang posibilidad na manalo ay hindi kailangang maglaro nang walang kamali-mali; dapat nitong tukuyin ang isang landas mula sa posisyong aktwal nitong kinakaharap. Ang pagbangon laban sa isang piling kalaban ay nagmumungkahi na ang lakas ng AlphaGo ay hindi limitado sa pagpapatupad ng mga ginustong pattern mula sa isang maagang kalamangan.
Kasabay nito, ang resulta ay hindi dapat ipagkamali bilang adaptasyon sa panahon ng laban sa diwa ng tao. Hindi muling sinanay ng DeepMind ang AlphaGo sa pagitan ng mga laro upang maisama ang ipinakita ni Lee dito. Ang bersyong naglaro noong Martes ay halos pareho ang sistema. Sa kabilang banda, pinag-aralan ni Lee ang mga tendensiya ng programa, binago ang kanyang diskarte at hiniling na maglaro ng itim sa katapusan dahil itinuturing niyang iyon ang mas mahirap na pagsubok.
sa huling salaysay ng The Guardian ang maliit na tagumpay matapos ang malakas na pagbubukas ni Lee. Pinatitibay ng malapit na laro ang isang mas malawak na punto: sinukat sa limang paligsahan, ang AlphaGo ay mas malakas, ngunit ang mga indibidwal na laro ay nanatiling sensitibo sa mga bagong bagay, pagkakamali, at mga madiskarteng pagpili.
Ano ang mga Paglilipat na Higit Pa sa Lupon
Ang mga pamamaraan sa likod ng AlphaGo ay may potensyal saanman ang mga desisyon ay nagsasangkot ng malalaking espasyo sa paghahanap at mga pattern na masyadong kumplikado upang tukuyin nang manu-mano. Ang mga neural network ay nakakatulong na makilala ang pagsasalita at mga imahe. Ang reinforcement learning ay maaaring mag-ambag sa robotics, pamamahala ng mapagkukunan at pagtuklas ng agham sa pamamagitan ng pagpapahintulot sa mga sistema na mapabuti sa pamamagitan ng nakabalangkas na feedback.
Ngunit ang Go ay isang hindi pangkaraniwang malinis na kapaligiran. Bawat legal na aksyon ay tinukoy, lahat ng kaugnay na impormasyon ng lupon ay nakikita, at ang tagumpay ay may malinaw na sukatan. Dapat hawakan ng mga totoong sistema ang nawawalang datos, magkasalungat na layunin, mga pagpapahalagang pantao, at nagbabagong mga kondisyon. Ang isang medikal na rekomendasyon o autonomous na makina ay hindi maaaring basta-basta magsaliksik ng mga pagkakamali sa pamamagitan ng milyun-milyong walang kahihinatnan na mga pagsubok sa sarili.
ng Google tungkol sa hamon ay nagpapakita ng laban bilang isang demonstrasyon ng mga sistema ng pagkatuto na humaharap sa isang problemang dating nangangailangan ng intuwisyon ng tao. Sinusuportahan ng mga laro ang pahayag na iyon, ngunit ipinapakita rin nila kung bakit dapat isama sa pagsubok ang mga pasalungat at hindi pangkaraniwang mga kondisyon. Ang karaniwang pagganap ay maaaring magtago ng mga malutong na rehiyon na tanging isang malikhaing kalaban lamang ang nakakatuklas.
Iyan mismo ang serbisyong ibinigay ni Lee. Ang kanyang nag-iisang tagumpay ay hindi nakakabawas sa resulta ng 4-to-1; ginagawa nitong mas mayaman sa agham ang tagumpay. Ipinakita ng AlphaGo ang kakayahan para sa estratehikong paghatol na higit pa sa mga naunang programa sa paglalaro, habang inilantad ng Game Four ang isang pagkabigo na maaaring suriin ng mga taga-disenyo nito sa halip na basta haka-haka lamang.
Samakatuwid, ang laban ay nagtatapos nang walang simpleng paligsahan sa pagitan ng katalinuhan ng tao at pagkalkula ng makina. Natuto ang AlphaGo mula sa mga laro ng tao, umunlad sa pamamagitan ng sariling paglalaro at nakagawa ng mga galaw na nagturo sa mga propesyonal ng mga bagong posibilidad. Umayon si Lee sa makina at natagpuan ang isang kahinaan na hindi nito isiniwalat sa sarili nito. Ang pinakamabungang pamana ay maaaring ang palitang iyon: ang makapangyarihang mga sistema ng pagkatuto na hinamon ng mga taong may kakayahang sorpresahin sila.