Nagpataw ang awtoridad sa proteksyon ng datos ng Italya ng agarang pansamantalang limitasyon noong Biyernes sa pagproseso ng OpenAI ng personal na datos ng mga gumagamit ng Italya sa pamamagitan ng ChatGPT, na lumikha ng pinakamahalagang interbensyon sa regulasyon laban sa mabilis na lumalagong generative artificial-intelligence service.
Sinabi ng Italyanong regulator, na kilala bilang Garante, sa utos nito noong Marso 31 na nagbukas ito ng imbestigasyon matapos matukoy ang mga alalahanin tungkol sa mga abiso sa privacy, ang legal na batayan para sa malawakang pangongolekta ng personal na impormasyon na ginagamit upang sanayin ang mga algorithm, hindi tumpak na personal na data na ginawa ng system at ang kawalan ng isang epektibong mekanismo upang i-verify ang edad ng mga user. Itinuro rin nito ang isang insidente sa seguridad noong Marso 20 na naglantad sa mga pamagat ng chat ng ilang user at limitadong impormasyon sa pagbabayad.
Ang datos ng pagsasanay ay nagiging sentro ng debate sa AI
Ang utos ay higit pa sa mekanismo ng isang paglabag sa datos. Sinabi ng Garante na tila walang legal na batayan na sumusuporta sa "malawakang pangongolekta at pagproseso" ng personal na datos na ginagamit upang sanayin ang mga pinagbabatayang algorithm ng ChatGPT. Ang hamong iyon ay tumutuon sa isang pundamental na tanong para sa modernong generative AI: kung ang malawak na paggamit ng impormasyon sa internet ay makakatugon sa mga kinakailangan ng Europa para sa legal, transparent, at proporsyonal na pagproseso.
Inilarawan ng OpenAI ang mga modelo nito bilang mga sistemang sinanay sa kombinasyon ng impormasyong makukuha ng publiko, mga lisensyadong materyal, at datos na nilikha ng mga tagapagsanay na tao, ngunit hindi naglalathala ang kumpanya ng komprehensibong listahan ng mga dokumento sa pagsasanay. Ang interbensyon ng regulator ay maaaring magpilit ng mas tumpak na paliwanag kung anong personal na datos ang ginagamit, kung bakit naaayon sa batas ang pagproseso ng mga ito, at kung ano ang mga karapatan ng mga indibidwal kapag ang mga output ng modelo ay naglalaman ng hindi tumpak na impormasyon tungkol sa mga ito.
Dumating ang desisyon halos dalawang linggo matapos ilabas ng OpenAI ang GPT-4, isang mas may kakayahang modelo na kayang tumanggap ng mga input ng imahe pati na rin ang mga input ng teksto at sinasabi ng kumpanya na mas mahusay ang pagganap kaysa sa mga naunang sistema sa maraming propesyonal at akademikong benchmark. Ang paglulunsad na iyon ay nagpatindi sa parehong komersyal na interes at pagsusuri sa pagiging maaasahan ng mga sistema.
Nagdagdag ng pagkaapurahan ang paglabag noong Marso 20
Isiniwalat ng OpenAI na isang bug sa software ang nagtulak sa ChatGPT na mag-offline noong Marso 20 matapos makita ng ilang user ang mga pamagat mula sa mga pag-uusap ng ibang user. Sa isang detalyadong ulat ng insidente, sinabi ng kumpanya na ang parehong bug ay maaaring naglantad ng impormasyon na may kaugnayan sa pagbabayad para sa 1.2% ng mga aktibong subscriber ng ChatGPT Plus sa loob ng siyam na oras, kabilang ang mga pangalan, email address, payment address, expiration date ng card at ang huling apat na digit ng mga numero ng card.
Hindi inilantad ng insidente ang kumpletong numero ng credit card, at sinabi ng OpenAI na nakipag-ugnayan ito sa mga apektadong user. Ngunit nagbigay ito ng konkretong halimbawa ng mga panganib sa privacy na kaakibat ng isang serbisyong ginagamit ng milyun-milyong tao para sa pagsusulat, coding, pananaliksik, at lalong nagiging sensitibong mga pag-uusap.
Samakatuwid, pinagsasama ng aksyon ng Garante ang dalawang magkaibang tanong sa regulasyon: ang mga kumbensyonal na obligasyon sa cybersecurity na nakapalibot sa isang paglabag at mas malawak na mga tanong tungkol sa kung ang mga generative AI system ay maaaring legal na mangolekta, maghinuha, at magparami ng personal na impormasyon nang malawakan.
Ang Italya ang naging unang pangunahing kaso ng pagsubok sa Kanluran
ng Guardian noong Biyernes na kumilos ang Italya upang paghigpitan ang ChatGPT habang iniimbestigahan ng regulator, na ginagawa itong unang Kanluraning bansa na gumawa ng ganitong direktang hakbang laban sa serbisyo. Tumugon ang OpenAI sa pamamagitan ng hindi pagpapagana ng access sa Italya at sinabing naniniwala itong sumusunod ito sa batas sa privacy.
Iniulat ng Euronews na binigyan ang OpenAI ng 20 araw upang ipaalam ang mga hakbang na ginawa nito upang sumunod. Sa ilalim ng General Data Protection Regulation ng Europa, ang mga paglabag ay maaaring humantong sa mga parusang aabot sa €20 milyon o 4% ng taunang kita sa buong mundo, depende sa probisyon at mga pangyayari.
Ang aksyong pangregulasyon ay nagbabangon din ng isang mahirap na tanong sa pagpapatupad. Ang ChatGPT ay isang serbisyong cloud na inihahatid sa buong mundo, habang ang batas sa privacy ay nakabatay sa teritoryal at mga karapatan. Maaaring paghigpitan ng OpenAI ang pag-access ayon sa heograpiya, ngunit ang paglutas sa mga pinagbabatayang tanong ay maaaring mangailangan ng mga pagbabago sa pamamahala ng datos, mga abiso, mga kontrol sa edad, pagbuo ng modelo o mga pamamaraan para sa pagwawasto ng impormasyon—hindi lamang isang pagharang sa heograpiya.
Lumalawak ang presyon sa advanced AI
Ang hakbang na ito ng Italya ay naganap sa gitna ng mas malawak na debate tungkol sa kung gaano kabilis dapat i-deploy ang mga advanced na sistema ng AI. Mahigit isang libong mananaliksik at ehekutibo ng teknolohiya ang pumirma sa isang pampublikong liham na nananawagan para sa anim na buwang paghinto sa mga sistema ng pagsasanay na mas malakas kaysa sa GPT-4 habang binubuo ang mga pamantayan sa kaligtasan. Ang liham ay hindi isang dokumento ng regulasyon at ang iminungkahing paghinto nito ay boluntaryo, ngunit inilalarawan nito ang lumalawak na pag-aalala tungkol sa pamamahala na mas mabagal kaysa sa kakayahang teknikal.
Kasabay nito, bumibilis ang kompetisyon sa komersyo. Inilalagay ng Microsoft ang teknolohiyang OpenAI sa buong search at productivity software, isinusulong ng Google ang sarili nitong mga conversational system at ang mga startup ay bumubuo ng mga application sa ibabaw ng malalaking language model. Ang insentibo sa ekonomiya ay ang mabilis na pag-deploy; ipinapakita na ngayon ng mga awtoridad sa privacy at kaligtasan na ang pag-deploy ay maaaring magdulot ng mga obligasyon bago pa man maisaayos ang mga pamantayan ng industriya.
ulat ng TechCrunch na ang order sa Italya ay hindi lamang nagtatanong tungkol sa transparency kundi pati na rin sa katumpakan ng personal na data na nabuo ng ChatGPT. Ito ay isang partikular na mahalagang isyu para sa mga generative model dahil hindi nila kinukuha ang mga katotohanan sa parehong paraan tulad ng isang kumbensyonal na database. Bumubuo sila ng mga istatistikal na posibleng wika at maaaring makagawa ng mga kumpiyansa ngunit maling pahayag.
sa ulat ng Reuters na inilabas ng Investing.com, agarang ginawa ang aksyon ng Italya habang iniimbestigahan ng regulator. Malamang na babantayang mabuti ng iba pang mga awtoridad sa proteksyon ng datos sa Europa ang kaso dahil ang GDPR ay nalalapat sa buong European Union kahit na ang mga pambansang regulator ang nangunguna sa pagpapatupad.
Ang resulta ay maaaring maging isang maagang plano kung paano naaangkop ang batas sa privacy sa generative AI. Ang mga pangunahing tanong ay hindi na teoretikal: anong datos ang maaaring gamitin upang sanayin ang isang modelo, ano ang dapat sabihin sa mga gumagamit, paano ibinubukod o pinoprotektahan ang mga menor de edad, paano itinatama ang hindi tumpak na personal na impormasyon at sino ang mananagot kapag ginawa ito ng isang modelo. Ipinilit na ngayon ng Italya ang mga tanong na iyon sa isang pormal na proseso ng regulasyon, na ginagawang hindi lamang isang penomeno sa teknolohiya ang ChatGPT kundi isang pagsubok kung ang umiiral na batas sa privacy ay maaaring mamuno sa isang bagong uri ng mga sistema ng machine-learning.