Pinapanatili ng Google na hindi magagamit ang kakayahan ng Gemini na lumikha ng mga larawan ng mga tao matapos ang isang linggong kritisismo dahil sa mga hindi tumpak at may kinikilingang output sa kasaysayan, na ginagawang mas malawak na pagsubok ang isang pagkabigo sa kalidad ng produkto kung gaano kabilis maaaring mag-deploy ang malalaking kumpanya ng teknolohiya ng generative AI nang hindi nawawala ang kontrol sa mga sistema ng kaligtasan na nakapatong sa kanilang mga modelo. Sinabi ng CEO na si Sundar Pichai sa mga empleyado noong Martes na ang ilang tugon ng Gemini ay "lubos na hindi katanggap-tanggap" at sinabing gagawa ang kumpanya ng mga pagbabago sa istruktura bago ibalik ang tampok.

Nagsimula ang kontrobersiya matapos mag-post ang mga user ng mga halimbawa kung saan gumawa ang Gemini ng mga hindi kapani-paniwalang paglalarawan ng lahi at kasarian para sa mga makasaysayang prompt. Kinilala ng Google ang problema at itinigil ang pagbuo ng imahe ng mga tao noong Pebrero 22. Sa isang detalyadong paliwanag ng kumpanya, sinabi ng Senior Vice President ng Google na si Prabhakar Raghavan na labis na nabayaran ng sistema ang pagkakaiba-iba sa ilang mga prompt habang naging labis na maingat sa iba.

Ang pagsasaayos sa kaligtasan ay nagdulot ng pagkabigo sa katumpakan sa kasaysayan

Karaniwang nakatutok ang mga generative image system upang mabawasan ang mga stereotyped o exclusionary output. Sinabi ng Google na ang mga pananggalang ng Gemini ay inilaan upang maiwasan ang pag-uulit ng mga bias na lumitaw sa mga naunang sistema ng pagbuo ng imahe, ngunit ang implementasyon ay nagdulot ng kabaligtaran na pagkabigo sa ilang kontekstong pangkasaysayan. Ang modelo ay nakabuo ng mga taong hindi akma sa panahon o prompt at, sa ibang mga kaso, tumanggi sa mga hindi kanais-nais na kahilingan.

ng Associated Press na pansamantalang sinuspinde ng Google ang tampok matapos kumalat ang mga halimbawa online. Sinabi ng kumpanya na pagbubutihin nito ang katumpakan bago ibalik ang pagbuo ng imahe ng tao. Mahalaga ang desisyong iyon dahil ang Gemini ay hindi isang eksperimental na demo ng pananaliksik; ipinoposisyon ito ng Google bilang pagkakakilanlang nakaharap sa mamimili para sa pinakamahalagang mga produktong generative-AI nito.

sa ulat ng Reuters na muling inilathala ng Yahoo Finance, ang paghinto ay dumating ilang linggo lamang matapos simulan ng Google ang pag-aalok ng pagbuo ng imahe sa pamamagitan ng Gemini at ilang sandali matapos palitan ang pangalan ng Bard bilang Gemini. Inilalarawan ng naka-compress na timeline ang presyur na kinakaharap ng Google habang nakikipagkumpitensya ito sa Microsoft at OpenAI sa mga consumer assistant, enterprise AI, at mga platform ng developer.

Nangako si Pichai ng mga pagbabago sa mga proseso ng paglulunsad at pagsusuri

Sa isang panloob na memo na inilathala ng Semafor, sinabi ni Pichai na ang mga problematikong tugon sa teksto at imahe ay nakasakit sa mga gumagamit at nagpakita ng pagkiling. Sinabi niya na ang mga koponan ay "nagtatrabaho nang walang tigil" at nagbalangkas ng isang hanay ng mga aksyon na kinabibilangan ng mga pagbabago sa istruktura, na-update na mga alituntunin ng produkto, pinahusay na mga proseso ng paglulunsad, mas matibay na mga pagsusuri, pinalawak na red-teaming at mga teknikal na rekomendasyon.

Mahalaga ang listahang iyan dahil inilalarawan nito ang insidente bilang higit pa sa isang makitid na depekto sa modelo ng imahe. Ipinahihiwatig ni Pichai na ang pagkabigo ay maaaring may kinalaman sa paraan ng pagsasalin ng Google ng mga kakayahan ng modelo sa mga produktong pangkonsumo: mabilis na interpretasyon, mga layer ng patakaran, mga filter ng kaligtasan, pagsubok sa saklaw at pamamahala sa paglabas. Sa madaling salita, ang pag-aayos ng output ay maaaring mangailangan ng pagbabago sa proseso na nagbigay-daan sa output na maisagawa ang produksyon.

Hindi pa nagbibigay ang kumpanya ng tiyak na petsa para sa pagpapanumbalik ng imahe ng mga tao. Ipinahiwatig ni Pichai na inaasahan ng Google ang mga pagpapabuti sa mga darating na linggo, ngunit ang tampok na ito ay nananatiling hindi pinagana simula Sabado. Ito ay isang makabuluhang pag-atras para sa isang kumpanyang gumugol ng Pebrero sa pagpapabilis ng pampublikong paglulunsad ng Gemini.

Ang paghinto ay dumating sa gitna ng isang hindi pangkaraniwang agresibong paglawak ng Gemini

Noong Pebrero 8, pormal na pinalitan ng Google ang pangalang Bard ng Gemini at ipinakilala ang Gemini Advanced, na pinapagana ng Ultra 1.0, pati na rin ang isang nakalaang Android application. Sa anunsyo ng paglulunsad, inilarawan ni Pichai ang Gemini bilang isang ecosystem na sumasaklaw sa mga produktong pangkonsumo, API, serbisyo sa cloud at mga tool ng developer sa halip na iisang chatbot.

Pagkalipas ng isang linggo, inanunsyo ng Google ang Gemini 1.5, na nagtatampok ng isang context window na maaaring umabot sa 1 milyong token sa limitadong preview at magproseso ng mahahabang dokumento, video, audio at malalaking codebase. Ipinapakita ng mga teknikal na pagsulong na iyon na ang pinagbabatayang diskarte sa produkto ay nagpapatuloy kahit na naka-pause ang isang nakikitang tampok ng mamimili.

Ang tensyon ay nagiging sentro ng industriya ng AI: ang kakayahan ng modelo ay mabilis na umuunlad, habang ang mga pananggalang sa produkto ay nananatiling mahirap i-calibrate. Ang isang sistema ay maaaring maging mas may kakayahan sa pangangatwiran, pag-coding o multimodal analysis at mabibigo pa rin dahil ang pag-tune ng patakaran o mga interbensyon sa kaligtasan ay nagpapabago sa mga partikular na output.

Ang tiwala ay nagiging isang kinakailangan sa produkto, hindi isang isyu sa komunikasyon

Ang problema ng Google ay lalong sensitibo dahil ang pangunahing negosyo ng kumpanya ay nakabatay sa pagkuha ng impormasyon at tiwala ng gumagamit. Ang Gemini ay isinasama sa mga produktong maaaring makaimpluwensya sa paghahanap, produktibidad, advertising at mobile computing. Kung naniniwala ang mga gumagamit na ang sistema ay may kinikilingan sa politika o kultura, o sadyang hindi maaasahan sa mga pangunahing tanong sa kasaysayan, ang problema ay maaaring kumalat nang higit pa sa isang tampok ng imahe.

Kinikilala ng mismong paliwanag ng kumpanya na ang generative AI ay patuloy na magkakamali. Isinulat ni Raghavan na ang mga halusinasyon at mga di-perpektong output ay nananatiling kilalang mga hamon at nagbabala sa mga gumagamit laban sa pag-asa sa Gemini para sa mga umuusbong na balita o sensitibong mga paksa nang walang beripikasyon. Makatotohanan ang pag-amin na iyon, ngunit itinatampok din nito ang agwat sa pagitan ng probabilistikong katangian ng teknolohiya at ang mga inaasahan na inilalagay sa isang produktong impormasyon na may tatak na Google.

Ang agarang layunin sa inhinyeriya ay ibalik ang imahe ng mga tao nang hindi muling lumilikha ng mga stereotype o lumilikha ng mga hindi kapani-paniwalang eksena sa kasaysayan. Ang mas malawak na layunin ay mas mahirap: bumuo ng isang proseso ng paglabas na makakatukoy kung kailan ang isang mahusay na nilayong interbensyon sa kaligtasan ay lumilikha ng ibang anyo ng pagbaluktot. Habang patuloy na pinapalawak ng Google ang Gemini sa buong portfolio ng produkto nito, ang paghinto ngayong linggo ay isang paalala na ang kompetisyon ay hindi lamang tungkol sa mas malalaking modelo at mas mahahabang window ng konteksto. Ito ay tungkol din sa kung magagawa ng mga kumpanya na ang mga sistemang iyon ay kumilos nang sapat na mahuhulaan upang maging karapat-dapat sa tiwala na kinakailangan para sa paggamit sa malawakang merkado.