Ipinakilala ng Google ang Gemini, isang bagong pamilya ng mga modelo ng artificial-intelligence na idinisenyo upang iproseso ang teksto, mga imahe, audio, video at code, at agad na inilalapat ang mid-sized na modelo ng Gemini Pro sa Bard. Sinasabi ng kumpanya na ang pinakamalaking bersyon nito, ang Gemini Ultra, ay lumampas sa kasalukuyang state-of-the-art na pagganap sa 30 sa 32 malawakang ginagamit na mga benchmark sa akademya, bagaman ang modelong iyon ay mananatili sa pagsubok sa kaligtasan at limitadong pagsusuri hanggang sa susunod na taon.
Ang paglulunsad noong Disyembre 6 ang pinakadirektang teknikal na sagot ng Google sa mabilis na pag-aampon ng GPT-4 at ChatGPT ng OpenAI. Sa halip na maglabas ng isang modelo para sa lahat ng gamit, bumuo ang Google ng tatlong bersyon: Ultra para sa mga pinakakumplikadong gawain, Pro para sa malawak na paggamit sa cloud-scale at Nano para sa mahusay na pagkalkula sa device.
Tatlong modelo ang nagta-target ng iba't ibang kapaligiran sa pag-compute
Ayon sa Google DeepMind, ang Gemini ay dinisenyo mula pa sa simula bilang isang multimodal system sa halip na isang text model na may magkakahiwalay na bahaging kalakip sa ibang pagkakataon. Sinasabi ng kumpanya na ang pamamaraang iyon ay nagbibigay-daan sa mga modelo na mangatwiran sa mga kumbinasyon ng nakasulat na wika, mga imahe, audio at video at magsagawa ng mga gawain sa programming. launch collection ang Gemini 1.0 bilang sinanay sa malawakang saklaw sa imprastraktura ng Tensor Processing Unit ng kumpanya.
Ang Gemini Pro ang bersyong maaaring maranasan ng karamihan sa mga gumagamit ngayon. Naglagay ang Google ng espesyal na naka-tune na bersyon sa wikang Ingles sa Bard sa mahigit 170 bansa at teritoryo. Sinasabi ng kumpanya na ang pag-upgrade ay nagpapabuti sa pangangatwiran, pagpaplano, at pag-unawa. Ayon sa isang anunsyo ng Bard , ang access sa Gemini Ultra ay darating sa ibang pagkakataon sa pamamagitan ng mas advanced na karanasan sa Bard pagkatapos ng karagdagang pagsusuri.
Ang Gemini Nano ay para sa mga mobile device. Ayon sa update ng Google sa Pixel , ginagamit ng Pixel 8 Pro ang Nano para sa mga feature kabilang ang summarization sa Recorder application at Smart Reply sa Gboard. Ang pagpapatakbo ng ilang generative-AI function nang lokal ay maaaring makabawas sa latency, magpahintulot sa offline na paggamit, at magtago ng ilang impormasyon sa device sa halip na ipadala ito sa isang remote data center.
Agresibong mga pahayag tungkol sa benchmark ang ginawa ng Google
Ang pinakakapansin-pansing bahagi ng anunsyo ay ang pahayag ng Google na ang Gemini Ultra ay nagtatakda ng mga bagong resulta sa isang malawak na grupo ng mga pagsubok. Sinasabi ng kumpanya na ang Ultra ay higit pa sa mga umiiral na makabagong resulta sa 30 sa 32 benchmark na ginagamit para sa malalaking modelo ng wika at mga multimodal system. Nag-uulat ito ng iskor na 90% sa MMLU, isang benchmark na sumasaklaw sa 57 na paksa tulad ng matematika, pisika, kasaysayan, batas, medisina at etika.
Ang mga resultang iyon ay dapat ituring bilang mga natuklasang benchmark na iniulat ng kumpanya sa halip na ebidensya mula sa malawakang paggamit ng publiko. Ang Gemini Ultra ay hindi pa pangkalahatang magagamit, na nangangahulugang ang mga panlabas na developer at mananaliksik ay hindi maaaring malayang kopyahin ang buong hanay ng mga pahayag sa ordinaryong pag-deploy. Ars Technica na sinasabi ng Google na nalampasan ng Ultra ang mga resultang nauugnay sa GPT-4 sa maraming pagsubok, ngunit binigyang-diin din na ang mga paghahambing ng benchmark sa pagitan ng mga proprietary na modelo ay maaaring maging sensitibo sa mga prompt, mga pamamaraan ng pagsusuri at pag-access sa modelo.
ng Guardian na sinabi ng Google na mas mahusay ang performance ng Ultra kaysa sa mga kalabang sistema sa 30 sa 32 pagsubok na itinampok nito. Kinilala rin ng kumpanya na ang mga halusinasyon — na may kumpiyansang nakabuo ng mga mali o hindi sinusuportahang sagot — ay nananatiling isang hindi nalutas na problema sa pananaliksik. Mahalaga ang babalang ito dahil ang lakas ng benchmark ay hindi nag-aalis ng mga limitasyon sa pagiging maaasahan na nakaapekto sa bawat pangunahing generative-AI system.
Nanatili ang Ultra sa likod ng isang safety gate
Hindi pa malawakang inilalabas ng Google ang pinakamalakas nitong modelo sa paglulunsad. Ayon sa kumpanya, ang Gemini Ultra ay sumasailalim sa external red-team testing, safety evaluation, fine-tuning at reinforcement learning mula sa feedback ng tao. Makakatanggap ng maagang access ang piling mga customer, developer, at eksperto bago ang mas malawak na release na nakaplano sa unang bahagi ng 2024.
Ang unti-unting pamamaraan ay sumasalamin sa lumalaking pagsusuri ng mga frontier AI system. Ang executive order ni Pangulong Joe Biden noong Oktubre ay nag-aatas sa mga developer ng ilang modelo na may mataas na kakayahan na magbigay sa pederal na pamahalaan ng impormasyon tungkol sa pagsusuri sa kaligtasan sa ilalim ng mga tinukoy na kondisyon. Sinasabi ng Google na balak nitong makipagtulungan sa mga pagsisikap sa kaligtasan ng gobyerno at tinatalakay din ang pagsusuri sa bagong AI Safety Institute ng United Kingdom.
Magiging available ang Gemini Pro sa mga developer at enterprise customer sa pamamagitan ng Google AI Studio at Vertex AI simula Disyembre 13, ayon sa kumpanya. Dahil sa estratehiyang pamamahagi na ito, hindi lamang magiging isang consumer-chatbot upgrade ang Gemini kundi isang platform technology na nilayong makipagkumpitensya para sa corporate software, cloud-computing, at mga workload sa pagbuo ng application.
Ang mga mapagkumpitensyang pusta ay umaabot sa buong portfolio ng produkto ng Google
May mga hindi pangkaraniwang bentahe ang Google sa pamamahagi ng isang bagong modelo ng pundasyon dahil kontrolado nito ang malawakang ginagamit na mga serbisyo ng mga mamimili, ang Android, Chrome, Search at isang pangunahing cloud platform. Sinasabi ng kumpanya na kalaunan ay lilitaw ang Gemini sa Search, Ads, Chrome at iba pang mga produkto. Ang mga unang eksperimento sa Search ay nagbawas ng latency sa Search Generative Experience nito, ayon sa mga materyales sa paglulunsad ng Google.
Ang lawak na iyan ay nagpapataas din ng nakataya. Isinama ng Microsoft ang teknolohiyang OpenAI sa Bing, GitHub at sa software nito para sa mga negosyo, habang ang OpenAI ay nakapagtayo ng malaking direktang base ng mga gumagamit sa pamamagitan ng ChatGPT. Dapat ipakita ng Google hindi lamang na mahusay ang pagganap ng Gemini sa mga kontroladong pagsubok, kundi na mapapabuti rin nito ang mga produktong ginagamit ng bilyun-bilyong tao nang hindi nagdudulot ng hindi katanggap-tanggap na mga problema sa pagiging maaasahan, privacy, o kaligtasan.
Samakatuwid, ang unang paglabas ay lumilikha ng dalawang-yugtong pagsubok. Maaari nang simulan ng Gemini Pro at Nano ang pag-iipon ng totoong ebidensya sa pamamagitan ng mga device na Bard at Pixel. Ang Gemini Ultra, ang modelo sa likod ng pinakamatinding pahayag tungkol sa pagganap ng kumpanya, ay dapat munang aprubahan ang karagdagang panloob at panlabas na pagsusuri.
Itinatag ng anunsyo ng Google ang Gemini bilang sentral na arkitektura ng AI ng kumpanya sa mga susunod na panahon. Kung babaguhin nito ang balanse ng kompetisyon ay hindi gaanong nakasalalay sa iisang benchmark table kundi sa kung paano gumaganap ang tatlong laki ng modelo kapag ginagamit ito ng mga developer, negosyo, at mamimili sa malawakang saklaw. Sa linggong ito, nagsimula na ang prosesong iyon para sa Pro at Nano; ang mga pinakamahalagang pahayag na nakakabit sa Ultra ay nananatiling susubukan sa labas ng Google.