Inilabas ng OpenAI ang GPT-4 ngayong linggo, na nagpapakilala ng isang bagong henerasyon ng modelo ng artificial-intelligence nito na kayang tumanggap ng parehong input ng teksto at imahe, makabuo ng mga tugon sa teksto at mas mahusay kaysa sa hinalinhan nito sa malawak na hanay ng mga propesyonal at akademikong benchmark. Kasabay nito, kinumpirma ng Microsoft na ang bagong karanasan sa paghahanap sa Bing ay tumatakbo na sa GPT-4, na ginagawang agarang pagsubok ang pasinaya ng modelo kung gaano kabilis makakagalaw ang frontier AI mula sa pananaliksik patungo sa mga produktong pangmalawakang pamilihan.
Inilalarawan ng anunsyo ng paglulunsad ng OpenAI noong Marso 14 ang GPT-4 bilang isang malaking multimodal na modelo na nananatiling hindi gaanong may kakayahan kaysa sa mga tao sa maraming sitwasyon sa totoong mundo ngunit ipinapakita ang tinatawag ng kumpanya na pagganap sa antas ng tao sa ilang mga standardized na pagsusuri. Ang pinakakapansin-pansing benchmark ay isang kunwaring bar exam: Ang GPT-4 ay nakakuha ng iskor na nasa bandang top 10% ng mga kumuha ng pagsusulit , kumpara sa GPT-3.5 na nasa bandang bottom 10%.
Pinalalawak ng multimodal input ang maaaring bigyang-kahulugan ng modelo
Ang pinakamalaking pagbabago sa arkitektura na nakikita ng mga gumagamit ay ang multimodality. Ang GPT-3.5 at ang orihinal na karanasan sa ChatGPT ay pangunahing gumagana sa teksto. Ang GPT-4 ay maaaring tumanggap ng mga imahe pati na rin ang teksto at dahilan sa pamamagitan ng kombinasyon, na nagpapahintulot sa isang gumagamit na magbigay ng litrato, diagram, tsart o screenshot at magtanong tungkol sa kung ano ang nilalaman nito. Sa simula, ginagawang magagamit ng OpenAI ang kakayahang teksto sa pamamagitan ng ChatGPT Plus at isang waitlist ng developer API, habang ang pag-input ng imahe ay nananatili sa isang mas limitadong preview ng pananaliksik.
ng kasamang teknikal na ulat ang benchmark performance sa batas, medisina, matematika, pagbasa, pagsusulat at iba pang larangan. Sinasabi ng OpenAI na mahusay din ang performance ng GPT-4 sa mga multilingual variant ng mga karaniwang pagsusulit sa modelo ng wika. Gayunpaman, binibigyang-diin ng kumpanya na ang mga benchmark na resultang ito ay hindi nangangahulugan na ang modelo ay nagtataglay ng maaasahang propesyonal na paghatol o dapat itong gamitin nang walang pagsusuri sa mga setting na may mataas na panganib.
Kapansin-pansin din ang ulat dahil sa mga hindi nito isinisiwalat. Kakaunti lang ang detalyeng ibinibigay ng OpenAI tungkol sa laki ng modelo, hardware, training compute, pagbuo o arkitektura ng dataset, na binabanggit ang mapagkumpitensyang kapaligiran at mga implikasyon sa kaligtasan ng mga modelong may mataas na kakayahan. Ito ay kumakatawan sa isang pag-alis mula sa mas kumpletong teknikal na pagsisiwalat na kasama ng ilang naunang pananaliksik sa large-language-model at malamang na magpatindi ng debate kung gaano karaming impormasyon ang dapat ilathala ng mga frontier-model developer.
Kinumpirma ng Microsoft na ang GPT-4 ay nasa loob na ng Bing
Inalis ng Microsoft ang isang malaking misteryo noong araw ng paglulunsad. Sa isang post sa Bing Search Blog, kinumpirma ng kumpanya na ang bagong Bing nito ay tumatakbo sa isang customized na bersyon ng GPT-4 sa buong panahon ng preview. Samakatuwid, ang mga user na sumubok sa conversational search ng Bing sa nakalipas na limang linggo ay nakipag-ugnayan na sa isang maagang pag-deploy ng modelo.
Ipinapakita ng kumpirmasyong iyan kung gaano kalapit ang kaugnayan ng pananaliksik ng OpenAI at ng estratehiya ng produkto ng Microsoft. Malaki ang namuhunan ng Microsoft sa OpenAI, nagbibigay ng imprastraktura ng Azure para sa mga modelo nito, at hinabi ang generative AI sa search at enterprise software. Ang paglulunsad ng GPT-4 ay nagbibigay sa Microsoft ng isang bagong layer ng modelo na maaaring sumuporta sa mga produktong higit pa sa Bing, kahit na pinapabilis ng Google at iba pang mga kumpanya ng teknolohiya ang kanilang sariling mga paglabas ng generative-AI.
ng isang kasabay na ulat ng Reuters ang paglulunsad bilang bahagi ng lumalawak na kompetisyon sa kung paano gagamit ng generative AI ang mga manggagawa sa opisina, developer, at mamimili. Nabanggit sa ulat na ang bersyong text-input ay magagamit na ng mga subscriber at developer ng ChatGPT Plus sa pamamagitan ng waitlist, habang ang image input ay hindi pa karaniwang magagamit.
Ipinapakita ng mga unang customer kung gaano kabilis na napupunta ang GPT-4 sa mga produkto
Gumagamit ang OpenAI ng ilang naunang kasosyo upang ipakita na ang GPT-4 ay inilaan bilang isang plataporma sa halip na isang bagong chatbot lamang. Inilalapat ng kumpanya ng pagbabayad na Stripe ang modelo sa suporta, klasipikasyon ng negosyo, at mga daloy ng trabaho na may kaugnayan sa pandaraya. Ayon sa isang case study , pinakilos ng Stripe ang 100 empleyado upang galugarin ang mga aplikasyon ng GPT-4 at natukoy ang dose-dosenang mga potensyal na kaso ng paggamit, kabilang ang pagbubuod ng mga website ng merchant at pagtulong sa mga developer na mag-navigate sa teknikal na dokumentasyon.
Nag-eeksperimento rin ang mga kompanya ng edukasyon sa modelo. Ipinakilala ng serbisyo sa pag-aaral ng wika na Duolingo ang mga feature na pinapagana ng GPT-4 para sa mga pag-uusap na role-play at mga paliwanag kung bakit tama o mali ang isang sagot. Sinusubukan ng Khan Academy ang isang tutoring assistant na nakabatay sa GPT-4. Itinatampok ng mga paggamit na ito ang isang mahalagang pagkakaiba sa pagitan ng isang pangkalahatang-gamit na modelo at isang tapos na produkto: ang modelo ay nagbibigay ng kakayahan sa wika at pangangatwiran, habang tinutukoy ng taga-disenyo ng aplikasyon kung anong impormasyon ang natatanggap nito, kung paano ito sinenyasan at kung saan ipinapasok ang pangangasiwa ng tao.
Isang ulat ng TechCrunch ang tumukoy din sa Morgan Stanley, Stripe, Duolingo at Khan Academy sa mga unang gumamit nito. Pinopresyuhan ng OpenAI ang access sa API ayon sa bilang ng mga input at output token na naproseso, na nagtatatag ng direktang modelo ng ekonomiya para sa mga kumpanyang gustong bumuo ng GPT-4 sa software sa halip na gamitin ang ChatGPT bilang isang standalone na serbisyo.
Pinapabuti ng gawaing pangkaligtasan ang modelo ngunit hindi inaalis ang mga halusinasyon
Ayon sa OpenAI, gumugol ito ng halos anim na buwan sa paulit-ulit na pagkakahanay at pagsubok sa adversarial bago ilabas. Ang hiwalay na GPT-4 system card ay nagdedetalye ng mga pagsusuri na kinasasangkutan ng mapaminsalang nilalaman, cybersecurity, privacy, impormasyon tungkol sa biyolohikal na panganib, mga hindi pinapayagang kahilingan at iba pang mga lugar kung saan ang isang mas may kakayahang modelo ay maaaring lumikha ng mas malalaking problema sa kaligtasan kung ilalapat nang hindi maingat.
Iniulat ng kumpanya na ang GPT-4 ay mas malamang na hindi makagawa ng ilang uri ng hindi pinapayagang nilalaman kaysa sa GPT-3.5 at mas mahusay ang pagganap sa mga panloob na pagsusuri ng katotohanan. Gayunpaman, paulit-ulit na nagbabala ang OpenAI na ang GPT-4 ay hindi pa rin ganap na maaasahan. Maaari itong maghalusinasyon ng mga katotohanan, gumawa ng mga pagkakamali sa pangangatwiran, tumanggap ng mga maling premisa at makagawa ng mga kumpiyansang wika na nagpapalabis sa kalidad ng sagot nito. Ang mga limitasyong iyon ay lalong mahalaga dahil ang pinahusay na kahusayan at pagganap sa benchmark ay maaaring magpahirap sa mga error na makilala ng mga user.
Para sa mga propesyonal na aplikasyon, ang isyu ay hindi lamang kung ang modelo ay kahanga-hanga sa isang demonstrasyon. Ito ay kung ang mga organisasyon ay maaaring bumuo ng mga sistema na nagpapatunay ng mga output, naghihigpit sa pag-access sa sensitibong data, nag-i-log ng pag-uugali ng modelo at tumutukoy kung kailan dapat suriin ng isang tao ang isang sagot bago ito makaapekto sa isang customer, pasyente, desisyon sa pananalapi o prosesong legal.
Ang mapagkumpitensyang tanong ay nagbabago mula sa kung ilalapat ang AI patungo sa kung gaano kabilis
Dumating ang GPT-4 tatlo at kalahating buwan lamang matapos ang pampublikong debut ng ChatGPT na nagpabago sa generative AI mula sa isang espesyalistang teknolohiya patungo sa isang pangunahing penomeno ng mga mamimili. Ang bilis ngayon ay pinipilit ang mga kumpanya ng teknolohiya na gumawa ng mga desisyon sa hindi pangkaraniwang maiikling panahon. Nailagay na ng Microsoft ang modelo sa paghahanap. Naghahanda na ang mga developer para sa access sa API. Sinusubukan ng mga kumpanya sa mga sektor ng pagbabayad, edukasyon, at pananalapi ang mga daloy ng trabaho sa produksyon bago pa man maging malawakang magagamit ang kakayahan sa imahe ng modelo.
Samakatuwid, ang panandaliang kalamangan sa kompetisyon ay maaaring hindi gaanong nakasalalay sa kung sino ang maaaring magpakita ng isang modelo ng wika at higit pa sa kung sino ang ligtas na makakapagkonekta sa isa sa mahahalagang datos at mga daloy ng trabaho. Ang mga search engine ay may mga web index. Ang mga bangko ay may mga sistema ng pananaliksik at pagsunod. Ang mga kumpanya ng edukasyon ay may mga kurikulum at kasaysayan ng mga mag-aaral. Ang mga vendor ng enterprise software ay may mga rekord ng customer, benta, at operasyon. Ang GPT-4 ay maaaring magbigay ng pangkalahatang layer ng pangangatwiran at pagbuo, ngunit ang nakapalibot na datos, mga kontrol, at disenyo ng produkto ang magtatakda kung ang kakayahang iyon ay magiging kapaki-pakinabang.
Ang paglabas ng OpenAI ay isa ring paalala na ang mas mahusay na pagganap ng benchmark ay hindi nalulutas ang mas malalaking tanong tungkol sa AI. Ang modelo ay mas may kakayahan, ngunit hindi pa rin malinaw sa mahahalagang teknikal na aspeto at madaling magkamali. Maaari nitong bigyang-kahulugan ang mas maraming uri ng input, ngunit ang pag-access sa kakayahang iyon ay isinasagawa na lamang sa yugto. Nasa loob na ito ng isang pangunahing produkto ng Microsoft, ngunit ang mga kumpanya ay nagsisimula pa lamang na maunawaan kung paano pamahalaan ang paggamit nito.
Ang nagbago ngayong linggo ay ang baseline. Ang generative AI na tila hindi pangkaraniwan noong inilunsad ang ChatGPT noong Nobyembre ay mayroon na ngayong mas may kakayahang kahalili, isang multimodal interface at isang lumalawak na komersyal na ecosystem. Ang kahalagahan ng GPT-4 ay sa huli ay susukatin hindi sa pamamagitan ng mga kunwang pagsusulit kundi sa kung magagawa ng mga developer na gawing maaasahang tool ang mga kakayahang iyon nang hindi hinahayaang lumampas ang kumpiyansa ng modelo sa katumpakan nito.