Inilabas ng OpenAI ngayong linggo ang Sora, isang generative artificial-intelligence model na kayang gumawa ng mga video na hanggang 60 segundo ang haba mula sa mga nakasulat na prompt, na nagpapalawak sa trabaho ng kumpanya mula sa teksto at mga still image patungo sa mas mahaba at lubos na detalyadong mga gumagalaw na eksena. Ang modelo ay nananatiling isang research preview sa halip na isang pampublikong produkto, na may limitadong access sa mga piling visual artist, filmmaker, designer at safety tester habang sinusuri ng OpenAI ang mga kakayahan at panganib.

Sa isang teknikal na ulat na inilabas noong Huwebes, inilarawan ng OpenAI ang Sora bilang isang diffusion transformer na magkasamang sinanay sa mga video at imahe na may iba't ibang tagal, resolusyon, at aspect ratio. Sinasabi ng kumpanya na ang pinakamalaking modelo nito ay maaaring makabuo ng isang minuto ng high-fidelity na video at maaari ring mag-animate ng mga still image, palawigin ang umiiral na video pasulong o paatras, at magsagawa ng ilang mga gawain sa pag-edit ng video.

Mula sa mga token ng wika hanggang sa mga visual na patch

Ang arkitektura ng Sora ay humihiram ng isang pangunahing ideya mula sa malalaking modelo ng wika: ang kumakatawan sa magkakaibang impormasyon sa mga standardized unit na maaaring iproseso nang malawakan. Sa halip na mga text token, ang modelo ay kumakatawan sa mga naka-compress na visual data bilang "spacetime patches." Sinasabi ng OpenAI na pinapayagan nito ang isang sistema na matuto mula sa mga video at imahe na may maraming dimensyon sa halip na limitado sa mga fixed-length na clip o isang resolution lamang.

ng kumpanya sa Sora , pinagsasama ng sistema ang proseso ng diffusion at arkitektura ng transformer. Nagsisimula ito sa visual noise at unti-unting binabago ang noise na iyon sa isang video, habang pinoproseso ang maraming frame sa mga paraang nilayon upang mapanatili ang mga paksa kahit na pansamantala silang umalis sa paningin ng camera.

Gumagamit din ang OpenAI ng isang teknik sa pag-recaption na binuo para sa DALL·E 3. Ang isang modelo ng captioning ay lumilikha ng mas detalyadong paglalarawan ng mga training video, at maaaring palawakin ng GPT ang isang maikling prompt ng user sa mas detalyadong mga tagubilin bago ito mabuo. Ang layunin ay upang mapabuti ang kakayahan ng modelo na sundin ang mga prompt na kinasasangkutan ng mga paksa, setting, galaw ng camera at biswal na istilo.

Itinataas ng isang minutong henerasyon ang mapagkumpitensyang pamantayan

Mayroon nang mga text-to-video system mula sa mga kumpanyang kabilang ang Runway, Meta at Google, ngunit ang mga naunang halimbawa ng Sora ay namumukod-tangi dahil sa kanilang tagal at maliwanag na visual coherence. sa preview ng Wired noong Pebrero 15 ang modelo bilang gumagawa ng mga photorealistic sequence na hanggang isang minuto ang haba, habang binibigyang-diin na kasalukuyan lamang itong ipinapakita sa isang maliit na grupo ng mga tagalikha at mananaliksik ng seguridad.

sa saklaw ng Engadget ang mga halimbawa mula sa mga tanawin ng lungsod na may maniyebe hanggang sa mga mammoth na gawa sa lana, pati na rin ang kakayahan ng modelo na bumuo ng isang buong sequence sa halip na basta pagdugtungin lamang ang maiikling clip. Ang mga demonstrasyon ay nagmumungkahi ng makabuluhang pag-unlad sa pagkakapare-pareho ng panahon, isa sa mga pangunahing teknikal na problema sa nabuong video.

Ang pag-unlad na iyan ay hindi dapat ipagkamali sa pisikal na pag-unawa. Ayon sa ulat mismo ng OpenAI, maaaring mabigo ang Sora sa pangunahing sanhi at bunga, pagiging permanente ng bagay, at pisika sa totoong mundo. Ang isang taong nabuo ay maaaring kumagat ng pagkain nang hindi nag-iiwan ng inaasahang marka, ang mga bagay ay maaaring lumitaw nang kusang-loob, at ang mga kumplikadong interaksyon ay maaaring maging hindi magkakaugnay. Ang sistema ay maaaring lumikha ng mga biswal na nakakakumbinsing eksena habang hindi pa rin nauunawaan ang mekanismo ng inilalarawan nito.

Sadyang hindi pa pampubliko ang produkto

Mas maingat ang pamamaraan ng paglulunsad ng OpenAI kaysa sa ginamit nito sa ChatGPT. sa ulat ng Associated Press , hindi karaniwang available ang Sora at limitado lamang ang impormasyong isiniwalat ng kumpanya tungkol sa pinagbabatayang training corpus. Nakikita ng publiko ang mga piling halimbawa, hindi isang serbisyong malayang maaaring subukan ng sinuman.

Sinasabi ng kumpanya na nagbibigay ito ng access sa mga miyembro ng Red Team na may kadalubhasaan sa maling impormasyon, mapoot na nilalaman, at bias, pati na rin sa mga artista at filmmaker na ang feedback ay maaaring matukoy ang parehong mga malikhaing aplikasyon at mga paraan ng pagkabigo. Bumubuo ang OpenAI ng isang detection classifier na nilayon upang makilala ang mga video na binuo ng Sora at sinasabing maaari itong gumamit ng mga pamantayan ng pinagmulan tulad ng C2PA metadata kung ang modelo ay ilalagay sa isang produkto.

Sensitibo ang tiyempo dahil dumarating ang makatotohanang sintetikong video sa panahon ng isang taon ng mga pangunahing halalan sa buong mundo. Ang panganib ay hindi limitado sa mga gawa-gawang talumpating pampulitika. Ang mga nabuong footage ay maaaring gamitin para sa panggagaya, pandaraya, panliligalig, gawa-gawang ebidensya o mapanlinlang na paglalarawan ng mga totoong pangyayari. sa ulat ng paglulunsad ng The Guardian na sinusubukan ng OpenAI na subukan ang mga panganib na iyon bago ang malawakang paglabas.

Pumasok din ang Sora sa isang hindi pa naaayos na legal na debate tungkol sa materyal na ginamit upang sanayin ang mga generative model. Hindi nagbigay ang OpenAI ng detalyadong imbentaryo ng mga video at larawang ginamit para sa Sora. Ayon sa kontemporaryong ulat, inilarawan ng kumpanya ang corpus sa malawak na termino bilang kinabibilangan ng mga materyal na magagamit sa publiko at may lisensya.

Malamang na masusing pagsisiyasat ito mula sa mga filmmaker, photographer, publisher, at iba pang may hawak ng karapatan. Ang mga kumpanya ng Generative-AI ay nahaharap na sa mga kaso kung ang materyal na may copyright ay maaaring gamitin para sa pagsasanay nang walang pahintulot at kung ang mga output ng modelo ay maaaring magparami ng protektadong ekspresyon. Nagdaragdag ang video ng isa pang layer dahil ang materyal sa pagsasanay ay maaaring kabilang ang sinematograpiya, mga pagtatanghal, mga karakter, musika, at iba pang mga karapatan.

Gayunpaman, malaki ang potensyal ng modelo sa pagiging malikhain. Maaaring gumawa ng prototype ang isang filmmaker ng mga eksena bago ang isang shooting, maaaring makabuo ang isang advertiser ng mga konsepto ng footage, maaaring subukan ng isang game studio ang mga kapaligiran, o maaaring mailarawan ng isang tagapagturo ang mga sitwasyong mahirap kunan. Maaari ring tumanggap ang Sora ng mga imahe at mga umiiral na video bilang mga input, na nagmumungkahi ng mga gamit na higit pa sa purong pagbuo ng text-to-video.

Isang preview ng pananaliksik na may mga implikasyon na higit pa sa video

Binibigyang-kahulugan ng OpenAI ang Sora bilang higit pa sa isang kasangkapan sa media. Ikinakatuwiran ng mga mananaliksik nito na ang pag-scale ng generative video ay maaaring isang landas tungo sa mga modelo na natututo ng mga kapaki-pakinabang na representasyon ng pisikal na mundo. Itinuturo ng papel ng pananaliksik ang mga umuusbong na pag-uugali tulad ng pare-parehong paggalaw ng camera at ilang anyo ng interaksyon ng bagay, habang maingat na kinikilala na ang mga kakayahang iyon ay nananatiling hindi kumpleto.

Ang pahayag na iyan ay mangangailangan ng masusing independiyenteng pagsubok. Ang pagbuo ng mga kapani-paniwalang pixel ay hindi katulad ng pag-unawa sa pisika, sanhi o layunin ng tao, at ang mga nakakumbinsing pagkakamali ng Sora ay maaaring magpahirap sa mga gumagamit na maunawaan ang mga pagkakaibang iyon. Ang modelo ay maaaring magmukhang may kaalaman kahit na mali ang pinagbabatayang simulation.

Sa ngayon, ang kahalagahan ng Sora ay nasa agwat na tila isinasara nito sa pagitan ng maiikli at hindi matatag na mga AI clip at mas mahahabang cinematic sequence. Ipinakita ng OpenAI ang isang sistema na maaaring makabuo ng isang minutong video mula sa wika at pinipigilan ang malawak na pag-access habang sinusubukan ang mga kahihinatnan. Kung ang Sora ay magiging isang malawakang ginagamit na creative platform ay nakasalalay hindi lamang sa kalidad ng visual, kundi pati na rin sa gastos, bilis, mga patakaran sa copyright, pinagmulan at kung ang mga sistema ng kaligtasan ay makakasabay sa lalong nakakakumbinsing sintetikong media.