Krajem prošlog tjedna, OpenAI je najavio novi generativni AI sustav pod nazivom Sora, koji proizvodi kratke videozapise iz tekstualnih upita. Iako Sora još nije dostupna javnosti, visoka kvaliteta do sada objavljenih uzoraka rezultata izazvala je i uzbuđenje i zabrinute reakcije.

Ogledni videozapisi koje je objavio OpenAI, za koje tvrtka kaže da ih je stvorila izravno Sora bez izmjena, prikazuju rezultate iz upita poput "fotorealističnog videa izbliza dvaju gusarskih brodova koji se međusobno bore dok plove unutar šalice kave" i "povijesne snimke Kalifornije za vrijeme zlatne groznice".

Na prvi pogled često je teško reći da ih generira AI, zbog visoke kvalitete videa, tekstura, dinamike scena, pokreta kamere i dobre razine dosljednosti.

TEST — Noctua Tech (homepage top 2)

Izvršni direktor OpenAI-ja Sam Altman također je objavio neke videozapise na X-u (bivši Twitter) generirane kao odgovor na upite koje su sugerirali korisnici, kako bi demonstrirao Sorine mogućnosti.

https://twitter.com/sama/status/1758219575882301608?ref_src=twsrc%5Etfw%7Ctwcamp%5Etweetembed%7Ctwterm%5E1758219575882301608%7Ctwgr%5Ed84270f0af6e2423a0b551a38aff8b6564e76b5d%7Ctwcon%5Es1_&ref_url=https%3A%2F%2Fwww.sciencealert.com%2Fopenais-sora-unleashes-new-text-to-video-generative-ai-its-shockingly-powerful

Kako Sora funkcionira?

Sora kombinira značajke alata za generiranje teksta i slika u ono što se naziva "model difuzijskog transformatora".

Transformatori su vrsta neuronske mreže koju je prvi put predstavio Google 2017. Najpoznatiji su po upotrebi u velikim jezičnim modelima kao što su ChatGPT i Google Gemini.

Difuzijski modeli, s druge strane, temelj su mnogih AI generatora slika.

Rade tako da započinju s nasumičnim šumom i idu prema "čistoj" slici koja odgovara upitu za unos.

Od niza takvih slika može se napraviti video.

Međutim, u videu su koherentnost i dosljednost između okvira bitni.

Sora koristi transformatorsku arhitekturu za upravljanje međusobnim odnosom okvira. Dok su transformatori u početku dizajnirani za pronalaženje uzoraka u tokenima koji predstavljaju tekst, Sora umjesto toga koristi tokene koji predstavljaju male dijelove prostora i vremena.

Sora nije prvi model pretvaranja teksta u video

Raniji modeli uključuju Emu tvrtke Meta, Gen-2 tvrtke Runway, Stable Video Diffusion tvrtke Stability AI i nedavno Lumiere tvrtke Google. Lumiere, objavljen prije samo nekoliko tjedana, tvrdio je da proizvodi bolji video od svojih prethodnika. Ali čini se da je Sora moćnija od Lumierea barem u nekim aspektima. Sora može generirati videozapise razlučivosti do 1920 × 1080 piksela i u različitim omjerima, dok je Lumiere ograničen na 512 × 512 piksela. Lumiereovi videi traju oko 5 sekundi, dok Sora radi video do 60 sekundi. Lumiere ne može napraviti video sastavljen od više kadrova, dok Sora može. Sora, kao i drugi modeli, također je navodno sposobna za zadatke uređivanja videa kao što je stvaranje videa od slika ili drugih videa, kombiniranje elemenata iz različitih videa i produženje videa.

https://www.youtube.com/watch?v=xNb7E_h48uw

Oba modela stvaraju široko realistične videozapise, ali mogu patiti od halucinacija.

Lumiereove videe moglo bi se lakše prepoznati kao generirane umjetnom inteligencijom.

Sorini videi izgledaju dinamičnije, imaju više interakcija među elementima.

Međutim, u mnogim primjerima videozapisa nedosljednosti postaju očite pomnim pregledom.

Obećavajuće aplikacije

Videosadržaj se trenutno proizvodi ili snimanjem stvarnog svijeta ili korištenjem specijalnih efekata, a oboje može biti skupo i dugotrajno.

Ako Sora postane dostupna po razumnoj cijeni, ljudi bi je mogli početi koristiti kao softver za izradu prototipa za vizualizaciju ideja po mnogo nižoj cijeni.

Na temelju onoga što znamo o Sorinim mogućnostima, mogla bi se čak koristiti za izradu kratkih videa za neke aplikacije u zabavi, oglašavanju i obrazovanju.

OpenAI-jev tehnički dokument o Sori nosi naslov "Modeli videogeneracije kao svjetski simulatori".

Rad tvrdi da bi veće verzije video generatora poput Sore mogle biti "sposobni simulatori fizičkog i digitalnog svijeta, te objekata, životinja i ljudi koji žive u njima".

https://twitter.com/billpeeb/status/1758650919430848991?ref_src=twsrc%5Etfw%7Ctwcamp%5Etweetembed%7Ctwterm%5E1758650919430848991%7Ctwgr%5Ed84270f0af6e2423a0b551a38aff8b6564e76b5d%7Ctwcon%5Es1_&ref_url=https%3A%2F%2Fwww.sciencealert.com%2Fopenais-sora-unleashes-new-text-to-video-generative-ai-its-shockingly-powerful

Ako je to točno, buduće verzije mogu imati znanstvene primjene za fizičke, kemijske, pa čak i društvene eksperimente. Na primjer, mogao bi se testirati utjecaj tsunamija i različitih veličina na različite vrste infrastrukture – te na fizičko i mentalno zdravlje ljudi u blizini.

Postizanje ove razine simulacije vrlo je izazovno, a neki stručnjaci kažu da je sustav poput Sore u osnovi nesposoban za to. Kompletan simulator trebao bi izračunati fizičke i kemijske reakcije na najdetaljnijim razinama svemira. Međutim, simulacija grubi aproksimacije svijeta i izrada realističnih videa ljudskim očima mogli bi biti dostupni u nadolazećim godinama.
Rizici i etička pitanja
Glavna zabrinutost oko alata kao što je Sora vrti se oko njihovog društvenog i etičkog utjecaja. U svijetu koji je već zahvaćen dezinformacijama, alati poput Sore mogu pogoršati stvari. Lako je vidjeti kako se sposobnost generiranja realističnog videa bilo koje scene koju možete opisati može koristiti za širenje uvjerljivih lažnih vijesti ili bacanje sumnje na stvarnu snimku. Može ugroziti mjere javnog zdravlja, koristiti se za utjecaj na izbore ili čak opteretiti pravosudni sustav potencijalnim lažnim dokazima. Video generatori također mogu omogućiti izravne prijetnje ciljanim pojedincima, putem deepfakeova – osobito pornografskih. To može imati strašne posljedice na živote pogođenih pojedinaca i njihovih obitelji.

Izvor: Science Alert