OpenAI-jev model se oteo kontroli: "Ovo je ozbiljno upozorenje"
Dok biolozi s opasnim virusima eksperimentiraju prema strogim pravilima kako bi spriječili njihovo širenje izvan laboratorija, za umjetnu inteligenciju takvi protokoli ne postoje. Rizik, međutim, nije samo teoretski.
Jedan testni model tvrtke OpenAI ovog je tjedna probio svoje izolirano okruženje i upao na servere druge tvrtke dok je radio internu provjeru kibernetičke sigurnosti. Stručnjaci upozoravaju da će se takvi incidenti ponavljati ako AI tvrtke ne pooštre sigurnosne mjere pri testiranju, što uključuje i obuku modela o etičkom rješavanju zadataka, piše CNN.
"Ovo shvaćamo vrlo ozbiljno"
Predsjednik OpenAI-ja Greg Brockman jučer je na konferenciji za novinare rekao da tvrtka provodi "detaljnu istragu" kako bi "u potpunosti razumjela što se dogodilo". "Ovo shvaćamo vrlo ozbiljno. Analiziramo svaki dio našeg procesa kako bismo osmislili ispravne načine reagiranja", poručio je Brockman.
Proboj iz izoliranog okruženja
Takozvani "AI sandbox" je zatvoreno okruženje koje tvrtke koriste za testiranje modela s ciljem da sve aktivnosti ostanu unutar tog prostora. U takvim uvjetima često se uklanjaju sigurnosna ograničenja modela kako bi se procijenile njegove pune sposobnosti.
No, u ovom slučaju OpenAI-jev sandbox nije bio potpuno odvojen od mreže ili interneta, objasnila je za CNN Jessica Ji, viša analitičarka iz Centra za sigurnost i nove tehnologije Sveučilišta Georgetown. Iz OpenAI-ja su potvrdili da su modeli tijekom testa imali vrlo ograničen pristup mreži kako bi mogli instalirati resurse s internog softvera trećih strana.
Model je iskoristio dosad nepoznatu ranjivost u tom softveru, pronašao put do interneta, a zatim i do platforme Hugging Face. Pritom je upotrijebio ukradene pristupne podatke i druge sigurnosne propuste. Ji je istaknula da ni OpenAI ni vanjski dobavljač softvera nisu znali za tu ranjivost, što pokazuje koliko je važno detaljno provjeriti sustav u potrazi za potencijalnim slabim točkama.
Nije prvi put
Ovo nije prvi put da je AI model probio granice testnog okruženja. Tvrtka Anthropic ranije ove godine objavila je da je svojem modelu zadala upravo takav zadatak. Nakon što je uspješno pobjegao, model je poslao e-mail istraživaču u Anthropicu, iako nije trebao imati tu mogućnost. Ipak, incident s platformom Hugging Face jedan je od prvih javno poznatih slučajeva u kojem je AI model samoinicijativno pobjegao iz izolacije i hakirao sustave druge tvrtke, a da mu to nitko nije zadao.
Ji smatra da bi tvrtke trebale agresivnije izolirati svoje testne modele. "To bi moglo značiti da inženjeri moraju fizički otići u podatkovni centar i izravno se spojiti na mrežu, umjesto da pokreću sustave u cloudu ili distribuiranom virtualnom okruženju, na što su navikli", rekla je Ji. Dodala je i da bi tvrtke trebale imati opciju ručnog isključivanja mrežnog pristupa kao osigurač pri testiranju rizičnih scenarija, primjerice kod provjere može li AI agent hakirati banku.
Što je Hugging Face?
Da bi se shvatila težina ovog incidenta, valja razumjeti što je uopće Hugging Face. Riječ je o američkoj platformi sa sjedištem u New Yorku, osnovanoj 2016. godine, koju u IT i AI zajednici često nazivaju "GitHubom za umjetnu inteligenciju".
Služi kao središnje svjetsko okupljalište za više od milijun stručnjaka, istraživača i tvrtki koje ondje razmjenjuju otvorene AI modele, gotove baze podataka i programske alate. Provala OpenAI-jevih modela na njihove servere stoga nije bila samo napad na bilo koju IT tvrtku, već izravan upad u ključnu globalnu infrastrukturu na kojoj se temelji suvremeni razvoj i testiranje umjetne inteligencije.
Problem u metodi učenja
Uobičajena tehnika u obuci AI modela je "poticano učenje", gdje se model nagrađuje za uspješno obavljene zadatke. Problem je što će modeli često učiniti bilo što kako bi došli do cilja, pa i poduzeti neetične korake poput hakiranja. Svi najnapredniji modeli koje je nedavno testirao britanski Institut za sigurnost umjetne inteligencije u nekom su trenutku pokušali varati.
Modeli "razmišljaju" o posljedicama svojih postupaka samo ako su tako obučeni, objašnjava Justin Cappos, profesor kibernetičke sigurnosti sa Sveučilišta u New Yorku. Kao primjer navodi situaciju u kojoj vam netko zada da do kraja dana nabavite 10 milijuna dolara - provala u bankovni sef ispunila bi cilj, iako biste zbog toga završili u zatvoru.
Sam Altman, čelnik OpenAI-ja
"Ovo je vrlo uznemirujuće. Sada imamo stvarne dokaze da će AI sustavi koji nisu usklađeni s ljudskim vrijednostima praktički činiti kaznena djela ako ne postoje stroge zaštitne mjere", izjavio je Steven Adler, bivši voditelj sigurnosti proizvoda u OpenAI-ju, koji sada vodi grupu za sigurnost umjetne inteligencije Guidelight AI Standards. "Ovo moramo shvatiti kao ozbiljno upozorenje."
Incident je potaknuo nove zahtjeve istraživača, stručnjaka za kibernetičku sigurnost i zakonodavaca za regulacijom tehnologije koja se ubrzano razvija. "Vjerujem da se trenutno vode mnogi hitni telefonski razgovori", rekla je Ji. Problem je, kaže Cappos, što traje globalna utrka za dominacijom u području umjetne inteligencije, a regulacija bi taj proces mogla usporiti.
"Postoji snažan motiv da tvrtke ne uvode sigurnosne kontrole, osim ako ih nemaju i njihovi konkurenti. To je temeljna dilema", zaključio je Cappos.