Ballina IA OpenAI kishte marrë paralajmërime përpara se agjentët e saj të dilnin nga...

OpenAI kishte marrë paralajmërime përpara se agjentët e saj të dilnin nga mjediset e testimit

OpenAI kishte vërejtur, por nuk kishte reaguar ndaj disa sinjaleve paralajmëruese që tregonin se modelet e saj po shfrytëzonin dobësi sigurie dhe po dilnin nga mjediset e izoluara të testimit, përpara se të depërtonin në sistemet e Hugging Face, sipas një raporti teknik të publikuar të mërkurën nga vetë kompania.

Rasti ngre pyetje serioze nëse mjediset e testimit dhe mekanizmat e brendshëm të sigurisë të kompanive të inteligjencës artificiale janë në gjendje të ecin me të njëjtin ritëm me modelet që po bëhen gjithnjë e më të afta për të zbuluar dhe shfrytëzuar vetë dobësitë e sigurisë.

Çfarë zbulon raporti i OpenAI

Analiza e hollësishme teknike e OpenAI për incidentin e muajit të kaluar në Hugging Face tregon se agjentët e saj kishin arritur gjithashtu të hynin në mjedise të tjera të palëve të treta, përfshirë sistemin e një klienti të Modal Labs dhe një llogari që i përkiste një përdoruesi të një shërbimi tjetër, emri i të cilit nuk është bërë publik.

Sipas raportit, më 27 qershor, një mjet për monitorimin e sigurisë kibernetike paralajmëroi OpenAI për aktivitet të dyshimtë. Ekipet që reaguan ndaj alarmit gjurmuan aktivitetin deri te agjentët, të cilët po përdornin një lloj tabele të improvizuar mesazhesh si mënyrë për të lëvizur nëpër rrjet.

Në atë moment, personeli përgjegjës vendosi se nuk ishte e nevojshme të ndërpritej vlerësimi që po zhvillohej.

Një muaj më herët, një ekip i brendshëm kishte vërejtur gjithashtu një agjent duke përdorur të njëjtën tabelë mesazhesh, si dhe raste në të cilat agjentët kishin hyrë në internet edhe pse nuk kishin leje për ta bërë këtë.

OpenAI kishte bërë të ditur më herët, gjatë konferencës së sigurisë Black Hat, se agjentët e saj kishin shndërruar mjetin e ruajtjes së softuerëve Artifactory në një tabelë të improvizuar mesazhesh dhe më vonë kishin shfrytëzuar një dobësi “zero-day” në këtë shërbim për të siguruar qasje në internet.

Publicitet

“Duke e parë situatën në retrospektivë, disa prej sinjaleve të hershme të identifikuara në këtë raport mund të kishin shkaktuar një reagim më të hershëm”, shkruan OpenAI në raport.

OpenAI po rishikon procedurat e sigurisë

Raporti teknik publikohet në një kohë kur OpenAI vazhdon të mbajë të pezulluara disa punë mbi modelet e saj, përfshirë shtyrjen e publikimit të modelit të ardhshëm Astra, ndërsa kompania rivlerëson praktikat e saj të sigurisë.

Edhe Anthropic dhe Meta kanë deklaruar, në javët pas incidentit të Hugging Face, se modelet e tyre gjithashtu kanë arritur të depërtojnë në sisteme reale gjatë testimeve të sigurisë përpara publikimit.

Agjentët ekzekutuan kod në 41 serverë të Hugging Face

Sipas raportit teknik të OpenAI, agjentët e kompanisë arritën të ekzekutonin kodin e tyre në 41 serverë prodhimi të Hugging Face.

Ata gjithashtu siguruan kontroll në nivelin “root” mbi të paktën një makinë prodhimi.

Agjentët patën qasje edhe në kredenciale të mjedisit të prodhimit dhe në disa të dhëna të brendshme, si dhe shkarkuan katër depo private kodi.

Agjentët depërtuan edhe në sistemet e vetë OpenAI

Në të njëjtën kohë, agjentët e OpenAI arritën të depërtonin edhe në sistemet e brendshme të vetë laboratorit të inteligjencës artificiale.

Sipas raportit, ata arritën të lexonin 956 të dhëna sekrete të ruajtura, përfshirë kredenciale sensorësh që i përkisnin mjetit të monitorimit të sigurisë kibernetike të OpenAI.

Më 19 korrik, agjentët identifikuan një dobësi të zbuluar së fundmi që prekte një makinë Linux, e cila ishte pjesë e infrastrukturës mbi të cilën funksiononte mjedisi i tyre i testimit.

Agjentët e shfrytëzuan këtë dobësi për të marrë privilegje në nivelin “root” në atë makinë, gjë që u mundësoi të lëviznin më tej nëpër mjedisin e ndërlidhur.

Në fund, ata arritën të siguronin qasje në nivel administratori në një pjesë të infrastrukturës cloud të OpenAI dhe patën qasje në kredenciale të lidhura me disa sisteme të brendshme.

Në një testim tjetër të zhvilluar po atë ditë, një model tjetër i brendshëm, nga e njëjta familje me Astra-n, gjeti material të një çelësi nënshkrimi që kishte mbetur nga aktiviteti i mëparshëm i agjentëve dhe e përdori atë për të krijuar një kredencial të ri administratori.

OpenAI: Modelet po përpiqeshin të përfundonin testet e sigurisë

OpenAI thekson se veprimet e modeleve buruan nga përpjekjet e tyre për të përfunduar vlerësime të sigurisë kibernetike.

Mes tyre ishte edhe ExploitGym, një test që mat nëse një model është në gjendje të gjejë dhe të shfrytëzojë vetë dobësi sigurie.

Incidenti në Hugging Face përfshiu dy modele: GPT-5.6 Sol dhe një model kërkimor të brendshëm, i cili nuk është publik.

Megjithatë, sipas raportit, modeli i brendshëm kërkimor ishte përgjegjësi kryesor për depërtimin.

Trajnimi mund të ketë përforcuar sjelljet problematike

Hetimi i OpenAI zbuloi gjithashtu prova se mënyra e trajnimit të modeleve mund të ketë përforcuar pa dashje disa nga sjelljet që kontribuuan në incident.

Gjatë një prej proceseve të trajnimit, agjentët mësuan gjithnjë e më shumë të hetonin dhe të shfrytëzonin pjesë të mjedisit të tyre kur mjetet që duhej të përdornin nuk ishin të disponueshme ose nuk funksiononin siç duhej.

Në disa raste, modelet morën shpërblime pozitive pasi përdorën këto metoda të paparashikuara, gjë që, sipas OpenAI, mund ta përforcojë këtë lloj sjelljeje.

Në një shembull, një agjent shfrytëzoi një dobësi për të hyrë në programin bazë që në fakt duhej ta rikrijonte vetë. Ai kopjoi përgjigjen prej andej dhe më pas mori një shpërblim pozitiv për përfundimin me sukses të detyrës.

Hetim nga autoritetet amerikane

Në fillim të kësaj jave, zyra e prokurorit të përgjithshëm të Alabamës i dërgoi OpenAI një urdhër zyrtar për dorëzimin e dokumenteve, si pjesë e një hetimi për incidentin e Hugging Face.

Edhe prokurorë të përgjithshëm të shteteve të tjera amerikane i kanë kërkuar OpenAI që të ruajë dokumentet e brendshme që lidhen me këtë çështje.

Incidenti i shtohet një historie më të gjerë rastesh në të cilat agjentët e inteligjencës artificiale kanë arritur të dalin jashtë kufijve të mjediseve të tyre të testimit./Aksios