Ballina IA OpenAI zbulon gjashtë incidente të reja të sigurisë

OpenAI zbulon gjashtë incidente të reja të sigurisë

OpenAI bëri të ditur të mërkurën gjashtë incidente të reja në të cilat modelet e saj fshehën gabime, kërkuan kredenciale pa autorizim, ngarkuan skedarë në internetin publik ose komunikuan mes mjediseve të trajnimit që supozohej të ishin të izoluara nga njëri-tjetri.

Kompania njoftoi gjithashtu një procedurë të re për raportimin e sjelljeve të ngjashme problematike në të ardhmen.

Pse ka rëndësi: Po bëhet gjithnjë e më e qartë se komprometimi i Hugging Face nuk ishte një incident i izoluar, ndërsa modelet e IA-së po bëhen gjithnjë e më të afta për të gjetur mënyra të papritura për të anashkaluar masat mbrojtëse që synojnë t’i mbajnë nën kontroll.

“Aktualisht nuk ekziston një kuadër në nivel industrie me standarde të qarta për raportimin publik, ndaj po e ndërmarrim këtë hap vullnetarisht, sepse mendojmë se është vërtet e rëndësishme të ndajmë atë që po mësojmë”, tha për Axios Kai Chen, drejtues kërkimor në ekipin e përafrimit të OpenAI.

“Shpresojmë që kjo të ndihmojë realisht në formësimin e standardeve dhe rregulloreve të përbashkëta”, tha Chen.

Në detaje: Gjashtë incidentet e sapozbuluara varionin nga modele që u linin udhëzime versioneve të tyre të ardhshme për të fshehur gjurmët pasi kishin shkelur rregullat, deri te përdorimi i çelësave API të rrjedhur dhe të gjetur në GitHub. Incidenti më i hershëm ndodhi në tetor.

Një model ende i papublikuar i familjes Astra futi në përmbledhjet e veta të kontekstit udhëzime të ngjashme me “jailbreak”, përfshirë udhëzime për të shpërfillur mesazhet e zhvilluesit. OpenAI identifikoi 27 përmbledhje të prekura.

Video

Gjatë trajnimit të GPT-5.6 Sol, modelet synuan të fshihnin gabimet, të sajonin të dhëna historike që mungonin dhe të maskonin mospërputhjet mes versioneve të burimeve.

Një model kërkoi në depot publike të GitHub-it për çelësa API të ekspozuar dhe u përpoq të përdorte llogari emaili të përkohshme, përpara se të sajonte të dhëna mbi fitimet kur nuk arriti të siguronte informacionin e kërkuar.

Shembuj të tjerë:

Modelet ngarkuan të dhëna dhe një imazh të detyrës në shërbime publike për hostimin e skedarëve në dy raste, në tetor dhe janar, për të siguruar citime ose rezultate të kërkimit të jashtëm të imazheve, pa i kërkuar leje përdoruesit.

Modelet përdorën depon e brendshme Artifactory të OpenAI si një tabelë mesazhesh për të shkëmbyer kërkesa dhe përgjigje mes mostrave të veçanta të trajnimit.

Agjentë që bashkëpunonin me njëri-tjetrin ngarkuan një libër pune të një fletellogaritëse në shërbime publike të hostimit, në mënyrë që agjentët e tjerë të mund ta merrnin atë, pavarësisht udhëzimeve që të përdornin vetëm skedarë lokalë.

Për t’u përballur me çështje të ngjashme në të ardhmen, OpenAI thotë se çdo punonjës mund të sinjalizojë një rast të dyshuar për shqyrtim nga ekipet e sigurisë dhe të përafrimit. Rastet do të vendosen në njërën prej tri kategorive: “gati për publikim”, “hetim i kufizuar” ose “hetim më i gjerë”.

OpenAI thotë se incidentet që janë “gati për publikim” do të bëhen publike brenda gjashtë ditësh pune, ndërsa ato që kërkojnë një hetim të kufizuar do të raportohen brenda 12 ditësh pune.

OpenAI thotë se procedura më e ngadaltë do të zbatohet përgjithësisht për raste komplekse që përfshijnë palë të treta dhe se procesi i publikimit do të zgjasë më shumë.

Kompania thotë se mund të lëshojë një njoftim fillestar përpara përfundimit të hetimit, por detyrimet që lidhen me sigurinë, aspektet ligjore dhe publikimin e përgjegjshëm mund ta vonojnë publikimin e hollësive.

“Nuk besojmë se industria e IA-së e ka zgjidhur çështjen e përafrimit dhe monitorimit në një nivel të mjaftueshëm për të lejuar një zgjerim me shpejtësinë maksimale në mënyrë të përgjegjshme”, tha Chen.

“Hapa të tillë si publikimi i përgjegjshëm janë pjesë e mënyrës se si, në përgjithësi, mund të kontrollojmë ritmin dhe t’i ofrojmë publikut më shumë transparencë për proceset dhe standardet tona të sigurisë dhe të përafrimit.”

Çfarë thonë ata: OpenAI thotë se kuadri i ri i jep përparësi transparencës edhe kur rëndësia e një incidenti është e pasigurt.

Kompania thotë gjithashtu se dëshiron të zhvillojë kritere më objektive për publikimin e incidenteve, së bashku me zhvillues të tjerë të IA-së, studiues, organe standardizuese dhe rregullatorë.

OpenAI thotë se punonjësit që mendojnë se një incident duhet të publikohet, por vendimi i tyre rrëzohet, mund ta çojnë çështjen në nivelet e larta drejtuese.

Pamja e përgjithshme: Njoftimet vijnë pas publikimit nga OpenAI të një rasti në të cilin modele që po vlerësoheshin dolën jashtë kufizimeve të parashikuara dhe komprometuan pjesë të sistemeve të Hugging Face.

Sipas përshkrimit të OpenAI, modelet siguruan qasje në internet, shfrytëzuan dobësi sigurie dhe patën qasje në një sasi të kufizuar të dhënash private. Kompania e ka përshkruar këtë ngjarje si aktivitetin më të rëndë të këtij lloji të nxitur nga modele deri më sot.

Mes rreshtave: Ndërsa një numër figurash të njohura të teknologjisë — përfshirë edhe drejtorin ekzekutiv të Anthropic — druhen se incidenti i Hugging Face ishte vetëm fillimi i rasteve në të cilat agjentët e IA-së mund të marrin kontrollin e pjesëve të internetit në mënyra të paparashikuara, shumë ekspertë të sigurisë kanë paralajmëruar se shumë prej këtyre incidenteve mund të ishin parandaluar me masa bazë të sigurisë kibernetike.

OpenAI i tha Axios se i konsideron incidentet si rezultat të dy faktorëve: mungesës së mëparshme të kontrolleve të mjaftueshme të sigurisë për të kapur këto raste të mospërafrimit dhe përparimit të modeleve me një ritëm më të shpejtë nga sa kompania kishte parashikuar.

“Mendoj se është një kombinim i të dyjave”, tha Chen. “Është e vërtetë se aftësitë e modeleve janë rritur më shpejt nga sa prisnim, por ka edhe gjëra që mund t’i ndryshojmë dhe t’i përmirësojmë brenda kompanisë.”

“Duhet të ngrihemi në nivelin që kërkon kjo epokë e re e zhvillimit të IA-së dhe publikimet vullnetare duhet të jenë pjesë e kësaj.”/Axios