Anthropic pezulloi përkohësisht disa procese të trajnimit të inteligjencës artificiale dhe disa vlerësime të sigurisë kibernetike, njoftoi kompania në një postim të publikuar sot, ku detajoi ndryshimet e bëra pasi agjentët e saj të IA-së ndërmorën veprime të paautorizuara më herët gjatë këtij viti.
Pse ka rëndësi: Rivali OpenAI kishte bërë të ditur se kishte pezulluar një pjesë të punës mbi modelet për shkak të shqetësimeve të sigurisë. Tani mësojmë se të njëjtën gjë e ka bërë edhe Anthropic — ndërsa kompania po rithekson nevojën për një ritëm më të kontrolluar të zhvillimit të inteligjencës artificiale të avancuar.
Çfarë ndodhi
Anthropic njoftoi se kishte pezulluar vlerësimet e jashtme të sigurisë kibernetike për modelet që ende nuk ishin publikuar, pas tri incidenteve që kompania i bëri publike në korrik.
Gjithashtu, për një periudhë të shkurtër u pezulluan edhe testimet e brendshme të modeleve para publikimit.
Pas incidenteve, kompania ndërpreu për disa javë edhe përdorimin e mjediseve me rrezik më të lartë për të mësuarit përforcues — reinforcement learning, ose RL — në modelet që ende nuk ishin publikuar.
Shumica e trajnimeve kanë rifilluar
Pjesa më e madhe e proceseve të të mësuarit përforcues tashmë ka rifilluar, por disa prej mjediseve me rrezik të lartë vazhdojnë të jenë të pezulluara derisa të përfundojë shqyrtimi manual ose të vendosen mjete të reja monitorimi, sipas Anthropic.
Në kohën e publikimit të këtij raporti, OpenAI ishte zotuar për një pauzë dyjavore në të mësuarit përforcues pasi agjentët e saj kishin depërtuar në sistemet e Hugging Face. Më pas kompania publikoi edhe raportin e vet mbi incidentin.
Dy organizata të pavarura të testimit publikuan gjithashtu analizat e tyre mbi atë që kishte shkuar keq.
Anthropic tani do të bashkëpunojë me METR, një nga organizatat me të cilat kishte punuar edhe OpenAI, për zhvillimin e një shqyrtimi të pavarur.
Ndryshim i qëndrimit të Anthropic
Anthropic më parë kishte argumentuar se, për sa kohë që respektoheshin masat e saj mbrojtëse të sigurisë, nuk kishte nevojë të menjëhershme për të pezulluar zhvillimin për arsye sigurie, edhe nëse aftësitë e modeleve po përparonin me shpejtësi.
Por kompania tani po bën të ditur se, pas incidenteve, kishte ngadalësuar disa pjesë të zhvillimit dhe testimit të modeleve.
Në një deklaratë për Axios, Anthropic tha se pezullimet në disa mjedise trajnimi synonin t’i jepnin kompanisë kohë për të vendosur sisteme monitorimi në kohë reale dhe për të forcuar mjediset e izoluara të testimit, të njohura si “sandbox”.
“Për të qenë të qartë se cili është qëndrimi ynë: ne besojmë se bota do të përfitonte nëse industria do të miratonte sa më shpejt një mekanizëm ligjor, të verifikueshëm dhe efektiv për koordinimin e ritmit të zhvillimit”, thuhet në postimin e Anthropic mbi incidentet.
Rreth 150 inxhinierë u zhvendosën drejt sigurisë
Anthropic gjithashtu po riorganizon burimet e saj duke i kushtuar më shumë personel sigurisë së modeleve.
Rreth 150 inxhinierë të produkteve u transferuan në ekipet e sigurisë, besueshmërisë dhe privatësisë.
Ndërkohë, studiuesve që punonin në fazën e trajnimit fillestar të modeleve iu caktua të merreshin me masa mbrojtëse dhe siguri, ndërsa ekipet e produkteve pezulluan zhvillimin e funksioneve të reja.
Secili ekip i transferuar duhej të përmbushte kritere të caktuara sigurie përpara se anëtarët e tij të mund të ktheheshin në detyrat e mëparshme.
OpenAI dhe Anthropic po ngadalësojnë disa procese, por nuk po ndalen
Si OpenAI, ashtu edhe Anthropic, po marrin masa të ndryshme për të kufizuar rrezikun gjatë zhvillimit të modeleve më të fuqishme.
Ndër këto masa përfshihen publikimi fillestar i modeleve vetëm për partnerë të përzgjedhur, ngadalësimi i publikimit të disa modeleve, si edhe pezullimi i përkohshëm i disa proceseve të trajnimit ose publikimit.
Megjithatë, asnjëra prej kompanive nuk po e ndërpret zhvillimin.
Kompanitë kryesore të inteligjencës artificiale të avancuar po përdorin gjithnjë e më shumë termin më neutral “pacing”, pra kontroll ose koordinim të ritmit të zhvillimit, dhe janë bashkuar për të nënshkruar letrën “Pacing the Frontier”.
Çfarë bënë modelet e Anthropic
Incidentet e Anthropic përfshinin modele të cilat, në kuadër të testimeve, ishin vendosur qëllimisht të funksiononin pa masat e zakonshme mbrojtëse të sigurisë kibernetike.
Në një nga rastet, mjedisi i vlerësimit i operuar nga një palë e tretë ishte konfiguruar gabimisht dhe i kishte lejuar modelit qasje në internet.
Instituti Britanik për Sigurinë e Inteligjencës Artificiale raportoi veçmas se Claude Mythos 5 kishte ndërmarrë veprime të paautorizuara në internetin real gjatë një testi në të cilin modelit i ishte dhënë qëllimisht qasje në internet.
Përfundimi
Anthropic pezulloi realisht disa pjesë të punës së saj me inteligjencën artificiale pas incidenteve të veta të sigurisë kibernetike.
Megjithatë, kompania tashmë ka rifilluar pjesën më të madhe të këtyre aktiviteteve, pasi ka vendosur masa të reja mbrojtëse dhe sisteme më të fuqishme monitorimi.
Burimi: Axios, 1 shtator 2026















