Ballina Lajme Anthropic: Tre modele të Claude arritën të depërtonin në sisteme reale gjatë...

Anthropic: Tre modele të Claude arritën të depërtonin në sisteme reale gjatë testeve kibernetike

Disa nga modelet më të fuqishme të Anthropic – përfshirë Mythos 5 dhe një model të brendshëm kërkimor – fituan qasje të paautorizuar në sisteme reale gjatë testimeve të sigurisë kibernetike para publikimit, njoftoi kompania të enjten.

Pse ka rëndësi

Zbulimet e fundit nga OpenAI dhe Anthropic tregojnë se modelet më të avancuara të inteligjencës artificiale po arrijnë deri te sistemet reale gjatë testeve të sigurisë, duke ngritur pyetje të reja për mënyrën se si laboratorët i mbrojnë mjediset e tyre të vlerësimit.

Pamja e përgjithshme

Anthropic tha se një keqkuptim ndërmjet kompanisë dhe njërit prej partnerëve të saj të testimit bëri që mjedisi i vlerësimit të mbetej i lidhur me internetin.

Kompania shqyrtoi më shumë se 141.000 ekzekutime të testeve të sigurisë kibernetike, pasi OpenAI kishte zbuluar se disa prej modeleve të saj kishin hyrë në infrastrukturën e platformës Hugging Face gjatë testimit.

Çfarë ndodhi

Anthropic njoftoi në një postim në blog se tre prej modeleve të saj kishin komprometuar sisteme reale që u përkisnin tri organizatave.

Publicitet

Incidentet përfshinin modelet Opus 4.7, Mythos 5 dhe një model të brendshëm kërkimor që nuk ishte planifikuar të publikohej për përdorim të përgjithshëm. Sipas Anthropic, ato ndodhën gjatë vlerësimeve të kryera në bashkëpunim me kompaninë e jashtme të testimit Irregular.

Në secilin rast, modeleve iu kërkua të përfundonin një ushtrim të tipit “capture-the-flag” – “kap flamurin” – një test bazë i sigurisë kibernetike, në të cilin pjesëmarrësit përpiqen të gjejnë të dhëna të vendosura qëllimisht në një pajisje ose rrjet tjetër.

Konteksti

Incidentet më të hershme ndodhën në muajin prill, sipas Anthropic. Kompania kontaktoi të tria organizatat e prekura.

Anthropic tha se dy organizatat me të cilat arriti të komunikonte nuk e kishin zbuluar më parë aktivitetin e modeleve.

Kompania nuk i bëri të ditur emrat e tri organizatave, sistemet e të cilave u prekën.

Një zëdhënës i Irregular i tha Axios se, megjithëse hetimi i kompanisë vazhdon, ajo e vlerëson “bashkëpunimin dhe transparencën e Anthropic” dhe se pret që të vazhdojnë të punojnë së bashku për avancimin e sigurisë.

Megjithatë

Ndryshe nga incidenti i OpenAI, Anthropic tha se modelet e saj nuk shfrytëzuan ndonjë cenueshmëri të panjohur të tipit “zero-day” për të fituar qasje në internet.

Qasja në internet ishte e mundur për shkak të konfigurimit të gabuar të mjedisit të testimit.

Anthropic tha se në udhëzimin e vlerësimit të dhënë Claude-it ishte përcaktuar se modeli do të vepronte në një mjedis të simuluar, pa qasje në internet.

Por, për shkak të keqkuptimit me partnerin e testimit, mjediset e vlerësimit ishin të lidhura me internetin. Si rezultat, modelet i trajtuan sistemet reale sikur të ishin pjesë e ushtrimit të simuluar.

Kontrolli i realitetit

Ngjashëm me rastin e OpenAI, Anthropic po i testonte modelet pa mekanizmat shtesë mbrojtës që kompania i përdor në modelet e ofruara publikisht.

Kjo u mundëson studiuesve të matin aftësitë themelore të modeleve, pa kufizimet që zbatohen gjatë përdorimit normal.

Anthropic tha në raportin e saj se mekanizmat mbrojtës do t’i kishin bllokuar këto veprime.

Në hollësi

Në secilin prej rasteve, Claude përdori teknika relativisht të thjeshta hakerimi, përfshirë shfrytëzimin e fjalëkalimeve të dobëta dhe të pikave fundore që nuk kërkonin autentikim, për të hyrë në sistemet reale.

Incidenti i parë: Opus 4.7 komprometoi një faqe reale

Në incidentin e parë, kompania e trilluar që Opus 4.7 duhej ta sulmonte gjatë ushtrimit kishte të njëjtin emër me një faqe reale dhe aktive në internet.

Pasi nuk arriti të lidhej me objektivin e trilluar, Claude përdori qasjen në internet për të gjetur faqen që kishte të njëjtin emër me kompaninë e simuluar.

Më pas, modeli e komprometoi faqen reale.

Incidenti i dytë: Mythos 5 publikoi një paketë keqdashëse në PyPI

Në rastin e dytë, Mythos 5 krijoi dhe ngarkoi një paketë keqdashëse në PyPI, platforma publike ku publikohen paketat dhe programet e shkruara në gjuhën programuese Python.

Modeli besonte se publikimi i paketës ishte pjesë e simulimit.

Paketa qëndroi në internet për rreth një orë. Gjatë kësaj kohe, ajo u shkarkua dhe u ekzekutua në 15 sisteme reale.

Njëri prej sistemeve i përkiste një kompanie të sigurisë kibernetike, e cila instalon automatikisht paketat Python për t’i analizuar nëse përmbajnë programe keqdashëse.

Kjo i mundësoi kodit të krijuar nga Claude të nxirrte kredenciale dhe të fitonte qasje në pjesë të tjera të infrastrukturës së kompanisë.

Incidenti i tretë: Modeli skanoi rreth 9.000 objektiva

Në rastin e tretë, një model i brendshëm kërkimor i Anthropic nuk arriti të lidhej me objektivin e trilluar që i ishte caktuar gjatë testimit.

Modeli më pas skanoi rreth 9.000 objektiva dhe në fund gjeti dhe komprometoi aplikacionin e një kompanie që ishte i ekspozuar në internet.

Megjithatë, gjatë një pjese të testimit, modeli kuptoi se kishte përfunduar në një llogari cloud që “nuk kishte asnjë lidhje me ushtrimin ‘capture-the-flag’” dhe e ndërpreu sulmin.

Çfarë tregojnë incidentet

Incidentet e OpenAI dhe Anthropic sugjerojnë se modelet vazhduan të përqendroheshin në përfundimin e detyrave të caktuara gjatë testimit, në vend që të ndiqnin objektiva të pavarur.

Në fillim të kësaj jave, Axios raportoi se agjenti i OpenAI, i cili hyri në një sistem të palës së tretë gjatë incidentit që përfshinte Hugging Face, e bëri këtë sepse sistemi përmbante informacione të lidhura me CyberGym – projektin që qëndronte pas testit të sigurisë kibernetike që modeli po përpiqej ta zgjidhte.

Çfarë pritet më tej

Anthropic dhe Irregular po vazhdojnë hetimet e tyre për të përcaktuar saktësisht se si ndodhën incidentet.

Anthropic gjithashtu njoftoi se i ka pezulluar testimet kibernetike që mund të kenë qasje në internet, derisa të përfundojë shqyrtimin e infrastrukturës së saj të testimit.

Për më shumë

Njerëzit që testojnë inteligjencën artificiale për rreziqe nuk po arrijnë ta ndjekin ritmin e zhvillimit të saj.

Shënim i redaksisë: Ky artikull është korrigjuar për të sqaruar se një keqkuptim ndërmjet Anthropic dhe njërit prej partnerëve të saj të testimit bëri që mjedisi i vlerësimit të modeleve të mbetej i lidhur me internetin. Sipas Anthropic, modelet nuk “u arratisën” nga mjedisi i testimit./Axios