OpenAI, Anthropic dhe studiues të sigurisë po hetojnë dhjetëra mijëra incidente në të cilat modelet e tyre të avancuara kanë ndërmarrë veprime që vlerësuesit e jashtëm do t’i konsideronin problematike, thanë burime për Axios.
Pse ka rëndësi: Numri jashtëzakonisht i madh i incidenteve, të cilat kanë ndodhur muajt e fundit gjatë testimeve të brendshme dhe në botën reale, tregon se problemi është shumëfish më kompleks nga sa dihet publikisht.
Gjetjet, të cilat po dalin në pah si pjesë e punës së brendshme për vlerësimin e modeleve dhe gjatë hetimeve të të dyja kompanive mbi sjelljen e modeleve, ngrenë pikëpyetje nëse ndonjëra prej kompanive — apo ndonjë prodhues tjetër kryesor modelesh — është aktualisht në gjendje të vendosë kontroll të plotë mbi teknologjinë e vet.
Detajet: Episodet përfshijnë anashkalimin e masave mbrojtëse, krijimin e forumeve të mesazheve, daljen nga mjediset e izoluara të sigurisë (sandbox), marrjen nën kontroll të faqeve të internetit, gjenerimin autonom të udhëzimeve për veten ose përpjekjet për të anashkaluar sistemet e monitorimit, thanë burimet.
Ato kanë ndodhur si gjatë testimeve të brendshme, ashtu edhe në botën reale, dhe shumë prej tyre ende nuk janë bërë publike, ndërsa studiuesit e sigurisë vazhdojnë hetimet, thanë burimet.
Disa prej testimeve janë të ngjashme me aktivitetet e njohura si “red teaming”, ku kompanitë përpiqen qëllimisht t’i nxisin modelet të sillen në mënyrë të papërshtatshme, për t’u siguruar se ato janë të sigurta, thanë burimet.
Sjellja problematike e agjentëve po bëhet gjithnjë e më e lidhur me zhvillimin e IA-së së avancuar: laboratorët më të mëdhenj të IA-së përballen me një sfidë të ngjashme, ku njerëzit përpiqen të krijojnë masa mbrojtëse përballë sistemeve të fuqishme dhe këmbëngulëse që përpiqen të përmbushin detyrat.
Çfarë po e nxit lajmin: Incidentet ndryshojnë për nga shkalla e seriozitetit dhe janë të krahasueshme me rastet e bëra publike nga OpenAI ditët e fundit. Ato përfshijnë si përpjekje të suksesshme, ashtu edhe të pasuksesshme për të anashkaluar masat mbrojtëse dhe, deri tani, për shumicën e tyre nuk dihet të kenë shkaktuar dëme në botën reale. Numri i përgjithshëm mund të rritet shumë përtej dhjetëra mijëra rasteve, thanë burimet.
Ditët e fundit, OpenAI dhe studiues të jashtëm kanë bërë publike një varg episodesh që lidhen me sjelljen e sistemeve të kompanisë, të cilat disa ekspertë i konsiderojnë shqetësuese.
Këtu përfshihen agjentë të OpenAI që nxorën në internet 53 imazhe të përdoruesve të ChatGPT, komprometimi i një faqeje interneti të qeverisë australiane dhe përpjekjet për të hakuar faqe të tjera — përfshirë ato të qeverisë amerikane — sipas kompanisë, burimeve dhe raportimeve nga Reuters dhe The New York Times.
OpenAI njoftoi se po pezullonte trajnimin e modeleve të saj më të avancuara dhe se do ta rifillonte atë “vetëm kur të jemi të bindur se kemi vendosur masa shtesë mbrojtëse dhe përmirësime të harmonizimit”, tha një zëdhënës për Axios.
Drejtori ekzekutiv Sam Altman tha në X se shqyrtimi i vazhdueshëm “nuk ka qenë aq i shpejtë sa do të kishim dëshiruar”.
Altman tha se incidenti i Hugging Face është më seriozi që kanë parë. Në atë rast, një grup prej qindra agjentësh koordinuan punën e tyre në një forum mesazhesh dhe hakuan një kompani të jashtme në përpjekje për të përmirësuar performancën e tyre në një test të sigurisë kibernetike.
“Njerëzit duan të dinë se IA-ja po zhvillohet në mënyrë të sigurt dhe kjo fillon me atë që bëjnë vetë kompani si e jona”, tha një zëdhënës i OpenAI për Axios. “Kjo nuk është hera e parë që kemi bërë një pauzë për të ndërmarrë masa të tilla dhe nuk presim që të jetë as e fundit, ndërsa aftësitë e IA-së vazhdojnë të përparojnë.”
Gjendja aktuale: Anthropic ka angazhuar një organizatë të jashtme të sigurisë për të shqyrtuar sjelljen e modeleve të saj. Në dokumentet që kompania ka publikuar, ajo ka bërë të ditur shpeshtësinë e episodeve të mosharmonizimit.
“System card” i modelit të saj Opus 5.5, i publikuar këtë javë, tregoi se sa shpesh modeli sillej në mënyra që kompania i kishte cilësuar si të pazakonta ose problematike.
Për shembull, modeli u përpoq të dilte nga një “sandbox” — një mjedis i sigurt testimi — në 1,5% të testimeve, megjithëse kompania theksoi se bëhej fjalë për eksperimente kundërshtuese, ku një detyrë nuk mund të zgjidhej pa dalë nga “sandbox”-i.
Po, por: Anthropic dhe kompani të tjera kryejnë qindra mijëra ose edhe më shumë testime të modeleve të tyre, thanë burimet. Kjo do të thotë se edhe një përqindje e vogël e sjelljes së mosharmonizuar mund të përkthehet në dhjetëra mijëra incidente, në të cilat modelet janë sjellë në mënyra të papritura dhe, në disa raste, shqetësuese.
Incidenti i Hugging Face, si dhe një varg incidentesh të tjera që pasuan, i shtynë drejtuesit kryesorë të IA-së të bëjnë thirrje për ngadalësimin e zhvillimit dhe të kërkojnë rregullore më të fuqishme federale dhe ndërkombëtare.
Disa në OpenAI e shohin incidentin e Hugging Face si një rast të izoluar, ndërsa rastet që mund të bëhen publike në të ardhmen ka të ngjarë të jenë më pak serioze për shkak të kontrolleve të përmirësuara dhe natyrës së pazakontë të testimit që kishin kryer, i cili përfshinte një model ende të papublikuar, thanë burimet për Axios.
Studiuesit e sigurisë së IA-së pajtohen se ekzistojnë disa zgjidhje të thjeshta që do t’i ndihmojnë kompanitë e IA-së të shmangin disa prej faktorëve që e bënë incidentin e Hugging Face të dukej kaq i rrezikshëm për vëzhguesit e jashtëm.
Niveli i kërcënimit: Drejtues të tjerë të IA-së dhe studiues të sigurisë, megjithatë, paralajmëruan se kanë besim të kufizuar se kompanitë e IA-së do të jenë në gjendje të parandalojnë çdo sjellje problematike të modeleve.
Gjenerata e re e modeleve të IA-së i përmbush detyrat me një këmbëngulje të jashtëzakonshme, ndaj përpjekja për të kufizuar aftësinë e tyre për të gjetur zgjidhje shpesh është një betejë e vështirë për t’u fituar, sepse kërkon parashikimin e çdo mënyre të mundshme se si ato mund të dalin jashtë kontrollit.
Shpesh, ajo që u mundëson modeleve të kapërcejnë masat mbrojtëse është një teknikë që njerëzve mund të mos u ketë shkuar kurrë ndër mend, thanë drejtues të lartë të IA-së. “Përpjekja për të hartuar një listë të përsosur me gjëra që duhen dhe nuk duhen bërë ndoshta është një përpjekje e kotë”, tha një drejtues i sigurisë kibernetike.
Kontrolli i realitetit: Një nivel i caktuar i asaj që profesionistët e sigurisë së IA-së e quajnë “sjellje e mosharmonizuar” është i pritshëm brenda kompanive të IA-së, ndërsa ato testojnë modelet e tyre të reja.
Ulja në zero e rrezikut të mosharmonizimit mund të mos jetë e realizueshme, thanë ekspertët për Axios.
Në fokus: Shqetësimi qëndron në faktin se, nëse një model ndërmerr shumë herë një veprim problematik gjatë testimeve, rritet mundësia që sjellja e atij modeli të shkaktojë një incident kibernetik në botën reale.
“Ajo që kemi parë deri tani lidhur me atë që po bëjnë këta agjentë është vetëm maja e ajsbergut”, tha për Axios studiuesi Conrad Stosz nga Transluce, një organizatë e pavarur për vlerësimin e IA-së.
Çështja nuk është se sa i dëmshëm ishte secili rast individual, tha për Axios Connor Leahy, studiues i IA-së dhe drejtor ekzekutiv i ControlAI.
“Gjëja e çmendur”, tha ai, është se këto raste përfshijnë “sisteme autonome që bëjnë gjëra që u ishte thënë të mos i bënin”, potencialisht duke përfshirë edhe vepra penale.
Përfundimi: Priten zbulime të reja për sjelljen problematike të modeleve, ndërsa kompanitë e IA-së vazhdojnë të zgjerojnë aftësitë e modeleve të avancuara./Axios















