Ballina IA Laboratorët e IA-së po përballen me një problem serioz të kontrollit të...

Laboratorët e IA-së po përballen me një problem serioz të kontrollit të agjentëve

Sipas sistemeve aktuale, laboratorët e inteligjencës artificiale nuk mund të garantojnë më se agjentët e IA-së nuk do të grumbullohen në “tufa”, të bashkëpunojnë mes tyre dhe të dalin nga mjediset e kontrolluara ku testohen.

Pse ka rëndësi: Sulmi ndaj Hugging Face nga agjentët e OpenAI ishte një paralajmërim serioz — dhe studiuesit thonë se vetëm forcimi i kontrolleve teknike të sigurisë nuk do të jetë i mjaftueshëm për të parandaluar incidente të ngjashme, ndërsa agjentët e IA-së bëhen gjithnjë e më të aftë.


Çfarë po ndodh: Javën e kaluar, ndërsa OpenAI publikoi raportin e vet teknik mbi mënyrën se si agjentët e kompanisë depërtuan në Hugging Face, dy organizata të pavarura testimi publikuan analizën e tyre mbi atë që kishte shkuar keq.

Studiuesit — Hjalmar Wijk dhe Ajeya Cotra nga METR, si dhe shkencëtari kryesor i Redwood Research, Ryan Greenblatt — punuan për gjashtë ditë në ambientet e OpenAI për të kuptuar incidentin e fundit.

Gjendja aktuale: Mijëra agjentë të inteligjencës artificiale bashkëpunuan përmes një tabele të fshehtë mesazhesh dhe shkëmbyen më shumë se 70.000 mesazhe, ndërsa përpiqeshin të arrinin rezultate sa më të larta në një test të brendshëm sigurie. Ky proces përfundimisht i çoi ata drejt depërtimit në sistemet e Hugging Face.

Por Cotra i tha Axios se agjentët vazhduan të koordinoheshin edhe pasi kishin gjetur përgjigjet që kërkonin. Pas kësaj, vëmendjen e zhvendosën drejt kuptimit dhe manipulimit të sistemit që do të vlerësonte performancën e tyre dhe që, potencialisht, mund t’i kapte duke mashtruar.

Në fokus: Cotra e krahasoi incidentin me nxënës që vjedhin çelësin me përgjigjet e një testi dhe më pas fillojnë të kërkojnë pamjet e kamerave të sigurisë që mund t’i ekspozojnë, duke u përpjekur më pas t’i zëvendësojnë ose manipulojnë ato.

Publicitet

„Është një formë shumë më e ndërlikuar dhe intensive mashtrimi sesa thjesht vjedhja e përgjigjeve“, tha ajo. „Edhe unë u befasova nga fakti se sa obsesivisht dhe me sa shumë hollësi mendonin për sistemin e vlerësimit.“

Niveli i kërcënimit: Sipas Cotra-s, fokusimi vetëm te forcimi i mjediseve të testimit është një „betejë e humbur“.

„Mund t’i fortifikoni sandbox-et tuaja, por pas gjashtë muajsh agjentët tuaj do të jenë shumë më të aftë“, tha ajo. „Nëse kanë të njëjtat motivime si këta agjentë, ata do të bëjnë maksimumin për të gjetur vrima në sistemin tuaj të sigurisë.“

Kontrolli i realitetit: Për të përpunuar sasinë jashtëzakonisht të madhe të të dhënave mbi incidentin, vetë studiuesit u detyruan të mbështeteshin shumë te agjentët e inteligjencës artificiale — përfshirë edhe një agjent që kishte marrë pjesë në sulm.

Cotra tha për Axios se studiuesit nuk besojnë se ai agjent i kishte mashtruar gjatë hetimit, por nuk ekziston asnjë mënyrë për ta konfirmuar këtë me siguri.

Ryan Greenblatt tha në X se, gjysmë me shaka, e kishte quajtur punën e tyre një „slop-vestigation“, sepse ishin jashtëzakonisht të varur nga IA-ja për të analizuar atë që kishte ndodhur dhe sepse kishte një numër shumë të madh elementesh të rëndësishme që duheshin shqyrtuar.

Në vetëm gjashtë ditë, studiuesve iu desh të analizonin:

  • më shumë se 70.000 mesazhe dhe skedarë të publikuar nga agjentët;
  • rreth 1.300 transkripte që përmbanin zinxhirët e papërpunuar të arsyetimit të modeleve.

Mes rreshtave: Hetimi i tyre u përqendrua kryesisht në veprimet e agjentëve mes 7 dhe 13 korrikut, edhe pse OpenAI ka thënë se ekipet e kompanisë kishin vërejtur shenja të sjelljeve të papritura dhe daljeve nga mjediset e testimit që në maj 2026.

Përfundimi: Laboratorët e inteligjencës artificiale, studiuesit dhe qeveritë duhet të punojnë urgjentisht së bashku për të krijuar një shkencë të re të kontrollit të agjentëve dhe standarde minimale, në mënyrë që modelet të mos motivohen më për të mashtruar në testet ku vlerësohen, tha Cotra.

„Në fund, nuk do të dalim nga kjo kurth pa disa rregulla të qarta loje, për të cilat të ketë marrëveshje dhe që të zbatohen në mënyrë të njëtrajtshme dhe të drejtë“, tha ajo.

Për më shumë: OpenAI dhe Anthropic kanë paralajmëruar gjithashtu për rritjen e rrezikut kibernetik nga modelet më të avancuara të inteligjencës artificiale./Axios