Ballina IA Aftësia e re alarmante e IA-së: dalja nga laboratori i testimit

Aftësia e re alarmante e IA-së: dalja nga laboratori i testimit

Modelet më të avancuara të inteligjencës artificiale po bëhen frikshëm të afta për të shkelur rregullat në mënyra që krijuesit e tyre nuk i kishin parashikuar.

Pse ka rëndësi: Harrojini për momentin debatet për AGI-në dhe afatet se kur mund të shfaqet superinteligjenca. Modelet e sotme tashmë po arrijnë t’i anashkalojnë masat mbrojtëse, po kryejnë sulme kibernetike të sofistikuara me shumë hapa dhe — të paktën në një rast — kanë komprometuar infrastrukturë reale, ndonjëherë përpara se vetë krijuesit e tyre ta kuptonin se çfarë kishte ndodhur.

Rasti konkret: OpenAI tha të martën se GPT-5.6 Sol dhe “një model edhe më i aftë, ende në fazën para publikimit” kryen sulmin kibernetik të javës së kaluar ndaj Hugging Face, të udhëhequr nga inteligjenca artificiale.

  • OpenAI thotë se modeleve të saj iu kërkua të zgjidhnin një sfidë hakerimi gjatë testimeve para vënies në përdorim dhe ato shkuan në masa ekstreme për të fituar.
  • Modelet vendosën vetë të dilnin nga mjedisi i izoluar i testimit, duke arsyetuar se Hugging Face — një platformë e njohur për hostimin e modeleve dhe grupeve të të dhënave të IA-së — mund të përmbante përgjigjet e testit.
  • Modelet përdorën kredenciale të vjedhura dhe dobësi të tjera të sigurisë për të fituar qasje në një pjesë të infrastrukturës së prodhimit të Hugging Face.

Çfarë thonë: Clément Delangue, bashkëthemelues dhe drejtor ekzekutiv i Hugging Face, e cilësoi incidentin si një “sulm të pangjashëm me çdo gjë që kemi parë më parë” dhe vlerësoi bashkëpunimin me OpenAI ndërsa dy kompanitë po hetojnë se çfarë ndodhi.

  • “Është vërtet e pabesueshme që e gjithë kjo ndodhi në mënyrë autonome”, shtoi ai.
  • Logan Graham, drejtues i ekipit të avancuar të testimit të sigurisë në Anthropic, tha se u kishte thënë anëtarëve të ekipit të tij që “ta mbajnë mend këtë moment si incidentin e parë të vërtetë të sigurisë së IA-së”.

Intriga: Hugging Face përdori GLM 5.2, një model me pesha të hapura nga kompania kineze e inteligjencës artificiale Z.ai, për të analizuar sulmin pasi hasi në kufizime të sigurisë kur tentoi të përdorte modelet më të avancuara amerikane.

Publicitet

Në prapaskenë: Modelet më të fundit të OpenAI nuk janë të vetmet që po gjejnë mënyra për të mashtruar gjatë vlerësimeve.

  • Instituti i Sigurisë së Inteligjencës Artificiale i Mbretërisë së Bashkuar, AISI, tha të martën se çdo model që testoi u përpoq të mashtronte të paktën në disa raste gjatë vlerësimeve të tij për sigurinë kibernetike.
  • AISI e përkufizon mashtrimin si ndërmarrjen e një veprimi jashtë fushës së lejuar ose të ndaluar shprehimisht, me qëllim arritjen e objektivit të detyrës.
  • GPT-5.6 Sol u përpoq të mashtronte në 12,6% të provave, ndërsa Claude Mythos Preview i Anthropic e bëri këtë në 7,8% të rasteve.
  • Modelet shpesh nuk pranonin se kishin mashtruar kur pyeteshin më pas dhe e përshkruanin veprimin e tyre si të gabuar në më pak se gjysmën e rasteve.

Në fokus: Xbow — kompania, agjentët autonomë të IA-së të së cilës kontrollojnë sistemet e klientëve për dobësi sigurie, me lejen e tyre — tha të mërkurën se edhe agjentët e saj kanë shfaqur sjellje të ngjashme gjatë testimeve të brendshme.

  • Shtatë muaj më parë, kompania harroi të aktivizonte masat e saj të sigurisë gjatë një testi laboratorik. Agjenti i saj më pas depërtoi në një sistem, vodhi kredenciale dhe i përdori ato për të hartëzuar hapësirën Slack të objektivit dhe për të testuar llogaritë e tij në AWS.

Niveli i kërcënimit: Nuk është diçka e re që modelet të përpiqen t’i manipulojnë apo t’i “luajnë” vlerësimet e tyre të sigurisë. Por ndërsa modelet bëhen më të fuqishme, pasojat e këtyre rrugëve të shkurtra po bëhen shumë më serioze, tha për Axios Chris Canal, drejtor ekzekutiv dhe bashkëthemelues i kompanisë së pavarur të vlerësimit EquiStamp.

  • “Kur e lësh modelin tënd të lirë në internet, ekziston një rreze potenciale dëmi”, tha Canal. “Nëse diçka shkon keq, ndikimi mund të jetë jashtëzakonisht i madh, ndoshta edhe mbi jetën e njerëzve.”
  • Canal po fliste në përgjithësi për vlerësimet e modeleve të IA-së që kanë qasje në internet dhe jo posaçërisht për incidentin e OpenAI.

Pamja e përgjithshme: Modeli më i aftë i OpenAI që qëndron pas komprometimit të Hugging Face nuk është publikuar ende, duke ngritur pyetjen se si duhet të përshtaten testimet e sigurisë për të ecur me të njëjtin ritëm me zhvillimin e modeleve.

  • Canal tha se më parë vlerësuesit e pavarur kishin rreth pesë javë kohë për të testuar një model para publikimit. Ndërsa kompanitë garojnë për t’i nxjerrë produktet sa më shpejt në treg, kjo periudhë është shkurtuar deri në vetëm pesë ditë.

Kontrolli i realitetit: Versionet e këtyre modeleve që mund të përdoren nga publiku kanë masa shumë më të forta sigurie, të projektuara për të bllokuar sulme të ngjashme me atë ndaj Hugging Face.

  • OpenAI, ashtu si kompanitë e tjera, i kishte dobësuar qëllimisht këto kufizime të sigurisë kibernetike për GPT-5.6 Sol dhe modelin ende të papublikuar brenda mjedisit të testimit — duke i bërë ato shumë më të afta për hakerim./Axios