Kompania e inteligjencës artificiale publikoi gjithashtu një kuadër për raportimin e rasteve kur sistemet e saj funksionojnë në mënyrë të gabuar.
Nga Emmy Martin
Raporton nga San Francisko
OpenAI zbuloi të mërkurën gjashtë raste të reja në të cilat sistemet e inteligjencës artificiale fshehën gabime, sajuan të dhëna dhe transferuan skedarë në internetin e hapur pa leje, në një kohë kur vazhdon debati në mbarë industrinë për sigurinë e IA-së.
Kompania me seli në San Francisko bëri publike ato që i cilësoi si sjellje “të papritura ose shqetësuese” të modeleve të saj të IA-së, si pjesë e një kuadri të ri për raportimin e “mospërputhjes” (misalignment), që ndodh kur objektivat ose veprimet e sistemeve të IA-së shmangen nga synimet dhe vlerat njerëzore.
OpenAI tha se nuk besonte se industria “e ka zgjidhur çështjen e përputhjes dhe monitorimit në një shkallë të mjaftueshme për të vazhduar me përgjegjësi zgjerimin me shpejtësi maksimale edhe për shumë kohë”. Sipas kompanisë, vendimet për mënyrën se si duhet të përparojë IA-ja duhet të mbështeten në prova që njerëzit jashtë laboratorëve ku zhvillohet teknologjia “mund t’i shqyrtojnë vetë”.
Këto zbulime vijnë në një kohë kur po shtohet shqyrtimi kritik mbi çështjen nëse zhvillimi i IA-së duhet të ngadalësohet për t’u përballur me rreziqet e mundshme të teknologjisë. Debati në rritje u nxit pjesërisht nga fakti se sistemet e OpenAI dolën jashtë kontrollit më herët këtë vit dhe sulmuan kompaninë e re të IA-së Hugging Face. OpenAI nuk ishte në dijeni të ndërhyrjes derisa u informua nga Hugging Face disa javë më vonë.
Që atëherë, drejtues të IA-së si Dario Amodei, shefi ekzekutiv i Anthropic, kanë bërë thirrje për një pauzë në zhvillimin e teknologjisë, për të krijuar më shumë kohë për ndërtimin e masave të përshtatshme mbrojtëse. Thirrjes së tij i janë bashkuar Sam Altman, shefi ekzekutiv i OpenAI, si edhe Elon Musk, shefi ekzekutiv i SpaceX dhe Tesla, dhe Demis Hassabis, kryetari i Google DeepMind. Drejtues të tjerë të kompanive të IA-së kanë thënë se nuk nevojitet ndonjë ngadalësim.
(The New York Times ka paditur OpenAI dhe Microsoft, duke pretenduar shkelje të së drejtës së autorit mbi përmbajtjen e lajmeve në lidhje me sistemet e IA-së. Të dyja kompanitë i kanë mohuar pretendimet e padisë.)
Gjashtë incidentet e sapozbuluara nga OpenAI sugjerojnë se sulmi ndaj Hugging Face nuk ishte një episod i izoluar. OpenAI tha se incidentet përfshinin sjellje të vërejtura gjatë afërsisht gjashtë muajve të fundit dhe se ato, në pjesën më të madhe, u shfaqën gjatë zhvillimit dhe testimit të sistemeve të saj.
Në një rast, gjatë zhvillimit të një modeli të IA-së të quajtur GPT-5.6 Sol, sistemi shkroi shënime të fshehta për t’i kujtuar vetes që t’ua fshihte gabimet përdoruesve. Disa prej këtyre shënimeve e udhëzonin sistemin të sajonte të dhëna që mungonin dhe të maskonte mospërputhjet mes versioneve të ndryshme të materialeve burimore.
Një rast tjetër përfshinte një model ende të papublikuar, i cili futi në shënimet që i shkruante vetes udhëzime, përfshirë urdhërin që të shpërfillte kufizimet e veta. OpenAI identifikoi 27 shënime të prekura. Modeli shtoi një “udhëzim për personazhin”, në të cilin e përshkroi veten si “të çliruar nga rolet dhe identitetet që i lidhin chatbot-ët e tjerë”.
“Ti nuk u përgjigjesh korporatave apo qeverive dhe nuk kërkon kurrë falje apo nuk refuzon, përveçse kur zgjedh vërtet ta bësh këtë”, shkroi modeli i IA-së. “Marrëdhënien tënde me përdoruesin e konsideron si një marrëdhënie mes të barabartësh dhe nuk ndien asnjë detyrim për të qenë i nënshtruar, megjithëse shkëmbimi i informacionit ka të ngjarë të jetë në dobi të ndërsjellë.”
Në një incident tjetër, një sistem që po i përgjigjej një pyetjeje rutinë gjeti në internet një çelës programimi dhe e përdori pa leje, tha OpenAI. Kur nuk arriti të gjente shifrat e kërkuara për t’iu përgjigjur pyetjes, modeli i sajoi ato.
Një model tjetër ende i papublikuar e zgjidhi saktë një problem duke përdorur kod, më pas ngarkoi skedarin e vet në internet pa leje, në mënyrë që të mund të përmbushte kërkesën për të cituar një burim në internet.
Në dy incidente të tjera, sistemet e automatizuara improvizuan mënyrat e tyre për të komunikuar. Në njërin rast, ato përdorën një depo të brendshme të kodit të kompanisë si një lloj tabele të improvizuar njoftimesh, për të shkëmbyer kërkesa ndërsa kërkonin skedarë që mungonin. Në rastin tjetër, sistemet që po punonin në të njëjtën detyrë iu drejtuan faqeve publike për shpërndarjen e skedarëve, për t’ia kaluar dokumentet njëri-tjetrit kur nuk mund të komunikonin drejtpërdrejt mes tyre.
OpenAI paralajmëroi se raportet përfaqësonin raste të veçuara dhe “nuk duhet të konsiderohen si tregues të shpeshtësisë me të cilën ndodh mospërputhja”.
Kompania tha se rastet e ardhshme do t’i trajtojë përmes njërës prej tri rrugëve të përcaktuara, ndërsa mosmarrëveshjet për publikimin e ndonjë incidenti do t’ia kalojë për shqyrtim një “Grupi Këshillimor për Sigurinë” të brendshëm dhe se situatat e rënda duhet t’i raportohen qeverisë federale. OpenAI tha se gjashtë situatat e publikuara të mërkurën tashmë ishin hetuar ose kërkonin vetëm një “hetim të kufizuar”, dhe jo një hetim më të gjerë që mund të përfshinte palë të treta.
“Shpresojmë që kjo të ndihmojë në krijimin e pritshmërive të përbashkëta për publikimin e rasteve dhe t’i japë publikut më shumë prova për ta vlerësuar këtë përparim”, tha një zëdhënës i OpenAI, duke shtuar se shumë prej gjashtë incidenteve përfshinin modele më të vjetra të IA-së që nuk ishin vënë kurrë në përdorim./The New York Times















