Ballina IA Shënjimi i teksteve të gjeneruara nga IA: Pse ideja e Anthropic është...

Shënjimi i teksteve të gjeneruara nga IA: Pse ideja e Anthropic është si një ombrellë me vrima

Pas lavdërimeve, erdhën kritikat. Më 11 gusht, Anthropic njoftoi se tekstet e prodhuara nga modelet e saj Claude do të mbajnë tashmë një shenjë të padukshme. Reagimet qenë të forta, duke filluar nga akuzat për përgjim e deri te frika se përdoruesit mund të etiketohen si mashtrues.

Megjithatë, objekti teknik është më modest sesa polemika që ka shkaktuar. Një inteligjencë artificiale prodhon tekstin e saj token pas tokeni – fragmente fjalësh që shërbejnë si njësi llogaritjeje dhe faturimi. Në çdo hap, ekzistojnë disa vazhdime të mundshme dhe modeli zgjedh njërin prej tyre në mënyrë probabilistike. Filigrani konsiston në manipulimin shumë të lehtë të kësaj zgjedhjeje, duke favorizuar një pjesë të caktuar të fjalorit, të përcaktuar nga një çelës sekret.

Në një fjali të vetme, ky devijim mbetet i pazbulueshëm. Por në disa qindra fjalë, një test statistikor mund të identifikojë gjurmën e inteligjencës artificiale.

Ndryshe nga sa është thënë në disa raportime, në tekst nuk shtohet asnjë karakter i padukshëm dhe përgjigjja nuk konsumon më shumë tokenë. Ajo që harxhon kjo metodë është entropia, pra hapësira e zgjedhjeve që ka në dispozicion modeli.

Kjo teknikë, megjithatë, përballet me disa kufizime. Një tekst i shkurtër i gjeneruar nga IA nuk jep ndonjë sinjal të besueshëm për origjinën e tij. Studimi themelor i John Kirchenbauer dhe bashkautorëve të tij nga Universiteti i Marylandit, i publikuar në vitin 2023, përmendte një prag prej rreth 25 tokenësh.

Kodi kompjuterik, nga ana tjetër, është rezistent ndaj një shënjimi të tillë, sepse nuk mund të zëvendësosh një fjalë me një sinonim pa rrezikuar që programi të mos funksionojë më.

Shkruar nga një njeri, redaktuar nga Claude

Anthropic thekson gjithashtu në dokumentacionin e vet se zbulimi i filigranit tregon vetëm se përmbajtja ka kaluar nëpër Claude, jo domosdoshmërisht se Claude e ka shkruar të gjithë tekstin.

Publicitet

Një tekst i shkruar nga një njeri dhe që më pas i nënshtrohet korrigjimit, përkthimit apo përmbledhjes nga Claude do të marrë gjithashtu shenjën.

Por e kundërta nuk provon asgjë: një rishkrim pak më i thelluar nga një njeri ose kalimi i tekstit nëpër një model tjetër mund të mjaftojë për ta zhdukur sinjalin.

Alex Cui, drejtor teknik i GPTZero, kompani që shet mjete për zbulimin e teksteve të gjeneruara nga IA, pohon se ka arritur ta heqë filigranin e Google duke përdorur mjete falas për riformulim të tekstit.

Google, në fakt, i shënjon tekstet e Gemini që nga viti 2024 me SynthID-Text, një metodë e publikuar në revistën shkencore Nature në tetor të të njëjtit vit, pa shkaktuar ndonjë polemikë të krahasueshme.

Studiuesit e Google thonë se nuk kanë vërejtur ndonjë ndryshim në nivelin e kënaqësisë së përdoruesve në pothuajse 20 milionë ndërveprime.

Megjithatë, laboratori SRI i Shkollës Politeknike Federale të Cyrihut gjeti gjurmë të besueshme të filigranit vetëm në versionin e Gemini të destinuar për publikun e gjerë.

Pikërisht këtu Anthropic dallon nga të tjerët.

Shënjimi aplikohet drejtpërdrejt në nivelin e modelit. Për këtë arsye, ai është i pranishëm kudo: nga ndërfaqja e programimit, API-ja, deri te shërbimet e rishitura përmes Amazon, Google dhe Microsoft.

OpenAI, nga ana e saj, kishte në dispozicion një mjet të ngjashëm që në vitin 2023, sipas dokumenteve të brendshme të analizuara nga The Wall Street Journal.

Por ky sistem thuhet se nuk u aktivizua pas rezultateve të një ankete: pothuajse një në tre përdorues deklaronte se do të largohej nga ChatGPT nëse do të gjente një model konkurrues që nuk përdorte shënjim.

Mjeti i verifikimit ende nuk është gati

Nëse Anthropic ka vendosur ta zbatojë tani këtë sistem, arsyeja lidhet edhe me nenin 50 të Rregullores Evropiane për Inteligjencën Artificiale.

Ai është i zbatueshëm që nga 2 gushti dhe u kërkon ofruesve që përmbajtjet e prodhuara prej tyre të jenë të dallueshme nga makinat, përndryshe mund të përballen me gjoba që arrijnë deri në 15 milionë euro ose 3 për qind të qarkullimit global.

Një kod i praktikave të mira, i publikuar më 10 qershor, u jep nënshkruesve një lloj prezumimi të pajtueshmërisë me rregullat. Sipas Komisionit Evropian, deri në fund të korrikut atë e kishin nënshkruar rreth 190 organizata.

Anthropic vendosi ta shtrijë shënjimin në mbarë botën, megjithëse legjislacioni e kërkonte këtë vetëm brenda Bashkimit Evropian.

Vetë kodi pranon se asnjë teknikë nuk është e mjaftueshme e vetme dhe, kur është e mundur, kërkon përdorimin e dy mekanizmave: një filigrani dhe metadata të nënshkruara, pra një lloj etikete të bashkëngjitur skedarit.

Përvoja me imazhet shpjegon këtë kujdes.

Imazhet e prodhuara nga Claude marrin një etiketë të origjinës sipas standardit C2PA, i cili është përqafuar nga më shumë se 6.000 organizata, nga Adobe deri te BBC.

Por kjo etiketë ndodhet në strukturën që rrethon skedarin dhe jo brenda vetë imazhit. Ekzistojnë disa mjete që mund ta heqin atë.

Filigrani i tekstit ka dobësinë e kundërt: ai i mbijeton kopjimit dhe ngjitjes së tekstit, por mund të zhduket pas një rishkrimi.

Anthropic premton se do të publikojë një mjet verifikimi, por deri tani nuk ka dhënë hollësi të tjera.

Kodi evropian u jep nënshkruesve afat deri më 2 shkurt 2027 për t’i bërë këta mekanizma të ndërveprueshëm, në mënyrë që përdoruesit të mos jenë të detyruar të përdorin veçmas detektorin e secilit ofrues.

Rruga drejt transparencës është ende e gjatë./L’Express.fr