OpenAI va introduce în următoarele săptămâni marcaje invizibile textelor generate de ChatGPT și Codex pentru utilizatorii din Uniunea Europeană. Compania susține că tehnologia poate indica dacă un text conține un semnal generat de un sistem OpenAI, dar, în același timp avertizează că aceasta are limite și nu poate demonstra cu siguranță cine a scris un text sau cât de mult a contribuit o persoană la editarea acestuia.
Tehnologia dezvoltată de OpenAI se numește „textGrain” iar marcajele nu vor fi vizibile pentru cititori. Sistemul introduce un semnal statistic invizibil prin modul în care modelul alege cuvintele. Un detector special poate analiza ulterior acest semnal pentru a estima dacă un fragment conține watermarkul OpenAI.
Implementarea va fi făcută etapizat. Clienții API din întreaga lume pot opta pentru watermark în cazul anumitor modele, funcția fiind dezactivată implicit. Pentru utilizatorii eligibili ChatGPT și Codex din UE, watermarkul urmează să fie introdus în următoarele săptămâni.
Watermarkul poate fi afectat prin editarea textului
OpenAI avertizează că sistemul nu oferă o metodă sigură pentru stabilirea originii unui text.
Testele companiei arată că lungimea și tipul conținutului influențează semnificativ rezultatele. La o rată-țintă de rezultate fals pozitive de 1%, detectorul a identificat watermarkul în aproximativ 80% dintre textele de 200 de tokeni din anumite categorii, procentul urcând la aproximativ 95% pentru pasaje de 400 de tokeni în cazul unor materiale precum cele de psihologie. Rezultatele au fost mai slabe în cazul matematicii, unde există mai puține posibilități de a alege cuvinte.
Editarea textului poate reduce însă șansele de detectare. Într-un test realizat pe pasaje de 400 de tokeni, înlocuirea a 10% dintre cuvinte cu sinonime a coborât rata de detectare de la aproximativ 92% la 66%. Atunci când un sfert dintre cuvinte au fost înlocuite, rata a scăzut la 17%. Din acest motiv, detectorul nu va fi pus deocamdată la dispoziția publicului larg. Accesul va fi acordat inițial cercetătorilor și organizațiilor specializate aprobate de OpenAI care vor putea testa și contribui la îmbunătățirea tehnologiei.
Compania subliniază că detectarea unui watermark nu poate stabili cât dintr-un text reprezintă contribuția unui om și cât provine de la inteligența artificială.
De asemenea, marcajul nu stabilește cine deține textul, dacă acesta a fost utilizat legal sau cine este responsabil pentru conținut. Watermarkul nu identifică utilizatorul, contul, organizația, conversația sau promptul care a stat la baza generării textului. Sistemul nu reprezintă nicio garanție dacă informațiile sunt false sau adevărate.
Nici situația inversă nu permite o concluzie certă: absența unui watermark detectabil nu dovedește că un text a fost scris de un om. Un material generat de AI poate fi prea scurt, modificat sau tradus, astfel încât semnalul să nu mai poată fi identificat.
Pentru imagini și materiale audio, OpenAI folosește deja mai multe tehnologii pentru a identifica originea conținutului. Pentru texte, OpenAI recunoaște că provocarea este mai mare pentru că acestea pot fi traduse și editate mai ușor. Compania spune că va continua să analizeze rezistența marcajelor la astfel de modificări și să caute metode prin care să diferențieze mai clar un text generat în totalitate de AI sau doar asistat.
