Z tego artykułu dowiesz się:
- Na czym polega nowa technologia znakowania treści, którą OpenAI wdraża w odpowiedzi na regulacje AI Act?
- Jak proste modyfikacje tekstu mogą niemal całkowicie zneutralizować skuteczność tego rozwiązania?
- Co wdrożenie nowej technologii oznacza dla wydawców oraz weryfikatorów informacji?
OpenAI w tym tygodniu zaczęło uruchamiać rozwiązanie, którego branża spodziewała się od dawna, lecz którego wdrożenie twórcy AI dotąd odkładali. Chodzi o znakowanie tekstów, które nie są dziełem człowieka, lecz generatywnej sztucznej inteligencji. Nowe zabezpieczenie obejmie użytkowników ChatGPT we wszystkich planach subskrypcyjnych w Unii Europejskiej.
Jak działa textGrain?
Niewidoczny system, określany jako „znak wodny”, choć bynajmniej nim nie jest, to technologia, która ma umożliwiać wykrycie treści wygenerowanej przez AI. Rozwiązanie trafi do ChatGPT i modelu programistycznego Codex. Deweloperzy korzystający z komercyjnego interfejsu API na całym świecie zyskali możliwość włączenia tej funkcji dla wybranych modeli, choć w skali globalnej pozostaje ona domyślnie wyłączona. OpenAI nie zdecydowało się na globalne narzucenie „stempla” wszystkim użytkownikom – Europa staje się w tym wypadku poligonem doświadczalnym i pierwszym obszarem obowiązkowej implementacji. Jest to efekt obowiązującego w UE rozporządzenia AI Act.
Nowatorskie narzędzie nosi nazwę textGrain. W przeciwieństwie do powszechnych wyobrażeń o cyfrowych znakach wodnych, technologia ta nie polega na doklejaniu do pliku niewidocznych spacji o zerowej szerokości, ukrytych symboli Unicode czy technicznych metadanych. Zwykły czytelnik, a nawet standardowy edytor tekstu, nie dostrzeże absolutnie żadnej anomalii. System nie wstawia też widocznej etykiety. Jak więc to działa?
OpenAI w opublikowanym wraz z badaczami z uniwersytetów Yale oraz Pensylwanii raporcie technicznym wyjaśnia: textGrain działa bezpośrednio na etapie próbkowania i doboru kolejnych tokenów (słów lub ich fragmentów). Kiedy zatem sztuczna inteligencja buduje zdanie, dokonuje wyborów spośród słów o zbliżonym prawdopodobieństwie statystycznym. Posiadając unikalny, tajny klucz matematyczny, algorytm celowo i subtelnie faworyzuje konkretne warianty leksykalne. Z perspektywy odbiorcy styl i jakość wypowiedzi pozostają w pełni naturalne (przy tym wewnętrzne testy nie wykazały spadku wydajności modeli). Jednak na przestrzeni setek takich mikrodecyzji w całym akapicie powstaje specyficzny, powtarzalny rozkład statystyczny – swoisty matematyczny odcisk palca.
Czytaj więcej
Nowa aplikacja na iPhone’a ma pomóc rozwiązać jeden z największych problemów ery AI: jak odróżnić prawdziwe zdjęcie od fałszywego. Zcam podpisuje m...
Ponieważ stempel jest wpleciony w sam szyk i strukturę użytych słów, tradycyjne próby jego usunięcia okazują się bezskuteczne. Skopiowanie wygenerowanego tekstu, wklejenie go do prostego Notatnika w systemie Windows, a następnie przeniesienie do dokumentu Worda czy arkusza kalkulacyjnego w żaden sposób nie neutralizuje sygnału, bo ten zawarty jest w leksykalnej treści.
Zabezpieczenia da się obejść
Aby zweryfikować, czy dany tekst napisał człowiek, czy maszyna, nie wystarczy zwykła analiza logiczna. Odczyt jest możliwy wyłącznie za pośrednictwem specjalnego detektora dysponującego odpowiednim kluczem deszyfrującym. Detektor sprawdza, jak często analizowany fragment tekstu pokrywa się z preferencjami narzuconymi przez klucz. Narzędzie nie zwraca zero-jedynkowego werdyktu typu „100 procent AI”, lecz rachunek prawdopodobieństwa określający, czy dany fragment nosi cechy „statystycznego stempla” OpenAI. Eksperci przyznają, że największym wyzwaniem pozostaje jednak podatność tego rozwiązania na edycję. Inżynier oprogramowania Sean Goedecke wskazuje, że takie znakowanie tekstu przez ChatGPT będzie można w trywialny sposób usunąć, a wewnętrzne testy laboratoryjne w OpenAI potwierdzają te wątpliwości. W badaniach przeprowadzonych na próbkach o długości 400 tokenów wykrywalność wynosiła początkowo około 92 proc., ale wystarczyło zastąpić synonimami zaledwie 10 proc. słów, by wskaźnik ten spadł do 66 proc. Przy modyfikacji na poziomie 25 proc. leksykonu skuteczność detektora dramatycznie załamywała się, osiągając zaledwie 17 proc. Sygnał rozmywa się również niemal całkowicie w przypadku krótkich odpowiedzi, przekładów na inne języki, parafraz oraz w zadaniach czysto matematycznych, gdzie pole manewru w doborze słownictwa jest silnie ograniczone.
Dla środowiska wydawców, redakcji i instytucji weryfikujących fakty wniosek jest taki, że brak wykrytego „statystycznego stempla” w tekście nie stanowi dowodu na pracę człowieka. Z drugiej strony „znak wodny” wyraźnie sygnalizuje proces maszynowy.
Czytaj więcej
Nepal walczy ze skutkami katastrofalnej powodzi, a w mediach społecznościowych rozprzestrzeniają się fałszywe filmy, zdjęcia i oszukańcze zbiórki....
Warto podkreślić, że sam „znak wodny” nie gromadzi danych wrażliwych: nie identyfikuje konkretnego konta ani tożsamości użytkownika, nie ujawnia wpisanego promptu, nie orzeka o prawdziwości faktów ani nie przesądza o prawach autorskich. OpenAI planuje w przyszłości udostępnić technologię textGrain na zasadach open source, jednak na początkowym etapie dostęp do detektora otrzymają wyłącznie zweryfikowani naukowcy oraz instytucje analityczne.
Brukselski bat i kodeks dobrych praktyk
Decyzja amerykańskiego giganta o wdrożeniu w UE nowego rozwiązania to efekt przepisów – to bezpośrednia odpowiedź na artykuł 50 unijnego Aktu o sztucznej inteligencji (AI Act), którego rygorystyczne zapisy dotyczące przejrzystości obowiązują od sierpnia br. Zgodnie z nimi dostawcy systemów generatywnych muszą zapewnić maszynową wykrywalność syntetycznych tekstów, grafik oraz wideo. Choć systemy funkcjonujące na rynku przed sierpniem 2026 r. otrzymały w ramach pakietu Digital Omnibus czas na wdrożenie wymogów do końca roku (Rada ds. AI odrzuciła postulaty dalszego przedłużenia okresu przejściowego), OpenAI postanowiło nie czekać na ostateczny termin. Co więcej, sygnatariusze unijnego kodeksu dobrych praktyk – w tym OpenAI, Google, Meta czy Microsoft – zobowiązali się udostępnić interoperacyjny ekosystem detekcji do 2 lutego 2027 r.
Czytaj więcej
Wojna na Bliskim Wschodzie wywołała bezprecedensową lawinę fałszywych materiałów tworzonych przez AI. Zalewające sieć deepfake’i są dziś tak realis...
Dotychczas OpenAI zwlekało jednak z uruchomieniem podobnego mechanizmu. Jak ujawniono już w 2024 r., w zarządzie spółki istniały poważne obawy, że użytkownicy masowo odpłyną do konkurencji, która nie wprowadza podobnych zabezpieczeń. Sytuację zmieniły jednak nie tylko unijne przepisy, ale również ruchy rywali: Anthropic wdrożył znakowanie w modelu Claude na całym świecie dwa miesiące wcześniej, natomiast Google z powodzeniem rozwija narzędzie SynthID (wedle zapewnień OpenAI, textGrain w testach porównawczych osiąga wyniki równe lub wyższe od rozwiązania Google).