Etyka i prawo AI

Anthropic znakuje teksty Claude'a. Jak działa watermark

Przyszłe modele Claude będą znakować generowany tekst znakiem wodnym. Anthropic wdraża go, by spełnić wymogi AI Act, i zapewnia, że nie zmienia to jakości ani ceny odpowiedzi.

Redakcja Zespół redakcyjny 5 min czytania aktualizacja: 1 września 2026
Biała kostka do gry i drewniane pionki na planszy

Czego się dowiesz

  • Jak watermark zmienia źródło losowości przy wyborze kolejnych słów, nie zmieniając treści
  • Dlaczego znak wodny słabo działa na krótkich tekstach, w kodzie i przy korekcie tekstu człowieka
  • Czy znakowanie wpływa na cenę, szybkość modelu i prawa do wygenerowanej treści
  • Jakie terminy i obowiązki wynikają z unijnego kodeksu przejrzystości oraz AI Act
  • Czym oznaczanie plików w standardzie C2PA różni się od znaku wodnego w tekście

Anthropic ogłosił, że kolejne wersje Claude'a będą generować tekst ze znakiem wodnym (watermark). Mechanizm ma pozwolić ocenić prawdopodobieństwo, że dany fragment powstał z udziałem tego modelu. Firma wdraża go, aby spełnić wymogi europejskiego AI Act, i zaznacza, że podobne rozwiązania wprowadzają inni duzi dostawcy modeli, którzy podpisali ten sam kodeks postępowania.

Dla firm w Polsce oznacza to, że obowiązek oznaczania treści generowanych przez AI wchodzi do narzędzi, z których na co dzień korzystają zespoły marketingu, obsługi klienta i dokumentacji technicznej.

Na czym polega znakowanie tekstu w modelach językowych

Model językowy tworzy tekst słowo po słowie, za każdym razem wybierając spośród kilku prawdopodobnych kandydatów. W zdaniu "The weather today was cold and..." kolejnym słowem raczej nie będzie "sugary", ale "overcast" i "grey" mogą być równie prawdopodobne. Zwykle taki wybór rozstrzyga liczba losowa, a odbiorca nie odczuwa różnicy.

Znak wodny wykorzystuje właśnie te pozornie nieistotne decyzje. Zamiast całkowicie losowego generatora liczb model używa klucza oraz kilku poprzedzających słów, aby ustalić kolejne słowo. Wybory nadal wyglądają na losowe, ale osoba z kluczem może później sprawdzić, czy ciąg słów odpowiada temu, co Claude wybrałby przy tym kluczu, i na tej podstawie oszacować, czy model brał udział w powstaniu tekstu.

Anthropic zaznacza, że mechanizm nie skłania modelu do wybierania słów, których normalnie by nie użył. Nie zmusi go na przykład do sięgnięcia po rzadkie słowo "nubilous". Model niczego też nie dopisuje do tekstu i nie zostawia ukrytych znaków.

Firma porównuje to do gry w Monopoly, w której zamiast rzucać kostką gracze odczytują kolejne cyfry rozwinięcia liczby pi, zaczynając od losowo wybranego miejsca. Przebieg gry pozostaje losowy, ale znając liczbę pi, można później sprawdzić, czy ruchy odpowiadają tej sekwencji.

Skąd pochodzi metoda i jakie ma ograniczenia

Claude korzysta z odmiany podejścia SynthID-Text, które Google DeepMind opublikował w 2024 roku w czasopiśmie "Nature". Ta rodzina rozwiązań wywodzi się z propozycji Scotta Aaronsona z 2022 roku i opiera się na tej samej zasadzie: zmienia się źródło losowości przy wyborze kolejnych słów.

W testach wewnętrznych Anthropic nie stwierdził wpływu znakowania na treść, kreatywność ani czytelność odpowiedzi. W badaniu dotyczącym SynthID-Text DeepMind udostępnił część odpowiedzi Gemini ze znakiem wodnym i porównał oceny użytkowników w postaci "thumbs-up" i "thumbs-down". Różnice nie były istotne statystycznie. W kontrolowanym badaniu oceniający porównywali odpowiedzi z watermarkiem i bez niego, i nie dostrzegali różnicy w jakości.

Klucz odpowiada wyłącznie na pytanie, czy Claude brał udział w powstaniu tekstu. Nie potwierdza, że tekst napisał człowiek, ani nie wykryje innego modelu, bo tamten korzystałby z innego klucza albo odmiennej metody znakowania. Krótkie fragmenty są trudniejsze do wykrycia, bo zawierają mniej decyzji modelu; wraz z długością tekstu pewność rośnie.

Znak jest też słabszy w tekstach faktograficznych. Po frazie "Isaac Newton's most famous work was called Principia..." jedyną poprawną kontynuacją jest "Mathematica", więc watermark nie ma tu pola do działania. Podobnie jest z kodem, który zwykle musi być precyzyjny i zgodny z określoną składnią. Znakowanie może natomiast obejmować komentarze i praktycznie nie ruszać samego kodu. Przy korekcie gramatyki i interpunkcji w tekście człowieka poprawek bywa z kolei zbyt mało, żeby cokolwiek wykryć.

Co to zmienia dla użytkowników i klientów API

Znakowanie nie generuje dodatkowych tokenów, dlatego nie zwiększa kosztu obsługi ani ceny dla użytkownika. Wpływ na szybkość modelu firma określa jako pomijalny.

Z watermarku nie da się odtworzyć danych o użytkowniku, jego organizacji ani o rozmowach prowadzonych z Claude'em.

Nie zmienia się również status prawny wygenerowanej treści. Znak wodny nie rozstrzyga kwestii własności ani autorstwa i nie wpływa na prawa użytkownika wynikające z regulaminu Anthropic.

Tłumaczenia wykonywane przez Claude'a również będą zawierały znak wodny, bo model samodzielnie wybiera w nich wszystkie słowa. Lekka redakcja prawdopodobnie nie usunie oznaczenia, natomiast całkowite przepisanie tekstu własnymi słowami może je zneutralizować. Watermark wskazuje jedynie, że model brał udział w powstaniu treści, i nie odróżnia sytuacji "Claude napisał tekst" od "Claude mocno go przeredagował".

Przy plikach graficznych Anthropic stosuje inne rozwiązanie. W formatach takich jak .png, .jpg czy .svg do metadanych trafia podpisana kryptograficznie adnotacja zgodna z otwartym standardem C2PA. Informuje ona, że plik powstał lub był przetwarzany z udziałem Claude'a. Sam obraz pozostaje niezmieniony, a adnotację odczyta dowolne narzędzie zgodne z C2PA. Anthropic zapowiada również własne.

Podstawa prawna, terminy i zapowiedziane narzędzia

Anthropic wskazuje zgodność z AI Act jako jeden z powodów wprowadzenia rozwiązania. Firma podpisała unijny Code of Practice on Transparency of AI-Generated Content wraz z innymi dużymi dostawcami modeli; łącznie sygnatariuszy jest około 190. Kodeks każe stosować metody oznaczania treści generowanych przez AI.

Znakowanie zostanie włączone globalnie, bo Anthropic nie ma obecnie trwałego sposobu ograniczenia go do jednego regionu. Firma zapowiada, że będzie dalej oceniać rozwiązanie i publikować aktualizacje.

Przepisy przewidują okres przejściowy dla modeli wydanych przed 2 sierpnia 2026 roku. Anthropic pracuje nad dodaniem watermarku również do nich i planuje wdrożenie w kolejnych miesiącach. Firma zapowiedziała także API do wykrywania znaku wodnego, którego szczegóły implementacji dopiero ustala.

Anthropic odróżnia swoje rozwiązanie od komercyjnych detektorów AI, takich jak Pangram. Nie mają one dostępu do klucza i zamiast tego analizują charakterystyczne cechy stylu, na przykład konstrukcję "this isn't [X], it's [Y]" czy nadużywane słowo "quietly". Zdaniem Anthropic to zupełnie co innego niż sprawdzanie znaku wodnego.

Czy ten artykuł był pomocny?

Jeden głos na artykuł. Możesz go zmienić albo wycofać ponownym kliknięciem - Twój wybór zapamiętujemy w tej przeglądarce.

Redakcja

Zespół redakcyjny portalu. Piszemy i redagujemy teksty, weryfikujemy zgłoszenia od autorów i pilnujemy, żeby definicje w słowniku były aktualne.

Wszystkie artykuły autora →