💌 Поштова розсилка SEO-новин, раз на тиждень найголовніше. Підписатися →
Новини індустрії

Anthropic почали додавати до текстів Claude вотермарки

Олеся Коробка··6 хв читання

Anthropic почали додавати невидиму вотермарку до всього тексту, який видає Claude. Це зобов'язання за Кодексом практики до статті 50 європейського AI Act, яка діє з 2 серпня 2026 року і вимагає позначати згенерований контент так, щоб позначку могла зчитати програма.

  • Моделі, випущені з 2 серпня 2026 року, позначають текст одразу, старіші допрацьовують.
  • Помітка стоїть у чаті, в API, у Claude Code, Claude Cowork і Claude Tag, а також коли Claude викликають через AWS, Google Cloud і Microsoft Foundry. По всьому світу, не тільки в Європі.
  • Сигнал, за описом Anthropic, вплетений у самі слова, переїжджає разом з текстом при копіюванні і частково переживає редагування.
  • Там само кажуть, що зайвих токенів помітка не використовує, тому на ціну і швидкість відповіді не впливає, а даних про людину, компанію чи чат у ній немає.
  • До файлів .svg, .png і .jpg додається підпис за стандартом C2PA, за яким видно, чи файл потім чіпали.
  • API для перевірки помітки Anthropic обіцяють, але поки що його немає. Публічного детектора теж немає.

Як помітка потрапляє в текст

Прихованих символів схема з Nature не додає, весь сигнал сидить у перекосі при виборі слів. Свою помітку Anthropic описують так само.

Схема з трьох кроків: секретний ключ і попередні слова дають початкове число, воно роздає кандидатам нулі та одиниці, перевірка рахує частку одиниць

Модель дописує фразу Це був … день. На місце пропуску в неї є чотири кандидати: гарний, хороший, чудовий і приємний. Секретний ключ, а це просто список з двадцяти-тридцяти випадкових чисел, разом з кількома попередніми словами дає одне число, і воно роздає кожному кандидату нуль або одиницю. За інших рівних турнір віддає перемогу слову з одиницею, і в текст іде гарний.

Підмінити слово помітка не може. Якщо після слів пішов на модель майже впевнена, що далі буде роботу, то серед кандидатів раз за разом витягається саме роботу, воно грає саме проти себе і виграє з будь-яким значенням. Помітка живе тільки на розвилках, де моделі байдуже, який з варіантів узяти. Тому в сухих фактологічних відповідях вона й виходить слабкою. Anthropic кажуть, що в коді помітки майже немає, там кожен символ мусить стояти на своєму місці, і сигналу вистачає хіба на коментарі, а от переклад позначається повністю, бо кожне слово в ньому вибирає модель.

Перевірка з ключем іде по готовому тексту, на кожній позиції відновлює те саме число з попередніх слів і питає, яке значення мало слово, що реально стоїть. У людському тексті одиниць буде приблизно половина, у поміченому помітно більше. Оцей перекіс і є вся помітка. Без ключа роздачу не відтворити, тому й рахувати нема чого.

Який алгоритм у Claude

14 серпня Anthropic підтвердили, що для вотермарки тексту використовують гуглівську технологію SynthID-Text 2024 року, описану в Nature. Тією самою помічений Gemini, ключ у Anthropic свій. Ідея підмінювати джерело випадковості при виборі слів належить Scott Aaronson і озвучена ще в 2022 році.

Кодекс практики Євросоюзу підписали близько 190 сторін, серед них інші великі розробники моделей. Свої вотермарки будуть і в них.

DeepMind дали користувачам на оцінку майже 20 мільйонів живих відповідей Gemini і різниці між поміченою і чистою моделлю не знайшли. Anthropic кажуть, що на своїх тестах бачать те саме, але тестів не показують.

23 липня Anthropic оновили сторінку прозорості. Стара версія прямо казала, що вотермарок для тексту компанія не надає, у новій уже йшлося про роботу з індустрією та академією і підготовку до вимог законів. Різницю видно у збереженій копії на Archive.org, а розбір збігів між заявленими властивостями помітки і науковими роботами зробив Roger Montti.

Що помітка доводить

Небагато. Вона означає, що текст проходив через Claude, і все. Модель могла вичитувати чи перекладати чуже, а людина могла переписати відповідь після того, як її отримала. Відсутність помітки теж нічого не доводить, бо її не знаходять у коротких уривках, у сильно відредагованому тексті і після конвертації файлу.

Як позбутися водяного знаку AI в тексті

Anthropic кажуть, що легку правку помітка скоріш за все переживе, а повне переписування, де замінене кожне слово, її зітре. Оскільки під сподом лежить SynthID-Text, працюють і всі досліди над відкритою версією Google. Дослідники з Queen's University перевірили чотири способи прибрати помітку, не міняючи змісту тексту.

  • Перекласти текст іншою мовою і назад. Найдієвіше з усього. Після подорожі через китайську детектор упізнає лише два помічені тексти з трьох, кожен третій проходить як людський.
  • Втопити помічений уривок у чужому тексті. Коли навколо нього вдесятеро більше людського тексту, детектор перестає розрізняти взагалі. Він називає машинними більше половини звичайних людських текстів, і вірити його відповідям уже не можна.
  • Переказати текст іншою моделлю. Сигнал слабшає, але помітку здебільшого ще видно.
  • Замінити частину слів синонімами. Не працює, помітка лишається на місці.

Помацати ці атаки руками можна в безкоштовному застосунку Lee Foot: він обгорнув робочий код схеми Kirchenbauer et al., генерує помічений текст, підсвічує сигнал у кожному слові і на графіках показує, де детекція ламається. У його прогонах помітка спрацьовує вже з 20 токенів, переживає до 50% випадково видалених слів і до 40% замінених, а пошук ковзним вікном знаходить її, навіть коли помічений шматок складає лише 10% великого документа. Чужий текст застосунок не оцінить, бо пише власним ключем і ним же перевіряє.

Три графіки атак на текстову вотермарку: обрізання, випадкове видалення і заміна слів

Є й спосіб не збивати помітку наосліп. Дослідники з ETH Zurich показали атаку під назвою викрадення водяного знаку. Помічену модель ганяють запитами, будують наближену карту слів, до яких вона тяжіє, і далі міняють у тексті саме їх. Ключа це не розкриває, але для практики вистачає. За менше ніж $50 на запити вдавалося і прибрати помітку, і навпаки підробити її в чистому людському тексті, щоб підставити автора, з успішністю понад 80%. Показували це на іншому сімействі схем і до виходу SynthID Text, проти турнірного добору публічно не перевіряли.

Помічені тексти дослідники згенерували самі. Вони взяли невелику модель Sheared-LLaMA-1.3B, поставили на неї той самий механізм SynthID зі своїм власним ключем, і тому могли потім перевіряти результат. Ні Gemini, ні Claude вони не чіпали. Google і самі називають межі своєї технології. Знак переживає обрізання тексту і легкий переказ, але падає після ґрунтовного переписування чи перекладу, і SEOшника не спинить.

Чи позначають текст Google і OpenAI

  • Google позначають текст Gemini з 2024 року і виклали код текстової версії SynthID у відкритий доступ, тож поставити помітку на власну модель може будь-хто. Ключі до Gemini при цьому лишаються в Google, тому перевірити чужий текст цим кодом не вийде. На травневому I/O пообіцяли завести розпізнавання SynthID і C2PA в пошук і Chrome.
  • OpenAI текст не позначають. Детектор з точністю 99.9% зробили ще у 2023 році і не запустили, бо боялися вдарити по людях, для яких англійська нерідна. Позначають тільки зображення і аудіо.

Як AI-текст виявляють без водяного знаку

Група Dmitry Kobak порахувала лексику 14 мільйонів анотацій наукових статей у PubMed до і після виходу ChatGPT. Слово delves стало траплятися у 28 разів частіше, разом з ним intricate, meticulous і crucial. За цим надлишком автори оцінили, що щонайменше 13.5% анотацій 2024 року писали з моделлю.

Про конкретний текст такий підрахунок нічого не скаже, зате ключів і згоди розробника моделі для нього не треба. Google теж працюють над розпізнаванням за ознаками самого тексту, їхню наукову роботу про виявлення AI-спаму ми вже розбирали.

📬 Новини SEO українською раз на тиждень.

Підписатися