Главная/AI/Watermark в AI-тексте: как нейросети метят свои тексты и что эту метку стирает

Watermark в AI-тексте: как нейросети метят свои тексты и что эту метку стирает

ВВиталий ГротОбновлено 18 августа 20260 просмотра9 мин11 564 знаков
Схема скрытого watermark в потоке токенов AI-текста

11 августа 2026 Anthropic объявила: все модели Claude, вышедшие со 2 августа, метят свой текст невидимым водяным знаком — во всех продуктах сразу и по всему миру, а не только в Евросоюзе. Метка вплетена в сам текст, а не в свойства файла, поэтому переживает копирование в блокнот, а стирают её только парафраз, перевод и переписывание заново. Публичного детектора пока нет ни у кого, а отсутствие метки не доказывает, что текст писал человек. Ниже — какие вообще бывают метки, почему вопрос «как удалить watermark» поставлен неверно и что с этим делать редакции сайта.

Что именно объявила Anthropic

Компания обновила свою справку «How Claude marks AI-generated content». Коротко, по пунктам её же формулировок:

ЧтоКак у Anthropic
Кого метятМодели, вышедшие 2 августа 2026 и позже, — с момента запуска. Для старых моделей поддержку «дорабатывают»
ГдеВезде, где есть Claude: API, веб-версия, Claude Code, Cowork, Claude Tag, плюс модели у AWS, Google Cloud и Microsoft Foundry
ТекстНезаметный водяной знак, который «не меняет смысл, качество и читаемость»
ФайлыПодписанные метаданные происхождения по стандарту C2PA — там, где Claude работает с файлами (.svg, .png, .jpg)
КопипастМетка «путешествует с текстом при копировании и может пережить часть правок»
Что метку убиваетСильная правка, парафраз, перевод, смешивание с чужим текстом
Что метка доказываетЧто текст прошёл через Claude. Не то, кто автор: «сигнал не является полностью убедительным»

Повод внешний: со 2 августа 2026 в ЕС применяется статья 50 AI Act — поставщик генеративной системы обязан помечать вывод машиночитаемым способом. Anthropic включила маркировку глобально, а не по региону: держать две ветки поведения дороже, чем одну.

Публичного детектора нет. Anthropic пишет, что «работает над возможностью обнаружения» и опубликует детали позже. То есть проверить чужой текст на метку Claude сегодня нельзя — ни вам, ни площадке, ни суду.

Важно

Метка отвечает на вопрос «проходил ли текст через Claude», а не «кто это написал». Через модель проходит и вычитка, и перевод чужого текста — и оба случая оставят тот же след, что генерация с нуля.

Шесть способов пометить текст, и только один работает после копипаста

«AI-метка» — не одна технология. Под этим словом живут вещи с разной физикой и разной живучестью.

СпособГде сидит меткаВидна человекуПереживает копипаст обычным текстом
Видимая приписка «сделано ИИ»В самом текстеДаДа, но удаляется одним движением
Метаданные файлаВ свойствах DOCX, PDFНетНет
C2PA, Content CredentialsВ подписанных данных файлаНетНет
Невидимые символы UnicodeМежду словамиНетОбычно да, но чистятся поиском с заменой
Статистический watermarkВ выборе токеновНетДа
Семантический watermarkВ вариантах формулировокНетИногда

Отдельно от них стоят AI-детекторы и стилометрия: там метки нет вовсе, есть догадка по стилю. Путать эти две вещи — главная ошибка в разговоре про «проверку на ИИ», и ниже я разберу её отдельно.

Почему метаданные и C2PA не спасают текст

Метаданные — служебные сведения внутри файла: чем создан, когда, что с ним делали. C2PA поверх этого добавляет криптографическую подпись, поэтому историю нельзя подделать. Но её очень легко потерять.

Метаданные файла

история лежит в свойствах DOCX. Скопировали абзац в редактор CMS — история осталась в файле, в буфер уехали голые буквы

Метка внутри текста

сигнал сидит в самом выборе слов. Скопировали абзац — сигнал уехал вместе с ним

Отсюда правило, из которого растёт вся текстовая маркировка: контент, который живёт копипастом, метится только изнутри. Для картинок C2PA работает, для текста в вебе — почти нет.

Невидимые символы Unicode — не то, что ищут детекторы

В Unicode есть символы нулевой ширины: программа их видит, человек нет.

КодНазвание
U+200BZero Width Space
U+200CZero Width Non-Joiner
U+200DZero Width Joiner
U+2060Word Joiner
U+FEFFZero Width No-Break Space

Ими можно закодировать хоть последовательность битов — это текстовая стеганография, приём старше нейросетей. Именно его чаще всего имеют в виду, когда в соцсетях советуют «прогнать текст через чистильщик и метка слетит».

Слетит — но не та. Невидимые символы хрупкие: их снимает нормализация Unicode и любая чистка управляющих знаков. Поэтому современные текстовые метки на них не строят, и «очистка от zero-width» ничего не говорит о статистическом watermark.

Статистический watermark: метка без единого лишнего символа

Модель пишет текст не словами, а токенами — кусками слов. На каждом шаге она выбирает следующий токен из распределения вероятностей:

ТокенВероятность
необходимо30%
следует27%
рекомендуется21%
желательно12%
нужно10%

Алгоритм маркировки заранее делит словарь на «зелёную» часть и остальное, а потом чуть-чуть двигает вероятности в пользу зелёной:

ТокенБез меткиС меткой
необходимо30%27%
следует27%33%
рекомендуется21%25%
желательно12%8%
нужно10%7%

На одном предложении разницы нет — смысл и стиль не пострадали. Но на сотнях токенов накапливается перекос: там, где по случайности ждали пятьдесят зелёных токенов из ста, детектор видит семьдесят. Насколько такой перекос неслучаен, считают z-оценкой — числом стандартных отклонений от ожидаемого. Чем длиннее текст, тем увереннее ответ; на твите уверенности не будет никогда.

Схему с зелёным списком и z-оценкой предложили Кирхенбауэр и соавторы в работе A Watermark for Large Language Models. Открытый работающий пример — SynthID Text от Google: он встраивается в генерацию как обработчик логитов, то есть вмешивается ровно в тот момент, когда модель выбирает следующий токен. Код открыт и лежит в Hugging Face Transformers.

Важно

Всё, что выше, — пример того, как такие метки устроены вообще, а не описание алгоритма Claude. Anthropic свою механику не раскрыла: неизвестно, зелёные списки там, семантическое кодирование или что-то третье. Любой текст в интернете, который «объясняет алгоритм метки Claude», сегодня выдумывает.

Что метку стирает, а что нет

Короткий ответ: метаданные снимаются одной командой, невидимые символы — чисткой Unicode, а статистический watermark не стирается ничем, кроме переписывания текста заново.

Текст из модели:
метка в выборе токенов

Копипаст, смена шрифта,
разметка и заголовки

Правка отдельных слов,
перестановка абзацев

Парафраз, перевод,
смешивание с чужим текстом

Фрагмент
в пару предложений

Метка на месте:
сигнал пережил правку

Метки нет:
доказывать нечего

Метка есть,
но статистика молчит

Что происходит с меткой по дороге к читателю
Действие с текстомЧто с меткой
Копирование в блокнот, в CMS, в мессенджерНичего: последовательность токенов та же
Смена шрифта, разметки, заголовковНичего: метка не в оформлении
Правка отдельных слов, перестановка абзацевОбычно переживает — Anthropic пишет «может пережить часть правок»
Глубокий парафраз своими словамиРазрушается
Перевод на другой языкРазрушается
Смешивание с большим человеческим текстомРазмывается до неразличимости
Короткий фрагмент, пара предложенийМетка есть, но статистика её не докажет

Отсюда честный вывод, который редко пишут: наличие метки — сильный сигнал, отсутствие — ноль информации. Текст без метки мог написать человек, старая модель, конкурент Claude или тот же Claude, но с последующим переводом.

AI-детектор и детектор watermark — разные приборы

Их постоянно путают, и цена путаницы высокая: на выводе AI-детектора увольняют, снимают с публикации и снижают оценки.

AI-детектор

секрета не знает. Смотрит на предсказуемость текста, длину предложений, частотность слов — и угадывает. Ровный технический текст живого автора регулярно помечает машинным

Детектор watermark

знает, какой сигнал разработчик закладывал. Считает статистику по своему же списку токенов и выдаёт z-оценку, а не впечатление

У классификаторов это не детская болезнь, а свойство метода. OpenAI закрыла свой AI Text Classifier ещё летом 2023 года — из-за низкой точности, о чём написала сама. С тех пор общедоступного текстового классификатора с доказанной точностью не появилось, а платные сервисы своей точности не показывают на воспроизводимых выборках.

Важно

Решение о человеке — снять статью, отказать автору, обвинить студента — на выводе AI-детектора принимать нельзя. Это оценка стиля, а не доказательство происхождения. Детектор watermark таким доказательством был бы, но публичного детектора для Claude пока нет.

Картинки: здесь проверка уже работает

С изображениями ситуация лучше, чем с текстом. С 19 мая 2026 OpenAI ставит на картинки из ChatGPT, Codex и API сразу два сигнала — подпись C2PA и watermark SynthID, а на поддерживаемое аудио — SynthID. Проверить можно самому:

Подробный разбор маркировки картинок — в отдельной статье: как маркируются изображения ИИ. Здесь только то, что нужно проверить прямо сейчас.

Генератор ставит
подпись C2PA и SynthID

Скачали файл целиком

Сделали скриншот

Пересохранили
конвертером или редактором

Провели через соцсеть

Подпись на месте:
происхождение доказуемо

Подписи нет,
SynthID в пикселях иногда жив

Где теряется подпись C2PA по дороге к читателю
  1. Откройте проверку OpenAI

    Инструмент openai.com/verify принимает изображения и аудио. Текст он не проверяет — для текста таких инструментов пока нет ни у кого.

  2. Загрузите файл целиком

    Не скриншот и не пересохранённую копию: и то, и другое срезает C2PA. SynthID в пикселях переживает сжатие и обрезку, поэтому иногда отвечает даже там, где подпись потеряна.

  3. Прочитайте пустой ответ правильно

    «Сигналов не найдено» не значит «сделано человеком». Значит: подписи нет или её срезали по дороге — соцсетью, конвертером, скриншотом.

Совет

Если публикуете чужие изображения, проверяйте их до вёрстки, а не после жалобы. Свои — наоборот: следите, чтобы конвейер сжатия картинок на сайте не срезал C2PA, иначе вы теряете доказательство собственного авторства.

Что это меняет для сайта

Раньше площадка могла только гонять тексты через классификатор и получать вероятность. Теперь вопрос смещается: не «похоже ли это на ИИ», а «есть ли в тексте машиночитаемый сигнал конкретной системы». Практических следствий три.

  1. Спрашивать про ответственность, а не про происхождение. Вопрос автору «писал ли ИИ» бессмысленный: проверить нельзя, а после перевода метка исчезнет. Спрашивайте, кто отвечает за факты и источники, — это проверяется.
  2. Отменить санкции по выводу AI-детектора. Пока нет детектора метки, любое обвинение строится на догадке. Один ложный срыв публикации у живого автора стоит дороже десяти пропущенных машинных текстов.
  3. Сохранять провенанс своих материалов. Для картинок это уже рабочая практика: подпись C2PA — ваш аргумент в споре об авторстве. Проверьте, переживает ли она вашу же оптимизацию изображений.

Поисковикам метка не мешает: Google оценивает пользу материала, а не способ производства, и отдельного «фильтра за watermark» нет. Опасность не в ранжировании, а в доверии читателя и в спорах об авторстве.

Главное

Единой «AI-метки» не существует. Под этим словом прячутся шесть разных механизмов — от приписки в конце текста до статистики по токенам, — и живучесть у них отличается на порядки.

Поэтому вопрос «как удалить метку ИИ» не имеет ответа, пока не назван её тип. Метаданные снимаются одной командой, невидимые символы — чисткой Unicode, статистический watermark — только переписыванием текста заново, то есть работой, которую и пытались сэкономить.

А главный практический вывод обратный тому, который обычно делают из новости: метка не про то, чтобы ловить авторов. Она про то, чтобы у площадки появился проверяемый сигнал происхождения там, где раньше были только догадки.