Watermark в AI-тексте: как нейросети метят свои тексты и что эту метку стирает

11 августа 2026 Anthropic объявила: все модели Claude, вышедшие со 2 августа, метят свой текст невидимым водяным знаком — во всех продуктах сразу и по всему миру, а не только в Евросоюзе. Метка вплетена в сам текст, а не в свойства файла, поэтому переживает копирование в блокнот, а стирают её только парафраз, перевод и переписывание заново. Публичного детектора пока нет ни у кого, а отсутствие метки не доказывает, что текст писал человек. Ниже — какие вообще бывают метки, почему вопрос «как удалить watermark» поставлен неверно и что с этим делать редакции сайта.
Что именно объявила Anthropic
Компания обновила свою справку «How Claude marks AI-generated content». Коротко, по пунктам её же формулировок:
| Что | Как у Anthropic |
|---|---|
| Кого метят | Модели, вышедшие 2 августа 2026 и позже, — с момента запуска. Для старых моделей поддержку «дорабатывают» |
| Где | Везде, где есть Claude: API, веб-версия, Claude Code, Cowork, Claude Tag, плюс модели у AWS, Google Cloud и Microsoft Foundry |
| Текст | Незаметный водяной знак, который «не меняет смысл, качество и читаемость» |
| Файлы | Подписанные метаданные происхождения по стандарту C2PA — там, где Claude работает с файлами (.svg, .png, .jpg) |
| Копипаст | Метка «путешествует с текстом при копировании и может пережить часть правок» |
| Что метку убивает | Сильная правка, парафраз, перевод, смешивание с чужим текстом |
| Что метка доказывает | Что текст прошёл через Claude. Не то, кто автор: «сигнал не является полностью убедительным» |
Повод внешний: со 2 августа 2026 в ЕС применяется статья 50 AI Act — поставщик генеративной системы обязан помечать вывод машиночитаемым способом. Anthropic включила маркировку глобально, а не по региону: держать две ветки поведения дороже, чем одну.
Публичного детектора нет. Anthropic пишет, что «работает над возможностью обнаружения» и опубликует детали позже. То есть проверить чужой текст на метку Claude сегодня нельзя — ни вам, ни площадке, ни суду.
Метка отвечает на вопрос «проходил ли текст через Claude», а не «кто это написал». Через модель проходит и вычитка, и перевод чужого текста — и оба случая оставят тот же след, что генерация с нуля.
Шесть способов пометить текст, и только один работает после копипаста
«AI-метка» — не одна технология. Под этим словом живут вещи с разной физикой и разной живучестью.
| Способ | Где сидит метка | Видна человеку | Переживает копипаст обычным текстом |
|---|---|---|---|
| Видимая приписка «сделано ИИ» | В самом тексте | Да | Да, но удаляется одним движением |
| Метаданные файла | В свойствах DOCX, PDF | Нет | Нет |
| C2PA, Content Credentials | В подписанных данных файла | Нет | Нет |
| Невидимые символы Unicode | Между словами | Нет | Обычно да, но чистятся поиском с заменой |
| Статистический watermark | В выборе токенов | Нет | Да |
| Семантический watermark | В вариантах формулировок | Нет | Иногда |
Отдельно от них стоят AI-детекторы и стилометрия: там метки нет вовсе, есть догадка по стилю. Путать эти две вещи — главная ошибка в разговоре про «проверку на ИИ», и ниже я разберу её отдельно.
Почему метаданные и C2PA не спасают текст
Метаданные — служебные сведения внутри файла: чем создан, когда, что с ним делали. C2PA поверх этого добавляет криптографическую подпись, поэтому историю нельзя подделать. Но её очень легко потерять.
история лежит в свойствах DOCX. Скопировали абзац в редактор CMS — история осталась в файле, в буфер уехали голые буквы
сигнал сидит в самом выборе слов. Скопировали абзац — сигнал уехал вместе с ним
Отсюда правило, из которого растёт вся текстовая маркировка: контент, который живёт копипастом, метится только изнутри. Для картинок C2PA работает, для текста в вебе — почти нет.
Невидимые символы Unicode — не то, что ищут детекторы
В Unicode есть символы нулевой ширины: программа их видит, человек нет.
| Код | Название |
|---|---|
| U+200B | Zero Width Space |
| U+200C | Zero Width Non-Joiner |
| U+200D | Zero Width Joiner |
| U+2060 | Word Joiner |
| U+FEFF | Zero Width No-Break Space |
Ими можно закодировать хоть последовательность битов — это текстовая стеганография, приём старше нейросетей. Именно его чаще всего имеют в виду, когда в соцсетях советуют «прогнать текст через чистильщик и метка слетит».
Слетит — но не та. Невидимые символы хрупкие: их снимает нормализация Unicode и любая чистка управляющих знаков. Поэтому современные текстовые метки на них не строят, и «очистка от zero-width» ничего не говорит о статистическом watermark.
Статистический watermark: метка без единого лишнего символа
Модель пишет текст не словами, а токенами — кусками слов. На каждом шаге она выбирает следующий токен из распределения вероятностей:
| Токен | Вероятность |
|---|---|
| необходимо | 30% |
| следует | 27% |
| рекомендуется | 21% |
| желательно | 12% |
| нужно | 10% |
Алгоритм маркировки заранее делит словарь на «зелёную» часть и остальное, а потом чуть-чуть двигает вероятности в пользу зелёной:
| Токен | Без метки | С меткой |
|---|---|---|
| необходимо | 30% | 27% |
| следует | 27% | 33% |
| рекомендуется | 21% | 25% |
| желательно | 12% | 8% |
| нужно | 10% | 7% |
На одном предложении разницы нет — смысл и стиль не пострадали. Но на сотнях токенов накапливается перекос: там, где по случайности ждали пятьдесят зелёных токенов из ста, детектор видит семьдесят. Насколько такой перекос неслучаен, считают z-оценкой — числом стандартных отклонений от ожидаемого. Чем длиннее текст, тем увереннее ответ; на твите уверенности не будет никогда.
Схему с зелёным списком и z-оценкой предложили Кирхенбауэр и соавторы в работе A Watermark for Large Language Models. Открытый работающий пример — SynthID Text от Google: он встраивается в генерацию как обработчик логитов, то есть вмешивается ровно в тот момент, когда модель выбирает следующий токен. Код открыт и лежит в Hugging Face Transformers.
Всё, что выше, — пример того, как такие метки устроены вообще, а не описание алгоритма Claude. Anthropic свою механику не раскрыла: неизвестно, зелёные списки там, семантическое кодирование или что-то третье. Любой текст в интернете, который «объясняет алгоритм метки Claude», сегодня выдумывает.
Что метку стирает, а что нет
Короткий ответ: метаданные снимаются одной командой, невидимые символы — чисткой Unicode, а статистический watermark не стирается ничем, кроме переписывания текста заново.
| Действие с текстом | Что с меткой |
|---|---|
| Копирование в блокнот, в CMS, в мессенджер | Ничего: последовательность токенов та же |
| Смена шрифта, разметки, заголовков | Ничего: метка не в оформлении |
| Правка отдельных слов, перестановка абзацев | Обычно переживает — Anthropic пишет «может пережить часть правок» |
| Глубокий парафраз своими словами | Разрушается |
| Перевод на другой язык | Разрушается |
| Смешивание с большим человеческим текстом | Размывается до неразличимости |
| Короткий фрагмент, пара предложений | Метка есть, но статистика её не докажет |
Отсюда честный вывод, который редко пишут: наличие метки — сильный сигнал, отсутствие — ноль информации. Текст без метки мог написать человек, старая модель, конкурент Claude или тот же Claude, но с последующим переводом.
AI-детектор и детектор watermark — разные приборы
Их постоянно путают, и цена путаницы высокая: на выводе AI-детектора увольняют, снимают с публикации и снижают оценки.
секрета не знает. Смотрит на предсказуемость текста, длину предложений, частотность слов — и угадывает. Ровный технический текст живого автора регулярно помечает машинным
знает, какой сигнал разработчик закладывал. Считает статистику по своему же списку токенов и выдаёт z-оценку, а не впечатление
У классификаторов это не детская болезнь, а свойство метода. OpenAI закрыла свой AI Text Classifier ещё летом 2023 года — из-за низкой точности, о чём написала сама. С тех пор общедоступного текстового классификатора с доказанной точностью не появилось, а платные сервисы своей точности не показывают на воспроизводимых выборках.
Решение о человеке — снять статью, отказать автору, обвинить студента — на выводе AI-детектора принимать нельзя. Это оценка стиля, а не доказательство происхождения. Детектор watermark таким доказательством был бы, но публичного детектора для Claude пока нет.
Картинки: здесь проверка уже работает
С изображениями ситуация лучше, чем с текстом. С 19 мая 2026 OpenAI ставит на картинки из ChatGPT, Codex и API сразу два сигнала — подпись C2PA и watermark SynthID, а на поддерживаемое аудио — SynthID. Проверить можно самому:
Подробный разбор маркировки картинок — в отдельной статье: как маркируются изображения ИИ. Здесь только то, что нужно проверить прямо сейчас.
- Откройте проверку OpenAI
Инструмент openai.com/verify принимает изображения и аудио. Текст он не проверяет — для текста таких инструментов пока нет ни у кого.
- Загрузите файл целиком
Не скриншот и не пересохранённую копию: и то, и другое срезает C2PA. SynthID в пикселях переживает сжатие и обрезку, поэтому иногда отвечает даже там, где подпись потеряна.
- Прочитайте пустой ответ правильно
«Сигналов не найдено» не значит «сделано человеком». Значит: подписи нет или её срезали по дороге — соцсетью, конвертером, скриншотом.
Если публикуете чужие изображения, проверяйте их до вёрстки, а не после жалобы. Свои — наоборот: следите, чтобы конвейер сжатия картинок на сайте не срезал C2PA, иначе вы теряете доказательство собственного авторства.
Что это меняет для сайта
Раньше площадка могла только гонять тексты через классификатор и получать вероятность. Теперь вопрос смещается: не «похоже ли это на ИИ», а «есть ли в тексте машиночитаемый сигнал конкретной системы». Практических следствий три.
- Спрашивать про ответственность, а не про происхождение. Вопрос автору «писал ли ИИ» бессмысленный: проверить нельзя, а после перевода метка исчезнет. Спрашивайте, кто отвечает за факты и источники, — это проверяется.
- Отменить санкции по выводу AI-детектора. Пока нет детектора метки, любое обвинение строится на догадке. Один ложный срыв публикации у живого автора стоит дороже десяти пропущенных машинных текстов.
- Сохранять провенанс своих материалов. Для картинок это уже рабочая практика: подпись C2PA — ваш аргумент в споре об авторстве. Проверьте, переживает ли она вашу же оптимизацию изображений.
Поисковикам метка не мешает: Google оценивает пользу материала, а не способ производства, и отдельного «фильтра за watermark» нет. Опасность не в ранжировании, а в доверии читателя и в спорах об авторстве.
Главное
Единой «AI-метки» не существует. Под этим словом прячутся шесть разных механизмов — от приписки в конце текста до статистики по токенам, — и живучесть у них отличается на порядки.
Поэтому вопрос «как удалить метку ИИ» не имеет ответа, пока не назван её тип. Метаданные снимаются одной командой, невидимые символы — чисткой Unicode, статистический watermark — только переписыванием текста заново, то есть работой, которую и пытались сэкономить.
А главный практический вывод обратный тому, который обычно делают из новости: метка не про то, чтобы ловить авторов. Она про то, чтобы у площадки появился проверяемый сигнал происхождения там, где раньше были только догадки.
- https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
- https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/
- https://openai.com/index/advancing-content-provenance/
- https://help.openai.com/en/articles/8912793-c2pa-and-synthid-in-openai-generated-images
- https://deepmind.google/technologies/synthid/
- https://arxiv.org/abs/2301.10226




