Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Как работают текстовые ИИ-вотермарки и как их обходить

Дата публикации: 12-08-2026 10:51:43

Наверное уже многие знают, что в силу недавно вступивших в ЕС законов, регулирующих использование ИИ, провайдеры LLM обязаны помечать ИИ-сгенерированные тексты. Та же Claude недавно обновила справочную информацию о работе своей помечалки сгенерированного ИИ контента, в том числе и текста. Но в подробности его работы почему-то вдаваться не стала, как и размещать в публичном доступе средства добавления и обнаружения этих самых вотермарок.Не то чтобы я часто балуюсь текстовым нейрослопом, но сама идея того, что твой текст могут им объявить чисто случайно или в следствии того, что ты отредактировал иишкой его часть, меня не сильно радует. Поэтому в этой статье мы разберемся, как собственно эти метки работают, и как с ними бороться. Читать далее

Основное содержимое страницы с новостью.

Наверное уже многие знают, что в силу недавно вступивших в ЕС законов, регулирующих использование ИИ, провайдеры LLM обязаны помечать ИИ-сгенерированные тексты. Та же Claude недавно обновила справочную информацию о работе своей помечалки сгенерированного ИИ контента, в том числе и текста. Но в подробности его работы почему-то вдаваться не стала, как и размещать в публичном доступе средства добавления и обнаружения этих самых вотермарок.

907dcaa9fbfc96534f1f1860be2df388.jpeg

Не то чтобы я часто балуюсь текстовым нейрослопом, но сама идея того, что твой текст могут им объявить чисто случайно или в следствии того, что ты отредактировал иишкой его часть, меня не сильно радует. Поэтому в этой статье мы разберемся, как собственно эти метки работают, и как с ними бороться.

Как работают текстовые ИИ-вотермарки

Поначалу, когда я впервые услышал о текстовых вотермарках, я подумал, что LLM просто вставляет в текст всякие скрытые символы или там длинные тире, но этот метод донельзя дубовый и очевидно, что обходится на раз-два. На самом деле это работает так.

LLM это авторегрессионная вероятностная модель. На каждом шаге она выбирает следующий токен из своего большого словаря (обычно от десятков до сотен тысяч токенов) опираясь на изначальный промпт и предыдущие сгенерированные ею токены. Сначала модель отбирает топ-K наиболее вероятных токенов, а затем выбирает среди них один единственный с учетом его вероятности. Вотермаркинг же смещает распределение вероятностей токенов: слова, которые обычно редко встречаются в тексте, начинают появляться чаще, и наоборот.

aa0652e72776963dbdbbcef1b3e58c12.png

Для человека заметить разницу практически невозможно, но для машины, знающей реальное распределение слов/токенов, это не составит труда.

4f1601ae9b9bc3931d3daa2e508bb181.png

Собственно вот видео, в котором объясняется, как работает вотермаркинг в Gemini. Claude работает точно так же.

В видео это объяснено довольно поверхностно, поэтому объясню немного детальнее.

У нас есть фиксированный секретный ключ K. При генерации текста смотрим на последние m токенов, и на основании ключа K и этих токенов при помощи хэш функции разбиваем словарь на две половины, условно красную и зеленую. И следующий токен выбирает только из зеленой части. Дальше переходим к выбору следующего токена. Поскольку набор из m последних токенов у нас теперь другой, окраска словаря при выборе следующего токена у нас также будет совершенно другая, поэтому не возникнет такой ситуации, что каждый раз выбираются только одни и те же токены.

А при проверке текста, зная ключ и зная предыдущие токены, просто смотрим, из какой половины раскраски происходит наш текущий токен - зеленой или красной. И вот, если раз за разом на протяжении 10-20-30 токенов стабильно получается так, что токен всегда из зеленой части, очень похоже на то, что текст сгенерирован. Причем даже если какие-то слова в тексте менять, что-то выкидывать, добавлять и т.д., все равно останется множество подпоследовательностей, в которых эти зеленые токены будут идти подряд один за другим. Поэтому от вотермарки так сложно избавиться.

Как их обходить

Вполне очевидно, что придется либо жестко редактировать либо переписывать текст другими словами. Что предлагаю я.

Для начала предобработать исходный текст, чтобы удалить самые очевидные признаки сгенерированного ИИ контента: длинные тире, символы нулевой ширины, нестандартные пробелы и т. д.

Следующие три шага направлены на борьбу с самой сутью вотермаркинга - специфическим распределением токенов. Вот как это работает:

  • Отправить текст в переводчик (например, Google Переводчик) и перевести его на промежуточный язык

  • Перевести текст обратно с промежуточного языка на исходный

  • При необходимости переписать текст с помощью LLM, которая гарантированно не добавляет водяные знаки в свои ответы (например, модели с открытыми весами вроде DeepSeek-v4). Это поможет сделать итоговый текст более читаемым (если его качество снизилось в результате двойного перевода) и удалить оставшиеся следы вотермаркинга, если они каким-то образом сохранились

Вдохновившись этой идеей, я разработал простое приложение, которое автоматизирует этот процесс. В нём можно выбрать, какие именно шаги использовать, и настроить каждый из них отдельно (например, выбрать конкретный переводчик или модель LLM для перефразирования).

Оно создано на основе Streamlit и LangChain, GUI выглядит вот так:

8660dc01fdaaff7872f37a028b6b9e6a.png

Просто задаешь нужные настройки, вставляешь текст в поле и нажимаешь кнопочку "Process". Дальше она все сделает сама. Дополнительно напишет, какие символы были удалены из текста, а также покажет промежуточные результаты перевода.

77229e6d417fe3d126df338f2116daa9.png

Проект есть на гитхабе, лежит по этой ссылке. И как всегда, предложения по доработке и исправлению багов приветствуются.

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Claude начнет помечать сгенерированные им тексты скрытыми водяными знаками09.911-08-2026
2Ваш Claude может быть «подписан» невидимыми чернилами, и это не ...05.1415-08-2026
3Невидимые метки ИИ: Anthropic будет маркировать всё, что пишет Claude08.3311-08-2026
4Нейросети: кому на самом деле принадлежат права на то, что вы там генерируете — разбираемся по-человечески-5609-07-2026
510+ AI-агентов на Claude Code и Kaiten: опыт директора, который почти вышел из операционки015.4912-08-2026
6[Перевод] Кража памяти: как я заставил Claude рассказать личные секреты пользователя0818-07-2026
7Чаты пользователей нейросети Claude оказались доступны в поиске Google-19.1828-07-2026
8Подножка для AI в виде UTF-8010.0714-10-2025
9Что в тренде по нейросетям: 5 ИИ-скиллов, 4 вайбкодинг-проекта и еще 7 ИИ-полезностей020.0627-07-2026
10А нам точно нужны code agents?0517-07-2026

Классификация: Мнения. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 8.8. Источник: habr.com.