Как работят водните знаци за AI текст - зелен списък, червен списък и скрити модели
Когато ChatGPT или Gemini генерират текст, те избират думи една по една от списък с кандидати. Водните знаци за AI текст променят този процес - насочват модела да предпочита определени думи пред други. Промяната е толкова малка, за да я забележи читател, но софтуер може да я засече.
Съдържание
Зелен списък и червен списък
Изследователи от University of Maryland (John Kirchenbauer и Tom Goldstein) публикуваха метод, който разделя речника на модела на две групи при всяка стъпка от генерирането. Едната група е "зелен списък" - думи, които моделът предпочита. Другата е "червен списък" - думи, които моделът избягва.
Пример: ако моделът трябва да избере дума след "красив", алгоритъмът може да класифицира "цвете" като зелена дума и "орхидея" като червена. Моделът ще избере "цвете" по-често от обичайното. Човек не забелязва разликата, защото и двете думи имат смисъл. Но статистически моделът е оставил следа.
Как се засича
Детекторът знае кои думи са били в зеления списък за всяка позиция в текста. Ако текстът съдържа прекалено много "зелени" думи - повече, отколкото би се очаквало от случаен човешки текст - той е генериран от маркиран модел.
Математически проверката е z-тест: колко стандартни отклонения над средното е броят на зелените думи. При дълъг текст (над 300 думи) резултатът е много точен.
Какво постигна OpenAI
OpenAI разработиха собствена система за маркиране на текст от ChatGPT. Тя леко променя вероятностите при избора на думи - по същия принцип като метода от Maryland, но с техни модификации. Детекторът им постига 99.9% точност при разпознаване на маркиран текст. Качеството на текста не пада забележимо.
Системата работи. Но OpenAI не я пуснаха публично.
Защо не са я пуснали
Три причини спират OpenAI:
- Фалшиви обвинения: В проучване на компанията мнозинството от анкетираните отговарят, че инструмент под 100% точност може несправедливо да обвини честни студенти.
- Загуба на потребители: Близо 30% казват, че ще спрат да ползват ChatGPT, ако текстът се маркира автоматично.
- Неравнопоставеност: Хора, за които английският не е роден език, разчитат на ChatGPT при писане. Автоматичен watermark ги поставя под подозрение, без да са направили нещо нередно.
Към средата на 2025 г. OpenAI нямат обявена дата за пускане. ЕС обаче натиска - AI Act изисква внедряване на watermarking до август 2026.
Методът на проф. Bu от University of Florida
Проф. Yuheng Bu от University of Florida предлага друг подход. Вместо да маркира всяка дума в текста, неговият алгоритъм маркира само избрани участъци. Останалата част от текста се генерира нормално.
Резултатът: текстът звучи по-добре, защото по-малко думи са "насилени" в определена посока. А водният знак е по-трудно да се премахне чрез парафразиране, защото атакуващият не знае кои участъци са маркирани.
Системата работи с частен ключ. Само този, който е вградил watermark-а, може да го засече. За потребителя няма начин да провери сам.
Как се заобикаля watermark
Текстовите водни знаци имат слабо място - те зависят от конкретните думи в текста. Ако думите се сменят, знакът се разпада.
Методи за заобикаляне:
- Превод: Пуснете текста през Google Translate на друг език и обратно. Думите се сменят и статистическият модел изчезва.
- Парафразиране с друг AI: Подайте текста на Claude или друг модел с инструкция да го преформулира. Новият модел няма зеления списък на оригиналния.
- Ръчна редакция: Заменете думи на ключови места. При кратки текстове и малко промени са достатъчни.
- Вмъкване на символи: Емоджита, специални символи и тирета между думите разбиват статистическия модел.
Опит от University of Reading показва мащаба на проблема: изследователи подадоха AI-генерирани задачи като студентски работи. 94% от тях не бяха разпознати от наличните инструменти за засичане.
Watermark срещу лексикален анализ
Има два подхода за разпознаване на AI текст и всеки работи по различен начин.
Watermarking вгражда скрит сигнал при генерирането. Засича само текст от конкретния модел, който го е маркирал. Изисква достъп до ключа. Губи се при превод или парафразиране.
Лексикален анализ (като AI Detector) търси езикови и стилистични белези - повтарящи се конструкции, предпочитани фрази, структура на изреченията. Работи с текст от всеки модел. Не зависи от доставчика и не изисква ключ. Резултатът е вероятностен.
Watermarking-ът дава по-сигурен отговор, когато текстът е непроменен и от познат модел. Лексикалният анализ хваща текст от всякакъв произход, но без гаранция за 100% точност.
Какво предстои
Google вече маркират текст от Gemini чрез SynthID. OpenAI имат готова система, но я държат заключена. Meta работят по трети вариант. Нито един не разпознава текст от конкурентите.
Единен стандарт за текстови watermark не съществува. За снимки вече има C2PA - отворен формат, подкрепен от Adobe, Microsoft, Google и OpenAI. За текста индустрията все още не е намерила общ подход.
AI Act на ЕС може да промени това. Крайният срок за задължително маркиране е август 2026. До тогава компаниите ще трябва или да пуснат собствените си системи, или да се съгласят на обща.