Статистически водни знаци при AI текст - математиката, която издава генерирания текст
AI моделите не генерират текст по вдъхновение. При всяка стъпка избират следваща дума от вероятностно разпределение - списък от кандидати, подредени по шанс. Ако това разпределение бъде нарочно изместено с малка математическа корекция, в текста остава статистически подпис. Подпис, който е невидим за читателя, но измерим от детектор, който знае точно какво да търси.
Съдържание
Тази техника се нарича статистически воден знак. Различава се от стилистичните белези, по които иначе разпознаваме AI текст (повтарящи се фрази, равномерна структура, шаблонни формулировки). Статистическият подпис живее на ниво отделни токени и се засича с математически тест, не със субективна оценка.
Активен срещу пасивен статистически сигнал
При AI текст съществуват два вида статистика, полезни за детекция.
Пасивен сигнал: моделите избират думи с по-ниска ентропия, защото сампериращият алгоритъм предпочита високовероятни токени. Резултатът е текст с по-ниска перплексия от човешкия. Измерва се без достъп до модела, но е относително слаб сигнал и е чувствителен към редакция.
Активен воден знак: доставчикът нарочно изкривява разпределението при генериране, за да остави проверим подпис. Детекторът - знаейки алгоритъма и евентуално секретен ключ - пресмята очакваната стойност на измерима статистика и я сравнява с наблюдаваната. Математиката дава строга вероятностна граница.
Методът на Kirchenbauer - зелен списък и z-тест
John Kirchenbauer и екипът му от University of Maryland публикуваха на ICML 2023 първия работещ алгоритъм за статистически воден знак за текст. Работата е достъпна като arXiv:2301.10226.
Алгоритъмът действа на всяка позиция в генерирането:
- Хешира предишния токен и от хеша извежда псевдослучаен seed.
- Със seed-а дели речника на два равни дяла - "зелен" и "червен".
- Към логитите на зелените токени добавя постоянна добавка δ (обичайно 2.0).
- Моделът сампелира нормално, но зелените токени побеждават малко по-често от обичайното.
Детекцията е прав статистически тест. При дълъг текст с T токена, ако моделът не е маркиран, очакваният брой зелени токени е γT, където γ = 0.5. Отклонението се измерва с z-стойност:
z = (|s|_G - γT) / √(Tγ(1-γ))
При стойност z > 4 вероятността за фалшиво положително е под 0.003%. Реално при 200 токена и δ = 2.0 z-стойностите за маркиран текст се движат между 5 и 10.
Схемата на Aaronson - Gumbel-трик
Scott Aaronson разработи алтернативна схема за OpenAI през 2022 г. Вместо да мести логитите, тя променя самия механизъм на избор и минава през стандартната Gumbel-max трансформация на сампериращия слой.
За всеки кандидат-токен с вероятност p_i се изчислява:
r_i = -ln(1 - U_i) / p_i
където U_i е псевдослучайно число от 0 до 1, изведено детерминистично от контекста и секретен ключ. Моделът избира токена с най-висока r_i. При различен контекст U_i се променя и външно изборът изглежда като обичайно сампериране.
Детекторът, знаейки ключа, пресмята обратно U_i за всеки избран токен и сумира -ln(1 - U) за избраните. При случаен (немаркиран) текст сумата е близо до очакваната стойност за равномерно разпределение на U. При маркиран текст сумата е систематично над тази граница.
OpenAI обявиха, че техният детектор постига 99.9% точност върху непроменен текст от маркиран ChatGPT. Системата не е пусната публично - компанията се опасява от несправедливи обвинения и отлив на потребители.
SynthID-Text - турнирно сампериране на DeepMind
Най-новата разработка е SynthID-Text. През октомври 2024 г. Google DeepMind публикуваха труда "Scalable watermarking for identifying large language model outputs" в Nature, том 634, стр. 818-823.
Ядрото на алгоритъма е турнирно сампериране. При всеки токен се вземат N кандидата (най-често 4 или 8) и се пускат в елиминационен турнир. На всеки кръг двойки токени се състезават чрез псевдослучайна резултатна функция, изведена от контекста и секретен ключ. Победителят минава напред. Крайният шампион е избраният токен.
Резултатните функции са такива, че маркираните токени статистически получават по-високи стойности. Детекторът преизчислява същите функции и проверява дали избраните токени показват систематично предимство в турнирите.
Статията в Nature документира внедряване в Gemini с над 20 милиона дневни запитвания. Паралелно DeepMind отвориха кода чрез Hugging Face Transformers - всеки разработчик може да приложи алгоритъма към собствен модел. В слепи тестове SynthID-Text не влоши качеството на изхода над прага на човешко възприятие.
Защо математиката работи
Зад всички тези схеми стои една и съща логика - централна гранична теорема. Дори 1-2% изместване на вероятностите за отделните токени се натрупва по дължината на текста. При 1000 токена минимално локално изместване се превръща в отклонение с много стандартни отклонения над очакваното.
Границите са точно пресметнати:
- 50 токена: шумът е висок, z-стойностите надхвърлят 4 само при δ ≥ 4.
- 200 токена: z > 4 се постига стабилно при δ = 2.
- 1000+ токена: дори δ = 0.5 дава убедително отклонение.
Практическото следствие: колкото по-дълъг текстът, толкова по-малко изкривяване е нужно за детекция. Доставчикът може да си позволи почти неусетен воден знак при дълги отговори.
Слабости на статистическите водни знаци
- Къси изходи. Заглавия, един параграф или чат отговор от 50 думи не носят достатъчно статистика. Детекторът дава неопределен резултат.
- Парафразиране. При смяна на 30-40% от думите z-стойността пада под прага за детекция. Човек или друг модел, който пренапише текста, най-често изтрива сигнала.
- Превод. Преминаването през втори език (български → английски → български) сменя токенизацията. Оригиналните избори на токени престават да съществуват в новия текст.
- Атака с редки токени. Ако атакуващият знае общия механизъм, може целенасочено да замени редки думи със синоними. Това разваля натрупването на сигнала по-бързо от случайна редакция.
- Кръстосана проверка липсва. Детекторът на SynthID засича само текст от Gemini. Този на OpenAI - само от ChatGPT. Никой модел не разпознава текст от конкурент.
Практическо значение
Статистическите водни знаци дават по-строго доказателство от стилистичния анализ. Математиката е проверима, вероятностните граници са точни, резултатът не зависи от субективна оценка. Но зависимостите са ясни:
- Текст, генериран от модел с внедрен алгоритъм.
- Непроменен изход, без парафразиране, превод или тежка редакция.
- Достатъчна дължина - над 150-200 токена.
- Достъп до съответния детектор със съответния ключ.
За текст с неизвестен произход или минал през редакция работи стилистичният подход. AI Detector разпознава езикови и структурни белези, независими от конкретен модел или вграден сигнал. Двете стратегии се допълват: статистиката дава сигурност при контролирани условия, лексикалният анализ - сигнал при реалните условия на уеб съдържание.
Къде отива посоката
SynthID-Text в Nature задава академичния стандарт за следващите две години. Отвореният код на Hugging Face позволява на малки и средни доставчици да внедрят еквивалентен алгоритъм. EU AI Act задължава маркиране на AI изход до август 2026 г. - статистическите водни знаци са най-добрата налична технология за изпълнението на това задължение.
Остава нерешен въпросът за кръстосана съвместимост. При изображенията стандартът C2PA обединява Adobe, Microsoft, Google и OpenAI. При текста все още няма общ подпис. Всеки доставчик вижда своите токени, но не и чуждите. Докато това не се промени, статистическите водни знаци ще бъдат вътрешен инструмент на всяка компания, не общ детектор за целия пазар.