Кой ползва AI водни знаци и защо няма единен детектор

Водните знаци за AI съдържание звучат като готово решение - маркираш текста при генерирането и после го засичаш автоматично. Реално нещата са по-сложни. Всяка компания си има собствена система, нито една не хваща съдържание от конкурентите, а при редактиран текст точността пада рязко.

Съдържание

Кой какво ползва

Google маркират текст, снимки, видео и аудио от собствените си модели чрез SynthID. Meta имат подобна система за своите продукти. OpenAI маркират снимки от DALL-E и ChatGPT с C2PA метаданни, но за текст - не. Имат готов инструмент с 99.9% точност при тестове, но са решили да не го пускат засега.

Проблемът е, че всяка от тези системи е затворена. SynthID хваща само текст от Gemini. Ако подадете текст от ChatGPT на SynthID детектора, той няма какво да търси - водният знак на OpenAI не е вграден там. Същото важи обратно.

Къде намира приложение

Водните знаци не са само за ловене на студенти. Има няколко сектора, където засичането на AI съдържание е от значение.

Университети и училища

Преподаватели искат да знаят дали домашна работа е писана от студент или от ChatGPT. Проблемът: повечето студенти редактират текста след генерирането. Добавят свои изречения, трият параграфи, сменят думи. При такъв смесен текст - частично AI, частично човешки - водните знаци стават ненадеждни.

Изследователи от University of Reading създадоха фалшиви студентски профили и подадоха AI-генерирани задачи. 94% от тях минаха незабелязано. А това бяха изцяло AI текстове, без дори ръчна редакция.

Застраховки

Застрахователни компании проверяват дали снимки към щети са реални или генерирани. C2PA метаданните помагат, когато изображението не е обработвано. Но ако някой направи screenshot на AI снимка и качи screenshot-а, метаданните изчезват.

Журналистика

Редакции проверяват дали видеоклип или снимка от новинарски материал е автентична. BBC, Reuters и Associated Press са сред поддръжниците на C2PA стандарта за изображения. За текст все още няма работещ стандарт в медиите.

HR и подбор на персонал

Работодатели искат да знаят дали мотивационно писмо или тестова задача е написана от кандидата. Тук watermarking-ът помага само ако кандидатът подаде текста без редакция - което е рядкост.

Защо няма единен детектор

Всеки доставчик (Google, OpenAI, Meta) маркира по свой начин. Няма общ формат, няма споделени ключове, няма единен протокол за проверка. Ако искате да проверите текст, трябва да го подадете на всеки от тях поотделно - и всеки ще каже само дали е от неговия модел.

За снимки има C2PA - отворен стандарт с подкрепа от Adobe, Microsoft, Google и Sony. Но C2PA е за метаданни (кой е създал снимката, кога, с какъв инструмент), а не за разпознаване на AI стил. И метаданните се губят при upload в социални мрежи, защото платформите ги изтриват при обработка.

За текст няма еквивалент на C2PA. Изследователи от различни университети настояват за обща система, но компаниите нямат интерес да споделят ключовете си. Всеки иска да контролира своя детектор.

Проблемът с фалшивите обвинения

OpenAI споделиха конкретна причина, поради която не пускат текстовия си детектор: може да навреди на хора, които ползват ChatGPT легитимно. Хора с друг роден език, които пишат на английски с помощта на AI, рискуват да бъдат обвинени в измама.

Проучване на компанията показва, че мнозинството от запитаните смятат инструмент под 100% точност за опасен - може несправедливо да обвини честен студент. А 100% точност при текстово маркиране не е постижима, след като текстът може да бъде редактиран.

Google не коментират публично подобни рискове, но SynthID има същия проблем. Системите не обясняват защо са стигнали до даден резултат. Когато детектор каже "AI текст" без аргументи, преподавателят няма как да прецени дали е грешка.

Какво работи по-добре при смесен текст

Водните знаци разчитат на статистически модел в конкретните думи. Когато човек смени част от думите, моделът се разпада. Затова при реални условия - където текстът почти винаги е редактиран - лексикалният анализ дава по-стабилни резултати.

Лексикалният анализ (като този в AI Detector) не зависи от конкретни думи, а от структурни и стилистични модели: дължина на изреченията, разнообразие на речника, честота на определени конструкции. Тези характеристики са по-устойчиви на ръчна редакция.

Нито един метод не е перфектен. Но при смесен текст от AI и човек лексикалният подход се справя по-добре от watermarking.

AI Act и крайният срок

Европейският AI Act изисква от компаниите, които предлагат AI модели, да внедрят маркиране на генерираното съдържание до август 2026. Това засяга OpenAI, Google, Meta и всички други доставчици, които оперират в ЕС.

Как точно ще се изпълни изискването, все още не е ясно. Може всяка компания да си запази собствената система. Може да се появи общ стандарт. Засега единственото сигурно е крайният срок.