Методология и точност

Последна актуализация: април 2026 г.  |  Общи условия  |  Поверителност

Тази страница описва прозрачно как работи ИИ Редактор, какво анализираме, какви са известните ограничения на инструмента и как можете да оспорите резултат. Публикуваме я в съответствие с принципите за прозрачност на Регламент (ЕС) 2024/1689 (AI Act) и нашата отговорност към потребителите.

1. Как работи алгоритъмът

ИИ Редактор е статистически и детерминиран анализатор на текстово съдържание. Той не използва генеративен изкуствен интелект и не "разбира" смисъла на текста. Алгоритъмът извършва технически проверки върху HTML кода и текстовото съдържание и сравнява резултатите с вътрешна база от признаци.

Анализът преминава през следните стъпки:

  1. Декодиране на HTML entities - &,   и подобни се преобразуват в реалните им символи, за да не пропуснем скрити маркировки.
  2. Сканиране на Unicode символи - всеки знак в текста се проверява срещу база от технически детерминирани символи (zero-width знаци, BOM, soft hyphen и подобни).
  3. Сканиране на типографски заместители - различни видове кавички, тирета, апостроф варианти, нестандартни интервали.
  4. Сканиране за фрази и думи - текстът се разбива на лексикални единици и се сравнява с база от думи и фрази, които често се срещат в съдържание от ИИ модели.
  5. Анализ на HTML атрибути - проверка за специфични технически "отпечатъци" в HTML кода, оставени от някои ИИ инструменти при копиране (например data-start и data-end атрибути).
  6. Изчисляване на брой съвпадения - системата връща брой намерени съвпадения по всеки клас, без да дава категорична оценка за произход.

2. Класове признаци, които анализираме

Анализът обхваща четири основни класа технически признаци:

2.1 Невидими Unicode символи (детерминирано)

Това са невидими знаци, които могат да се появят в HTML кода без визуално да се забелязват. Включват: zero-width space (U+200B), zero-width non-joiner (U+200C), zero-width joiner (U+200D), Byte Order Mark (U+FEFF), soft hyphen (U+00AD), word joiner (U+2060) и подобни. Това откриване е технически детерминирано: ако такъв символ присъства в кода, системата го констатира с пълна сигурност. Това не означава непременно AI произход - такива символи могат да бъдат вмъкнати и от различни редактори, копиране между програми или конкретни CMS системи.

2.2 Типографски заместители (статистически индикатор)

Различни видове "интелигентни" кавички („ " " " ‚ ‛ ‟), em-dash (—), en-dash (–), figure dash (‒), не-разкъсващ интервал (U+00A0) и нестандартни видове интервали (thin space, hair space, em space, en space и т.н.). Тези символи се появяват автоматично при копиране от Word, Google Docs, някои ИИ модели или съвременни текстови процесори. Тяхното присъствие НЕ е достатъчно доказателство за AI произход - те се срещат и в напълно авторско съдържание, особено в официален стил.

2.3 Думи и фрази, типични за ИИ съдържание (вероятностен индикатор)

Базата ни съдържа думи, изрази и фрази, които често се срещат в съдържание, генерирано от популярни ИИ модели като ChatGPT, Claude, Gemini, Perplexity и други. Базата се поддържа и обновява от нашия екип на основата на собствени наблюдения, тестове и практически анализи на текстове, генерирани от тези модели. Базата НЕ е официално публикуван научен списък и не претендира за изчерпателност или научна валидност. Същите думи и фрази могат да се появят и в напълно авторско съдържание, особено в официален, технически, юридически или формален стил.

2.4 HTML атрибути и структурни патърни (статистически индикатор)

Някои ИИ инструменти оставят технически "отпечатъци" в HTML кода при копиране от тях. Примери: data-start / data-end атрибути (характерни за текст копиран от ChatGPT интерфейс), data-hveid атрибути (характерни за Google AI Overview), data-subtree="aimfl" или CSS клас Y3BBE (характерни за Gemini). Системата изброява тези атрибути в резултата за прозрачност.

3. Известни ограничения и точност

Бихме искали да бъдем напълно прозрачни относно ограниченията на инструмента:

3.1 Калибриране и тестване

Нашият екип периодично сравнява резултатите от инструмента с известно ИИ генерирано съдържание (контролни проби) и с известно авторско съдържание (контролни проби) за български език. Калибрирането се основава на тези практически тестове, не на формална академична валидация. Конкретни числови стойности за false-positive / false-negative rate не публикуваме, защото те зависят силно от типа на текста (формален vs разговорен, кратък vs дълъг, тематика и т.н.) и не отразяват реалистично надеждността при произволен текст.

4. Прозрачност на базата

За технически читатели, които искат да разберат обхвата на инструмента:

5. Без автоматизирани решения със значими последици

В съответствие с чл. 22 от GDPR и Регламент (ЕС) 2024/1689 (AI Act), потребителите трябва да знаят, че:

6. Процедура за оспорване на резултат

Ако сте автор, собственик или представител на организация, за която считате, че получен резултат е неточен или вреди на доброто Ви име, моля свържете се с нас:

В рамките на процедурата по оспорване ще извършим една или повече от следните стъпки:

7. Подобрение и обратна връзка

Точността на инструмента се подобрява постепенно с реалния опит. Ако забележите систематични грешки (например цял клас тексти, който получава нереалистично високи или ниски резултати), моля споделете с нас. Тази обратна връзка е безценна за подобряване на алгоритъма.

За технически въпроси, предложения или сътрудничество: support@ai-detector.bg.

8. Връзка с другите документи

Тази методология подлежи на актуализация при значими промени в алгоритъма или базите. При въпроси: support@ai-detector.bg.