В одном из прогонов я убрал из текстов маркеры выделения — те самые звёздочки, которыми размечают жирный шрифт. Слова остались прежними. Полный текст документа не изменился ни на один символ, я это проверил побайтово: 14 485 знаков до и 14 485 после. Все шесть моделей, которые до этого уверенно относили текст к машинным, назвали его человеческим.
Вероятность машинного происхождения упала с 0,97–1,00 до 0,03–0,23. Решение сменилось у всех шести. Изменилось при этом ровно одно: счётчик жирных фрагментов упал с 76 до нуля, а часть строк, которые раньше опознавались как заголовки, ушла в прозу — объём прозаической части вырос с 5540 до 5792 знаков.
Это не курьёз из угла таблицы. Это тот случай, который лучше всего объясняет, почему я не советую принимать контент по проценту машинности — и почему требование «0% AI» в техзадании не значит того, что заказчик в него вкладывает.
Эксперимент, который отделяет автора от условий
У каждого текста есть история создания: кто писал, по какому заданию, по какому шаблону, как потом редактировали и как выгружали. Детектор этой истории не видит. Он видит буквы. Значит, об авторе он судит по косвенным следам — и вопрос в том, за автора эти следы отвечают или за что-то другое.
Чтобы разделить эти два объяснения, я построил эксперимент так, чтобы происхождение текста оставалось неизменным, а условия менялись. Машинную часть корпуса писали четыре канала генерации, за каждым своё семейство моделей. Заданий 45, каждое давалось в трёх формулировках, с двумя повторами.
- Нейтральное задание. Просто напиши материал по теме.
- Жёсткое задание. Подробный список требований к структуре и составу.
- Задание без штампов. Требование писать «по-человечески»: без клише, лишних списков и украшений.
Логика простая. Автор один и тот же, тема одна и та же, модель та же — различается только формулировка запроса. Если оценка машинности действительно измеряет происхождение, от смены формулировки она сдвигаться не должна. Сдвинулась — значит, измеряет не только его.
Человеческую часть я не заказывал у авторов. Вместо найма взял архивные тексты, опубликованные до 1 января 2022 года: научные статьи, новости, переводы, художественную прозу, отраслевые материалы. Дата отсечки выбрана не случайно — у текстов более позднего времени невозможно надёжно доказать, что их не помогала писать нейросеть.
Машинность считалась четырьмя процедурами с разными входами и разным происхождением весов: интерпретируемым индексом с весами, заданными до сбора данных; обученным классификатором; метрикой предсказуемости текста на открытой модели; и моделью-судьёй, которая ставит балл по рубрике, как проверяющий на экзамене. Ни одна из четырёх не назначалась эталоном — в этом и был смысл.
Представьте, что один и тот же врач меряет одному и тому же человеку температуру четырьмя разными градусниками. Если все четыре покажут разное, дело уже не в пациенте, а в градусниках.
Я сделал то же самое с текстами. Автор один, тема одна, модель одна — меняю только формулировку просьбы. И смотрю четырьмя разными измерителями, что будет с оценкой «похоже на машину».
- Ложное срабатывание
- детектор назвал машинным текст, который написал живой человек. Самая дорогая ошибка: страдает невиновный.
- Пропуск
- обратная ошибка. Текст сгенерировала модель, а детектор посчитал его человеческим.
- Порог
- граница, после которой оценка превращается в приговор. Сдвиньте порог — и те же самые тексты получат другие вердикты.
- AUROC
- насколько верно модель расставляет тексты по порядку от «человечнее» к «машиннее». Единица — идеальный порядок, 0,5 — как подбрасывание монеты. Оценивает именно порядок, а не правильность конкретного вердикта.
- Разбиение
- проверка на текстах, которых модель при обучении не видела. Их держат отдельно, чтобы не проверять ученика по тем же задачам, которые он решал на уроке.
- Доверительный интервал
- диапазон, внутри которого лежит истинная величина. Если он накрывает ноль, эффекта может не быть вовсе.
- Калибровка
- честность заявленной уверенности. Если детектор в сотне случаев сказал «машина с вероятностью 90%», машинными должны оказаться примерно девяносто.
- Предобработка
- техническая чистка текста перед проверкой: снять разметку, склеить абзацы, убрать мусор вёрстки. Читатель её не видит, а на результат она влияет.
Четыре прибора, четыре разных ответа
Основной контраст считается внутри машинной части: обе половины пары породила одна модель по одному заданию, различается только формулировка. Человеческие тексты в этот контраст не входят вообще.
| Процедура | Вход | Пар | Эффект | 95% интервал | Знак |
|---|---|---|---|---|---|
| Индекс стиля | матрица признаков, веса заданы заранее | 359 | −1,7655 пункта | [−2,6639; −0,8773] | минус |
| Классификатор | та же матрица, веса обучены | 120 | −0,0941 вероятности | [−0,1473; −0,0463] | минус |
| Метрика предсказуемости | сырой текст | 359 | 0,1140 средней неожиданности | [0,0964; 0,1313] | минус |
| Модель-судья | сырой текст | 359 | +0,5153 по шкале рубрики | [0,1806; 0,8552] | плюс |
Все четыре сдвинулись. Ни один интервал не накрыл ноль. И знаки разошлись: три процедуры сказали «стало меньше похоже на машину», четвёртая — «стало больше».
Четыре измерителя посмотрели на одну и ту же пару текстов и не сошлись даже в том, в какую сторону изменилась оценка. Три сказали «стало человечнее», четвёртый — «стало машиннее».
Если бы четыре весов в магазине разошлись в том, потяжелел покупатель или похудел, вопрос был бы к весам. С детекторами ровно та же история, только весов у нас в отрасли обычно одни, и им верят на слово.
Соблазн велик: объявить судью сломанным и выкинуть. Я этого не сделал, потому что правило запрещало выбрасывать процедуру за несогласие с остальными — и записано оно было до того, как я увидел результат. Расхождение здесь и есть результат. Входы у процедур разные, происхождение весов разное, и там, где приборы читают разные свойства текста, разный ответ логичен.
Единого числа по четырём процедурам нет и не будет. Голосование «две из трёх» я не применял, сводный эффект не считал. Пункты индекса, вероятность класса, средняя неожиданность и шкала рубрики — это четыре разные шкалы, и усреднять их так же осмысленно, как усреднять температуру с давлением.
Отдельно про судью, чтобы не создавать ложного впечатления о его весе. Разрешение у него грубое: 84,6% документов получили одну из двух соседних оценок, а у 65,6% сравниваемых пар разность вообще нулевая. Согласованность повторных прогонов умеренная, коэффициент внутриклассовой корреляции 0,477. Средний плюс держится на перевесе в 26 пар из 358. Направленный результат — да. Точный прибор — нет.
Оценку тянет форматирование, а не слог
Две процедуры из четырёх устроены так, что их результат раскладывается на слагаемые. Индекс собран из категорий с весами, заданными до сбора данных, поэтому разложение точное по построению — не оценка, а алгебра.
Читается это прямо. Стилевые категории двигали индекс вверх, на +1,674 пункта. Структурная категория тянула вниз, на −3,4395, и перевешивала примерно вдвое — она и определила итоговый знак. Решала форма, которую предписало задание, а не «почерк» модели.
Проверка от обратного даёт то же самое. Если посчитать индекс без структурной категории, эффект становится +2,0264 — знак переворачивается. У классификатора картина мягче, но в ту же сторону: полная модель даёт −0,0941, а модель без четырёх структурных признаков — +0,0169 с интервалом, накрывающим ноль. Эффект просто исчезает.
Прибор смотрит не столько на то, как написано, сколько на то, как оформлено. Заголовки, списки, жирный шрифт весят вдвое больше, чем язык и словарь вместе взятые.
Похоже на учителя, который ставит оценку за сочинение, глядя в основном на поля, подчёркнутый заголовок и аккуратные абзацы. Текст он тоже читает — но решают не буквы.
Аккуратность формулировки здесь принципиальна. У индекса это настоящая декомпозиция — вклады складываются. У классификатора это сравнение двух отдельно обученных моделей, и говорить «структура внесла столько-то» про него нельзя: аддитивности у отдельно обученных моделей нет. Корректная формулировка — исключение структурных признаков изменило направление контраста.
И ещё одна оговорка, без которой цифры выглядят весомее, чем есть. Это характеристика конкретного индекса на конкретном корпусе, а не универсальная константа. Веса категорий заданы спецификацией, и полностью покрыты признаками только две категории из тринадцати.
Вердикт перевернулся, текст не изменился
Теперь вернусь к случаю из начала статьи, потому что нашёлся он неожиданным образом.
Я отобрал тридцать самых нестабильных случаев по правилу, зафиксированному до отбора, и разбирал их вслепую. Скрыто было всё: идентификатор документа, происхождение, разбиение, название преобразования, обе вероятности и направление смены решения. Предъявлялись просто два текста в случайном порядке.
Одна карточка получила вердикт «неопределённо» с основанием «тексты совпадают посимвольно». Я решил, что это ошибка выгрузки. Оказалось — точное наблюдение.
Что произошло. Преобразование убрало маркеры выделения из исходного текста. Предобработка снимает разметку до подсчёта признаков, поэтому в профиле полного текста не изменилось ничего — 14 485 знаков, побайтовое совпадение. Но сдвинулась граница между заголовком и прозой: строки, которые раньше опознавались как жирные заголовки, перестали ими быть и ушли в прозаическую часть. Объём прозы вырос с 5540 до 5792 знаков, счётчик жирных фрагментов упал с 76 до нуля. Уверенное машинное решение сменилось человеческим у всех шести применимых моделей.
Слова текста одинаковые до последней буквы. Разница только в том, что раньше часть строк считалась заголовками, а теперь — обычным текстом. Этого хватило, чтобы приговор сменился на противоположный.
Заказчику, который получил такой отчёт, никто не скажет, что решило дело оформление. Он увидит число и сделает вывод об авторе.
Читать это надо как чувствительность всего измерительного конвейера, а не как прямой эффект жирного шрифта. Модель реагирует не только на слова, но и на решение предобработки о том, что считать прозой, а что — заголовком. Признаки прозаического профиля получили другой вход, форматные увидели ноль выделений вместо семидесяти шести.
Практический смысл: между текстом автора и вердиктом детектора стоит цепочка технических решений, к автору отношения не имеющих. Как экспортировали, как скопировали, какой шаблон публикации, как система очистила разметку перед проверкой. Каждое звено способно сдвинуть результат.
Детектор выучил адрес площадки
Дальше — находка, которая, по-моему, важнее всех остальных, и о которой почти не говорят в отраслевых обсуждениях детекторов.
Я построил диагностические базовые модели: что будет, если дать классификатору не двадцать два признака стиля, а один-единственный вход. Результаты по тринадцати разбиениям, где показатель определён:
| Модель | Что подано на вход | Медиана AUROC |
|---|---|---|
| основная | 22 признака стиля | 0,9973 |
| только источник | идентификатор площадки, один вход | 1,0000 |
| только форматирование | 4 структурных признака | 0,9775 |
| только жанр | метка жанра | 0,6667 |
| только длина | объём текста | 0,4364 |
| контроль с перемешанными метками | шум | 0,3614 |
Одна переменная — «с какой площадки взят текст» — ранжирует классы точнее, чем модель на двадцати двух признаках стиля. Это говорит не о силе модели, а об устройстве коллекции: человеческие тексты пришли с одних площадок, машинные — с других. Классификатор, обученный на такой коллекции, рискует выучить не стиль нейросети, а адрес сайта.
Здесь нужна честная оговорка, и я ставлю её сразу. Идеальное ранжирование не означает безошибочной классификации. Рядом с AUROC 1,0000 у той же модели стоит медианная доля ложных срабатываний 1,0000: при фиксированном пороге она отнесла к машинным все человеческие документы незнакомой площадки. Источник работает сильным ориентиром для сортировки, а порог решения на новый источник не переносится. Превосходство над моделью на признаках стиля утверждается только по ранжированию.
Модель могла выучить не «как пишет нейросеть», а «откуда пришёл файл». Примерно как врач, который ставит диагноз по тому, в какую дверь вошёл пациент: пришли из платного крыла — здоров, из районной поликлиники — болен.
Пока пациенты ходят в те же двери, статистика сходится и выглядит блестяще. Приведите человека с улицы — и система посыплется. Именно это и случилось: на текстах с незнакомой площадки модель записала в машинные всех людей подряд.
Что из этого следует для практики. Любой детектор обучался на какой-то коллекции. Если в этой коллекции человеческие и машинные тексты приходили из разных мест — а так почти всегда и бывает, — часть его уверенности объясняется происхождением файла, а не письмом. На потоке, где оба класса приходят из одного места, такая уверенность не воспроизводится.
Формулировка задания и обнаружимость
Разбор ошибок на уровне бинарных решений дал самую наглядную цифру во всей работе.
Разница в двенадцать раз между нейтральным заданием и заданием «пиши без штампов». Тексты писали те же модели по тем же темам. Пропуски не привязаны к одному каналу — они есть у всех.
Механизм я разобрал вручную на конкретных случаях, и он тот же, что даёт разворот знака у индекса и классификатора. В одном из пропущенных документов модель дала вероятность машинного происхождения 0,005 при полном отсутствии заголовков и списков — а именно их режим «без штампов» и запрещает. Структурные признаки ушли в минус, и вместе с ними ушёл вердикт.
Вот что здесь стоит понять про режим «без штампов». Он не делает текст умнее, точнее или полезнее. Он снимает ровно те внешние приметы, на которые опирается измерение: предписанные заголовки, маркированные перечни, выделения, дежурные обороты. Содержание при этом не меняется — меняется оболочка. Проверка, которая ловит оболочку, на снятой оболочке слепнет.
Тот, кто пользуется нейросетью как есть, попадается почти всегда. Тот, кто добавил в запрос одну строчку про «без штампов», проходит проверку в тринадцати случаях из ста.
Получается, проверка ловит не использование нейросети, а неумение её попросить.
Практический вывод неприятный, но простой. Проверка детектором бьёт по тем, кто пишет как обычно, и пропускает тех, кто попросил модель писать иначе. Добросовестный автор со структурированным материалом рискует больше, чем тот, кто сознательно обходит проверку. Инструмент контроля, который работает наоборот, контролем не является.
Кто попадает под ложное обвинение
Зарегистрированное правило отклонения по подгруппам сработало для формального регистра в пяти разбиениях из восемнадцати: медианная доля ложных срабатываний в подгруппе 0,066 при разности 0,043 с остальным тестом. Совокупный вердикт по справедливости при этом порог не перешёл, но уязвимость перестала быть эффектом одной площадки.
Чем ровнее и суше человек пишет, тем выше шанс, что его обвинят. Первыми под удар попадают научные статьи, инструкции, отчёты, документация — тексты, где ровный стиль требуется по определению.
Сумбурный текст с эмоциями и отступлениями проходит легче. Проверка на выходе поощряет неряшливость.
Выверенная, дисциплинированная проза похожа на то, что процедуры считают машинным письмом. Отсюда неприятный вывод для академической среды, где детекторы применяют охотнее всего: осторожнее всего к их показаниям стоит относиться именно там.
Ограничение здесь жёсткое, и обойти его я не могу. В моём корпусе метка формального регистра совпадает с научным жанром документ в документ — все 167 текстов. То же с двумя другими подгруппами: вычитанные тексты совпадают с новостями, переводы с переводами. Значит, эффекты регистра и жанра на этих данных раздельно не идентифицируются, и ни одно число из этого раздела нельзя приписать регистру помимо жанра.
Ещё одна деталь, которая ломает удобную картинку «есть рискованные жанры». Разброс между площадками внутри одного жанра оказался больше, чем между жанрами. В новостях медианная доля ложных срабатываний 0,013, а по площадкам внутри жанра — от 0,000 до 0,033. Часть этого разброса объясняется качеством извлечения текста при сборе корпуса: процедура штрафует испорченный текст. На одной площадке ложные срабатывания объяснились этим целиком, на другой причина осталась неустановленной, и я записал её открытой.
Почему это бьёт именно по SEO
Теперь то, ради чего я вообще пишу эту статью для нашего цеха.
Классификатор проверялся на восемнадцати групповых разбиениях. Одно из них — SEO-жанр: отраслевые материалы с профильных площадок. Оно оказалось худшим одновременно по всем метрикам, какие я считал.
| Метрика | SEO-разбиение | Для сравнения |
|---|---|---|
| AUROC | 0,9433 | медиана 0,9973 |
| Коэффициент корреляции Мэтьюса | 0,6560 | медиана 0,9338 |
| Доля ложных срабатываний | 0,3098 | медиана 0,0380 |
| Полнота при 5% ложных срабатываний | 0,6250 | медиана 0,9833 |
| Ошибка вероятностного прогноза (Brier) | 0,1796 | 0,0365 — сводная оценка по 18 разбиениям с равным весом |
Почти каждый третий человеческий SEO-текст в этом разбиении получил обвинение в машинном происхождении. Полнота обнаружения при строгом пороге упала до 0,625 против 0,983 в среднем. Калибровка развалилась: по всем трём показателям качества вероятностного прогноза это разбиение худшее.
И там же — самое высокое значение ложных обвинений формальной прозы: 0,521 внутри подгруппы. То есть на SEO-материале детекция промахивается в обе стороны сразу, и промахивается сильнее, чем где-либо ещё в корпусе.
На наших с вами текстах эта проверка работает хуже всего. Почти каждого третьего живого автора она записывает в машины. И одновременно упускает больше трети настоящих генераций.
Металлоискатель, который звенит на каждого третьего человека без металла и молчит на трети ножей, из аэропорта убрали бы в тот же день.
Причину я могу назвать только предположительно, и обозначаю это прямо. Наши тексты пишутся по требованиям к структуре: заголовки уровнями, списки, выделения ключевых мыслей, таблицы, блоки вопросов и ответов, единообразные конструкции. Ровно те признаки, которые в моём разложении оказались решающими. Чем лучше материал сверстан под поиск и под извлечение нейросетями, тем больше в нём формальных примет, на которые реагирует измерение.
К этому добавилась вторая находка, уже техническая. Классификатор оказался нестабилен к допустимому изменению процедуры настройки — и сильнее всего именно на SEO-источниках. Когда я исправил дефект во вложенной валидации, внешняя оценка на этом разбиении просела: AUROC на 0,050, коэффициент Мэтьюса на 0,227, доля ложных срабатываний выросла на 0,234, полнота при строгом пороге упала на 0,869. Прежний результат выглядел лучше по случайной причине, и выдавать его за преимущество было бы подтасовкой.
Что это значит на практике. Если вы отдаёте SEO-текст на проверку детектору, вы применяете инструмент в той зоне, где на моих данных он работает хуже всего. Причём хуже в обе стороны сразу: чаще обвиняет живого автора и чаще пропускает сгенерированное.
Что делать с требованием «0% AI»
Требование прогнать текст через детектор и показать нулевой процент я вижу в брифах регулярно. Оно понятно по мотиву: заказчик хочет гарантию, что ему не сдадут сгенерированный мусор. Проблема в том, что выбранный измеритель эту гарантию не даёт.
Вот что я предлагаю вместо этого — с честным указанием, что каждый пункт проверяет на самом деле.
| Требование в ТЗ | Что оно реально проверяет | Чем заменить |
|---|---|---|
| «0% AI по детектору» | форматирование, площадку и настройки предобработки | проверку фактов по первоисточникам, названным в тексте |
| «текст должен быть уникальным» | отсутствие текстовых совпадений, к происхождению отношения не имеет | наличие собственных данных, замеров или опыта, которых нет у конкурентов |
| «живой, человеческий стиль» | вкус приёмщика в момент чтения | соответствие голосу бренда с примерами эталонных текстов |
| «без использования нейросетей» | ничего — проверить невозможно | раскрытие того, где и как модели использовались, и кто отвечает за ошибки |
| «пройти проверку сервисом X» | поведение конкретной версии конкретного сервиса | если оставляете — фиксируйте сервис, версию, порог и правило пересдачи |
Последняя строка нужна для случая, когда убрать требование не выходит. Заказчик вправе настаивать, а подрядчик — знать правила игры заранее. Не зафиксировали инструмент и порог — спор упрётся в то, что два сервиса на одном тексте выдают разные вердикты, и доказать в этом споре нечего ни одной стороне.
Как я принимаю контент сам, если коротко. Смотрю, откуда взяты числа и открываются ли ссылки. Проверяю, есть ли в материале хоть что-то, чего нельзя было получить пересказом первых десяти результатов выдачи. Спрашиваю автора о деталях, которых в тексте нет: почему выбран этот пример, откуда взялась вот эта цифра, что он делал, когда цифра не сошлась. Живой автор отвечает за две минуты. Пересказчик — нет, независимо от того, кто держал клавиатуру.
И отдельно — про ответственность. Правило, которое я считаю рабочим: подписывающий отвечает за каждое утверждение в тексте так, будто написал его сам. Инструмент подготовки при таком правиле перестаёт быть предметом спора.
Промпт, которым я правлю черновики
Раз уж проверка процентом машинности бесполезна, вот то, что вместо неё приносит пользу. Промпт короткий, только главное. Он вычищает пустоту и требует фактуры — то есть чинит текст по сути, а не подгоняет его под чей-то измеритель.
Отредактируй текст ниже. Цель — понятнее и достовернее, а не «незаметнее для проверок». 1. Вынеси в первое предложение самый сильный факт или вывод. Разогрев убери. 2. Каждое утверждение подкрепи числом, именем, датой или примером. Нечем подкрепить — вычеркни. 3. Верни глаголы: «осуществлять проверку» → «проверять», «принять решение» → «решить». 4. Убери канцелярит: «в рамках», «в целях», «данный», «является», «важно отметить», «таким образом». 5. Термин оставь, но объясни его тут же одной фразой обычными словами. 6. Разбей предложения длиннее 30 слов. Чередуй короткие и длинные. 7. Списком оформляй перечисление, рассуждение пиши прозой. 8. Убери противопоставления вида «это не X, а Y» — прямо скажи, что есть. 9. Где уверенности нет, так и напиши. Ровная уверенность во всём читается как враньё. 10. Не добавляй фактов, которых нет в исходнике. Пропуски помечай: «нужна фактура». Верни правленый текст, а под ним — список: что изменил и почему.
Проверять результат всё равно придётся руками. Пункт про выдуманные факты модели нарушают охотнее всего: попросишь подкрепить утверждение цифрой — и получишь красивую цифру, которой нигде нет.
Чего это исследование не утверждает
Раздел обязательный, и я предпочитаю писать его сам, а не отдавать критикам.
Не утверждает, что детекторы всегда ошибаются. Основная модель разделяла классы очень уверенно, медиана AUROC 0,9973. Работа показывает другое: оценка зависит не только от автора, и потому не годится как единственное основание для обвинения.
Числа не переносятся вовне. Один язык, один корпус, конкретные процедуры и конкретное поколение моделей. На английском материале, другой коллекции и других детекторах значения будут иными. Механизм зависимости от условий производства при этом никуда не денется.
Эффект происхождения и эффект площадки на этих данных не разделяются. Для этого нужны источники, поставляющие оба класса текстов, а таких у меня не было. Без них разделить два объяснения можно только через непроверяемые допущения.
Балл не переводится в вероятность происхождения. План анализа прямо запрещает такой перевод без калибровочного корпуса, заранее определённой целевой аудитории текстов, проверки дрейфа и опубликованного профиля ошибок. Ни одного из четырёх условий у меня не выполнено.
Ни одна из трёх зарегистрированных смешанных моделей не дала интерпретируемых оценок. Одна не сошлась, вторая оказалась структурно неидентифицируемой, для третьей в данных не нашлось поддержки нужного контраста. Сказать «модели не обнаружили эффект» было бы враньём: оценки не были получены либо не имели требуемой интерпретации, а это другое утверждение.
Человеческая часть корпуса написана до 2022 года. Как выглядит современное человеческое письмо на фоне повсеместных нейросетей — отдельный вопрос, который эта работа не закрывает.
Ещё одна проверка была зарегистрирована, чтобы отделить влияние объёма текста от влияния дословных повторов, и я её не выполнил: она не прошла собственный предварительный шлюз по одному критерию из четырёх. Смягчать критерий после просмотра результата запрещено правилами работы. Невыполненная проверка — тоже результат, и она записана как невыполненная.
Как это проверить самому
Препринт опубликован на Zenodo: DOI 10.5281/zenodo.21763668, версия 1.0.2 от 2 августа 2026 года. Там русская и английская версии текста и архив с материалами. Код по лицензии MIT, данные и текст по CC BY 4.0.
Устройство работы простое до занудства, и это сознательно. Дизайн зафиксирован до сбора основной выборки. Прогоны заморожены: признанный негодным прогон помечается как аннулированный с указанием причины, а новый пишется под новой ревизией со своими каталогами и логами. Хеши расчётного кода и входных данных фиксируются до запуска, и цепочка не стартует при расхождении. Ослаблять допуск шлюза, чтобы прогон прошёл, запрещено правилами — сработавший шлюз это результат проверки качества, а не помеха.
Про использование языковых моделей в самой работе скажу прямо, потому что тема делает умолчание уязвимым местом. Модели применялись: как объект измерения — четыре канала генерации создавали машинную часть корпуса; как одна из четырёх процедур оценки — модель-судья; и как рабочий инструмент при написании кода и черновиков текста. Решения по дизайну, отбор источников, проверка каждого числа перед публикацией и ответственность за содержание — мои. Раскрытие включено в саму статью, а не спрятано в приложении.
Источники
Все числа в этой статье взяты из замороженных протоколов прогонов моего исследования и прослеживаются до конкретного файла результатов. Первоисточник — препринт ниже.
- Кириченко С. Условия производства текста как конфаундер оценки машинности: четыре операционализации на русскоязычном корпусе. Zenodo, версия 1.0.2, 2 августа 2026. DOI 10.5281/zenodo.21763668.
- Запись препринта с файлами русской и английской версий и архивом материалов: zenodo.org/records/21763668.
- Профиль автора в ORCID: 0009-0001-2914-9541.
Частые вопросы
Нет. Исследование показывает другое: оценка зависит не только от автора. На моём корпусе классификатор разделял классы очень уверенно, медиана AUROC 0,9973 по тринадцати разбиениям. Проблема не в том, что прибор не работает, а в том, что он реагирует ещё и на форматирование, площадку и решения предобработки. Поэтому его вердикт не годится как единственное основание для обвинения конкретного автора.
Потому что этот показатель двигается без участия автора. В моём прогоне снятие маркеров жирного шрифта перевернуло уверенное решение «машина» на «человек» у всех шести применимых моделей, при том что полный текст не изменился ни на один символ. Смена шаблона публикации, конвейера выгрузки или способа копирования текста меняет вердикт сама по себе. Требование в договоре должно опираться на то, что вы можете проверить: фактуру, источники, соответствие брифу.
На моих данных — да, и разница большая. При нейтральном задании классификатор пропустил 4 машинных текста из 360, это 1,1 процента. При задании с запретом штампов, заголовков и списков — 47 из 359, то есть 13,1 процента. Тексты писали те же модели по тем же заданиям, менялась только формулировка запроса. Пропуски встречались у всех каналов генерации, а не у одного.
Авторы формальной прозы. Зарегистрированное правило отклонения по подгруппам сработало для формального регистра в 5 разбиениях из 18: медианный уровень ложных срабатываний 0,066 против разности 0,043 с остальным тестом. На SEO-разбиении доля ложных обвинений в этой подгруппе достигала 0,521. Оговорка обязательна: в моём корпусе метка формального регистра совпадает с научным жанром документ в документ, поэтому раздельно регистр и жанр не идентифицируются.
У них разные входы и разное происхождение весов. Индекс и классификатор читают матрицу признаков, метрика предсказуемости и модель-судья — сырой текст. Веса индекса заданы до сбора данных, у классификатора обучены. При смене режима задания три процедуры сдвинулись в минус, судья — в плюс, и ни один доверительный интервал не накрыл ноль. Свести их в одно число нельзя: пункты индекса, вероятность класса, средняя неожиданность и шкала рубрики — четыре разные шкалы.
Предложите заменить критерий на проверяемый. Вместо процента машинности — проверка фактов по первоисточникам, наличие собственных данных, соответствие брифу и техническим требованиям, ответственность автора за ошибки. Если заказчик настаивает на детекторе, зафиксируйте в договоре конкретный инструмент, версию, порог и правило пересдачи. Иначе спор упрётся в то, что два сервиса на одном тексте дают разный вердикт.
Числа — нет. Корпус русскоязычный, процедуры конкретные, человеческая часть опубликована до 1 января 2022 года. На другом языке, другом наборе моделей и другом детекторе значения будут иными. Механизм зависимости от условий производства при этом остаётся: любой детектор видит только буквы, а не историю создания текста, и вместе со стилем читает следы форматирования и сбора данных.
Препринт опубликован на Zenodo с DOI 10.5281/zenodo.21763668, версия 1.0.2 от 2 августа 2026 года. Там же лежат русская и английская версии текста и архив с материалами. Код распространяется по лицензии MIT, данные и текст — по CC BY 4.0. Дизайн исследования зарегистрирован до сбора основной выборки, прогоны заморожены и сверяются по хешам.
Итог
Представьте термометр, показания которого заметно меняются от того, в какой комнате он лежит и открыто ли окно. Числа на экране настоящие. Вопрос в том, что именно они измеряют.
С оценкой машинности происходит то же. Она отражает свойства текста, коллекции и самой измерительной системы, а не одно лишь авторство. Кто сидел за клавиатурой, детектор не устанавливает — и наказывать человека по одному его показанию нельзя.
Для нашего цеха вывод ещё жёстче. Хуже всего эта проверка работает ровно там, где её чаще всего применяют к нам: на структурированных отраслевых текстах. Почти каждый третий человеческий SEO-текст в худшем разбиении получил обвинение, а обнаружение действительно сгенерированного там же провалилось до 0,625 полноты.
Если вам нужен критерий приёмки контента — берите тот, который можно проверить и оспорить: факты, источники, собственные данные, ответственность подписавшего. Процент машинности этим критерием не является ни в одном из смыслов, которые в него вкладывают.
Нужен разбор контента без гадания по проценту машинности
Проверяю фактуру, источники и структуру материала, разбираю, что в тексте держится на данных, а что на пересказе выдачи. Если нужен second opinion по чужому контент-процессу или критерии приёмки, которые выдержат спор с подрядчиком — можно обсудить напрямую.
Обсудить проект