Три недели на моём сайте работал счётчик, который не мог видеть источники трафика. Ни одного. В базе лежало 1030 просмотров, и у всех 1030 в поле «откуда пришёл» стоял адрес той же страницы, которую смотрели.

Счётчик, который не видел источники

Причина оказалась в одной строке. Счётчик вызывался картинкой из подвала страницы, а PHP брал источник из заголовка HTTP_REFERER этого запроса. Браузер в таком запросе честно сообщает: «пиксель загружен со страницы /services.html». Скрипт записывал это как источник перехода. Тысяча строк, где страница сама себе источник.

Одна строка из таблицы pageviews · то, что счётчик считал «источником»
path/services.html
referrerhttps://sk-seo.ru/services.html← адрес той же страницы, а не источник перехода
uaMozilla/5.0 … HeadlessChrome/148← headless-браузер, записан как живой посетитель

Два дефекта в одной строке. Referrer занят собственным адресом, а фильтр ботов не ловит headless-браузеры — за 18 дней 107 таких визитов (10,4%) прошли как люди.

Обнаружил я это, когда сел считать, сколько трафика мне дают нейросети. Ответ получился ноль. Только ноль здесь означал не «нейросети не приводят людей», а «я ничего не измеряю».

Отличить одно от другого, глядя на дашборд, нельзя. В этом вся статья.

Четыре разных объекта под одним словом

Спор о том, сколько трафика дают нейросети, обычно упирается не в цифры, а в то, что собеседники считают разные вещи и называют одним словом. Разделим на четыре уровня.

От присутствия в ответе до денег: четыре уровня Видимость присутствие в ответе инструмент: prompt tracking слепая зона: нестабильность Переход визит из AI на сайт инструмент: GA4, Метрика, логи слепая зона: потеря referrer Влияние AI повлиял на выбор инструмент: опрос, брендовый поиск слепая зона: смешение каналов Результат лиды и выручка инструмент: CRM, эксперименты слепая зона: причинность
Каждую цифру нужно относить строго к одному уровню. Смешивать их — то же самое, что складывать позиции в выдаче с выручкой.

Эта прикладная классификация опирается на ту же логику, что и обзор Оливье Мартинеса (arXiv 2607.14035, 15 июля 2026), охвативший 45 исследований за ноябрь 2023 — июль 2026. Мартинес рассматривает GEO как частично наблюдаемый стохастический пайплайн и разделяет обнаруживаемость, цитирование, поглощение информации и экономический результат. Для практической аналитики я свожу этот пайплайн к четырём уровням выше. Рамки близкие, но не тождественные: у меня отдельно разведены переход и влияние, у него — цитирование и поглощение.

Что действительно видят GA4 и Метрика

Тринадцатого мая 2026 Google добавил в GA4 отдельный канал для переходов от AI-ассистентов. Называется он AI Assistants, во множественном числе, и определён так: «канал, по которому пользователи приходят на ваш сайт из источников вроде ChatGPT, Gemini, Deepseek, Copilot или Grok». Там же прямым текстом: «Исключает Google AI Overviews и AI Mode».

Последнее важнее самого канала. Клики из AI-обзоров Google считает органическим поиском. То есть AI Overviews и AI Mode не попадают в канал AI Assistants по определению — их клики учитываются как органический поиск.

Второе ограничение жёстче. Канал ловит сессии с читаемым реферером. Чат-интерфейсы ChatGPT и Алисы его обычно не передают, и эти визиты уходят в прямые заходы без всякой пометки.

Оценить возможный масштаб неатрибутируемого влияния попыталась панель Profound1: более двух миллионов диалогов с браузингом за январь — июнь 2026. После того как нейросеть упоминала бренд, посещения сайта этого бренда росли в полтора-два с половиной раза относительно прогнозной базовой линии в течение недели. Из этих визитов опознаваемую метку источника несли около 2,5%, причём даже после майского обновления ChatGPT, сделавшего ссылки заметнее.

Дизайн здесь наблюдательный, а исследование вендорское. Панель фиксирует временную связь между упоминанием и визитом, а не доказывает, что каждый дополнительный визит вызван именно упоминанием.

Автор Хабра2 в июле проверил метод на своём сайте руками: собрал сегмент Метрики из тринадцати доменов AI-сервисов, получил 10 визитов из 634 за 90 дней, и из тринадцати доменов сработали только yandex.ru и ya.ru. Его формулировка: «гарантированный минимум — ноль».

Здесь легко сделать неверный шаг, и его делают постоянно. У того же автора прямые заходы составили 552 визита, 87,1%. Соблазн объявить их скрытым AI-трафиком велик, и это ошибка. Прямые заходы включают закладки, ручной ввод адреса, мессенджеры, приложения, потерянные метки, приватные браузеры, почтовые клиенты. Утверждать можно ровно одно: часть AI-визитов физически неотличима от прочих прямых заходов. Сколько именно, стандартными средствами не выяснить.

~2,5%
визитов после AI-упоминания несут метку источника
Profound, 2+ млн диалогов, янв–июнь 2026
87,1%
трафика ушло в прямые заходы
но это не резерв скрытого AI-трафика
2 из 13
AI-доменов вообще сработали в сегменте
только yandex.ru и ya.ru за 90 дней

Значит ли это, что реферальная цифра врёт? Нет. Она корректна. Она просто показывает нижнюю границу, а не полный эффект канала. Разница принципиальная: врущий инструмент надо чинить, а инструмент с известной границей применимости используют по назначению.

Почему трекеры AI-видимости скачут

Уровень видимости живёт по другим законам, и здесь проблема серьёзнее.

Двадцатого июля я прогнал восемь русскоязычных запросов через Perplexity пять раз подряд в течение десяти минут. Совпадение наборов цитируемых доменов между повторами составило 0,72 по коэффициенту Жаккара. Из 95 связок «запрос плюс домен» во всех пяти прогонах удержались 49, то есть 51,6%. Домен на первом месте сменился в трёх запросах из восьми. По медицинскому запросу источники чередовались через прогон.

Один запрос, пять прогонов подряд за десять минут Медицинский запрос, топ-3 цитируемых источника. Сайт не менялся между прогонами. прогон 1 #1 sostav.ru #2 vc.ru #3 medesk.ru прогон 2 #1 medesk.ru #2 sostav.ru #3 digitalgeeks.ru прогон 3 #1 sostav.ru #2 vc.ru #3 medesk.ru прогон 4 #1 medesk.ru #2 sostav.ru #3 digitalgeeks.ru прогон 5 #1 sostav.ru #2 medesk.ru #3 digitalgeeks.ru sostav.ru medesk.ru vc.ru digitalgeeks.ru
Пять запросов подряд к одной модели за десять минут. Топ-1 скачет между sostav.ru и medesk.ru, vc.ru то появляется, то исчезает, digitalgeeks.ru приходит позже. Отчёт по любому одному прогону был бы «точным» — и другим.
0,72
совпадение доменов между повторами
Жаккар, 5 прогонов за 10 минут
49 из 95
связок удержались во всех пяти повторах
остальные 48,4% хотя бы раз выпадали
3 из 8
запросов сменили лидера
sostav.ru ↔ medesk.ru через прогон

За десять минут внешний корпус существенно обновиться не мог. Но утверждать, что выдача измениться не могла вообще, я не буду: за это время могли поменяться маршрутизация между моделями, набор извлечённых документов, ранжирование и состояние кэша. Замер показывает нестабильность всего контура, а не отдельно взятой модели.

Механизм известен. Работа Атиля с соавторами (arXiv 2408.04667) проверила пять моделей, выставленных на детерминизм: восемь задач, десять прогонов. Расхождение точности достигало 15%, а разрыв между лучшим и худшим прогоном доходил до 70%. Нулевая температура воспроизводимость не гарантирует.

Мой результат не уникален, и это хорошо. Препринт Зелински (arXiv 2603.08924) мерил то же самое на трёх платформах и трёх темах потребительских товаров, с замерами каждые десять минут и бутстрап-интервалами. Его вывод дословно: «single-run visibility metrics provide a misleadingly precise picture». Мой замер независимо подтверждает общий вывод на русскоязычных запросах: одиночный прогон создаёт ложное ощущение точности. Строгой репликацией это не назвать, потому что различаются язык, тематика, набор запросов и метрика.

Ещё одна работа, Шульте с соавторами (arXiv 2604.07585), измеряла четыре вертикали и четыре движка на протяжении 45 дней. Межсуточное совпадение источников составило 0,34–0,42 по Жаккару, ранговая метрика RBO — 0,21–0,26.

Почему 0,26 по RBO — это не «хуже», чем 0,35 по Жаккару У неэкстраполированного RBO потолок зависит от длины списка, у Жаккара он всегда 1,0 Жаккар потолок 1,0 0,34–0,42 34–42% шкалы RBO (список из 5) потолок 0,41 0,21–0,26 51–63% шкалы По доле от достижимого максимума диапазон RBO даже правее — сравнивать сырые числа нельзя
Один и тот же диапазон значений: на шкале Жаккара (потолок 1,0) он в левой трети, на шкале RBO (потолок 0,41 для списка из пяти) — в правой половине. Числа с разных шкал не сравниваются.

Здесь нужна осторожность, которую я сам чуть не потерял. Кажется очевидным вывод: раз RBO ниже, порядок источников плывёт сильнее их состава. Но авторы используют неэкстраполированную нижнюю границу RBO с параметром 0,9, и её максимум зависит от длины списка как 1 − p^k. При списке из пяти элементов потолок равен 0,410, при трёх — всего 0,271. Значит 0,26 на коротком списке означает почти полное совпадение, а вовсе не провал. Метрики живут на разных шкалах, и сравнивать их числа между собой нельзя.

Что можно сказать безопасно: Шульте и соавторы зафиксировали изменения и состава источников, и их порядка. Абсолютное значение их нижней границы RBO нельзя интерпретировать без длины списка и нельзя напрямую сравнивать с Жаккаром.

Как корзина промптов создаёт нужный процент

Дальше самое интересное. Если видимость нестабильна от прогона к прогону, то насколько она зависит от того, как вообще сформулирован вопрос?

В большинстве открытых GEO-отчётов, которые я изучил, этот вопрос не раскрывается. Агентство берёт список промптов, прогоняет, показывает процент. Список составляет то же агентство.

Короткий ответ. Смена формулировки одной и той же потребности разрушает набор источников значительно сильнее, чем обычный шум повторных прогонов. В моём эксперименте у 35% пар «потребность + домен» одна формулировка давала источник во всех пяти повторах, а другая — ни в одном. Процент видимости в отчёте частично создаётся выбором слов, а не работой над сайтом.

Я поставил эксперимент. Восемь информационных потребностей, для каждой пять формулировок, каждая прогнана пять раз. Итого 200 ответов. Формулировки сохраняют сущности, язык, регион и тип интента, меняются лексика, синтаксис и регистр речи: исходная, лексическая замена, другая синтаксическая конструкция, разговорная, короткая поисковая. «Какие сервисы проверяют видимость бренда в AI-поиске?» превращается в «сервисы проверки видимости бренда ai поиск» и в «Подскажи сервисы, которыми можно проверить видимость бренда в AI-поиске». Но не в «дешёвые сервисы», потому что это уже другая потребность.

Прогоны шли пятью блоками, в каждом блоке все сорок формулировок в случайном порядке. Так временной дрейф не выдаёт себя за эффект формулировки.

Просто посчитать сходство между формулировками мало: в нём сидит и обычный шум движка. Поэтому считаю две величины отдельно.

Wi = meanv meanr<s J(Civr, Civs)
Bi = meanv<u meanr,s J(Civr, Cius)
PPIi = Wi − BiSPRi = BiWi
iинформационная потребность — одна из восьми тем (например «медицинский сайт»)
v, uформулировки одной потребности — исходная, лексическая, синтаксическая, разговорная, короткая поисковая
r, sномера повторов одной формулировки — по пять прогонов каждой
C_ivrнабор доменов, процитированных в ответе на потребность i, формулировку v, повтор r
Jкоэффициент Жаккара — доля общих доменов в двух наборах, от 0 (не пересекаются) до 1 (совпадают)
W_iшум контура — среднее сходство повторов одной и той же формулировки
B_iсходство разных формулировок одной потребности
PPI_iштраф за перефразирование — сколько устойчивости съедает смена формулировки сверх обычного шума
SPR_iдоля сохранённой устойчивости — какая часть базовой воспроизводимости пережила перефразирование

B в одиночку ничего не доказывает: в нём сидит и шум движка. Вычитая W, я оставляю вклад именно формулировки.

Результаты по восьми потребностям: W = 0,723, B = 0,431, PPI = 0,292. Бутстрап с группировкой по потребностям, а не по отдельным ответам, даёт для PPI 95-процентный интервал от 0,206 до 0,372, и ноль в него не входит.

Значимость проверял перестановочным тестом с сохранением временных блоков: метки формулировок перемешивались только внутри своего блока, N = 10 000 раз, поэтому временной дрейф не попадал в нулевое распределение. p считалась как (b+1)/(N+1), где b — число перестановок с PPI не ниже наблюдённого. После поправки Холма на восемь сравнений максимальное скорректированное p равно 0,0008 — значимость сохранили все восемь.

200
ответов в замере
8 потребностей × 5 формулировок × 5 повторов
0,292
штраф за перефразирование
95% интервал 0,206–0,372, p < 0,001
35%
пар «потребность — домен»: 100% ↔ 0%
105 из 300, только из-за формы вопроса
Устойчивость видимости: шум контура против штрафа формулировки 0 0,2 0,4 0,6 0,8 1,0 Коэффициент Жаккара Статьи под цитирование PPI 0,43 Сервисы съёма позиций PPI 0,4 Выбор SEO-специалиста PPI 0,37 Отслеживание упоминаний PPI 0,36 Что такое GEO PPI 0,35 Медицинский сайт PPI 0,2 Падение трафика PPI 0,14 Сервисы видимости бренда PPI 0,09 B — разные формулировки W — повторы одной формулировки
Зелёная точка — воспроизводимость одного текста, оранжевая — устойчивость к перефразированию. Чем длиннее линия, тем сильнее меняется набор источников из-за одной лишь формулировки.

Формулировать результат надо аккуратно. Сходство между разными формулировками составляет 59,6% от воспроизводимости одинакового текста. Дополнительный штраф за перефразирование равен 0,292.

Разброс между темами важнее среднего. У запроса про сервисы проверки видимости разница составила 0,086, то есть формулировка почти не влияет. У запроса про то, как писать статьи под цитирование в AI-обзорах, штраф достиг 0,433: смена формулировки внесла особенно большой дополнительный разброс сверх обычного шума контура.

И цифра, которую стоит показывать клиенту вместо коэффициентов. Я взял все домены, встретившиеся хотя бы раз, и посчитал для каждого размах присутствия между формулировками. Знаменатель здесь — 300 пар «потребность плюс домен», где домен появился хотя бы однажды.

Размах присутствия домена между формулировками одного запроса 127 42% размах < 50 п.п. 68 23% размах 50–100 п.п. 105 35% полное переключение 100% ↔ 0% Всего 300 пар «потребность + домен»
У 105 пар из 300 (35%) одна формулировка давала источник во всех пяти повторах, а другая — ни в одном.

В 35% отобранных пар «потребность — домен» (105 из 300, где домен встретился хотя бы раз) одна формулировка давала источник во всех пяти повторах, а другая — ни в одном. Сайт при этом не меняется вообще.

Отсюда следует вещь, неприятная для рынка. Подрядчик, который сам формирует корзину промптов, существенно влияет на итоговый процент, даже без намеренной манипуляции. Чтобы отчёт стало возможно проверить, недостаточно неизменного списка. Нужны полный текст промптов, модель и режим, число повторов, даты, регион, правила агрегации и обработка пустых ответов.

Живой пример есть в открытом доступе. Портал GEOMI выкладывает демо-отчёт с подписью «пример того, как выглядит качественный отчёт от подрядчика». Значения там иллюстративные, поэтому разбираю структуру отчёта, а не достоверность результатов клиента.

Видимость в нём растёт с 20% в декабре до 43% в феврале. В детализации указан состав корзины: декабрь — 2 направления и 14 промптов, январь — 4 и 28, февраль — 6 и 42. Корзина выросла втрое.

Забавно, что данные для честной динамики в отчёте есть. По двум направлениям, присутствующим во всех трёх месяцах, рост настоящий и более убедительный: с 14 до 52% и с 26 до 71%. В шапку вынесли несопоставимое число.

Разложить такую динамику на две части несложно. Пусть p_i,t — видимость внутри группы промптов i в период t, а w_i,t — доля этой группы в корзине. Тогда общая видимость и её изменение раскладываются так:

Vt = Σi wi,t · pi,t
ΔV = Σii (pi,1 − pi,0)эффект работы+Σii (wi,1 − wi,0)эффект корзины
i = wi,0 + wi,12i = pi,0 + pi,12
iгруппа промптов (направление) внутри корзины
tпериод: 0 — начало, 1 — конец (например декабрь и февраль)
p_i,tвидимость внутри группы i в период t
w_i,tдоля группы i в корзине промптов в период t
V_tобщая видимость в период t — сумма по всем группам
ΔVизменение видимости между периодами
эффект работырост внутри прежних групп при неизменной корзине
эффект корзинысдвиг цифры из-за добавления или перевзвешивания промптов

Декомпозиция симметричная: сумма двух компонентов тождественно равна общему изменению, остаточного члена нет. Проверено численно на случайных данных, расхождение на уровне машинной погрешности.

Разложение роста видимости: работа против смены корзины Иллюстративный пример, не данные отчёта 20% V₀ · декабрь +9 Эффект работы +14 Эффект корзины 43% V₁ · февраль
Тот же прирост с 20% до 43% раскладывается на реальную работу и эффект расширения корзины промптов. Без разделения второе выдают за первое.

Формула стандартная, из экономической статистики. В просмотренных публичных GEO-отчётах такого разложения я не встретил. Разложить сам рост GEOMI я не могу: в отчёте нет видимости по каждому направлению за все три месяца, а без неё считать нечего. Метод проверен на моём расчётном примере, не на их данных.

Правило простое: пока подрядчик не показал два эффекта раздельно, фраза «видимость выросла» ничего не значит.

Почему исследования противоречат друг другу

Возьмите любую подборку статистики по AI-поиску, и вы увидите цифры, которые не сходятся между собой.

Доля ChatGPT в реферальном AI-трафике: у SE Ranking 74,78%3, у Trakkr 91,2%4, у Search Engine Land 92%5. Расхождение в 17 пунктов. Пересечение цитируемых источников с органической выдачей Google зависит от того, считать топ-10 или всю органику, и снижается со временем: Ahrefs в середине 2025 нашёл около 76% цитирований где-то в органике6, BrightEdge в сентябре 2025 — 54% в органике и лишь около 17% строго в топ-107, Ahrefs в начале 2026 — 38% в топ-108.

Доля ChatGPT в AI-трафике: одна метрика, три ответа Один и тот же показатель — расхождение в 17 процентных пунктов 0% 25% 50% 75% 100% SE Ranking 101 574 сайта 74,78% Trakkr панель GA4-свойств 91,2% Search Engine Land 6,77 млн сессий 92,0%
Три компании измерили одно и то же — долю ChatGPT в реферальном трафике из нейросетей — и получили от 74,78% до 92%. Причина не в ошибке, а в разных выборках: сайты, GA4-панели, сессии.

Дело не в том, что кто-то считает плохо. Выборки разные, методики разные, объекты измерения разные. Одна компания считает по панели GA4-свойств, другая по своей базе доменов, третья по клик-стриму.

Сходятся источники в одном. Surfer на примерно 5 миллионах цитируемых URL нашёл, что корреляция domain authority с частотой цитирования близка к нулю9, а Ahrefs зафиксировал неполное пересечение цитат с топ-10. Оба результата показывают: ни высокий Domain Authority, ни присутствие URL в топ-10 сами по себе не гарантируют цитирование в AI. Классические SEO-сигналы могут участвовать в отборе, но их недостаточно, чтобы прогнозировать AI-видимость.

Особенно осторожно стоит обращаться с оценками потерь кликов. Я сам сначала свёл их в диапазон «от 34,5 до 68 процентов» и был неправ. Такого диапазона не существует, потому что это разные величины с разными знаменателями.

Оценки потерь кликов от AI: разные метрики, разные знаменатели — не сводятся в общий диапазон
ИсследованиеЧто измерялосьБаза сравненияРезультат
Agarwal & Senвнешние органические клики на поискAIO показан / скрыт, только AIO-запросы−39,8% условно; ≈−18,5% в среднем
Pewвероятность клика по обычному результатувыдача с AI-саммари / без него8% против 15%
SparkToroдоля бескликовых поисковвсе поиски в Google, США68%
AhrefsCTR верхней позициивыдача с AIO / без него−58% (ранняя оценка −34,5%)
Seerклики на показцитируемый / нецитируемый бренднаблюдаемая связь, не причинная

Пять исследований, пять разных вопросов. Складывать их в интервал — то же самое, что усреднять температуру и давление.

Что нейросети делают с кликами

Самый сильный причинный дизайн среди работ, которые я нашёл для этого разбора, показал полевой эксперимент Агарвала из Индийской школы бизнеса и Сена из Карнеги-Меллон (SSRN 6513059, версия от 8 июля 2026).

Дизайн заслуживает отдельного описания, потому что на его фоне видно уровень остального рынка. Эксперимент предварительно зарегистрирован в реестре Американской экономической ассоциации под номером AEARCTR-0017393 — то есть гипотезы зафиксированы до сбора данных. Собственное расширение Chrome прошло проверку безопасности Google. Участников набирали через Prolific с фильтром: Google как основной поисковик, Chrome как единственный браузер, минимальная активность за предыдущие двадцать дней. В основное двухнедельное исследование прошли 1065 человек из США: 396 в контроле, 374 в группе со скрытым AI-обзором, 295 в группе с AI Mode. Через две недели группы поменяли местами.

Результаты на запросах, где AI-обзор срабатывал. Внешние органические клики: 0,37 на поиск в контроле против 0,62 при скрытом обзоре. Вероятность бескликовой сессии: 0,73 против 0,54. Клики по рекламе: 0,02 против 0,02, разницы нет. Число поисков между группами не изменилось.

Что происходит с кликами, если убрать AI-обзор Полевой эксперимент, запросы со сработавшим обзором. Значения — на один поиск 0,37 0,62 Органические клики на поиск 0,73 0,54 Бескликовые сессии 0,02 0,02 Клики по рекламе контроль (обзор показан) обзор скрыт расширением
Уберёшь AI-обзор — органические клики на сайты растут (0,37 → 0,62), а бескликовость падает (0,73 → 0,54). Клики по рекламе не меняются вовсе. Обзор отнимает именно органический переход, не рекламный.

Главное подтверждение причинности — плацебо-проверка. На запросах, где AI-обзор не должен был появляться, различий между группами нет.

Отсюда цифры, которые все цитируют: падение органических кликов на 39,8%, рост бескликовых сессий на 34,5%. И здесь рынок ошибается вдвое.

Обе цифры посчитаны условно, только для запросов с AI-обзором. В сноске самой работы сказано: поскольку обзор срабатывает примерно в 41% поисков, в среднем по всем поискам падение органических кликов составляет около 18,5%, а рост бескликовых — около 20,4%.

Внимательный читатель тут же попробует проверить умножением и получит другое число: 39,8% на 41% даёт 16,3%. Расхождение объясняется просто. Процент считается от общего контрфактического числа кликов, поэтому вес запроса определяется его вкладом в клики, а не долей в количестве поисков. Запросы с обзором и без него имеют разную базовую кликабельность. При доле обзоров 41%, кликабельности 0,62 без блока и 0,37 с блоком общая потеря даёт 18,5%, если запросы без обзора приносят около 0,508 клика на поиск. Противоречия нет.

Второй квазиэксперимент даёт другой порядок величины и другим методом. Хосрави и Йоганарасимхан (arXiv 2602.18455) использовали разновременный раскат AI-обзоров по языкам Википедии как источник вариации: 161 382 пары «статья — язык», метод разности разностей (difference-in-differences). Трафик англоязычных статей упал примерно на 15%.

Два исследования, две методики, минус 18,5% и минус 15%. Совпадение по порядку величины при разных подходах — более сильный аргумент, чем любая отдельная цифра.

Теперь то, что работает против удобного нарратива, и я обязан это привести. Вовлечённость на сайтах при условии клика между группами не различается. В сноске работы сказано прямо, что этот результат противоречит публичным заявлениям Google о показателях отказов из AI-обзоров. В этом эксперименте утверждение Google о более качественном трафике подтверждения не получило. Одновременно эксперимент не подтвердил и противоположную версию о заведомо худшем трафике из AI-обзоров.

И второе. Опрос после эксперимента не выявил статистически различимого улучшения или ухудшения воспринимаемого качества поиска. Утверждать равенство на этом основании нельзя: для этого нужен тест эквивалентности с заранее заданной границей практически значимого эффекта. Вывод самих авторов: обзоры отбирают трафик у издателей, не давая пользователю измеримого выигрыша.

Как считать результат сейчас

Перехожу от критики к тому, что предлагаю делать. Единица измерения нового поиска — не место и не процент упоминаний, а набор показателей с известной неопределённостью. Ниже шесть метрик, сбор которых можно начать на следующей неделе.

1. Видимость с нижней байесовской границей

Обычный трекер делит ответы с брендом на все ответы. Пять упоминаний из пяти он показывает как 100%. Вместо точечной оценки беру апостериорное распределение доли при m присутствиях из n прогонов с априорным распределением Джеффриса и выношу в отчёт его пятый процентиль:

p | m, n Beta(m + 0.5, n − m + 0.5)
CAVниж = Q0.05(p)
mчисло прогонов, где бренд присутствовал
nвсего валидных прогонов по запросу
+ 0.5априор Джеффриса — поправка, чтобы 5 из 5 не превращались в «100% наверняка»
pвероятность присутствия как распределение, а не одно число
Q_0.05пятый процентиль распределения — нижняя граница, которую показываем рядом с точечной оценкой
CAV_lowerнижняя 95% граница вероятности присутствия
Цена заявления «бренд появляется всегда»: нижняя граница вероятности присутствия
РезультатТочечная оценкаНижняя 95% граница
5 из 5100%69,4%
4 из 580%43,7%
10 из 10100%82,9%
20 из 20100%91,0%

После пяти успешных прогонов точечная оценка присутствия равна 100%, а нижняя 95-процентная байесовская граница — 69,4%. Это разные величины, и в отчёте должны стоять обе: точечная оценка и её нижняя граница. Таблица не задаёт универсального числа прогонов, она показывает цену заявления «бренд появляется всегда».

Обычный трекер покажет 100%
Честная нижняя граница
69,4%
5 из 5: точечная оценка 100%, но нижняя 95% граница — только 69,4%.
Одна оговорка про агрегацию. Границу считают отдельно для каждого промпта, а не по всем ответам разом. У промптов разная базовая вероятность присутствия, и если слить их в одну выборку m из n, получится псевдорепликация и заниженная неопределённость. Для общей видимости из апостериорного распределения каждого промпта берут выборку p_q, считают взвешенную видимость V = Σ w_q · p_q и выносят в отчёт пятый процентиль распределения V. Это строже, чем среднее из отдельных нижних границ.

2. Разложение корзины промптов

Отдельно эффект работы, отдельно эффект изменения списка запросов. Формула и график выше. Без этого разделения динамика видимости непроверяема.

3. Три координаты устойчивости вместо одной

Воспроизводимость одинакового промпта, устойчивость к перефразированию, дрейф во времени. Три числа с названиями осей, а не одно «устойчивость 56%». Свои измерения привожу так. Внутри одного эксперимента воспроизводимость одинакового текста составила 0,723, устойчивость к перефразированию — 0,431. Разница между ними, то есть штраф формулировки, равна 0,292. Межсуточная устойчивость 0,356 измерена отдельно и на другом движке, поэтому в единый индекс с первыми двумя не объединяется. Штраф — не координата устойчивости, а разность двух координат. Смешивать их в одном списке нельзя.

4. Период полураспада цитирования

Рынок показывает «было 12 упоминаний, стало 20» и не отвечает, удержались ли они. Trakkr на выборке из 857 тысяч отчётов обнаружил, что 73% цитирований появляются один раз и исчезают10. Строка отчёта вида «видимость выросла с 18 до 27%, но медианный срок жизни нового цитирования шесть дней» честнее любого графика. Цифры в этом примере гипотетические, своего продольного ряда у меня пока нет. Событие определяется так: цитирование считается исчезнувшим после двух подряд пропусков, а незавершённые наблюдения учитываются как цензурированные. Сравнивать полураспад можно только при одинаковой частоте замеров: два подряд пропуска при ежедневном и еженедельном сканировании — разные события. Поэтому в отчёте указывается интервал: ежедневно, раз в три дня или еженедельно.

5. Цитирование, упоминание бренда и поглощение содержания

Ссылка на источник в списке и реальное использование его содержания — разные вещи, и меряются они разными величинами. Semrush с Кевином Индигом на выборке из 3981 появления домена обнаружили, что 62% цитирований не называют бренд по имени11: это расхождение между цитированием и упоминанием. Работа Сюя с соавторами (arXiv 2605.14021) на 55 тысячах запросов и 98 тысячах атомарных утверждений нашла, что 11% утверждений в AI-обзорах не подтверждаются источником, на который ссылаются: это про достоверность.

Отсюда практическое следствие: «нас упоминают» и «на нас ссылаются» — не просто разные метрики, а почти несвязанные. Домен ставят в источники в одних ответах, имя бренда называют в других, и совпадают они редко. Считать эти два показателя надо раздельно, иначе один выдают за другой.

Ни то, ни другое не измеряет поглощение — фактический вклад источника в содержание ответа. Чтобы его посчитать, ответ надо разбить на атомарные утверждения j с весом важности s_j. Одно утверждение может опираться сразу на несколько доменов, поэтому его вклад делится между ними долей атрибуции a_jd ∈ [0,1], где Σ_d a_jd = 1. Признак f_jd = 1 ставится, если домен d поддерживает утверждение корректно:

ACSd = Σj sj·ajdΣj sj
Fidelityd = Σj sj·ajd·fjdΣj sj·ajd
UsefulInfluenced = ACSd × Fidelityd
dдомен-источник, вклад которого оцениваем
jатомарное утверждение в ответе нейросети
s_jвес важности утверждения j для ответа
a_jdдоля атрибуции — какая часть утверждения j опирается на домен d; сумма по доменам равна 1
f_jd1, если утверждение корректно поддержано источником, иначе 0
ACS_dдоля содержания ответа, пришедшая от домена (поглощение)
Fidelity_dточность использования — какая часть опоры на источник верна
UsefulInfluenceполезное влияние — поглощение, помноженное на достоверность

Доля атрибуции делит вклад между источниками, поэтому суммарное поглощение по всем доменам не превышает 100% — иначе один и тот же вес утверждения зачли бы нескольким доменам сразу. Первичную разметку может делать модель-судья, но часть выборки обязана проходить ручную проверку. Без такого определения поглощение остаётся красивым словом из обзора, а не метрикой.

6. Разность разностей для оценки собственных работ

Сопоставимые страницы, часть меняем, часть оставляем контролем, корзина промптов одна и та же до и после. Общий дрейф движка вычитается через контроль. Эффекты по цитированию, поглощению и переходам считаются раздельно и в один показатель не сводятся. Дизайн требует сопоставимых групп и проверки параллельных трендов на нескольких замерах до вмешательства. Если страницы можно распределить случайно, рандомизация сильнее квазиэксперимента.

Как сейчас
31%
AI Visibility — один процент, который ничего не гарантирует и не воспроизводится
Как честно
Видимость, нижняя граница24% (точечно 31%)
Динамика+9 работа / +4 корзина
Устойчивость (прогон/пере­фраз/время)0,72 / 0,43 / 0,36
Штраф формулировки (PPI)0,29
Период полураспада цитаты11 дней
Поглощение × достоверность17% × 91%
Межплатформенная устойчивость0,44
Инкрементальный эффект работ+5,2 п.п.

Значения справа иллюстративные; устойчивость по прогонам и времени — из моих замеров, остальное показывает формат. Смысл в другом: одна цифра слева непроверяема, вектор справа несёт свою неопределённость честно.

Каждую строку этого вектора можно посчитать. Пять — прямо в калькуляторе (ссылки ниже), две требуют накопления данных во времени. Вот куда что вводить.

Где посчитать каждую строку честного отчёта
Строка отчётаГде считатьЧто вводите
Видимость, нижняя границаЛист «Видимость (CAV)»по каждому промпту: в скольких прогонах бренд появился и сколько прогонов всего
Динамика: работа / корзинаЛист «Разложение корзины»по каждой группе промптов: видимость и долю в корзине до и после
Устойчивость: прогон, перефразЛист «Штраф формулировки»W и B по темам — средние дают две координаты
Устойчивость: времяЛист «Устойчивость»межсуточный коэффициент Жаккара между датами
Межплатформенная (CER)Лист «Межплатформенная»видимость бренда на каждом движке — формула считает концентрацию
Поглощение × достоверностьЛист «Поглощение»разметку ответа: какие утверждения опираются на ваш домен и верны ли
Период полураспада цитатынужен ряд по датамисторию присутствия связок «промпт + домен»: когда появилась, когда исчезла
Инкрементальный эффект работнужен эксперименттестовые и контрольные страницы, замер до и после работ

Две нижние строки нельзя посчитать одной таблицей: полураспад требует накопить историю замеров по датам, инкрементальный эффект — разделить страницы на тест и контроль. Это не пробел метода, а честное указание, что часть картины собирается временем, а не одним прогоном.

Для уровня влияния и результата работает другой набор. Опрос «как вы о нас узнали» с явным пунктом про нейросети остаётся одним из немногих способов поймать влияние, не оставившее реферера. Но верить ему напрямую нельзя. HockeyStack разобрал больше 8500 таких ответов от 36 компаний и обнаружил, что 90% назвавших «сарафанное радио» перед этим видели рекламу в LinkedIn больше сотни раз12. Единственная задокументированная процедура калибровки — сверять ответы с логами показов.

Скачать 40 промптов эксперимента (CSV) — с разметкой по типам перефразирования Скачать все 200 ответов (JSONL) — сырые данные замера с доменами и позициями Калькулятор GEO-метрик (Google Sheets) — сделайте копию и соберите свой отчёт: CAV, штраф формулировки, разложение корзины (нужен вход в Google; XLSX-версия — по кнопке ниже) Тот же калькулятор с нашими данными — формулы уже показывают PPI 0,29 и границу видимости на замере из статьи Мастер-промпт: проверьте свой бренд (Markdown) — готовая методика прогона запросов через ChatGPT, Perplexity, Алису с честным подсчётом Полный набор: данные и код замеров (ZIP) — сырые ряды двух замеров, скрипты анализа (PPI, кластерный bootstrap, блочный permutation, CAV) и результаты. Analyze-скрипты запускаются на Python из коробки

Требовать от подрядчиков открытую корзину промптов и при этом прятать свою было бы странно. Поэтому промпты, ответы, рабочий калькулятор и полный набор данных с кодом замеров лежат выше, а методология расчёта расписана в разделах этой статьи.

Какие цифры нельзя обещать клиенту

Прогноз AI-трафика для конкретного сайта я обещать не берусь, и никому не советую.

Метод для задач такого класса существует давно. Лес Бине показал на конференции IPA в 2020 году, что доля брендовых поисковых запросов относительно конкурентов коррелирует с долей рынка на уровне 83%13, на выборке из 30 кейсов, 12 категорий, 7 стран. Метрика опережающая: для автомобилей примерно на год, для мобильных телефонов на полгода. Придумывался метод ровно для нашей задачи, чтобы обойти неатрибутируемость офлайн-медиа.

Перенести его на AI-канал сегодня мешают четыре вещи, и три из них не про качество инструментов.

01История

Google Meridian требует два-три года недельных данных.14 AI-трафик в устойчивом объёме существует меньше.

ослабнет со временем
02Шум

Наблюдаемый AI-трафик у многих сайтов пока мал относительно общего и может теряться в недельных колебаниях прямых заходов.

может ослабнуть
03Эксперимент

Метод требует включить канал в одних регионах и выключить в других. Видимость в ChatGPT по регионам не выключается.

нужен другой дизайн
04Метрика

Аналога метрики Бине для AI-канала с доказанной предсказательной точностью не существует.

открытый пробел

Первый барьер ослабнет по мере накопления истории. Второй может ослабнуть, если доля AI-трафика поднимется над уровнем шума, но это не гарантировано. Третий требует другого дизайна эксперимента. Четвёртый — работы, которую пока никто не сделал.

Обзор Мартинеса, тот самый на 45 исследований, заканчивается выводом, который стоит повесить над рабочим столом каждому, кто продаёт GEO: ни одна из рассмотренных техник не показала устойчивого, продольного, кроссплатформенного причинного эффекта на обнаруживаемость или поведение пользователей.

Читать это надо точно. В рассмотренной литературе ни одна GEO-техника не показала одновременно устойчивого, продольного и кроссплатформенного причинного эффекта. Локальные эффекты это не отменяет. Оно означает, что переносить их между платформами, темами и периодами как универсальный закон пока нельзя.

Источники

Академические работы (arXiv, SSRN) со ссылками прямо в тексте: обзор Мартинеса, эксперименты Атиля, Зелински и Шульте по нестабильности, полевой эксперимент Агарвала и Сена, разность разностей Хосрави и Йоганарасимхан, разбор достоверности Сюя. Отраслевые источники — ниже.

  1. Profound. The AI Mention Effect — панель 2+ млн диалогов, январь–июнь 2026.
  2. Хабр. Как измерить трафик из нейросетей в Яндекс.Метрике — 10 визитов из 634 за 90 дней.
  3. SE Ranking. AI Traffic Research — доля ChatGPT 74,78%, 101 574 сайта.
  4. Trakkr. AI Search Traffic Index — доля ChatGPT 91,2% (размер панели обновляется).
  5. Search Engine Land. ChatGPT referral traffic — доля 92,4%, 6,77 млн сессий.
  6. Ahrefs. Search rankings & AI citations — около 76% цитирований где-то в органике, середина 2025.
  7. BrightEdge. Rank overlap after 16 months of AIO — 54% в органике, ~17% в топ-10, сентябрь 2025.
  8. Ahrefs. AI Overview citations vs top-10 — 38% в топ-10, начало 2026.
  9. Surfer. Domain Authority & AI citations — ~5 млн цитируемых URL, корреляция DA близка к нулю.
  10. Trakkr. Citation decay — 73,5% цитирований появляются один раз, 857 тыс. отчётов.
  11. Semrush. The Ghost Citations Study — 61,7% цитирований без упоминания бренда, 3981 появление домена.
  12. HockeyStack. State of Revenue — 8500+ ответов, 36 компаний; 90% «сарафана» видели рекламу LinkedIn.
  13. Les Binet, IPA. Share of Search — корреляция с долей рынка 83%, 30 кейсов, 12 категорий, 7 стран.
  14. Google. Meridian MMM — рекомендация: 2–3 года недельных данных.

Частые вопросы

Чат-интерфейсы ChatGPT и Алисы обычно не передают referrer, поэтому такие визиты уходят в прямые заходы без пометки. Канал AI Assistants в GA4 ловит только сессии с читаемым реферером и по определению исключает AI Overviews и AI Mode — их клики Google считает органическим поиском. По данным панели Profound, опознаваемую метку источника несут лишь около 2,5% визитов после AI-упоминания. Референс-цифра корректна, но показывает нижнюю границу, а не полный эффект канала.

Нет. Прямые заходы включают закладки, ручной ввод адреса, мессенджеры, приложения, потерянные метки, приватные браузеры и почтовые клиенты. Часть AI-визитов физически неотличима от прочего Direct, но выделить их среди прямых заходов стандартными средствами невозможно. Подавать весь Direct как резерв AI-трафика нельзя.

Ответ генеративной системы недетерминирован: даже при нулевой температуре набор извлечённых документов, ранжирование и состояние кэша меняются. В собственном замере пять прогонов восьми запросов за десять минут дали совпадение наборов доменов 0,72 по Жаккару, и только 51,6% связок «запрос + домен» удержались во всех пяти прогонах. Одиночный прогон создаёт ложное ощущение точности.

Эта цифра из полевого эксперимента Агарвала и Сена посчитана условно, только для запросов, где AI-обзор сработал. Поскольку обзор появляется примерно в 41% поисков, в среднем по всем поискам падение органических кликов составляет около 18,5%, а рост бескликовых сессий — около 20,4%. Умножать 39,8% на 41% нельзя: процент считается от общего числа кликов, а запросы с обзором и без него имеют разную базовую кликабельность.

Сильно. В эксперименте на восьми потребностях и пяти формулировках каждой штраф за перефразирование составил в среднем 0,292 сверх обычного шума движка. У 35% пар «потребность + домен» одна формулировка давала источник во всех пяти повторах, а другая — ни в одном. Подрядчик, который сам формирует корзину промптов, существенно влияет на итоговый процент даже без намеренной манипуляции. Поэтому отчёт нельзя проверить без полного текста промптов, модели, числа повторов, дат и правил агрегации.

Не одиночный процент упоминаний, а вектор с известной неопределённостью: видимость с нижней байесовской границей (консервативная оценка присутствия), разложение динамики на эффект работы и эффект корзины промптов, три координаты устойчивости (повторы, перефразирование, время), период полураспада цитирования, разделение цитаты, поглощения и достоверности, и разность разностей для оценки собственных работ.

Публично описанного и валидированного метода прогноза AI-трафика для отдельного сайта нет. Метод Share of Search Леса Бине для похожих задач существует, но его перенос на AI-канал упирается в четыре барьера: не хватает истории наблюдений, доля AI-трафика тонет в шуме, видимость нельзя выключить по регионам для эксперимента, и нет аналога метрики с доказанной предсказательной точностью. Обзор GEO-исследований 2026 года прямо отмечает, что ни одна техника не показала устойчивого кроссплатформенного причинного эффекта.

Итог

В SEO позицию можно было наблюдать. В GEO приходится оценивать скрытую вероятность, устойчивость, поглощение источника и бизнес-эффект. Поэтому единица измерения нового поиска — не место и не процент упоминаний, а вектор показателей с известной неопределённостью.

Что можно обещать честно: измеримую видимость с указанной неопределённостью, разделённую динамику, наблюдаемые переходы как нижнюю границу и опрос как индикатор влияния. Что нельзя: процент видимости без корзины промптов, прогноз трафика, ROI канала и рост, не разложенный на работу и смену методики измерения.

А начать я советую с того, с чего начал сам. Откройте свой счётчик и проверьте, что лежит в поле источника. У меня там три недели лежал адрес той же страницы.

Нужен GEO-аудит без магического процента

Считаю видимость в нейросетях с указанной неопределённостью, разделяю работу и эффект корзины промптов, честно показываю, где данных не хватает. Если нужен second opinion по чужому GEO-отчёту или замер под ваш проект — можно обсудить напрямую.

Обсудить проект