Оценки «видимости в ИИ» у разных сервисов расходятся на 200–300%, и проверить чужую цифру клиент не может. Единственный честный ответ на это — показать, как считаем мы, включая то, чего не умеем.
1. Почему один запрос — это не измерение
Языковые модели недетерминированы: один и тот же промпт даёт разные ответы даже при нулевой температуре — из-за маршрутизации между экспертами, обновлений индекса и серверного сэмплирования. Один запрос в день — лотерея, а не замер.
Каждый промпт опрашивается 3–5 раз за замер, метрики строятся как частоты по повторам и датам. Рядом с каждой цифрой едет data_quality: сколько проверок планировалось и сколько реально удалось. Частичный замер помечается честно, а не выдаётся за полный.
Что это меняет
При 3–5 повторах дневная видимость одного промпта имеет доверительный интервал шириной ±40–50 процентных пунктов. Показывать такую величину как «39,5%» — методологическая ошибка, и мы её не делаем: интервал показывается всегда.
2. Упоминание — не то же самое, что цитирование
Это два разных события, и они пересекаются примерно на треть.
Упоминание
Цитирование
Бренд назван в тексте ответа. Модель «знает» его из обучающего корпуса и упоминаний в вебе.
Конкретный URL приведён как источник. Это результат поиска в момент ответа.
Visibility Rate, Share of Voice, позиция, тональность, роль
Citation Rate, топ доменов и URL
Мы никогда не смешиваем эти группы. Бренд может рекомендоваться без единой ссылки на его сайт — и наоборот.
3. Интервалы вместо точек
Доли (видимость, цитируемость) — интервал Уилсона: он не ломается на малых выборках и на долях у нуля и единицы, в отличие от нормального приближения.
Share of Voice — отношение сумм, закрытой формулы для интервала нет, поэтому бутстрэп с ресемплингом на уровне ответов: числитель и знаменатель пересчитываются вместе, и бренды, упомянутые в одном ответе, остаются связанными.
Лидерство отмечается флагом только тогда, когда интервал лидера не пересекается с интервалом второго места. Иначе «обгон конкурента» лежит внутри шума, и показывать его как событие нельзя.
4. Судья проверяется, а не декларируется
Тональность и роль бренда — единственные метрики, которые не измеряются, а присуждаются моделью. Поэтому судья проходит проверку против разметки человека.
Доля совпадений доказательством не является: если 85% ответов нейтральны, модель, всегда отвечающая «нейтрально», совпадёт с человеком в 85% случаев, не умея ничего. Считается каппа Коэна — она вычитает согласие, которое получилось бы случайно.
Тональность — порядковая шкала, поэтому каппа взвешенная: спутать позитив с негативом хуже, чем позитив с нейтралом.
У каппы тоже есть интервал, и порог считается пройденным по его нижней границе, а не по точечной оценке.
Разметка слепая: вердиктов судьи в выгрузке нет, иначе размечающий просто с ними согласится.
Ответы Яндекса не судит Яндекс: модель систематически благосклоннее к своей экосистеме, поэтому судья всегда из другого вендора.
Порядок брендов в промпте судьи перемешивается — иначе первый в списке систематически получает другую оценку.
5. «Мы ничего не меняли — почему упало?»
Движки молча меняют поиск и ранжирование, и метрики клиента падают без единого его действия. На этот вопрос отвечают данные, а не догадки:
PSI на распределении цитируемых доменов показывает, что сменился пул источников, и кто именно занял место в выдаче.
CUSUM копит отклонения доли упоминаний, нормированные на ошибку дня: один слабый день не поднимает тревогу, несколько подряд — поднимают.
Стабильность промпта (медианный Jaccard источников между повторами) отвечает, не объясняется ли падение шумом самого промпта. Ниже 0,3 набор источников пересобирается почти заново — там нужно смотреть на тренд, а не на день.
6. «А наши правки сработали?»
Обычный статистический тест верен ровно один раз — при заранее объявленном размере выборки. Пользуются им иначе: смотрят каждый день и останавливаются, когда цифра нравится. При такой практике доля ложных срабатываний уходит с 5% к 30%.
Поэтому эффект интервенции оценивается always-valid тестом (mSPRT): на результат можно смотреть в любой момент и сколько угодно раз, уровень значимости от этого не портится. Окно «до» берётся той же длины, что и «после».
Проверено симуляцией
300 экспериментов, где эффекта нет, с ежедневным подглядыванием: обычный тест даёт 30% ложных срабатываний, mSPRT — 1% при заявленных 5%.
7. Что мы измеряем и чего не можем
Ограничения канала важнее красивых цифр, поэтому они названы прямо и едут в ответах API.
Прямого API к нейроответам Яндекса не существует
Мы используем официальный генеративный ответ Search API — ближайший официальный суррогат «Поиска с Алисой», но не идентичный тому, что видит пользователь в браузере. Канал замера маркируется в каждом ответе.
В API GigaChat и DeepSeek нет веб-поиска
Там мы измеряем знания модели — это валидно для брендовой видимости, но не для цитируемости. Каждый такой результат несёт пометку no_web_search.
Переходы из Алисы неотличимы от органики
В ответах Яндекса и Google AI Overviews ссылка ведёт с того же домена, что и обычная выдача. Любая цифра «трафик из Алисы», полученная из логов, была бы выдумкой, поэтому такие входы вынесены в отдельный разряд и в ИИ-трафик не засчитываются.
Трафик из остальных ИИ считается по серверным логам клиента: вход — это страница с внешним источником, внутренние клики и статика в знаменатель не попадают.
8. Воспроизводимость
Сырые ответы хранятся целиком, парсер версионируется — историю можно перепарсить новым парсером, и витрины пересоберутся идемпотентно.
Себестоимость каждого вызова записана вместе с версией тарифа.
Расписания и даты замеров живут в часовом поясе проекта, а не сервера.
Повторная развёртка или финализация замера не задваивает данные.