Методология измерений

Оценки «видимости в ИИ» у разных сервисов расходятся на 200–300%, и проверить чужую цифру клиент не может. Единственный честный ответ на это — показать, как считаем мы, включая то, чего не умеем.

1. Почему один запрос — это не измерение

Языковые модели недетерминированы: один и тот же промпт даёт разные ответы даже при нулевой температуре — из-за маршрутизации между экспертами, обновлений индекса и серверного сэмплирования. Один запрос в день — лотерея, а не замер.

Каждый промпт опрашивается 3–5 раз за замер, метрики строятся как частоты по повторам и датам. Рядом с каждой цифрой едет data_quality: сколько проверок планировалось и сколько реально удалось. Частичный замер помечается честно, а не выдаётся за полный.

Что это меняет
При 3–5 повторах дневная видимость одного промпта имеет доверительный интервал шириной ±40–50 процентных пунктов. Показывать такую величину как «39,5%» — методологическая ошибка, и мы её не делаем: интервал показывается всегда.

2. Упоминание — не то же самое, что цитирование

Это два разных события, и они пересекаются примерно на треть.

УпоминаниеЦитирование
Бренд назван в тексте ответа. Модель «знает» его из обучающего корпуса и упоминаний в вебе. Конкретный URL приведён как источник. Это результат поиска в момент ответа.
Visibility Rate, Share of Voice, позиция, тональность, роль Citation Rate, топ доменов и URL

Мы никогда не смешиваем эти группы. Бренд может рекомендоваться без единой ссылки на его сайт — и наоборот.

3. Интервалы вместо точек

4. Судья проверяется, а не декларируется

Тональность и роль бренда — единственные метрики, которые не измеряются, а присуждаются моделью. Поэтому судья проходит проверку против разметки человека.

Доля совпадений доказательством не является: если 85% ответов нейтральны, модель, всегда отвечающая «нейтрально», совпадёт с человеком в 85% случаев, не умея ничего. Считается каппа Коэна — она вычитает согласие, которое получилось бы случайно.

5. «Мы ничего не меняли — почему упало?»

Движки молча меняют поиск и ранжирование, и метрики клиента падают без единого его действия. На этот вопрос отвечают данные, а не догадки:

6. «А наши правки сработали?»

Обычный статистический тест верен ровно один раз — при заранее объявленном размере выборки. Пользуются им иначе: смотрят каждый день и останавливаются, когда цифра нравится. При такой практике доля ложных срабатываний уходит с 5% к 30%.

Поэтому эффект интервенции оценивается always-valid тестом (mSPRT): на результат можно смотреть в любой момент и сколько угодно раз, уровень значимости от этого не портится. Окно «до» берётся той же длины, что и «после».

Проверено симуляцией
300 экспериментов, где эффекта нет, с ежедневным подглядыванием: обычный тест даёт 30% ложных срабатываний, mSPRT — 1% при заявленных 5%.

7. Что мы измеряем и чего не можем

Ограничения канала важнее красивых цифр, поэтому они названы прямо и едут в ответах API.

Прямого API к нейроответам Яндекса не существует
Мы используем официальный генеративный ответ Search API — ближайший официальный суррогат «Поиска с Алисой», но не идентичный тому, что видит пользователь в браузере. Канал замера маркируется в каждом ответе.
В API GigaChat и DeepSeek нет веб-поиска
Там мы измеряем знания модели — это валидно для брендовой видимости, но не для цитируемости. Каждый такой результат несёт пометку no_web_search.
Переходы из Алисы неотличимы от органики
В ответах Яндекса и Google AI Overviews ссылка ведёт с того же домена, что и обычная выдача. Любая цифра «трафик из Алисы», полученная из логов, была бы выдумкой, поэтому такие входы вынесены в отдельный разряд и в ИИ-трафик не засчитываются.

Трафик из остальных ИИ считается по серверным логам клиента: вход — это страница с внешним источником, внутренние клики и статика в знаменатель не попадают.

8. Воспроизводимость