Раньше A/B-тест в Директе выглядел просто: два объявления в группе, ротация, через две недели победитель. Комбинаторика этот жанр похоронила — алгоритм сам тасует элементы, и «объявление А против объявления Б» больше не существует. Значит ли это, что тестирование умерло? Нет — оно переехало на уровни, где решения всё ещё за вами. Разберу, что тестировать в 2026-м и как не обмануть себя статистикой.
Что тестировать бессмысленно
Отдельные заголовки в комбинаторных группах — алгоритм сам решает, что и кому показывать, ваши «50 на 50» он игнорирует. Смотрите отчёт по сборкам и меняйте слабые элементы, но это отбор, не эксперимент.
Мелочи при малом трафике. Тест «синяя кнопка против зелёной» при 100 визитах в день потребует полгода до достоверности. За полгода изменится сезон, аукцион и сам Яндекс. Тестируйте крупное: оффер, посадочную, стратегию.
Что тестировать стоит: три уровня
Офферы. Самый прибыльный уровень: «скидка 20%» против «замер и проект бесплатно», цена на первом экране против квиза. Разница между офферами бывает двукратной по конверсии — ни одна настройка кампании столько не даёт. Механика: две посадочные или две версии первого экрана, трафик делится экспериментом.
Посадочные. Лендинг против квиза, длинная страница против короткой. Тест решает споры с клиентом лучше любых мнений — цифры вместо «мне кажется».
Стратегии и структуры. Оплата за конверсии против оплаты за клики, пакетная стратегия против раздельных, белый список РСЯ против открытых сетей. Тестируются последовательно (месяц так, месяц так) или на параллельных кампаниях с делением бюджета — грубее, но быстрее.
Инструмент: Эксперименты Директа
Для честного деления трафика в Директе есть штатные эксперименты (через Яндекс Аудитории): аудитория режется на доли, каждая видит свою версию кампании, пересечений нет. Это правильный способ сравнивать стратегии и посадочные — без него вы сравниваете «март против апреля» и приписываете сезонность своим правкам.
Настройка занимает полчаса: создаёте эксперимент, задаёте доли (обычно 50/50), привязываете кампании-варианты. Дальше — самое сложное: не лезть до накопления данных.
Сколько ждать и как считать достоверность
Главная ошибка тестов — ранний вывод. «За три дня вариант Б дал 8 заявок против 5» — это не результат, это шум. Минимальные рамки, которых я держусь:
- По 30–50 конверсий на вариант — раньше даже не открывайте калькулятор.
- Полные недели (сравнивать вторник-пятницу с субботой-понедельником нельзя).
- Проверка достоверности калькулятором, а не глазами: разница 20% на 40 конверсиях — это монетка. Считайте в калькуляторе A/B-теста или через байесовский калькулятор — он честнее отвечает на вопрос «какова вероятность, что Б лучше».
И фиксируйте гипотезу до старта письменно: «меняем X, ждём рост конверсии в заявку». Тест без записанной гипотезы всегда «что-то показывает» задним числом — это самообман, я на нём ловил и себя.
Частые вопросы
Сколько трафика нужно для теста посадочных?
Считайте от конверсий: нужно 30–50 на вариант. При конверсии 5% это 600–1000 визитов на вариант. Меньше трафика — тестируйте радикальные различия (другой оффер, другой формат страницы): крупные эффекты видны на меньших выборках.
Можно ли тестировать без Экспериментов — просто месяц одно, месяц другое?
Можно, но грязно: сезонность, аукцион и обучение стратегий смешиваются с эффектом. Годится для грубых решений с большой ожидаемой разницей. Всё тонкое — только параллельным делением трафика.
Алгоритм сам всё оптимизирует — зачем мне тесты?
Алгоритм оптимизирует внутри того, что вы ему дали: ваши элементы, ваша посадочная, ваша стратегия. Выбор между принципиально разными вариантами — оффер, формат страницы, модель оплаты — он за вас не сделает. Тесты — это способ кормить алгоритм лучшим сырьём.