Метод Точного Входа OS
🎯 Кабинет директолога
← Все статьи

A/B-тесты в Директе: как тестировать честно

⚙️ Практика Директа·Денис Смагин··обновлено ·10 мин чтения
A/B-тесты в Директе: как тестировать честно
Коротко

A/B-тесты в Директе часто врут: алгоритм обучается быстрее конверсий. Нужно от 100 конверсий на вариант, чтобы отличить честный результат от случайного шума.

Честный A/B-тест в Директе — это тест, где на разницу в результате влияет только ваша гипотеза, а не автостратегия и не аукцион. Развести варианты по-настоящему честно сложнее, чем кажется: алгоритм обучается на лету и сам решает, какому объявлению или сегменту показываться чаще. Ниже — как это учитывать, сколько данных нужно для вывода и какими инструментами Директа тестировать без искажений.

Почему классический тест не работает в Директе

Классический A/B-тест держится на одном условии: оба варианта работают в одинаковых условиях, и разницу в результате объясняет только гипотеза. В Директе это условие часто нарушается на уровне аукциона — автостратегии подстраивают показы под то, что уже приносит конверсии, и делают это отдельно для каждого варианта в реальном времени. Вы сравниваете не креатив с креативом, а два независимых процесса обучения алгоритма — у каждого своя случайность.

При ручном управлении ставками разница в показах объяснялась только вашими настройками. Автостратегия же сама решает, кому и когда показать объявление, ориентируясь на прогноз конверсии — похожий принцип разобран в статье про AI-агентов в Директе. Если один вариант в первые часы случайно получил пару кликов с высокой вероятностью покупки, алгоритм начинает отдавать ему приоритет — не потому что вариант лучше, а потому что по нему накопилось больше сигнала. Дальше разрыв в показах только растёт, и сравнивать итоговый CTR или конверсию по двум вариантам с разным объёмом трафика уже некорректно. Отсюда путаница: тест «показал» победителя, а при повторном запуске результат переворачивается — потому что измерили не гипотезу, а стечение первых сигналов.

Что стоит тестировать

В Директе стоит тестировать то, что вы контролируете напрямую и что не пересекается с работой алгоритма: тексты и креативы объявлений, посадочную страницу, оффер и структуру кампании. Тестировать саму стратегию назначения ставок или разбивку аудиторий смысла обычно меньше — там решения принимает система, и вы измеряете не свою гипотезу, а её текущее поведение.

Хороший тест решает один спорный вопрос за раз, а не пытается сравнить всё сразу. Что обычно тестируют без риска исказить работу алгоритма:

  • заголовки и тексты объявлений — конкретные формулировки оффера и УТП;
  • креативы для РСЯ и Мастера кампаний — картинка, видео или их комбинация;
  • посадочная страница — куда ведёт клик: на квиз, лендинг или карточку товара;
  • оффер — цена, бонус, условие доставки, гарантия;
  • структура объявления — набор быстрых ссылок, уточнений, визитка.

Чем ближе элемент к «интерфейсу», которым управляете вы сами, тем чище тест. Примеры разбора конкретных гипотез по разным нишам — в подборке практических материалов по Директу.

Ловушка обучения алгоритма

Ловушка в том, что алгоритм переобучается быстрее, чем набирается статистика для вывода. Пока вы ждёте нужное количество конверсий на оба варианта, автостратегия уже перераспределила бюджет в пользу того, кто вырвался вперёд первым, — и продолжает усиливать разрыв. В результате вариант, который «победил», может быть просто тем, кому алгоритм отдал приоритет раньше, а не тем, что реально работает лучше.

Это системное свойство автостратегий, а не баг конкретной кампании — чем активнее алгоритм ищет конверсии, тем сильнее реагирует на ранний сигнал. Подробнее о том, как автотаргетинг перераспределяет показы внутри кампании, — в статье про автотаргетинг в Директе. Практический вывод: тест нельзя запускать в кампании, где уже работает активная автостратегия с накопленной историей по одному из вариантов. Новый вариант в такой кампании стартует в заведомо проигрышной позиции — у него нет истории, и алгоритм осторожничает с показами, пока не наберёт свой минимум данных. Из-за этого «тест» на самом деле сравнивает не креативы, а разный возраст истории по каждому варианту.

Сколько данных нужно для честного вывода

Прежде всего нужно достаточно конверсий на каждый вариант — трафика и кликов для вывода недостаточно, статистическая значимость считается по конверсиям, а не по показам. Чем меньше конверсий, тем выше шанс, что разница объясняется случайностью, а не реальной эффективностью варианта. Сколько денег и дней заложить на конкретную проверку, считает калькулятор бюджета на тест.

По общепринятому в CRO правилу ориентир — не меньше 100 конверсий на вариант, и это нижняя, а не комфортная граница: чем меньше базовая конверсия сайта, тем дольше придётся ждать этот объём. Для B2B или ниш с длинным циклом сделки, где на кампанию в месяц приходится десяток заявок, статистически честный тест может растянуться на несколько месяцев — это стоит учитывать перед запуском сравнения. Подробнее о специфике коротких выборок — в статье про Директ для B2B. Кроме объёма конверсий важна длительность: цикл теста должен захватывать хотя бы одну полную неделю, чтобы учесть разницу в поведении аудитории по дням, и желательно не пересекаться с праздниками или разовыми акциями, которые искажают спрос. Если конверсий физически мало, честнее признать, что A/B-тест не даст статистически надёжного ответа, и опираться на качественные сигналы — стоимость заявки, долю целевых обращений, отзывы менеджеров о качестве лидов.

Как разделить трафик, чтобы варианты не смешались

Трафик нужно делить так, чтобы один и тот же пользователь не попадал то в один, то в другой вариант, а аудитории двух вариантов не конкурировали между собой на аукционе. Проще всего это делает встроенный инструмент «Эксперименты» в Директе — он резервирует часть показов и жёстко делит её между вариантами случайным образом, не давая кампаниям соревноваться друг с другом за одного и того же пользователя.

Ручной способ — запустить два одинаковых по настройкам кампании и развести их по времени показа, региону или устройству — тоже работает, но хуже: обе кампании продолжают участвовать в одном аукционе и конкурировать за одну аудиторию, что искусственно поднимает ставки и снижает показы друг другу. Если делите трафик вручную, минимум разводите варианты по непересекающимся сегментам аудитории, а не запускайте близнецов с одинаковым таргетингом и разными объявлениями, которые начнут перебивать друг друга в реальном времени.

Инструмент «Эксперименты» в Директе

Раздел «Эксперименты» в Директе — штатный инструмент для сравнения вариантов кампании на одной аудитории без их конкуренции друг с другом. Вы создаёте два (или больше) варианта кампании с разными настройками — например, разными объявлениями или посадочными страницами, — а система делит показы между ними по заданной пропорции и считает результат по каждому варианту отдельно, не смешивая статистику.

Такой сплит устраняет главную проблему ручного теста — конкуренцию вариантов на одном аукционе за одного пользователя. Внутри эксперимента варианты не торгуются друг против друга, поэтому разница в результате объясняется разницей в настройках, а не тем, кто раньше получил сигнал для алгоритма. Из отчёта по эксперименту стоит смотреть не только на итоговую конверсию, но и на устойчивость разницы во времени — узкий разрыв в проценте конверсии при небольшой выборке сам по себе ничего не доказывает.

Тест посадочных страниц через Директ

Тестировать посадочные страницы через Директ можно, направляя трафик на два адреса поочерёдно или через эксперимент, но чище результат получается, когда сплит делает сам лендинг или отдельный сервис A/B-тестирования, а Директ просто гонит одинаковый по качеству трафик на оба варианта. Так вы отделяете эффективность страницы от эффективности объявления и таргетинга, которые в эксперименте Директа тоже могут случайно перекоситься.

Если сравниваете, например, лендинг и карточку товара в интернет-магазине, важно, чтобы оба варианта получали трафик из одинаковых по составу источников — одна кампания, одна аудитория, просто разные ссылки в объявлении. Разница в конверсии сайта тогда действительно про сайт, а не про то, что один вариант случайно получил более тёплую аудиторию. Пример такого подхода для розницы — в статье про Директ для интернет-магазина. Держите тест минимум одну-две недели, чтобы захватить полный цикл покупательского поведения, а не один удачный или неудачный день.

Частые ошибки

Самая частая ошибка — менять настройки во время теста: подправить ставку, добавить минус-слова или расширить аудиторию только в одном варианте. Любое такое вмешательство обнуляет чистоту сравнения, потому что вы уже не знаете, чем объясняется итоговая разница — гипотезой или правкой на полпути.

Другие ошибки, которые встречаются регулярно:

  • останавливать тест раньше срока, как только один вариант вырвался вперёд, — ранний лидер часто проигрывает после накопления полных данных;
  • сравнивать варианты с разным бюджетом или ставкой — тогда они изначально получают разный объём и качество показов;
  • тестировать несколько гипотез одновременно в одном объявлении — при разнице в результате непонятно, что именно сработало;
  • запускать тест в период всплеска или падения спроса — сезонность и разовые акции маскируют реальную разницу вариантов.

Каждая из этих ошибок по отдельности не критична, но вместе они превращают тест в источник случайных решений — вы вроде бы «проверили» гипотезу, а на деле измерили шум.

Как читать результат при небольшой разнице

Если разница между вариантами небольшая, а выборка скромная, скорее всего перед вами шум, а не явный победитель — на таких объёмах случайность легко объясняет весь разрыв. Прежде чем объявлять вариант лучшим, проверьте, устойчив ли результат хотя бы на протяжении недели, а не является ли он следствием одного удачного дня или одной крупной заявки, случайно попавшей в выборку.

Практический способ проверить устойчивость без сложной статистики — разбить период теста на две половины и посмотреть, сохраняется ли разница в обеих. Если в первую неделю побеждал вариант А, а во вторую — вариант Б, вывода пока нет, нужно больше данных. Если разница держится в одном направлении на разных отрезках времени и при разных объёмах трафика — это куда более веский аргумент, чем один суммарный процент в отчёте. При сомнении честнее продлить тест или запустить его повторно, чем сразу масштабировать «победителя» и потерять бюджет на решении, основанном на случайности.

Чек-лист честного теста

Честный тест в Директе строится на нескольких условиях одновременно: одна гипотеза за раз, изолированные друг от друга варианты, достаточный объём конверсий и отсутствие правок по ходу теста. Чек-лист, который стоит пройти перед запуском и во время эксперимента:

  • сформулирована одна гипотеза, а не пучок изменений сразу;
  • варианты разведены через «Эксперименты» или иной механизм без конкуренции на одном аукционе;
  • определён минимальный объём конверсий на вариант до старта, а не после;
  • бюджет и ставки одинаковы для обоих вариантов;
  • период теста захватывает не меньше недели и не пересекается с акциями и сезонными всплесками;
  • в кампанию не вносятся правки до завершения теста;
  • результат проверен на устойчивость — разбит на два периода и сверен на обоих.

Если хотя бы один пункт не выполняется, воспринимайте результат теста как гипотезу для следующей проверки, а не как готовое решение для масштабирования.

Если хотите не разбираться самому, а получить готовое — Отчёт клиенту по рекламе и сквозная аналитика Директа.

Частые вопросы

Можно ли тестировать в кампаниях с автостратегией?

Можно, но только через инструмент «Эксперименты» или с изолированными друг от друга вариантами — иначе автостратегия сама перераспределит показы в пользу того, кто раньше получил сигнал, и результат теста отразит не гипотезу, а поведение алгоритма.

Сколько должен длиться A/B-тест в Директе?

Минимум неделю, чтобы учесть разницу в спросе по дням недели, и дольше — если конверсий набирается мало. Ориентируйтесь не на календарный срок, а на набранный объём конверсий по каждому варианту.

Что делать, если конверсий физически недостаточно для статистики?

Признать, что классический A/B-тест здесь ненадёжен, и опираться на качественные сигналы — стоимость заявки, долю целевых обращений, обратную связь от отдела продаж, а тест использовать как один из аргументов, а не единственный.

Нужно ли останавливать тест сразу, как только виден явный лидер?

Нет — ранний лидер часто теряет преимущество после накопления полной статистики. Останавливать тест стоит по заранее определённому объёму данных, а не по первому впечатлению от отчёта.

Можно ли одновременно тестировать креатив и посадочную страницу?

Технически можно, но тогда при разнице в результате не получится понять, что сработало — объявление или страница. Для чистоты вывода тестируйте один элемент за раз.

Источники

ДС
Денис Смагин →

Специалист по платному трафику: Яндекс Директ и таргет ВКонтакте. 11 лет практики, больше 50 ниш — от угг и мороженого до онлайн-школ и авто. Все статьи пишу из своих проектов.

PRO-кабинет директолога

Это же делается за пару кликов

Разбор из статьи — ручная работа на каждом клиенте. В PRO-кабинете такие проверки идут по расписанию сами, а вам приходит короткий вывод: где поехало и что делать.

Проверьте на своих цифрах
Бесплатные инструменты директолога

Больше 50 бесплатных калькуляторов и аудитов: грейдер аккаунта, чистка площадок, минус-слова из запросов, экономика клиента. Без регистрации.

Читайте также