Сбор семантики — та часть работы, которую я всегда любил меньше всего: механическая, долгая, но от неё зависит вся кампания. Сегодня связка «Вордстат + нейросеть» делает за час то, на что уходил день. При одном условии: вы понимаете, где ИИ ошибается, и проверяете эти места. Разберу процесс по шагам.
Шаг 1: базисы — головой, не нейросетью
Первая ошибка автоматизации — просить ИИ «собери запросы про кухни». Модель нагенерит правдоподобных фраз, половина из которых не имеет частотности вообще: люди так не ищут. Семантика начинается с реальных данных, а не с генерации.
Базисы (корневые маски) набрасываете сами: продукт, синонимы, жаргон, проблемы. Вот тут ИИ уже полезен как расширитель мышления: «назови 20 способов, как люди формулируют потребность в кухне на заказ, включая жаргон и ошибки» — из двадцати штук 5–7 окажутся углами, которые вы не вспомнили бы: «кухня по индивидуальным размерам», «гарнитур под нишу».
Шаг 2: частотности — только из Вордстата
Каждый базис прогоняется через Вордстат на реальные запросы и цифры. Это данные, их ничем не заменить — как выжимать из Вордстата максимум, есть отдельный гид. На выходе — сырая простыня в несколько тысяч фраз.
Шаг 3: чистка и кластеризация — вот тут ИИ король
Самая трудоёмкая часть — рассортировать простыню: мусор в минус-слова, остальное по группам со смыслом. Нейросеть делает это на удивление хорошо, если дать правильную инструкцию:
«Вот список запросов. Раздели на группы: 1) горячие коммерческие (купить/заказать/цена), 2) тёплые (выбор/сравнение), 3) информационные, 4) мусор для минусовки (халява, вакансии, своими руками, б/у). Внутри коммерческих сгруппируй по смыслу так, чтобы под каждую группу писалось одно объявление. Не выдумывай запросы, работай только со списком».
Последняя фраза обязательна: без неё модель «дополняет» список. Порциями по 300–500 фраз качество выше, чем простынёй.
Что получаете: готовую структуру групп, черновик минус-листа и разметку по теплоте — то есть скелет кампаний.
Шаг 4: проверка там, где ИИ падает
Три систематические ошибки, которые я ловлю в каждой сессии:
Омонимы и контекст ниши. «Кухня на металлокаркасе» модель может отнести к мебели, а это чаще про уличные конструкции. Всё, где вы сомневаетесь, — руками, модель ошибётся с вероятностью выше вашей.
Локальная специфика. Региональные формулировки и топонимы группируются криво: «кухни икеа бу авито» — это три минус-слова, а не группа.
Смешение интента в пограничных фразах. «Сколько стоит кухня на заказ» — информационный по форме, коммерческий по сути. Такие фразы модель раскидывает случайно; правило задайте явно: «вопросы о цене — в коммерческие».
Финальный проход глазами по группам обязателен: 15 минут на то, от чего зависит бюджет. Дочистить хвосты помогает чистилка семантики, а собрать минус-лист — генератор минус-слов.
Что в итоге по времени
Мой хронометраж на нише средней ширины (2–3 тысячи фраз): базисы — 20 минут, Вордстат — 20, кластеризация ИИ — 15, проверка — 30–40. Итого полтора часа против дня руками. Качество — сопоставимое, потому что все решения в спорных местах остались за человеком, а механику забрала машина.
Частые вопросы
Можно ли пропустить Вордстат и доверить сбор нейросети целиком?
Нет. Модель не знает частотностей и генерирует фразы, которые никто не ищет, — кампания на такой семантике сольёт бюджет на нулевые показы и кривой автотаргетинг. ИИ расширяет и сортирует, Вордстат даёт факты.
Какой промт для минус-слов?
«Из этого списка выбери запросы с намерением, которое нам не подходит: бесплатно, самостоятельно, вакансии, б/у, ремонт чужого, обучение. Выпиши минус-слова ФРАЗАМИ, объясни спорные». Объяснение спорных — важно: там видно, где модель поняла нишу неправильно.
Подходит ли процесс для РСЯ?
Для РСЯ семантика нужна короче и шире — без глубоких хвостов. Тот же процесс, но останавливайтесь на средне-частотных масках и просите ИИ группировать по интересам-сценариям, а не по точным формулировкам: в сетях таргетинг работает по смыслу, а не по вхождению.