📘 Руководство Общая информация

Как отстроиться от агрегаторов, когда поиск отбирает набор страниц

Поиск отбирает не самую релевантную страницу, а набор дополняющих друг друга источников. Что это меняет в работе с контентом, почему рерайт перестал ранжироваться и как находить темы, которых нет у конкурентов.

Двадцать лет SEO строилось на одном допущении: поиск оценивает страницу и сравнивает её с другими такими же. Отсюда рерайт, наращивание объёма, охват ключей. Исследования по отбору подмножеств данных описывают другую логику: система собирает комплект источников, где каждый следующий элемент добавляет к предыдущим что-то новое. Разница принципиальная. Ниже о том, что при таком отборе происходит с типовым текстом и как перестраивать страницы, если конкурент — агрегатор с бюджетом.

GIST: что это на самом деле и чего в нём нет

GIST расшифровывается как Greedy Independent Set Thresholding. Алгоритм разработали исследователи Google Research Мортеза Задимогаддам и Мэтью Фарбах, препринт лежит на arXiv под номером 2405.18754 с мая 2024 года, работу представили на NeurIPS 2025, а развёрнутый разбор Google Research опубликовал 23 января 2026 года.

Задача алгоритма — отобрать из большого массива компактное подмножество, которое одновременно полезно и не состоит из почти одинаковых элементов. Прикладная область в самой публикации указана прямо: прореживание обучающих выборок, когда из миллионов примеров нужно оставить тысячи без потери качества модели.

Здесь пересказы обычно и искажают исходник. GIST даёт гарантию: результат не хуже половины оптимального решения. Плюс доказано, что гарантировать больше 0,56 от оптимума — задача NP-трудная. Обе цифры относятся к доле от идеального набора, а не к «полезности контента на 56 процентов». В благодарностях к работе упомянуты Google DeepMind и YouTube, а команда YouTube Home применяла родственный принцип максимизации минимального расстояния между рекомендациями: пользователю, который посмотрел ролик, показывают не десять почти таких же.

Чего в публикации нет: свидетельств, что этот конкретный алгоритм работает в веб-выдаче. Признаков того, что поиск и генеративные ответы отбирают источники с оглядкой на их взаимную непохожесть, накопилось достаточно, но выдавать GIST за действующий фактор ранжирования некорректно. Практическая ценность здесь в другом. Логика отбора набора описана математически, её можно взять как рабочую модель и проверить на своих страницах.

Почему поиску экономически выгодно резать дубли

Сканирование, рендеринг и хранение индекса стоят денег на каждом этапе, и дубликаты в этой смете — чистый убыток. Отсюда движение в сторону более жёсткого отбора того, что вообще попадает в обработку.

3 февраля 2026 года Google переписал документацию по своим краулерам и указал лимит на размер файла для HTML и текстовых форматов в 2 МБ вместо прежних 15 МБ. Для PDF лимит 64 МБ, для краулеров без отдельно указанного значения по умолчанию остаётся 15 МБ. Компания подала это как уточнение документации, а не как изменение поведения, но следствие для практики одно: инлайновые картинки, встроенные скрипты и раздутая разметка съедают лимит, после чего чтение обрывается без предупреждения, и текст ниже отсечки поиск просто не увидит.

Второй слой издержек — рендеринг. Разбор чистого HTML дёшев, запуск браузерного движка с отрисовкой страницы дорог, поэтому до второго прохода доходит не всё подряд. Третий слой относится к генеративным ответам: у модели ограниченное окно, и если пять отобранных источников пересказывают одно и то же, бюджет уходит впустую вместо того, чтобы охватить разные грани вопроса.

Практики отдельно отмечают пессимизацию на уровне паттернов: сканер разбирает часть однотипных карточек, не находит в них ценности и распространяет вывод на остальную выборку. Проверить это со стороны сложно, но поведение согласуется с логикой экономии.

Рерайт закончился, и вот почему

Проверка текстовой уникальности сравнивает буквы, слова и фразы. Отбор по смыслу сравнивает векторы: текст превращается в точку многомерного пространства, и близость измеряется расстоянием между точками. «Мама мыла раму» и «родительница очищала раму» окажутся в этом пространстве соседями, хотя ни одно слово не совпало.

Из этого следует несколько вещей, неприятных для привычного производства контента:

  • Синонимайзинг и перестановка абзацев не создают нового смысла. Показатель уникальности 95% и семантический дубль спокойно уживаются в одном тексте.
  • Перевод чужой статьи с другого языка даёт примерно тот же набор векторов, что и оригинал.
  • Объём перестал быть аргументом. Страница на 5000 слов, где уникального смысла набирается на 200, проигрывает пятистам словам, в которых каждый абзац что-то добавляет.
  • Хорошо написанный текст, повторяющий содержание топа, остаётся заменяемым. Качество формулировок работает на читателя и поведенческие метрики, но не создаёт причины показать эту страницу вдобавок к уже отобранным.

Рабочий критерий вместо «сколько ключей закрыли» звучит так: если убрать эту страницу из выдачи и заменить любым конкурентом из топа, что именно потеряет человек? Если ответ «ничего конкретного» — дальше можно не оптимизировать.

Как искать пустые координаты

Методика не требует ничего, кроме выдачи и внимательности.

Соберите 10–20 результатов по целевому запросу. Полные тексты не нужны, достаточно сниппетов и скелета заголовков: H1, H2, H3. Именно каркас показывает, как конкуренты делят тему на части.

Выпишите все тезисы построчно и посчитайте, у скольких источников встречается каждый. Дальше выборка расслаивается сама:

  • Ядро избыточности — темы с частотой 7–15 из 20. Про амортизацию и вес беговых кроссовок написали все, туда лезть бессмысленно: набор уже закрыт, и место в нём достанется самым авторитетным доменам по сигналам, которые к тексту отношения не имеют.
  • Пустые координаты — темы с частотой 0–2, при этом релевантные исходному запросу. Как отличить реплику от оригинала, что происходит с товаром через год использования, когда стандартный совет не срабатывает, чем оборачивается ошибка при выборе.

Разные формулировки одного смысла считаются вместе. «Технические характеристики», «Обзор параметров» и «Что внутри» — это один тезис, а не три, и три четверти выборки, сложившиеся в одну точку, выглядят разнообразными только при поверхностном взгляде.

Живые вопросы, которых нет в SEO-статьях, лежат в обсуждениях на форумах и в тематических тредах, в отзывах на карточках, в обращениях в собственную поддержку. Там человек формулирует то, что действительно хочет узнать перед покупкой, а не то, что удобно вписать в подзаголовок.

Ловушка разнообразия ради разнообразия

Отличаться от конкурентов недостаточно, потому что в отборе участвуют оба слагаемых: непохожесть и польза. Разница видна на примерах:

Уникально, но бесполезноУникально и полезно
Коричневый шнурШнур 1,2 м, отсек для намотки излишка в основании
Удобная красная кнопкаМеханизм кнопки рассчитан на 15 000 нажатий, гарантия на узел 10 лет
Корпус из нержавеющей сталиДвойные стенки работают как термос, снаружи корпус не нагревается выше 40 °C
Стильный современный дизайнКружка 200 мл закипает за 40 секунд, полный объём 1,7 л — за 4 минуты

Левая колонка тоже отличается от конкурентов, но не снимает ни одной неопределённости при выборе. Признаки полезного блока: помогает принять решение, разводит варианты между собой, называет ограничения и исключения, показывает, когда типовой совет не работает. Признаки пустого: констатирует очевидное, пересказывает запрос другими словами, начинается с общего вступления и определения термина.

Чем брать агрегаторы

У маркетплейсов шаблонная подача и деньги на всё остальное. Соревноваться с ними в бюджете бессмысленно, зато шаблон — это уязвимость: миллионы карточек сделаны по одной схеме и в векторном пространстве лежат кучно.

Визуал

Стандарт агрегатора — товар на белом фоне, студийный свет, ракурс три четверти. Отстройка работает через съёмку, которой там не бывает: макро с фактурой материала и качеством сварного шва, товар в реальном интерьере вместо белого циклорамы, разборка на составные части с показом того, что внутри — какой стоит нагреватель, как выполнена пайка, есть ли герметизация.

Архитектура характеристик

Цифры у всех одинаковые, потому что берутся из паспорта производителя. Менять их нельзя, а вот группировать можно иначе: не столбцом «мощность, объём, материал», а по сценариям применения. Одна модель для тех, кто заваривает зелёный чай при 80 °C, другая для семьи с маленькими детьми, третья для тех, кому нужна одна кружка за 40 секунд перед выходом. Достоверность не страдает, а смысловая структура документа перестаёт совпадать с шаблоном агрегатора. Карточка при этом превращается из витрины в экспертный разбор.

Цитируемость в генеративных ответах

Там мест не десять, а два-три, и конкуренция идёт между источниками за право быть процитированным. Агрегаторы транслируют данные производителя, которые модель уже видела на сотнях сайтов, поэтому ценность нового такого же источника близка к нулю. Работают два приёма.

Первый — сравнительные утверждения вместо описаний. Не «у чайника носик гусиная шея», а «в отличие от модели A, у модели B носик формы гусиная шея, который даёт ламинарную струю для пролива через воронку». Модель получает готовую связку, которой нет в исходных данных производителя.

Второй — собственные измерения. Секундомер и время закипания кружки, шумомер на смартфоне и уровень децибел на разных стадиях нагрева, пересчёт ста циклов кипячения в рубли по местному тарифу. Такие числа физически не существуют больше нигде, их невозможно получить рерайтом, и человеку при выборе они полезнее строки «мощность 2200 Вт».

Конкуренция внутри собственной страницы

Дубли бывают не только между сайтами. Страница схлопывает сама себя, когда несколько блоков решают одну информационную задачу: вводный абзац повторяет то, что скажет таблица, сравнение дублирует список отличий, а внизу висит абзац под «незакрытые ключи», написанный теми же словами, что и середина текста.

Дисциплина простая: одна мысль встречается на странице один раз, в самой сильной формулировке. Остальные повторы удаляются. После чистки освобождается место, и туда идут недостающие узлы, те самые пустые координаты. Самое ценное поднимается в начало страницы.

Как прогонять это через языковую модель

Ручной разбор двадцати конкурентов занимает часы, поэтому механику логично переложить на LLM. Тут есть несколько деталей, без которых результат разваливается.

Не давайте модели ссылки, давайте файлы

Страницу конкурента лучше сохранить в Markdown и приложить файлом. По разборам, которые ходят среди практиков, при переходе по ссылке чат-бот читает порядка 5–6 тысяч знаков, а если в шапке и меню висят десятки ссылок, доля прочитанного падает до трети от этого объёма. Чужие замеры со стороны не проверишь, но направление совпадает с опытом: очищенный Markdown разбирается заметно полнее, чем живой URL. Расширения для сохранения в Markdown ставятся в браузер одной кнопкой и настраиваются под нужные блоки страницы.

Прикладывайте то, чего нет у конкурентов

Инструкция производителя в PDF, спецификация, сертификаты, вопросы из поддержки, отзывы. Прогон на одних конкурентах и прогон с приложенным паспортом дают разный результат: из документации вылезают ограничения по минимальному и максимальному объёму заливки, порядок первого запуска, правила повторного нагрева и очистки. Ничего из этого нет у конкурентов по одной причине: инструкцию никто не открывал.

Первый ответ не финальный

Рабочий цикл состоит из четырёх режимов: разбор конкурентов с картой избыточности, проектирование структуры, написание текста, аудит готового результата по блокам. Аудит почти всегда находит и лишнее, и пропущенное, после чего структура пересобирается. Один прогон без аудита даёт заметно более слабую страницу.

Вычитывайте глазами

Автоматический конвейер здесь не работает. Модель уверенно выдумывает правдоподобные характеристики, которых у товара нет, а цена такой ошибки в коммерческой карточке выше любой экономии времени. Ещё момент про язык: один и тот же промпт с одинаковыми данными отрабатывает по-разному для русскоязычной, англоязычной и испаноязычной ниши, поэтому нишу, язык и регион задавайте явно.

Что делать в понедельник

  1. Возьмите одну страницу, которая застряла в третьем-пятом десятке, и десять конкурентов из топа по её запросу.
  2. Сохраните все одиннадцать в Markdown, выпишите заголовки и посчитайте частоту тезисов.
  3. Отметьте ядро избыточности — из него ваша страница состоит примерно целиком.
  4. Найдите три-пять пустых координат и проверьте каждую на пользу: снимает ли она неопределённость при выборе.
  5. Придумайте один замер, который можно провести за пять минут, и проведите его. Секундомер, весы, шумомер в телефоне.
  6. Сожмите повторы до одного упоминания, освободившееся место отдайте новым узлам, самое ценное поднимите вверх.
  7. Проверьте вес готовой страницы: если разметка с инлайновыми ресурсами подбирается к двум мегабайтам, вынесите лишнее.
  8. Через две-три недели сверьте позиции. Практики отмечают, что в Яндексе изменения проявляются раньше, чем в Google.

Считать теперь приходится не покрытие ключей, а узлы смысла, которых нет у конкурентов. И каждый такой узел проверять вторым вопросом: нужен ли он кому-то, кроме вас.

GIST алгоритм GIST Google семантическая уникальность отстройка от агрегаторов AI Overviews ранжирование набора страниц рерайт не работает узлы смысла

Редакция «SEO Разум»

Разбираем SEO и нейросети на практике: проверяем сервисы на своих проектах, сверяем цены и лимиты с первоисточниками и пишем то, что можно применить в тот же день.

📚 Справочник по SEO и ИИ 🔄 Материалы обновляются 🕐 Обновлено: 11 сентября 2026

Читать по теме

Весь раздел →