Индексация сайта: почему страницы нет в поиске
26 SEO

Индексация сайта: почему страницы нет в поиске

Если бы я получал по рублю за каждый вопрос «а почему моя страница до сих пор не появилась в поиске?», мне давно бы хватило на отдельный кофе-бар для всех друзей из SEO. Много лет копаюсь в этих задачах – и за это время выработался у меня очень упрямый (но рабочий!) маршрут проверки. Он вырос из множества реальных факапов — и сотен ночей с логами, когда клиента жмёт дедлайн, а сайт упрямо остаётся невидимкой.

В первую очередь копаюсь в технической доступности

Иногда причина буквально лежит на поверхности, но по опыту — где-то в трети случаев всё дело как раз тут. Открываю robots.txt: вдруг там какой-нибудь Disallow:/ перекрывает всю лавочку? Банальная ошибка: менял сайт домен или выкатывали новый раздел – «заглушку для разработки» забыли снять, робот месяцами пинается во входную дверь.

Следом гляжу мета-тег robots прямо на самой странице. Казалось бы, ерунда, но некоторые CMS способны творить дичь — автоматически ставят noindex для целых пластов страниц. Один интернет-магазин так умудрился потерять половину витрины: движок подозревал дублирование и щедро закрывал карточки товаров.

Canonical — тихий саботажник

Это следующая ловушка. Canonical придумали как способ бороться с дублями, но если ты (или шаблон сайта) ошибся с адресом — можно «подарить» свой трафик другому URL или вообще отправлять робота кругами по сайту. Я встречал сайты, где canonical на всех страницах был прописан на главную. Вуаля: почти весь контент как будто исчезает (видим его мы, а поисковик считает иначе — потому что сам так попросил!).

Яндекс Вебмастер и Google Search Console — ваши детекторы правды

Без инструментов диагностика превращается просто в пляски с бубном и гадание на костях логов. Search Console откройте раздел «Страницы» и забейте нужный URL через инструмент проверки страницы — сразу видите отмашку: «Просканировано, не индексировано», или «Обнаружено, не проиндексировано», или вообще «Страница с перенаправлением». В Яндекс Вебмастер — Инструменты — «Анализ индексации страницы».

Сценарий «Просканировано, не индексировано» всегда особенно любопытная головоломка. Это знак: робот приходил, смотрел… но решил не брать вас с собой в выдачу. Причины? Самые типичные: страница показалась ему или слабой копией чего-то уже существующего (дубли), или уровень контента ниже требований даже к базовой заметке на портале районной газеты («текста мало и он без смысла»), либо же просто ей трудно пробиться среди других разделов сайта.

Контент! Сухие крохи vs настоящая польза

Видели когда-нибудь страницу длиной три предложения и ни одного уникального смысла? Для человека — тоска зелёная, а уж для поискового алгоритма тем более нет повода сохранять её свежей в индексе. Google и Яндекс научились распознавать thin content настолько хорошо… Лучше потратить лишние полчаса на адаптацию информации под реальную задачу пользователя, чем потом переживать из-за пропавших карточек товаров с одинаковыми описаниями (реальная беда для интернет-магазинов). Если описания отличаются только названием и ценой — сто гарантий из ста такая страница проживёт недолго.

Что насчёт внутренних ссылок?

Вот часто забытая история! Страница есть физически… но ни одна другая часть сайта о ней не «знает». Поисковый бот ходит по ссылкам внутри самого сайта — если их нет (или до страницы путь длиннее железнодорожной ветки Москва-Владивосток), то вероятность индексации призрачно мала. На практике держу простое правило: любой полезный материал должен быть максимум в трёх кликах от главной страницы сайта. Советую прочитать мою статью на эту тему «Внутренняя перелинковка: простой способ усилить SEO».

Параметры URL и фильтры

Катастрофа современного e-commerce: фильтры разносят структуру URL’ов по бесконечности (?brand=x&color=blue…), один и тот же товар открывается под десятками адресов! Поисковик видит это как огромное болото дублей и может забить на весь раздел ради экономии сил (краулингового бюджета). Решение всегда комплексное: расставлять canonicals с умом, управлять параметрами через Search Console (указывать какие игнорировать), ну и cкромно закрывать служебные вариации через robots.txt.

Скорость загрузки

Подглядываю логи сервера на крупных сайтах — где бот обходит тысячи страниц ежедневно… Иногда вижу парадокс: ресурсы трачу на сканирование мусорных служебных адресов вместо важных категорий или новых заметок блога! Особенно весело это проявляется при медленном хостинге: если каждая страница грузится вечность – робот примерно через N секунд уходит дальше (ограничения никто не отменял).

Честно говоря, 9 случаев из 10 расследования заканчиваются находками уже на первых шагах. Остальные ситуации действительно требуют опытного покопаться (“глубокие воды возникновения”). И давайте честно: индексация никаких секретных клавиш не знает — всё упирается в качественную архитектуру сайта плюс человеческий контент без попытки обмануть роботов ради количества.

Разобраться реально можно всегда — panic OFF!