Сайта нет в поиске: как найти причину
Сайта может не быть в поиске вовсе, а может быть — но далеко за первой страницей. Это разные поломки, и чинятся они разным.
ИндексацияТехническая проверка
Сначала — что именно случилось
Не найти себя по названию компании ещё не значит выпасть из индекса. Впереди могут стоять тёзки, агрегаторы и карты. А иногда поиск счёл запрос коммерческим и показал магазины.
Наберите в строке поиска site:example.ru, подставив свой домен. Яндекс и Google смотрите отдельно: индексы у них расходятся сильно. Сотни страниц в одном при десятке в другом никого не удивляют. Пустая выдача значит, что домена в индексе нет вовсе. Выдача заметно короче сайта — потерялась часть.
Где написана причина
Оператор говорит только, сколько страниц в индексе. Почему именно столько — прямым текстом написано в панели вебмастера.
В Яндекс Вебмастере: «Индексирование» → «Страницы в поиске», вкладка «Исключённые». В Google Search Console: отчёт «Страницы», блок «Страницы не проиндексированы». Против каждого адреса стоит причина: «Запрещена в robots.txt», «Страница с редиректом», «Обнаружена, не проиндексирована», «Дубль без канонической страницы». Дальше остаётся снять то, что там названо.
Панелей ещё нет — начинайте с них. Права на домен подтвердите файлом в корне сайта или записью в DNS.
Домену несколько недель
Самый частый случай и самый безобидный. В день запуска сайт в поиске не появляется: робот сначала узнаёт адрес, обходит страницы и только потом решает, что из обойдённого берёт в индекс. Между «робот был» и «страница в выдаче» проходят недели.
Ускорить это можно тремя способами:
- отправьте
sitemap.xmlв панель вебмастера; - пошлите главные страницы на переобход руками;
- получите ссылку с чужого живого сайта — по ней робот придёт раньше карты.
Платная «ускоренная индексация» и прогоны по каталогам не дают роботу ничего, чего у него нет.
Роботу запрещено читать сайт
Файл /robots.txt робот читает первым. Строка
User-agent: *
Disallow: /
закрывает домен целиком. Её ставят на время разработки и забывают снять при переезде на боевой адрес.
Файл открывается по адресу example.ru/robots.txt и не требует ничьих доступов. Заодно посмотрите шаблоны: Disallow: /catalog закрывает не только /catalog/, но и /catalog-2026, и /catalogue. Правило работает по началу строки, а не по папке.
Страницам запрещено показываться в поиске
Страница открывается, а в поиске её нет. Показывать её запрещает строка <meta name="robots" content="noindex"> в шапке кода. Снаружи такой запрет не виден — откройте исходный код страницы и поищите noindex. Тот же запрет приходит в заголовке X-Robots-Tag, и его видно только на вкладке «Сеть» в инструментах разработчика.
Здесь же различие, которое путают чаще всего. Disallow в robots.txt запрещает роботу читать страницу, noindex — показывать её в выдаче. Закрытая в robots.txt страница может остаться в выдаче без описания, одной ссылкой: поиск узнал о ней со стороны, а прочитать запрет ему не разрешили.
Значит, убрать страницу из поиска — это поставить noindex и снять запрет в robots.txt. Иначе робот до запрета не дойдёт.
Все страницы объявлены копиями главной
Канонический адрес говорит поиску, какой из адресов настоящий. В коде это тег <link rel="canonical" href="…">. Обычно он показывает сам на себя, и это нормально.
Поломка выглядит так: на всех страницах канонический адрес ведёт на главную. Поиск делает то, о чём его попросили: держит в индексе одну главную, остальное считает копиями. Так после обновления ведут себя некоторые шаблоны и плагины. Откройте код страницы, найдите canonical и сверьте с адресом в строке браузера.
На страницу не ведёт ни одной ссылки
Страница открывается, но попасть на неё можно только из письма или закладки. Робот ходит по ссылкам, и адрес, на который внутри сайта не ссылается ничто, для него почти не существует. Чаще всего так теряются карточки товаров из-под фильтра и старые посадочные из рекламы.
Поставьте на неё ссылку из меню, раздела или соседнего материала. sitemap.xml сообщает роботу адрес, а внутренняя ссылка — ещё и то, что адрес важен.
Сервер отвечает роботу иначе, чем вам
У вас страница открывается, а робот получает 404 или 500. Так бывает из-за защиты от автоматических запросов, кэша, отдельной мобильной версии, переадресации по региону.
Что именно получил робот, показывают «Проверить URL» в Search Console и «Проверка ответа сервера» в Вебмастере. Сюда же относится содержимое, которое собирает скрипт в браузере. Выключите JavaScript и откройте страницу: пусто у вас — скорее всего, пусто и у робота.
Порядок действий
site:в обеих поисковых системах.- Панель вебмастера, список исключённых страниц.
robots.txt.- Код страницы:
noindex, канонический адрес. - Ответ сервера для робота.
- Внутренние ссылки на потерявшиеся разделы.
Сверху то, что проверите за минуту сами. Снизу — то, ради чего придётся звать разработчика. Половина случаев закрывается на третьем пункте.
После правки поиск перестраивается не сразу. Отправьте исправленные адреса на переобход, обновите даты в карте сайта и дайте роботу вернуться. Ничего не изменилось за месяц — причина осталась, ищите заново.