robots.txt и sitemap.xml: зачем они и как проверить
Два служебных файла, с которых поисковый робот начинает знакомство с сайтом. Ошибка в одной строке первого способна убрать сайт из выдачи целиком — и заметить это можно через месяц.
С чего начинает робот
Оба файла лежат в корне сайта и доступны любому: наберите свой адрес и добавьте /robots.txt или /sitemap.xml. Если открывается страница ошибки — файла нет.
Что делает robots.txt
Это указание роботам, куда ходить не надо. Обычно закрывают служебные разделы: админку, корзину, результаты поиска по сайту, страницы с параметрами. Смысл в том, чтобы робот тратил силы на нужные страницы, а мусор в выдачу не попадал.
Самая дорогая ошибка в интернете выглядит так:
- Disallow: / — эта строка закрывает от поиска весь сайт целиком.
Появляется она обычно после разработки: сайт делали на тестовом домене, закрыли от индексации, выложили в бой и забыли убрать. Сайт работает, посетители заходят по прямым ссылкам, а из поиска он тихо исчезает. Замечают через месяц, когда падает трафик.
Что делает sitemap.xml
Карта сайта — это список адресов, которые вы хотите видеть в поиске. Робот находит страницы и сам, переходя по ссылкам, но карта помогает ему не пропустить те, на которые ссылок мало.
- Обязательной карта не является — сайт будет индексироваться и без неё.
- Особенно полезна на больших сайтах и там, где страницы появляются часто.
- В карту включаются только те адреса, которые открыты для индексации. Закрытая в robots.txt страница в карте — противоречие, и поисковик о нём сообщит.
- Адрес карты принято указывать в самом robots.txt строкой Sitemap: — так робот найдёт её наверняка.
Зачем нужен canonical
Одна и та же страница почти всегда доступна по нескольким адресам: со слэшем и без, с www и без, с параметрами от рекламы. Для человека это одна страница, для поисковика — несколько разных с одинаковым содержимым.
Тег canonical в коде страницы говорит: главный адрес вот этот, остальные считайте копиями. Без него поисковик выбирает сам, и выбирает не всегда то, что вы бы хотели.
Проверить просто: откройте страницу по двум разным адресам и посмотрите, указан ли в обоих случаях один и тот же canonical. Мы проверяем его наличие на каждой странице.
Быстрая проверка своими руками
- Откройте /robots.txtУбедитесь, что в нём нет строки Disallow: / без уточнений. Это первое, что стоит смотреть после любой переделки сайта.
- Откройте /sitemap.xmlПроверьте, что файл открывается и в нём ваши настоящие адреса, а не адреса тестового домена.
- Сверьте одно с другимСтраниц, закрытых в robots.txt, в карте быть не должно.
- Загляните в ВебмастерИ Яндекс, и Google показывают, сколько страниц в индексе и какие исключены. Резкое падение этого числа — сигнал тревоги.
Частые вопросы
Обязателен ли файл robots.txt?
Строго говоря, нет — без него робот считает, что можно ходить везде. Но на практике он нужен: без него в выдачу попадают служебные страницы, корзины и результаты поиска по сайту.
Как проверить, не закрыт ли сайт от индексации?
Откройте адрес вашего сайта с добавлением /robots.txt. Строка Disallow: / без уточнений закрывает весь сайт. Заодно проверьте мета-тег robots на самих страницах.
Нужна ли карта сайта маленькому сайту?
Для сайта из нескольких страниц с нормальной перелинковкой она не критична: робот найдёт всё сам. Польза растёт с числом страниц.
Проверяете ли вы эти файлы?
Да. Мы запрашиваем robots.txt и sitemap.xml один раз на сайт и проверяем canonical на каждой обойдённой странице — это раздел поисковой видимости в отчёте.
Проверьте свой сайт
Двадцать одна проверка по 152-ФЗ, безопасности и техническому состоянию. Первая страница — бесплатно, без регистрации.