Как работать с файлом robots.txt
Файл robots.txt — это простой, но очень важный инструмент для управления тем, как поисковые роботы взаимодействуют с вашим сайтом. Он помогает подсказать, какие разделы можно сканировать, а какие лучше оставить закрытыми. Для небольшого сайта это способ навести порядок, а для крупного — необходимость, без которой легко потерять контроль над индексацией.
Разберемся, как работать с robots.txt правильно, какие директивы использовать и каких ошибок стоит избегать.
Что такое robots.txt
robots.txt — это текстовый файл, который размещают в корне сайта. Поисковые системы читают его перед сканированием страниц и следуют указанным в нем правилам.
Например, через этот файл можно:
- закрыть служебные разделы;
- не допустить индексирования страниц с фильтрами и параметрами;
- ограничить доступ к дубликатам;
- указать путь к карте сайта.
Важно понимать: robots.txt не удаляет страницы из поиска напрямую. Он лишь сообщает роботам, какие URL лучше не обходить. Если страница уже известна поисковику и на нее есть внешние ссылки, она может попасть в индекс даже при закрытии через robots.txt.
Где находится robots.txt
Обычно файл лежит по адресу:
https://site.ru/robots.txt
Именно этот путь ищут поисковые роботы. Если файл отсутствует, это не ошибка, но для сайта с десятками или сотнями страниц лучше создать его и настроить вручную.
Базовая структура файла
Файл robots.txt состоит из нескольких простых директив. Чаще всего используются такие:
User-agent— для какого робота задаются правила;Disallow— что запрещено сканировать;Allow— что разрешено внутри закрытого раздела;Sitemap— ссылка на XML-карту сайта.
Пример:
User-agent:
Disallow: /admin/
Disallow: /cart/
Allow: /admin/ajax.php
Sitemap: https://site.ru/sitemap.xml
В этом примере правила применяются ко всем роботам (). Закрыты папки admin и cart, но при этом один конкретный файл в admin разрешен.
Как писать правила
1. Определите, кто будет читать правила
Если вы хотите задать правила всем поисковым системам, используйте:
User-agent:
Если нужно обратиться к конкретному роботу, например Googlebot, укажите его отдельно:
User-agent: Googlebot
Disallow:
Это значит, что для Googlebot нет запретов.
2. Закрывайте только то, что действительно нужно
Не стоит запрещать слишком много. Ошибочно закрытые разделы могут навредить SEO и скрыть полезные страницы от сканирования.
Чаще всего закрывают:
- служебные папки;
- страницы входа в админку;
- внутренний поиск;
- корзину и оформление заказа;
- страницы с параметрами сортировки и фильтрации.
3. Используйте Disallow аккуратно
Пример запрета папки:
Disallow: /private/
Пример запрета отдельной страницы:
Disallow: /thank-you.html
Если после Disallow ничего не указано, значит сканирование разрешено:
Disallow:
Полезные примеры robots.txt
Закрыть административную часть
User-agent:
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Это один из самых частых вариантов для WordPress-сайтов.
Закрыть служебные страницы
User-agent:
Disallow: /search/
Disallow: /checkout/
Disallow: /cart/
Разрешить все, но указать карту сайта
User-agent:
Disallow:
Sitemap: https://site.ru/sitemap.xml
Такой вариант подходит, если ничего закрывать не нужно, но важно помочь роботам быстрее найти все страницы.
Частые ошибки
Работая с robots.txt, легко допустить неточность, которая потом мешает индексации. Вот самые распространенные ошибки:
-
Закрыть весь сайт случайно
Например, директиваDisallow: /запрещает сканирование всего сайта. -
Путать сканирование и индексацию
Robots.txt не гарантирует, что страница исчезнет из выдачи. -
Использовать robots.txt для конфиденциальных данных
Если информация действительно секретная, ее нужно защищать паролем или закрывать на уровне сервера, а не только через robots.txt. -
Забывать про карту сайта
БезSitemapпоисковикам сложнее находить важные страницы. -
Закрывать нужные CSS и JS-файлы
Иногда это мешает корректной оценке страницы поисковыми системами.
Как проверить robots.txt
После внесения изменений файл нужно обязательно протестировать. Для этого можно:
- открыть его в браузере по адресу
/robots.txt; - проверить синтаксис;
- убедиться, что нужные разделы действительно закрыты или открыты;
- протестировать файл в инструментах для вебмастеров.
Проверка особенно важна после редактирования, потому что одна лишняя строка может повлиять на весь сайт.
Когда robots.txt нужен особенно
Файл robots.txt особенно полезен, если сайт содержит:
- интернет-магазин с фильтрами;
- большое количество технических страниц;
- дубли URL с параметрами;
- административные разделы;
- внутренний поиск;
- тестовые или временные страницы.
Чем больше сайт, тем важнее грамотно управлять обходом страниц роботами.
Итоги
Файл robots.txt — это несложный, но мощный инструмент SEO-управления. Он помогает направить поисковых роботов, сократить лишнее сканирование и сделать сайт более понятным для поисковых систем.
Главное — использовать его осознанно: закрывать только ненужное, не путать сканирование с индексированием и всегда проверять результат после изменений. Если настроить robots.txt правильно, он станет надежной основой для технической оптимизации сайта.