Технологии Разработка Дизайн Рост Аналитика
Продвижение и рост

Как настроить robots.txt и sitemap.xml на сайте 1С-Битрикс?

Пошаговый гайд: robots.txt и sitemap.xml через модуль SEO Битрикс, абсолютный Sitemap:, Allow для CSS/JS, проверка в Яндекс Вебмастере и Google Search Console.

Максим Мольков
6 мин. 42
Как настроить robots.txt и sitemap.xml на сайте 1С-Битрикс?

Карта сайта в админке 1С-Битрикс уже "зеленая", а в Яндекс Вебмастере - красная строка: "URL запрещен в robots.txt" или "Некорректный формат URL файла Sitemap". Чаще всего виноват не генератор sitemap, а старый robots.txt с http вместо https или путем `/sitemap.xml` без домена. За один проход вы обновите оба файла через модуль SEO, пропишете абсолютный Sitemap и проверите результат в Вебмастере и Google Search Console.

robots.txt - текстовый файл в корне сайта с правилами обхода для роботов (User-agent, Disallow, Allow, Sitemap); sitemap.xml - XML-карта URL для подсказки индексации. На 1С-Битрикс:Управление сайтом оба настраиваются модулем "Поисковая оптимизация": robots - Маркетинг → Настройка robots.txt, sitemap - генератор с автоправкой robots и лимитом 50 000 URL / 50 МБ по sitemaps.org. Сегодня откройте robots.txt, замените строку Sitemap на абсолютный https-URL и прогоните URL каталога в анализаторе Вебмастера.

Речь про сайт на 1С-Битрикс:Управление сайтом, а не про Bitrix24 CRM. robots.txt и sitemap.xml не поднимают позиции сами по себе, но без них робот может не найти новые страницы или тратить crawl budget на служебные разделы.

Что такое robots.txt и sitemap.xml

Схема связки robots txt и sitemap xml для индексации сайта на Битрикс

robots.txt - "охранник у двери": он говорит роботу, какие пути обходить (Allow), какие нет (Disallow) и где карта сайта (Sitemap). sitemap.xml - список важных URL: робот быстрее находит новые страницы на больших каталогах.

Когда нужно: публичный сайт с каталогом или блогом, после переезда на https, когда в Вебмастере мало обнаруженных URL. Когда не нужно: закрытый интранет или одностраничник - тогда хватит noindex на страницах.

Файл Задача Где в Битрикс
robots.txt Правила crawl, директива Sitemap Маркетинг → Поисковая оптимизация → Настройка robots.txt
sitemap.xml Список URL для индексации Тот же раздел → Карта сайта
sitemap index Несколько частей при >50 000 URL Автоматически через SitemapIndex в модуле seo

Настройте стартовый robots.txt для Битрикс

Шаблон Disallow и Allow для robots txt на 1С-Битрикс

На Битрикс закрывают `/bitrix/`, `/personal/`, `/search/`, корзину и фильтры с `?PAGEN`, но нельзя блокировать CSS и JS - без них Google видит страницу "пустой".

Делайте: Disallow для служебных путей и Allow для `/bitrix/*.css`, `/bitrix/*.js`. Не делайте: Disallow: / на весь сайт или блок `/upload/`, если там лежит sitemap.

User-agent: *
Disallow: /bitrix/
Allow: /bitrix/*.css
Allow: /bitrix/*.js
Disallow: /personal/
Disallow: /search/
Disallow: /*?PAGEN
Sitemap: https://example.ru/sitemap.xml
Host: https://example.ru

Строка Sitemap в robots.txt не заменяет отправку в Google Search Console: GSC показывает "обнаружено / проиндексировано" и ошибки по URL, которые discovery через robots не выводит.

Откройте генератор robots.txt в админке

Путь: Маркетинг → Поисковая оптимизация → Настройка robots.txt (с версии 14 модуля SEO - без FTP).

  1. Откройте раздел и проверьте поле "Карта сайта" - одна строка с https и каноническим доменом.
  2. На вкладках Yandex и Google сверьте Host; Crawl-delay для Google не обязателен.
  3. Добавьте Allow для CSS/JS, если стоит Disallow: /bitrix/.
  4. Удалите старые строки Sitemap с http или вторым доменом - Bitrix может оставить дубль (SEO_SITEMAP_RUN_ROBOTS_WARNING).
  5. Сохраните и откройте `https://ваш-домен/robots.txt` - ответ HTTP 200, не редирект на главную.

Делайте: править robots после смены PROTOCOL в настройках сайта. Не делайте: оставлять `Sitemap: /sitemap.xml` - Яндекс выдаст "Некорректный формат URL файла Sitemap".

Создайте sitemap.xml штатным генератором

Генератор sitemap xml в админке 1С-Битрикс с опцией добавить в robots txt

Генератор: Маркетинг → Поисковая оптимизация → Карта сайта. Классы `Bitrix\Seo\SitemapFile` и `Bitrix\Seo\RobotsFile` собирают абсолютный URL из PROTOCOL и DOMAIN.

  1. Создайте настройку: отметьте публичные инфоблоки каталога, блога, новостей.
  2. Включите автогенерацию при изменении контента, если сайт обновляется часто.
  3. Отметьте "Добавить правило в robots.txt" - ядро добавит SITEMAP_RULE через `RobotsFile::addRule`.
  4. Запустите генерацию - файл `https://домен/sitemap.xml` должен отдавать HTTP 200.
  5. При >50 000 URL или >50 МБ модуль создаст sitemap index; в robots укажите URL индекса.
  6. На крупных каталогах настройте cron `seo_sitemap_run.php` - на VPS у Beget cron в панели задается за минуту, проверьте PHP CLI.

Делайте: валидировать XML в Вебмастере до отправки. Не делайте: править сгенерированные части sitemap вручную.

Свяжите robots.txt и sitemap без конфликтов

Типичная ошибка: sitemap прописан в robots, но Disallow закрывает `/sitemap.xml`. Workflow: обновили robots → curl sitemap → анализатор → отправка в GSC.

Симптом Что сделать
Некорректный формат URL Sitemap `Sitemap: https://канонический-домен/sitemap.xml`
URL запрещен в robots.txt Убрать Disallow на путь sitemap или добавить Allow
Две строки Sitemap Оставить одну актуальную после переезда домена
Couldn't fetch в GSC Проверить HTTP 200, без 404/500 и лишних редиректов

robots.txt управляет обходом (crawl), meta noindex - индексом. Disallow не гарантирует удаление URL, если он уже известен роботу из sitemap или ссылок.

Проверьте файлы в Яндекс Вебмастере

Индексирование → Анализ robots.txt - вставьте URL каталога и карты, статус "разрешено". Затем Файлы Sitemap: добавьте `https://домен/sitemap.xml`.

  1. Загрузите robots в анализатор, исправьте ошибки из справочника Вебмастера.
  2. В "Анализ файлов Sitemap" проверьте XML - ответ сервера за 10 секунд, код 200.
  3. Убедитесь, что нет статуса "URL запрещен в robots.txt".

Делайте: сверять Host с основным зеркалом. Не делайте: игнорировать предупреждение о дублях Sitemap после автогенерации.

Отправьте sitemap в Google Search Console

GSC → Indexing → Sitemaps → `sitemap.xml`. Отдельно откройте robots.txt report в Settings и проверьте строку Sitemap.

  1. Выберите ресурс с https-версией домена, не http.
  2. Отправьте `sitemap.xml` или URL sitemap index для больших каталогов.
  3. Через 1-3 дня сверьте "Discovered" и ошибки валидации по URL.
  4. После правок robots перезапросите sitemap, если статус "Couldn't fetch".

Делайте: использовать оба канала - robots и GSC. Не делайте: отправлять http-версию карты после перехода на https.

Пройдите финальный чеклист перед публикацией

  1. Откройте `https://домен/robots.txt` и `https://домен/sitemap.xml` - оба HTTP 200.
  2. Проверьте одну строку Sitemap с абсолютным https-URL.
  3. Прогоните URL каталога и статьи блога в анализаторе robots - "разрешено".
  4. Отправьте sitemap в GSC и Вебмастер, дождитесь статуса без критических ошибок.
  5. Убедитесь, что Allow для CSS/JS на месте при Disallow: /bitrix/.

После crawl-файлов проверьте соседние сигналы: микроразметка Schema.org, Core Web Vitals и GEO-чеклист статьи. UTM-метки не меняют robots.txt - это отдельный слой аналитики.

Нужен аудит технического SEO - контакты mv-blog. Другие гайды - в разделе продвижение и рост.

Автор: Максим Мольков, digital-стратег, автор mv.digital.
Источники: 1С-Битрикс: robots.txt, генерация sitemap, справочник ошибок robots.txt (Яндекс), протокол sitemaps.org.

Частые вопросы

Что такое robots txt?

robots.txt - файл в корне сайта: робот читает User-agent, Disallow, Allow и Sitemap перед обходом. На Битрикс правят в Маркетинг → Поисковая оптимизация → Настройка robots.txt и проверяют анализатором Вебмастера.

Нужен ли sitemap для SEO?

Sitemap не ранжирует сам по себе, но ускоряет discovery новых URL. Для блога или большого каталога карта почти обязательна. Сгенерируйте sitemap.xml в модуле SEO, пропишите абсолютный URL в robots и отправьте в GSC и Вебмастер.

Как проверить robots txt?

Откройте `https://домен/robots.txt` - HTTP 200. Затем анализатор в Яндекс Вебмастере и robots.txt report в GSC. Тестовый URL каталога - "разрешено". Ошибка формата Sitemap - замените относительный путь на полный https-URL.

Можно ли указать Sitemap: /sitemap.xml?

Нет: Яндекс требует полный URL с протоколом, например `Sitemap: https://example.ru/sitemap.xml`. В Битрикс поле "Карта сайта" и опция "Добавить правило в robots.txt" подставляют https автоматически - сверьте после сохранения.

Как создать sitemap xml на Битрикс?

Маркетинг → Поисковая оптимизация → Карта сайта → настройка, инфоблоки, генерация. Ядро использует Bitrix\Seo\SitemapFile и SitemapIndex. Включите автогенерацию и SITEMAP_RULE в robots через RobotsFile::addRule.

Что закрывать в robots txt на Битрикс?

Disallow для /bitrix/, /personal/, /search/, корзины и ?PAGEN. Allow для /bitrix/*.css и /bitrix/*.js. Не закрывайте путь к sitemap.xml и не ставьте Disallow: / на весь сайт при нужной индексации.

Robots.txt или meta noindex - что выбрать?

robots.txt - обход (crawl); meta noindex - индекс. Для служебных страниц лучше noindex. Disallow не удаляет URL из индекса, если робот уже знает адрес. Crawl-файлы и UTM-метки в рекламе - разные задачи.

Автор
Максим Мольков

Автор блога «Всё о Digital»: технологии, разработка, дизайн и рост продуктов. Практические разборы без воды — понятно новичкам, полезно профи.

Вся рубрика