Что делать с сайтом

Краулеры ИИ, robots.txt и llms.txt

У каждой ИИ-платформы несколько ботов: для обучения и для поиска. Кого пускать, кого закрывать и что на самом деле известно про llms.txt.

Модель не «знает» ваш сайт — она читает его через краулеров. Если бот заблокирован, отдаёт пустой HTML или ждёт JavaScript, для ассистента страницы не существует, какими бы хорошими ни были тексты. Техническая подготовка занимает день-два, но без неё остальная работа по GEO не имеет смысла.

Кто именно ходит по вашему сайту

У каждой платформы несколько ботов с разными задачами: один собирает данные для обучения, другой строит поисковый индекс, третий открывает страницу по запросу пользователя прямо во время диалога. Открывать имеет смысл как минимум поисковых и «пользовательских» ботов — именно они приводят к цитатам.

Платформа User-agent Зачем приходит Рекомендация
OpenAI OAI-SearchBot Индекс поиска ChatGPT Открыть
OpenAI ChatGPT-User Читает страницу по запросу пользователя Открыть
OpenAI GPTBot Данные для обучения моделей Решение бизнеса
Perplexity PerplexityBot Собственный индекс Perplexity Открыть
Perplexity Perplexity-User Переход по запросу пользователя Открыть
Anthropic Claude-SearchBot / Claude-User Поиск и переходы из Claude Открыть
Anthropic ClaudeBot Данные для обучения Решение бизнеса
Google Googlebot Поиск, AI Overviews и AI Mode Открыть
Google Google-Extended Только обучение Gemini, на AI Overviews не влияет Решение бизнеса
Microsoft Bingbot Copilot и партнёрские ассистенты Открыть
Яндекс YandexBot Поиск, Нейро и Алиса AI Открыть
Основные ИИ-краулеры по состоянию на 2025 год. Названия — из официальной документации платформ.

Что писать в robots.txt

Правило простое: явно разрешайте поисковых ботов, а решение по «обучающим» принимайте осознанно. Запрет GPTBot не уберёт вас из поиска ChatGPT, но и не защитит от цитирования — за это отвечает OAI-SearchBot. Проверьте, что нет общего Disallow: / для неизвестных агентов: многие шаблоны CMS и WAF добавляют его «на всякий случай».

User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Claude-SearchBot
User-agent: Bingbot
Allow: /

User-agent: *
Disallow: /admin/
Sitemap: https://example.ru/sitemap.xml

Боты «по запросу пользователя» и CDN

ChatGPT-User, Perplexity-User и Claude-User открывают страницу, когда пользователь сам дал ссылку или задал вопрос именно о вашем сайте. Они могут не учитывать robots.txt — блокировать их бессмысленно, лучше следить за нагрузкой. Cloudflare в августе 2025 года обвинила Perplexity в скрытом краулинге под видом браузера, поэтому сверяйте логи с IP-диапазонами, которые публикуют OpenAI и другие платформы.

Отдельная тихая проблема — сама защита от ботов. Cloudflare с июля 2025 года по умолчанию закрывает ИИ-краулеров для новых доменов, а многие хостинги и анти-DDoS-сервисы отдают ботам JavaScript-заглушку вместо страницы. Симптом один: в логах есть заходы бота, а в ответах ассистента сайта нет. Проверяйте не только robots.txt, но и настройки WAF, «защиту от ботов», rate limit и гео-блокировки зарубежных IP.

Рендеринг, скорость и чистый HTML

Большинство ИИ-краулеров не исполняют JavaScript и не ждут загрузки данных из API. Всё, что должно цитироваться, обязано быть в первоначальном HTML: серверный рендеринг или статическая генерация. Контент в скрытых вкладках, аккордеонах и бесконечной прокрутке для модели часто невидим. Отдельно следите за временем ответа сервера: боты уходят по таймауту раньше людей.

llms.txt: что известно на самом деле

Файл llms.txt предложен в 2024 году как markdown-«оглавление» сайта для языковых моделей. Google заявил, что не использует его (Гэри Илш, июль 2025); ни один крупный провайдер не подтвердил применение в поиске, а по данным SE Ranking (2025) файл есть примерно у 10% доменов. Вывод: сделать дёшево и вреда нет, но ждать эффекта не стоит — приоритет у открытых ботов и структуры страниц. Что точно читают все платформы — разметку Schema.org с датами обновления, о ней следующая статья.

  • robots.txt открыт для поисковых ИИ-ботов
  • WAF и CDN не блокируют ИИ-краулеров
  • Ключевой контент есть в HTML без JavaScript
  • Ответ сервера быстрее 1 секунды
  • Schema.org с датами публикации и обновления
  • llms.txt указывает на 10–30 главных страниц
  • Sitemap актуален и указан в robots.txt
  • Сайт проверен в Bing Webmaster Tools и Яндекс Вебмастере
Чек-лист технической готовности — проверяйте раз в квартал и после каждого переезда сайта

Как убедиться, что вас видят

Запросите страницу с user-agent нужного бота через curl и сравните ответ с тем, что видит браузер. Посмотрите в логах сервера, приходят ли OAI-SearchBot и PerplexityBot и какие коды ответов получают. И самое надёжное — спросите у ассистента с включённым поиском: «что написано на странице example.ru/uslugi» и проверьте, читает ли он актуальную версию.

Узнайте, что ИИ говорит о вас сейчас

Оставьте адрес сайта — вернёмся с короткой диагностикой по трём платформам и предложением по аудиту. Ответим в течение одного рабочего дня.

  • Почта hello@startgeo.ru
  • Telegram @startgeo
  • Режим работы в рабочие дни с 10:00 до 19:00 по Москве
Без рассылок. Отвечаем лично.