Модель не «знает» ваш сайт — она читает его через краулеров. Если бот заблокирован, отдаёт пустой HTML или ждёт JavaScript, для ассистента страницы не существует, какими бы хорошими ни были тексты. Техническая подготовка занимает день-два, но без неё остальная работа по GEO не имеет смысла.
Кто именно ходит по вашему сайту
У каждой платформы несколько ботов с разными задачами: один собирает данные для обучения, другой строит поисковый индекс, третий открывает страницу по запросу пользователя прямо во время диалога. Открывать имеет смысл как минимум поисковых и «пользовательских» ботов — именно они приводят к цитатам.
| Платформа | User-agent | Зачем приходит | Рекомендация |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Индекс поиска ChatGPT | Открыть |
| OpenAI | ChatGPT-User | Читает страницу по запросу пользователя | Открыть |
| OpenAI | GPTBot | Данные для обучения моделей | Решение бизнеса |
| Perplexity | PerplexityBot | Собственный индекс Perplexity | Открыть |
| Perplexity | Perplexity-User | Переход по запросу пользователя | Открыть |
| Anthropic | Claude-SearchBot / Claude-User | Поиск и переходы из Claude | Открыть |
| Anthropic | ClaudeBot | Данные для обучения | Решение бизнеса |
| Googlebot | Поиск, AI Overviews и AI Mode | Открыть | |
| Google-Extended | Только обучение Gemini, на AI Overviews не влияет | Решение бизнеса | |
| Microsoft | Bingbot | Copilot и партнёрские ассистенты | Открыть |
| Яндекс | YandexBot | Поиск, Нейро и Алиса AI | Открыть |
Что писать в robots.txt
Правило простое: явно разрешайте поисковых ботов, а решение по «обучающим» принимайте осознанно.
Запрет GPTBot не уберёт вас из поиска ChatGPT, но и не защитит от цитирования — за это отвечает
OAI-SearchBot. Проверьте, что нет общего Disallow: / для неизвестных агентов: многие
шаблоны CMS и WAF добавляют его «на всякий случай».
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Claude-SearchBot
User-agent: Bingbot
Allow: /
User-agent: *
Disallow: /admin/
Sitemap: https://example.ru/sitemap.xml
Боты «по запросу пользователя» и CDN
ChatGPT-User, Perplexity-User и Claude-User открывают страницу, когда пользователь сам дал ссылку или задал вопрос именно о вашем сайте. Они могут не учитывать robots.txt — блокировать их бессмысленно, лучше следить за нагрузкой. Cloudflare в августе 2025 года обвинила Perplexity в скрытом краулинге под видом браузера, поэтому сверяйте логи с IP-диапазонами, которые публикуют OpenAI и другие платформы.
Отдельная тихая проблема — сама защита от ботов. Cloudflare с июля 2025 года по умолчанию закрывает ИИ-краулеров для новых доменов, а многие хостинги и анти-DDoS-сервисы отдают ботам JavaScript-заглушку вместо страницы. Симптом один: в логах есть заходы бота, а в ответах ассистента сайта нет. Проверяйте не только robots.txt, но и настройки WAF, «защиту от ботов», rate limit и гео-блокировки зарубежных IP.
Рендеринг, скорость и чистый HTML
Большинство ИИ-краулеров не исполняют JavaScript и не ждут загрузки данных из API. Всё, что должно цитироваться, обязано быть в первоначальном HTML: серверный рендеринг или статическая генерация. Контент в скрытых вкладках, аккордеонах и бесконечной прокрутке для модели часто невидим. Отдельно следите за временем ответа сервера: боты уходят по таймауту раньше людей.
llms.txt: что известно на самом деле
Файл llms.txt предложен в 2024 году как markdown-«оглавление» сайта для языковых моделей.
Google заявил, что не использует его (Гэри Илш, июль 2025); ни один крупный провайдер не подтвердил
применение в поиске, а по данным SE Ranking (2025) файл есть примерно у 10% доменов. Вывод: сделать
дёшево и вреда нет, но ждать эффекта не стоит — приоритет у открытых ботов и структуры страниц.
Что точно читают все платформы — разметку Schema.org с датами обновления, о ней следующая статья.
- robots.txt открыт для поисковых ИИ-ботов
- WAF и CDN не блокируют ИИ-краулеров
- Ключевой контент есть в HTML без JavaScript
- Ответ сервера быстрее 1 секунды
- Schema.org с датами публикации и обновления
- llms.txt указывает на 10–30 главных страниц
- Sitemap актуален и указан в robots.txt
- Сайт проверен в Bing Webmaster Tools и Яндекс Вебмастере
Как убедиться, что вас видят
Запросите страницу с user-agent нужного бота через curl и сравните ответ с тем, что видит
браузер. Посмотрите в логах сервера, приходят ли OAI-SearchBot и PerplexityBot и какие коды ответов
получают. И самое надёжное — спросите у ассистента с включённым поиском: «что написано на странице
example.ru/uslugi» и проверьте, читает ли он актуальную версию.