1. Что подтверждает OpenAI
В актуальном FAQ для издателей OpenAI указывает: чтобы контент можно было находить, показывать, корректно цитировать и снабжать ссылкой в поиске ChatGPT, не следует блокировать OAI-SearchBot. Там же отдельно описывается отслеживание переходов из ChatGPT через utm_source=chatgpt.com.
Это описание доступности, а не обещание, что конкретный URL обязательно появится в ответе.
2. Почему одного robots.txt недостаточно
Даже разрешённый User-agent может получить 403/429 от CDN, WAF, антибота или геофильтра. Поэтому я проверяю не только файл правил, но и фактическую доступность публичных URL, server logs при наличии и поведение защитного слоя.
Особенно важно, чтобы ключевые факты были доступны в основном HTML и не требовали авторизации, сложного пользовательского действия или закрытого API.
3. Разделить OAI-SearchBot и GPTBot
Названия crawler легко смешать, но задачи различаются. Управление поисковым обнаружением и управление потенциальным использованием контента для обучения — разные решения. Политика сайта должна отражать бизнес-цель, а не копировать чужой robots.txt.
4. Что делать после технической доступности
Я проверяю страницы, которые реально могут быть источниками: характеристики, цены/условия, документацию, кейсы, профили экспертов, исследования и ответы на конкретные вопросы. Для каждого важны ясный URL, актуальность, авторство и отсутствие конфликтующих фактов на самом сайте.
Затем строится контрольный prompt set и измеряются упоминания, цитаты и referral traffic отдельно.
Что проверяет Владимир Николаев
- Проверить правило OAI-SearchBot в robots.txt.
- Убедиться, что WAF/CDN не блокирует фактический запрос.
- Отделить политику OAI-SearchBot от GPTBot.
- Проверить, что ключевые факты доступны без JavaScript-only барьеров и авторизации.
- Настроить сегмент переходов с utm_source=chatgpt.com.
Что проверять в официальной документации
Для меняющихся поисковых и AI-функций 21SEO отделяет практическую интерпретацию от подтверждённых требований платформ.