Ошибки в robots.txt: Как фаундеры начали массово закрывать сайты от ИИ-ботов?
Никита Надолинский (к.т.н.)
CTO, Архитектор AI-Search и pSEO-систем.
Синтез сессии: Gemini 3.1 Pro | Обновлено: 06 сентября 2026.
Синтез сессии: Gemini
Какие ошибки и ненужные блокировки в Robots.txt могут привести к падениею трафика из Яндекс/Google-поиска и LLM (AI-Search)?
Никита, файл robots.txt — это первый рубеж архитектуры. Это API-шлюз между сервером и матрицей поисковиков.
В 2026 году ошибки в этом файле делятся на две категории: Классическое харакири (уничтожение рендеринга) и AI-Суицид (параноидальная блокировка LLM-ботов).
Давай препарируем самые фатальные баги, из-за которых фаундеры теряют трафик, даже не понимая, что их сайт технически невидим.
БЛОК 1: AI-Суицид (Блокировка RAG-краулеров)
Самая массовая эпидемия последних двух лет. Начитавшись новостей о том, что "нейросети воруют контент", фаундеры начали массово закрывать сайты от ИИ-ботов. Это стратегическая некомпетентность.
Если ты строишь GEO (Generative Engine Optimization) и хочешь, чтобы Perplexity или SearchGPT цитировали твой бренд, ты обязан пускать их краулеры.
Фатальные директивы (Что нельзя блокировать):
User-agent: GPTBot(Бот OpenAI для сбора данных).User-agent: OAI-SearchBot(Поисковый бот OpenAI — если закроешь, не попадешь в их поисковик).User-agent: PerplexityBot(Главный RAG-движок на рынке).User-agent: ClaudeBot(Бот Anthropic).User-agent: Google-Extended(Бот, собирающий данные для Gemini. Закроешь его — вылетишь из AI Overviews в Google).
Физика бага: RAG-система формирует ответ в реальном времени. Если Perplexity получает от твоего сервера отбой по robots.txt, он просто идет к твоему конкуренту, парсит его и ставит ссылку на него. Ты добровольно стираешь свой бизнес из ответов нейросетей.
БЛОК 2: Убийство Рендеринга (Headless Chrome Collision)
Googlebot и Яндекс.Робот давно перестали читать просто сырой HTML. Они заходят на сайт как полноценный Headless-браузер (рендеринг DOM-дерева).
Фатальная ошибка:
Disallow: /*.js$
Disallow: /*.css$
Disallow: /fonts/
Физика бага: Если ты заблокируешь ботам доступ к CSS-файлам (например, к твоему Q-Booster) и системному JavaScript, краулер попытается "собрать" страницу без них. Вместо твоей идеальной верстки он увидит сломанную кашу из 1998 года, где контент наезжает друг на друга, а элементы сдвинуты (CLS = 100). Алгоритм маркирует сайт как "Не оптимизирован для мобильных" (Mobile Usability Fail) и выбрасывает его из мобильной выдачи.
БЛОК 3: Блокировка API и JSON-эндпоинтов
Ты строишь Data-Driven pSEO. Твой фронтенд может подтягивать динамические таблицы комиссий или спредов через API.
Фатальная ошибка: Многие по старинке пишут:
Disallow: /api/
Disallow: /*.json$
Физика бага: ИИ-боты (особенно Gemini) обожают парсить чистые структурированные данные. Если твой сайт отдает классный JSON-LD или у тебя открытый /api/public/rates, бот вытащит из него цифры с нулевым когнитивным трением. Блокируя /api/, ты отрезаешь алгоритмам доступ к твоему самому плотному Information Gain.
БЛОК 4: Синтаксические коллизии (Слепой нож)
Robots.txt не понимает контекста, он понимает только строгое совпадение строк (String Matching).
Фатальная ошибка 1 (Ловушка слэша):
Disallow: /crypto— заблокирует не только папку/crypto/, но и важнейшую посадочную страницу/crypto-arbitrage-guide.html.- Патч: Если хочешь закрыть директорию, всегда ставь закрывающий слэш:
Disallow: /crypto/.
Фатальная ошибка 2 (Блокировка параметрических страниц с пользой):
Disallow: /*?*(запрет всех URL с параметрами).- Для классических сайтов это ок (режет дубли сортировки). Но, например, в pSEO хабе параметр может определять суть страницы (например,
?from=USDT&to=AED). Заблокировав параметры, ты убьешь 90% своего низкочастотного трафика.
Архитектурный Итог (Идеальный robots.txt для 2026 года)
Robots.txt должен быть максимально "тонким" и разрешительным (Permissive).
Ты блокируешь только:
- Админку (
/admin/). - Внутренние поисковые запросы по сайту (чтобы не генерировать мусорные дубли:
Disallow: /search?q=). - Корзину/Оформление заказа.
- Промежуточные стейты конвейера (если они светятся наружу).
Все остальное — CSS, JS, API, JSON-файлы, картинки и главное, всех AI-краулеров — нужно оставлять открытыми.
Ссылки по теме
Это реальная история!
Раздел со страницами CROSS-pages дополнительно привлек 18 090 пользователей за 9 месяцев.
На новом сайте. Без ссылок.