Гайд · llms.txt · AI-видимость

Как создать llms.txt для сайта:пошаговый гайд под ответы нейросетей

Файл в корне, карта URL и проверка без мифов — чтобы нейросети видели ваши сильные страницы

Канал Maya Pro в Telegram

Файл llms.txt — это короткая Markdown-карта вашего сайта для нейросетей и AI-агентов. Его кладут в корень домена по адресу https://ваш-сайт.ru/llms.txt, рядом с привычными robots.txt и sitemap.xml. Формат предложил Jeremy Howard (Answer.AI / fast.ai) в сентябре 2024; канон описан на llmstxt.org.

Зачем он нужен владельцу сайта из России? Чтобы агент, IDE или человек через чат с ИИ быстрее нашли ваши сильные материалы: курсы, гайды, FAQ, кейсы. Файл не заменяет контент и не поднимает позиции в Яндексе или Google сам по себе. Он помогает машине не блуждать по тысячам URL и не путать черновики с каноном.

site-root — zsh
$ cat /llms.txt
# H1 → summary → секции → Optional

$ curl -I https://site.ru/llms.txt
# HTTP/2 200 · text/plain; charset=utf-8

$ ./check_robots_ai.sh
# GPTBot / ClaudeBot: Allow

Что такое llms.txt и зачем его кладут в корень сайта

10–20ключевых URL в карте
<20 KBориентир размера индекса
200 OKобязательная проверка

Файл llms.txt — это короткая Markdown-карта вашего сайта для нейросетей и AI-агентов. Его кладут в корень домена по адресу https://ваш-сайт.ru/llms.txt, рядом с привычными robots.txt и sitemap.xml. Формат предложил Jeremy Howard (Answer.AI / fast.ai) в сентябре 2024; канон описан на llmstxt.org.

Маркер: простыми словами. llms.txt — это не «волшебный SEO-файл», а понятный список: кто вы, о чём сайт и какие страницы читать первыми. Как меню для модели, а не как гарантия места в выдаче.

Зачем он нужен владельцу сайта из России? Чтобы агент, IDE или человек через чат с ИИ быстрее нашли ваши сильные материалы: курсы, гайды, FAQ, кейсы. Файл не заменяет контент и не поднимает позиции в Яндексе или Google сам по себе. Он помогает машине не блуждать по тысячам URL и не путать черновики с каноном.

Чем llms.txt не является (и почему его путают с SEO-магией)

Его часто путают с тремя вещами:

  1. Не robots.txt. Robots говорит ботам «можно / нельзя ходить». Llms.txt говорит «вот смысл и приоритет страниц».
  2. Не sitemap.xml. Sitemap перечисляет много URL для поиска. Llms.txt — узкая карта 10–20 важных ссылок с короткими пояснениями.
  3. Не фактор ранжирования Google. В открытых заявлениях Google отдельно отмечал: для AI Overviews и AI Mode специальные AI-файлы не нужны. Обещания «+30–60% цитируемости только от файла» обычно переносят цифры из других исследований GEO — к самому файлу в корне они не относятся.

Ещё один миф: «ChatGPT, Claude и Perplexity уже фоном качают llms.txt со всех сайтов». По замерам трафика AI-ботов фоновые визиты к /llms.txt ничтожны (порядка долей процента). Реальная польза сегодня чаще в другом слое: когда агент или IDE читает файл по запросу, а не когда «бот проиндексировал ночью».

Маркер: простыми словами. GEO (Generative Engine Optimization) — это работа над тем, чтобы ваш сайт и бренд чаще попадали в ответы нейросетей. Llms.txt — один маленький рычаг внутри GEO, а не вся стратегия.

Кому файл реально нужен: сайт, блог, лендинг курса

Файл имеет смысл, если у вас есть что показывать как канон:

  • корпоративный сайт с услугами и кейсами;
  • блог или медиа с сильными лонгридами;
  • лендинг курса, документации продукта, базы знаний;
  • SaaS и docs, где coding-агенты (Cursor, Claude Code и аналоги) часто берут /llms.txt и /llms-full.txt с документации.

Если сайт — одна визитка на три абзаца без полезных страниц, файл можно сделать «для порядка», но чуда не будет: цитировать почти нечего.

Коротко: llms.txt = навигация для ИИ. Контент = то, что цитируют. Без живых страниц карта пустая.

llms.txt vs robots.txt: два разных языка для машин

Оба файла живут в корне, оба «для машин» — и на этом сходство заканчивается. Путать их — частая ошибка новичков.

Что говорит robots.txt краулерам и AI-ботам

robots.txt — правила доступа. Строки вроде User-agent и Disallow говорят боту: ходи сюда или не ходи. Для AI-видимости важно не закрыть нужных ботов, если вы хотите, чтобы они могли читать сайт: GPTBot, ClaudeBot, Google-Extended, PerplexityBot, Anthropic-AI (список сверяйте с актуальной политикой сервисов).

Если в robots запретить GPTBot, а в llms.txt красиво расписать «читайте наш блог» — вы сами противоречите себе.

Что говорит llms.txt моделям про смысл и приоритет страниц

Llms.txt не «разрешает» и не «запрещает» обход. Он даёт:

  • название проекта (обязательный H1);
  • краткое описание в blockquote;
  • секции со ссылками - название: пояснение;
  • особую секцию Optional — то, что можно пропустить, если контекста мало.

Маркер: простыми словами. Optional — это полка «по желанию». Агент при нехватке места может эти URL не читать. В основную карту кладите только то, без чего сайт понять нельзя.

Ожидаемый сценарий по спецификации — чтение «по запросу» (inference / on-demand), а не обучение модели с нуля на вашем файле.

Типичная ошибка — закрыть важное в robots и ждать цитирования

Схема провала выглядит так:

  1. В llms.txt указали сильный гайд.
  2. В robots.txt тот же раздел закрыли Disallow.
  3. Ждёте, что нейросеть «увидит файл и процитирует».

Итог: карта есть, доступ к страницам нет. Сначала откройте важные разделы ботам (если политика компании это позволяет), потом указывайте их в llms.txt.

Карта AI-видимости

От канонических URL до ответа нейросети

Не sitemap целиком и не «магия файла» — цепочка: отобрать страницы → собрать llms.txt → открыть путь ботам → проверить 200 → дать моделям понятный указатель.

  • 15–50 канонических URL с живыми описаниями
  • robots.txt — отдельный язык: доступ, не смысл
  • Публичный /llms.txt без редиректа и HTML-обёртки

Дальше разберём каркас файла: поля, тон ссылок и что класть в Optional.

Пайплайн · цикл ~42 с

Из чего состоит рабочий llms.txt: поля, ссылки, тон

Спецификация простая. Порядок секций:

  1. опциональный BOM (обычно не нужен новичку);
  2. один H1 — имя сайта или продукта (единственная строго обязательная секция);
  3. blockquote > — краткий summary (на практике почти обязателен для нормального файла);
  4. свободный Markdown без новых заголовков — доп. контекст;
  5. один или несколько H2 со списками ссылок;
  6. при необходимости H2 с именем ровно Optional.

Ориентиры по размеру индекса: держите файл компактным — примерно 2–5 KB, часто 10–20 ключевых ссылок, ориентир валидаторов меньше 20 KB. Content-Type: text/plain; charset=utf-8 или text/markdown. Ответ сервера — HTTP 200, без авторизации и без лишних редиректов. Ссылки — абсолютные https://.... Без HTML-тегов и вложенных списков.

Минимальный каркас: название, описание, ключевые URL

Минимальный рабочий каркас выглядит так:

# Название проекта

> Одна-две фразы: чем занимаетесь и для кого сайт.

Короткий абзац без новых заголовков: что важно знать агенту.

## Основные страницы

- Главная (https://example.ru/) — чем занимается компания
- Услуги (https://example.ru/uslugi/) — список направлений
- Блог: гайд по теме (https://example.ru/blog/gayd/) — практический материал с шагами и FAQ

## Optional

- Архив новостей (https://example.ru/news/) — лента обновлений, не канон

Тон — деловой и короткий. Без «лучший в Москве», без набивки ключей, без рекламных лозунгов. Пишите так, будто объясняете коллеге за 30 секунд.

Какие страницы включать в первую очередь (и какие выкинуть)

Включайте:

  • главную с ясным позиционированием;
  • страницы услуг / продукта / курса;
  • 3–7 лучших лонгридов с фактами, таблицами, FAQ;
  • страницу «О компании» / контакты, если важны для доверия;
  • документацию и справку, если есть продукт.

Выкидывайте из основной карты:

  • пагинацию, теги, архивы;
  • корзину, личный кабинет, служебные URL;
  • дубли и черновики;
  • сотни позиций «как в sitemap».

Правило контент-завода: в карту попадают только страницы, которые вы готовы цитировать как канон. Обновление llms.txt — шаг после публикации нового сильного лонгрида, а не «раз в год для галочки».

Пример файла: разбор строки за строкой

Разберём логику на живом RU-кейсе. У проекта etern8 файл доступен по адресу корня сайта; практический разбор на русском есть в статье на Хабре. Типичная сильная схема:

  • H1 = бренд;
  • blockquote = чем полезен сайт;
  • 15–20 пунктов в основном блоке;
  • остальное — в Optional;
  • отдельно может жить llms-full.txt с развёрнутым текстом.

Слабый антипаттерн рядом: скопировали sitemap, вставили 200 URL без описаний, забыли blockquote, дали относительные ссылки /blog/ вместо https://.... Такой файл формально «есть», но агенту от него мало толка.

Сильные docs-примеры в мире продуктов часто делают Anthropic, Vercel, Cloudflare, Stripe, GitHub — там файл заточен под агентов документации, а не под «SEO-магию».

Как создать llms.txt за один вечер: пошаговый чеклист

Ниже — сценарий, который новичок из России может повторить за 30–60 минут на WordPress (Beget) или на статике.

Шаг 1 — собрать карту важных URL

  1. Откройте сайт и выпишите 10–20 страниц, без которых бренд не понять.
  2. Для каждой напишите одно короткое пояснение (до одной строки).
  3. Отметьте 3–5 URL как Optional (полезно, но не критично).
  4. Проверьте, что страницы открываются без логина и отдают 200.

Признак успеха шага 1: у вас таблица из 10–20 строк: URL + пояснение + «основной / Optional». Нет битых ссылок.

Шаг 2 — написать файл и сохранить в корне

  1. Создайте текстовый файл llms.txt в редакторе (Блокнот, VS Code, Cursor).
  2. Сохраните в UTF-8.
  3. Соблюдите порядок: # Название> summary → абзац → ## Секция → списки ссылок.
  4. Загрузите в корень сайта:

- Статика / Next / Vite: положите в public/llms.txt, задеплойте. - WordPress на Beget: через файловый менеджер или SFTP загрузите в корень рядом с wp-config.php и robots.txt (не в папку темы и не в медиабиблиотеку «для красоты», если оттуда не отдаётся корень). - Плагины автогенерации (Citable GEO Schema и аналоги): можно стартовать с генерации, но обязательно вычитайте текст руками — автогенераторы часто льют воду.

Опционально сделайте копию /.well-known/llms.txt — это помогает discovery, но не заменяет корневой /llms.txt.

Маркер: простыми словами. well-known — служебная папка /.well-known/ на сайте, куда кладут стандартные файлы «для машин». Дубль llms.txt туда — страховка находки, а не новый формат.

Шаг 3 — открыть /llms.txt в браузере без редиректов

  1. Откройте https://ваш-домен.ru/llms.txt в режиме инкогнито.
  2. Должен открыться сырой текст, а не HTML-страница «404» или шаблон темы.
  3. Адрес в строке — именно /llms.txt, без редиректа на главную, /ru/ или «красивый» PHP-роут.
  4. Кодировка кириллицы читаемая, без «кракозябр».

Признак успеха шага 3: видите Markdown-текст, статус 200, URL стабильный.

Шаг 4 — связать с sitemap и не сломать robots

  1. Откройте /robots.txt. Убедитесь, что важные разделы и AI-боты не закрыты без причины.
  2. Sitemap оставьте как есть для поиска — не копируйте его целиком в llms.txt.
  3. Сверьте формулировки бренда с JSON-LD на сайте (Organization / FAQPage): в файле и в разметке не должно быть разных «кто мы» и разных URL курса.

Маркер: простыми словами. JSON-LD — машиночитаемая «визитка» на странице (тип организации, FAQ и т.д.). Speakable — подсказка, какие куски текста удобно читать вслух / коротко цитировать. Llms.txt, JSON-LD и Speakable должны говорить об одном и том же сайте, а не спорить друг с другом.

Типичные ошибки новичка на этом этапе:

Ошибка Что сделать
Файл лежит в теме, а корень отдаёт 404Перенести в document root / настроить отдачу
Редирект /llms.txt → главнаяУбрать правило в .htaccess / nginx / CMS
Относительные ссылкиЗаменить на абсолютные https://
GPTBot в Disallow, а файл зовёт «читайте нас»Согласовать robots и политику доступа

llms-full.txt: когда короткого файла мало

Короткий llms.txt — оглавление. llms-full.txt — уже «книга»: склеенный полный текст канонических материалов, чтобы агент мог читать без обхода десятков страниц.

Маркер: простыми словами. llms-full.txt — большой файл с полным текстом важных материалов. Нужен, когда агенту мало оглавления и хочется сразу дать тело гайдов. Не обязателен каждому сайту.

Чем full-версия отличается от краткой карты

llms.txt llms-full.txt
Ролькарта и приоритетполный текст канона
Размеркомпактно, часто 2–5 KB, <20 KBориентир 20–50 KB, потолок практики ~500 KB
Когда достаточнолендинг, услуга, 10–15 сильных URLdocs, база знаний, длинные гайды
Рискслишком общийслишком тяжёлый / устаревший

В кратком файле можно дать ссылку на full-версию отдельной строкой в основной секции.

Как не превратить full в свалку всех URL подряд

Не склеивайте всё подряд: теги, архивы, старые новости, дубли. Берите только канон. Обновляйте full вместе с лонгридами: устаревший 12‑тысячесловный файл хуже короткой свежей карты. Если нет ресурса поддерживать full — лучше качественный короткий llms.txt, чем мёртвый «кирпич».

Генератор или руками: что выбрать без сюрпризов

Когда генератор экономит час

Генератор полезен, если:

  • у вас много URL и нужно быстро собрать черновик;
  • есть плагин WordPress с автогенерацией;
  • вы сразу правите результат: названия, описания, Optional.

Поисковый спрос на «генератор llms.txt» есть — и это нормальный старт. Только не публикуйте сырой вывод «как есть».

Когда шаблон врёт о сайте и вредит видимости

Шаблон врёт, когда:

  • подставляет общие фразы «мы лидеры рынка»;
  • тащит служебные и пагинационные URL;
  • дублирует противоречивые описания услуг;
  • создаёт несколько H1 или пропускает blockquote.

Ручная сборка из 15 ссылок часто точнее автомата на 200 строк. Для контент-завода правило простое: генератор = черновик, редактор = финал.

Как проверить llms.txt: валидатор, статус 200, ловушки CMS

Чеклист проверки: доступность, кодировка, дубли пути

Пройдите список:

  1. https://домен/llms.txt открывается → 200.
  2. Текст — Markdown, не HTML-обёртка темы.
  3. Один H1, есть blockquote сразу после него.
  4. Все URL абсолютные и живые.
  5. Нет keyword-stuffing и HTML-тегов.
  6. Файл меньше ~20 KB (для индекса).
  7. При наличии дубля /.well-known/llms.txt содержимое согласовано с корнем.
  8. Robots не блокирует нужных AI-ботов без причины.
  9. Формулировки совпадают с сайтом и schema.
  10. Есть дата/привычка обновлять после сильных публикаций.

Онлайн-валидаторы и экосистема утилит (llms_txt2ctx, каталоги llmstxt) помогают поймать грубые ошибки формата — но финальная проверка глазами обязательна.

Тильда, редиректы на PHP и другие «ломатели» файла

На конструкторах (Тильда и аналоги) часто нет прямого доступа к корню. Тогда файл загружают отдельно и настраивают отдачу/редирект на /llms.txt. Опасность: редирект на HTML-страницу или PHP-шаблон — агент получает «красивую страницу», а не текст файла.

На WordPress ломатели типичны другие: плагин «красивых URL», кэш, правило «всё на index.php», файл положили в папку медиабиблиотеки WordPress (uploads), а не в корень и ждут, что он станет корневым. Решение: отдавать именно из корня домена или через явное правило веб-сервера.

Миф: «положил файл — нейросеть сразу цитирует»

Честный срез на 2026 год:

  • фоновые краулеры файл почти не качают;
  • Google не считает llms.txt фактором AI Overviews;
  • часть систем может прочитать файл по прямому запросу;
  • coding-агенты и docs-агенты — сильный практический слой, где файл реально используют.

Подробный разбор мифов и тестов «кто читает файл» — в разборе на Хабре. Рабочая позиция для владельца сайта: файл — дешёвый и полезный указатель, а не кнопка «попасть в ChatGPT за неделю».

Как llms.txt стыкуется с GEO и ответами нейросетей

Файл — указатель, контент — то, что цитируют

Продвижение в нейросетях и geo-оптимизация — шире, чем один файл. Llms.txt помогает агенту найти канон. Цитату берёт из страницы: чёткие тезисы, факты, списки, FAQ, таблицы. Если в карте указан пустой лендинг без пользы — указывать было нечего.

Связка для команды контента:

  1. Пишете сильный лонгрид под кластер запросов.
  2. Добавляете FAQ и проверяемые факты.
  3. Согласуете JSON-LD / Speakable.
  4. Вносите URL в llms.txt (или в Optional).
  5. Через 7/14/30 дней смотрите упоминания бренда и ручные промпты — без обещания «+60%».

Что ещё усиливает шансы попасть в ответ ИИ (структура, факты, FAQ)

Короткий список рядом с файлом:

  • страницы, которые можно цитировать кусками (chunkable);
  • прямые ответы на вопросы из FAQ;
  • согласованность названия компании и услуг везде;
  • доступность ботам (robots + скорость + 200);
  • внешние упоминания и донорские площадки — как фон GEO-стратегии, не как замена файла.

Итог блока: llms.txt ускоряет находку канона. GEO без контента не работает. Контент без карты хуже находится агентами.

Частые ошибки и быстрый аудит перед публикацией

Пустой файл, битые ссылки, закрытые разделы

Самые дорогие по времени ошибки:

  • файл из трёх строк без ссылок;
  • битые и относительные URL;
  • секция «Не цитировать» как будто из спеки — её в стандарте нет; блокировки делайте через robots.txt;
  • HTML вместо Markdown;
  • обещания в маркетинге «гарантия попадания в ответы ИИ».

Чеклист из 10 пунктов перед выкладкой

  1. H1 один, название совпадает с брендом.
  2. Есть blockquote-summary.
  3. 10–20 сильных URL с пояснениями.
  4. Optional не смешивается с обязательным.
  5. Абсолютные https-ссылки.
  6. UTF-8, без HTML.
  7. /llms.txt → 200, без редиректа на HTML.
  8. Robots согласован с политикой AI-ботов.
  9. Нет копии sitemap.
  10. Есть план обновления после новых лонгридов.

FAQ

Что такое llms.txt простыми словами?

Это текстовый файл в корне сайта, который коротко объясняет нейросети и AI-агенту: кто вы и какие страницы читать первыми.

Нужен ли llms.txt, если уже есть robots.txt и sitemap?

Да, это разные задачи. Robots — доступ. Sitemap — карта для поиска. Llms.txt — смысловая карта для ИИ и агентов. Один не заменяет другой.

Чем llms.txt отличается от llms-full.txt?

Краткий файл — оглавление. Full — развёрнутый текст канонических материалов. Начинайте с краткого; full добавляйте, если есть docs/база знаний и ресурс поддерживать объём.

Как проверить, что файл открывается?

Откройте https://ваш-домен.ru/llms.txt в браузере. Должен быть статус 200 и сырой Markdown. Дополнительно можно прогнать валидатор формата и сверить robots.

Поможет ли генератор llms.txt вместо ручной сборки?

Как черновик — да. Как финал без правки — часто нет: шаблоны тащат лишние URL и пустые описания. Лучший результат: генератор + ручная чистка до 10–20 ссылок.

Гарантирует ли файл попадание в ответы ChatGPT и других ИИ?

Нет. Файл повышает шанс, что агент быстро найдёт ваш канон, но не гарантирует цитату. Решают содержание страниц, доступность, согласованность фактов и то, как конкретная система ищет источники.

Что проверяли по источникам

  • Спецификация формата — llmstxt.org (ссылка в начале статьи).
  • Практический RU-разбор и кейс файла — материал на Хабре про llms.txt (ссылка в разделе про пример).
  • Мифы, логи ботов и агентный слой — разбор «кто реально читает» на Хабре (ссылка в блоке про мифы).
  • Открытые заявления и обзоры: позиция Google по AI-файлам; замеры adoption и трафика AI-ботов из отраслевых отчётов 2025–2026 (без переноса чужих «+30–60%» на сам файл).
Beget — надёжный хостинг и VPS