discover · data-study 10 липня 2026 р. 9 хв

llms.txt: чому файл майже не впливає на AI-цитування

Ahrefs перевірив 137 тисяч сайтів: 97% файлів llms.txt не отримали жодного запиту. Google називає файл непотрібним. Дані, механізм і власний досвід.

llms.txtAI crawlersSEO для AIGEOAI-видимістьAhrefs

Andrew Maryasov, AI-консультант. У червні 2026 я поставив llms.txt на чотири свої сайти — це зайняло півгодини. За той самий місяць Ahrefs перевірив серверні логи 137 тисяч доменів: 97% таких файлів не отримали жодного запиту. Google у власному гайді назвав їх непотрібними для потрапляння в AI-відповіді. llms.txt не робить сайт видимішим для AI, бо боти його не шукають. Видимість дають доступ краулера, індексація і глибина контенту.

TL;DR (за 30 секунд)

Тридцять хвилин, які нічого не змінили

13 червня я взявся розкласти llms.txt по чотирьох доменах: auspex.company, grow2.ai, amaryasov.expert і aelo.cloud. Файл простий — markdown-карта сайту для мовних моделей. Заразом додав Link-заголовок за RFC 8288 з rel="describedby", щоб бот не вгадував шлях, а отримував вказівник на файл у кожній HTTP-відповіді. Акуратна інженерія, тридцять хвилин роботи.

Перед деплоєм вирішив перевірити очевидне: а чи взагалі краулери доходять до моїх сайтів. Одна команда:

curl -sI -A "OAI-SearchBot/1.0" https://amaryasov.expert/

HTTP/2 403. «Your request was blocked.»

Те саме на GPTBot, ClaudeBot і PerplexityBot. Звичайний браузерний user-agent отримував спокійні 200. При цьому robots.txt пускав усіх — я його писав сам і писав гостинно. Блокування сиділо рівнем нижче, у Cloudflare: увімкнений «Block AI bots» на цьому конкретному домені. На auspex.company і grow2.ai його не було, тому я півроку жив із певністю, що все гаразд.

Тобто мій особистий сайт — центр усієї entity-стратегії, місце, де живе Person-схема, — був повністю невидимий для ChatGPT, Perplexity, Claude і Gemini. А я в цей момент акуратно клав туди записку для AI.

Виправив того ж дня, за п’ять хвилин у дашборді. llms.txt поїхав наступного ранку. І далі я місяць читав дослідження, які пояснили, що з цих двох дій значення мала тільки перша.

Що показують дані

За останні півроку вийшло чотири незалежні заміри. Вони дивляться на різні речі — кореляцію з цитуванням і реальні звернення в логах, — але сходяться в одному.

ДослідженняВибіркаЗнахідка
Ahrefs, червень 2026137 000 доменів, серверні логи97% файлів — нуль запитів за травень
SE Ranking, кінець 2025~300 000 доменівНемає значущого зв’язку з цитуванням
Limy.AI, 90-денний лог500+ млн візитів AI-ботів408 звернень до llms.txt
Otterly.AI, серверний лог62 100 візитів AI-ботів84 звернення до файлу (0,1%)

Деталі з дослідження Ahrefs варті окремої уваги, бо це не опитування і не кореляційна модель, а логи звернень.

Файл публікують 28% доменів вибірки. Цифра вища за середню по вебу: вибірка технічно зміщена, це користувачі Ahrefs Web Analytics, тобто люди, які вже займаються SEO професійно. Ширша вибірка SE Ranking дає ближче до 10%.

З тих 3% файлів, які взагалі хтось запитав, 19,5% звернень надійшли від іменованих AI-інструментів. Перший у списку — GPTBot, другий — Claude Code, і обидва випереджають будь-якого бота AI-пошуку чи асистента. Ще 12% запитів згенерували GEO- й AEO-платформи, чекери llms.txt і дослідники. Індустрія помітною мірою вивчає саму себе. Аудит Chrome Lighthouse дав приблизно одне звернення з тисячі.

SE Ranking підійшов з іншого боку і перевірив статистичний зв’язок наявності файлу з частотою цитування в AI-відповідях. Зв’язку не знайшлося ні в регресії, ні в XGBoost-класифікаторі. Більше того: коли llms.txt прибрали зі списку ознак, точність передбачення покращилась — змінна вносила шум, а не сигнал.

Механізму просто немає

До неіснуючих llms.txt не надійшло жодного запиту. Боти не приходять навмання перевіряти /llms.txt, як вони роблять з /robots.txt чи /sitemap.xml.

Тут і ховається різниця, яку маркетингові розсилки старанно розмивають. robots.txt працює, бо його запитують за конвенцією, до першої сторінки. sitemap.xml працює, бо на нього вказує robots.txt, а пошукові системи домовились його читати. За llms.txt не стоїть ані конвенції запиту, ані домовленості вендорів. Жоден з великих — OpenAI, Anthropic, Google, Meta, Mistral — не зобов’язався використовувати його як сигнал цитування.

Файл, якого ніхто не питає, не може вплинути на відповідь. Це не «слабкий ефект», який виявиться на більшій вибірці. Це відсутній канал.

Мій Link-заголовок з rel="describedby" теоретично закриває саме цю дірку: він каже боту, де лежить файл, без вгадування. Заголовок стоїть на всіх чотирьох доменах, віддається в кожній відповіді, і за місяць це не зробило файл потрібнішим нікому. Правильна відповідь на питання, якого ніхто не поставив, лишається правильною і непотрібною.

Google за тиждень зайняв обидві позиції

Наприкінці травня 2026 Google опублікував гайд з оптимізації під генеративні AI-функції. У розділі, буквально названому «mythbusting», написано: машиночитані файли на кшталт llms.txt не потрібні, щоб з’явитися в генеративному AI-пошуку.

За кілька днів вийшов Lighthouse 13.3 — і додав аудит наявності llms.txt у нову категорію «Agentic Browsing».

Це не плутанина, а два різні споживачі. Search-команда описує retrieval: як система вирішує, який сайт підтягнути у відповідь. Lighthouse дивиться на агента, який на сайт уже прийшов і має по ньому рухатися.

Джон Мюллер з Google сформулював це на епізоді Search Off the Record у червні: llms.txt не дає моделі жодного способу вирішити, який сайт показати за конкретним запитом. Самозаявлений файл не відрізняє один сайт від іншого — будь-хто напише про себе, що він найкраще джерело в ніші. Раніше Мюллер порівнював цю конструкцію з мета-тегом keywords, і порівняння точне: незавірене самоопис, яке легко грати, швидко перестає бути сигналом. Роль у файлу є, каже Мюллер, але вузька, і починається вона після того, як агент уже на сайті.

Кому файл справді потрібен

З даних Ahrefs випадає несподівано корисний висновок. Читачі llms.txt існують, просто це не пошукові боти.

GPTBot і Claude Code на вершині списку — це редактори коду й агенти розробника. Cursor, Copilot, агентні браузери. Такий агент уже стоїть на вашому домені й хоче знайти опис API, не продираючись крізь двісті кілобайтів HTML з навігацією, банером кукі та футером. Markdown-карта економить йому крок.

Звідси правило, з яким я тепер живу. Якщо у вас документація понад п’ятдесят сторінок — ставте llms.txt і llms-full.txt, у них є вимірні читачі. Якщо корпоративний сайт, блог чи невеликий магазин — поставте за півгодини, коли руки вільні, і забудьте; пріоритет останній.

Чого робити не варто взагалі: подавати це клієнту як «SEO для AI». Продати легко, довести неможливо, а через рік доведеться пояснювати, чому нічого не сталося.

Що працює замість нього

Це не альтернатива файлу, а те, що йде першим у будь-якому разі. Порядок — за силою доказів, не за модністю.

Перше і найгрубіше — доступ краулера. Я на ньому обпікся, тому ставлю в голову списку. 403 означає, що вся інша робота безглузда: ні контент, ні schema, ні файли не існують для того, хто не пройшов двері. Шукати блокування треба на рівні CDN, а не в robots.txt, бо живе воно саме там (і, судячи з мого випадку, вмикається інколи само, разом з якимось «рекомендованим» тумблером безпеки).

Друге — SSR або статичний HTML. GPTBot, ClaudeBot і PerplexityBot не виконують JavaScript, тож контент, який домальовується на клієнті, для них просто відсутній.

Третє — індексація. ChatGPT Search тягне кандидатів з пошукового індексу; сайт поза індексом не з’явиться у відповіді, скільки б markdown-карт ви не поклали в корінь.

Четверте — консистентність сутності: одне канонічне ім’я скрізь, @id в Organization-схемі, взаємні sameAs на Wikidata й LinkedIn. Тут я мушу пригальмувати з обіцянками. Schema App у контрольованому дослідженні показала приріст показів після додавання sameAs; Ahrefs на вибірці 75 тисяч брендів отримав кореляцію згадок з Google AI Overviews 0,66 проти 0,22 у беклінків. Це кореляції на спостережних даних, а не доведена причинність, і перетворювати їх на обіцянку клієнту я не раджу.

П’яте — глибина контенту, єдина частина GEO з рецензованою підтримкою. Princeton GEO paper (KDD 2024) міряв дев’ять тактик: статистика в тексті дає близько +41% до видимості уривка, прямі цитати +37–43%, посилання на джерела приблизно +30%. Застереження автори записали самі: тестували на проксі Bing Chat, а ефект міряли лише серед сторінок, які вже були в топ-5. Класичне SEO тут не «померло», воно передумова.

Власні цифри в мене теж є, і вони нічого не доводять. 14 червня я прогнав дванадцять промптів через Perplexity: сумарно 10 балів з 36, комерційні discovery-запити дали чистий нуль із семи. Замір зроблено наступного дня після деплою, до будь-якої переіндексації. Це точка А, не результат. Наступний зріз я знімаю в середині липня, і щось скаже саме він — а перший каже одне: на комерційних запитах мене не існує.

Три команди, які скажуть більше за llms.txt

Проженіть на своєму домені. Займе хвилину.

# 1. Чи пускає CDN AI-краулерів. 403 → решта роботи марна
curl -sI -A "OAI-SearchBot/1.0" https://example.com/ | head -n 1

# 2. Чи є контент у сирому HTML. Боти не виконують JavaScript
curl -s -A "GPTBot" https://example.com/ | grep -c "<h1"

# 3. Що насправді дозволяє robots.txt live-retrieval ботам
curl -s https://example.com/robots.txt

Якщо перша команда повернула 403 — ви щойно знайшли причину, через яку вас немає в AI-відповідях. Я знайшов її саме так, і мені для цього знадобилося півроку.

FAQ

Чи потрібен llms.txt для потрапляння в AI-відповіді? Ні. Google прямо пише в розділі «mythbusting» свого гайду, що машиночитані файли для цього не потрібні. Жоден великий AI-вендор не підтвердив використання llms.txt як сигналу цитування.

Чи шкодить llms.txt? Ні, якщо ви не витрачаєте на нього тижні. Файл нічого не блокує і нічого не псує. Шкода одна: він з’їдає бюджет уваги, який мав піти на доступ краулера і контент.

Чому тоді його ставлять великі компанії? Здебільшого через агентів розробника. Cursor, Claude Code й агентні браузери читають файл за конвенцією свого інструмента. Для сайтів з великою документацією це вимірна зручність, не пошукова тактика.

Чи змінить це найближчим часом? Може. Lighthouse уже аудитить файл під агентний браузинг. Якщо агентний трафік зросте, а вендори домовляться про конвенцію запиту, канал з’явиться. Сьогодні його немає.

Чим llms.txt відрізняється від robots.txt? robots.txt запитують за конвенцією, до першої сторінки, і він керує доступом. llms.txt ніхто не запитує за замовчуванням, і він нічим не керує — це самоопис.

Що робити першим, якщо бюджету на GEO мало? Перевірити curl з AI-user-agent, чи не віддає CDN 403. Це коштує нуль і закриває найдорожчу помилку.

Скільки коштує поставити llms.txt? Півгодини. Саме тому суперечка навколо нього така гучна: ціна помилки низька в обидва боки, тож обидві сторони можуть сперечатися вічно.


Проженіть три команди вище на своєму домені. Якщо перша дала 403 — напишіть мені, розберемо, де сидить блокування: у Cloudflare, у WAF чи в самому robots.txt.

Схожі розбори: як я оцінюю новий AI-інструмент — про те, як відділяти дані від хайпу, і чому я помилявся щодо цін на AI — про перегляд власних тверджень, коли з’являються цифри.

Написав Andrew Maryasov, AI-консультант, засновник Auspex і Grow2.ai. Розбираю AI-агентів і автоматизацію для бізнесу — консультації.

A
Andrew Maryasov

Засновник Auspex та Grow2.ai. 28 AI-проєктів у 14 галузях і 7 країнах, 8 власних AI-систем у продакшні.

Розсилка

Лист про AI — 2–3 листи на місяць

Особисті есе про те, як AI змінює мислення й роботу: що я спробував сам, що спрацювало, а що ні. Наприкінці — посилання на найкраще за останній час.

Без спаму. Відписатися можна в один клік.

Безкоштовний 30-хв discovery →