Някой ви казва: „Спрете AI роботите в robots.txt и си пазете съдържанието.“ Друг ви казва: „Не пипайте robots.txt, ще изчезнете от Google.“ И 2-мата са сигурни.
Прави са и 2-мата, за различни редове от един и същи файл.
Файлът robots.txt е обикновен текстов файл в корена на сайта, който казва на всеки робот, по име, кои адреси може да отваря и кои не.
Бърз отговор
Файлът robots.txt е текстовият файл на адрес /robots.txt, в който по име на робот пишете какво му е позволено и какво не. За AI функциите на Google важи същият файл като за търсенето.
Какво всъщност значи
Определението е просто. Файлът казва на роботите на търсачките до кои адреси на сайта ви може да стигне роботът и се ползва главно, за да не се претоварва сайтът със заявки.
Идеята е от 1994 г.
Стандартът от 2022 г. я описва формално и добавя правила за грешки и за кеширане.
Бъркат го със средство за скриване.
Google е категорична. Това не е механизъм за държане на страница извън Google.
Страница, забранена в robots.txt, може да се появи в резултатите с адрес и без съдържание, ако други сайтове сочат към нея.
За да я няма, се ползва указанието за неиндексиране или парола.
Файлът спира четенето, не показването, а как страница изчезва от Google наистина е друг механизъм.
Защо това ви засяга
Представете си табела на входа на склад.
Не „вход забранен“, а списък: „куриери само до рампата, инспектори навсякъде, фотографи не“.
Всеки, който влиза, чете реда със своето име. Който не намери името си, чете реда „всички останали“.
Табелата е вратата към всичките стъпки на AI търсачката до цитирането. Затворена врата значи нула цитирания.
Това е robots.txt.
И тук е същината на спора от началото.
Роботът на Google за търсене, Googlebot, е инспекторът.
При Google AI е вградено в търсенето и затова правилата в robots.txt за Googlebot са настройката, с която собствениците управляват достъпа и за тези функции. Спрете ли Googlebot, спирате и търсенето, и AI Overviews, и AI Mode. Няма отделен ред за AI при Google.
Затворите ли Googlebot, страницата ви не може да бъде прочетена, а непрочетена страница няма как да бъде посочена в отговора. Няма съобщение за грешка и няма отказ, телефонът просто спира да звъни.
Роботите на OpenAI са другите посетители.
При OpenAI GPTBot събира за обучение, OAI-SearchBot пълни търсенето в ChatGPT, и сайт, който е забранил втория, не се показва в отговорите на търсенето в ChatGPT.
Забраната на първия не засяга второто.
2-та съвета от началото са за 2 различни реда.
Същото важи и в ChatGPT, където забранен OAI-SearchBot ви изважда от отговорите на търсенето и клиентът стига до конкурента, без да е чувал за вас.
Файлът е първото място, на което четецът поглежда.
Сайтовете, които AI търсачките посочват, обикновено подават robots.txt, а четец на езиков модел в него се назовава рядко.
Как изглежда на практика
Файлът се чете отгоре надолу на блокове. Всеки блок започва с името на робота, за когото важи, и продължава с редове какво е забранено и какво изрично разрешено.
Звездичка значи „всички“.
| Ред | Какво прави |
|---|---|
| име на робота | казва за кого важи блокът: Googlebot, GPTBot, звездичка за всички |
| забрана с път | този робот не отваря адресите, започващи така |
| разрешение с път | изключение от забраната за по-тесен път |
| празна забрана | всичко е разрешено за този робот |
Промяната стига до доставчика с известно закъснение: на системите на OpenAI трябват около 24 часа след промяна на файла.
Най-честата грешка във файла е 1 ред: спрян GPTBot с надеждата да остане ChatGPT.
Google има и особен ред.
Google-Extended не е робот, а име във файла, което казва дали вече обходеното може да се ползва за обучение на моделите Gemini и за подаване към Gemini Apps и Vertex AI.
Той не влияе на включването на сайта в Google Търсене и не се ползва като сигнал за класиране.
Какво струва и какво носи
Решението е 3 въпроса, всеки за отделен ред.
Искате ли да сте в Google, включително в AI функциите му? Тогава Googlebot остава разрешен.
Искате ли да сте в търсенето на ChatGPT? Тогава OAI-SearchBot остава разрешен.
Искате ли страниците ви да учат чужди модели? Ако не, GPTBot и Google-Extended получават забрана.
Цената е половин час и един текстов файл.
Рискът е в грешния ред: забрана за „всички“ с намерението да спрете AI сваля сайта и от Google.
Това е най-скъпата грешка, която може да се направи с най-малкия файл на сайта.
Управлението на достъпа за Googlebot и AI функциите му е част от услугата ни за присъствие в екосистемата на Google, а какво пише във файла ви днес е първата проверка в потока за ChatGPT.
Кое правило стои във вашия сайт днес, проверяваме преди всичко друго.
Накъде отива
Стандартът от 2022 г. описва формата, не имената на роботите.
Имената растат. OpenAI, Anthropic и Perplexity вече публикуват по няколко, с различна цел.
За появата в AI Overviews и AI Mode няма допълнителни изисквания отвъд обичайните за търсенето.
Дали ще се появи общ формат за предпочитанията към AI, вместо отделен ред за всеки доставчик, никой не е обявил.
21 имена, 3 вида роботи, 3 различни решения и редът за деня на пускането.
2 примера
Онлайн магазин за детски дрехи иска да е в Google и в търсенето на ChatGPT, но не иска каталогът му да учи модели. Файлът му има 3 блока: Googlebot без забрани, OAI-SearchBot без забрани, GPTBot със забрана за целия сайт. 3 блока решават 3 въпроса.
Вторият пример е от Google: собственик забранява страница в robots.txt, за да я скрие, а тя продължава да излиза в резултатите с адреса си, защото други сайтове сочат към нея. За скриване се ползва неиндексиране или парола, не този файл.
Въпросите, които ще ви хрумнат
Ако забраня всички роботи, значи ли, че съм спрял само AI?
Не, спрели сте и Google.
При Google AI функциите минават през Googlebot и нямат отделен ред, така че забраната за „всички“ сваля сайта и от търсенето, и от AI Overviews.
Ако целта е само обучението, забранете по име: GPTBot и реда Google-Extended.
Кое правите първо, да скрия страница с robots.txt или с неиндексиране?
С неиндексиране.
Google казва изрично, че robots.txt не държи страница извън резултатите: забранена страница пак може да излезе с адреса си, ако други сайтове сочат към нея. robots.txt служи главно да не се претоварва сайтът със заявки, не за скриване.
Как да проверя за 10 минути дали файлът ми е верен?
Отворете в браузъра адреса на сайта си с добавено /robots.txt.
Прочетете блок по блок. Всеки казва за кого важи и какво забранява.
Ако видите звездичка със забрана за целия сайт, това е редът, който сваля и Google.
После отворете дневника на сървъра, вижте кои роботи ви посещават, и проверете дали за всеки от тях има ред, който казва точно това, което искате.
Отворете /robots.txt на сайта си. Има ли ред, който забранява „всички“? Ако да, знаете ли кого точно сте спрели с него?