Речник

AI роботи

На английски AI crawlers

AI роботите са програмите на OpenAI, Anthropic, Perplexity и Google, които теглят страниците ви, за да учат моделите и да ви цитират в отговорите.

Отворете дневника на сървъра си за един ден и ще видите посетители, които не са хора.

Един се казва GPTBot. Друг OAI-SearchBot.

Трети ClaudeBot, четвърти PerplexityBot.

Идват по няколко пъти дневно, отварят страници и си тръгват, без да купят нищо.

Това са AI роботите.

Не са един, а няколко на всеки доставчик, и всеки идва по различна работа.

Казано просто, AI робот е програма на фирма, която прави езикови модели, тоест програмите зад ChatGPT и подобните му.

Тя тегли страници от вашия сайт за обучение, за търсене в чат продукта си или защото конкретен човек е попитал нещо, за което трябва точно вашата страница.

Бърз отговор

AI роботите са програмите, с които OpenAI, Anthropic, Perplexity и Google теглят страници от сайта ви за моделите и за търсенето си. Всеки доставчик държи по 3, с различна цел, и всеки се спира поотделно в robots.txt.

Какво всъщност значи

Търсачките от години пращат робот, който обхожда връзка след връзка и пълни индекс, тоест списъка с прочетени страници. AI роботите приличат на него, но целта е друга.

И не е една.

При SEO имате един робот, Googlebot, и едно решение. Тук имате по 3 робота на доставчик и по 3 решения:

  • GPTBot тегли съдържание за обучение на моделите на OpenAI.
  • OAI-SearchBot служи за показване на сайтове в резултатите от търсене в ChatGPT.
  • ChatGPT-User се появява, когато човек в ChatGPT поиска конкретна страница. За него правилата в robots.txt не винаги важат, защото действието е поискано от човек, а не е автоматично обхождане.

Anthropic има същото разделение с 3 имена: ClaudeBot, Claude-SearchBot и Claude-User. Perplexity има PerplexityBot за търсене и Perplexity-User за отваряне по въпрос на човек, а вторият по правило не се съобразява с robots.txt.

Google не праща отделен робот.

Редът Google-Extended в robots.txt решава само дали прочетеното от Googlebot учи моделите Gemini и им служи за опора, а мястото ви в Google Търсене не се пипа.

Отделно стои CCBot на Common Crawl, отворен архив от 2008 г., който се раздава безплатно на всеки.

Веднъж събрана, страницата ви може да прочете всеки.

Бъркат го с един робот, който се спира с един ред.

Не е така. Спрете ли всички роботи на OpenAI наведнъж, изчезвате и от търсенето в ChatGPT.

Защо това ви засяга

Представете си магазин с 3 вида посетители, които не са клиенти. Първият снима рафтовете, за да научи занаята.

Вторият записва адреса ви в указател, за да ви праща клиенти, а третият е куриер, пратен от конкретен клиент да вземе точно един артикул и да му го занесе.

Ако сложите на вратата табела „вход забранен за всички“, губите и указателя, и куриера.

robots.txt е тази табела, само че с имена.

Можете да пуснете указателя и да спрете фотографа. Решението за обучение и решението за търсене са 2 отделни решения.

Клиентът питаКакво става на екрана
„Кой продава резервни части за Опел в Русе?“ в ChatGPTOAI-SearchBot е разрешен: магазинът излиза в отговора с връзка към каталога.
същият въпрос, а robots.txt спира всички роботи с един редChatGPT не намира магазина и посочва конкурент. Собственикът мисли, че е спрял само обучението.

Google е отделен случай.

Google-Extended не е робот и няма собствено име, с което да се представя.

Той е ред, който казва дали вече обходеното от Googlebot може да се ползва за обучение на моделите Gemini и за подаване на страници към Gemini Apps и Vertex AI.

Този ред не влияе на включването на сайта в Google Търсене и не се ползва като сигнал за класиране, тоест не пипа мястото ви в резултатите.

Как изглежда на практика

AI роботи

Доставчиците с най-ясни правила работят по еднаква схема: отделен робот за всяка цел.

ЦелOpenAIAnthropicPerplexity
обучение на моделиGPTBotClaudeBotняма. PerplexityBot не се ползва за обучение
търсене в чат продуктаOAI-SearchBotClaude-SearchBotPerplexityBot
отваряне по искане на човекChatGPT-UserClaude-UserPerplexity-User
21 робота: кой ги праща, за какво и слушат ли robots.txtРобот: предназначение, спазва ли robots.txt. Google: Googlebot: търсене, да; Google-Extended: обучение, да; Google-CloudVertexBot: друго, да. Microsoft: bingbot: търсене, да. OpenAI: GPTBot: обучение, да; OAI-SearchBot: търсене, да; ChatGPT-User: по искане на човек, може да не спазва. Anthropic: ClaudeBot: обучение, да; Claude-SearchBot: търсене, да; Claude-User: по искане на човек, да. Perplexity: PerplexityBot: търсене, да; Perplexity-User: по искане на човек, може да не спазва. Apple: Applebot: търсене, да; Applebot-Extended: обучение, да. Common Crawl: CCBot: друго, да. Amazon: Amazonbot: обучение, да; Amzn-SearchBot: търсене, да. Meta: meta-externalagent: обучение, да; meta-externalfetcher: по искане на човек, може да не спазва; facebookexternalhit: друго, може да не спазва. ByteDance: Bytespider: друго, не е потвърдено. „Друго“: Google-CloudVertexBot обхожда по заявка на собственика за Vertex AI; CCBot пълни отворен архив; facebookexternalhit прави преглед на споделени връзки; Amazonbot по документацията „може да се ползва за обучение“; Bytespider няма официална страница.търсенеобучениепо искане на човекдруго21 робота: кой ги праща, за какво ислушат ли robots.txtроботза каквоrobots.txtдаможе да не спазване е потвърденоGoogleMicrosoftOpenAIAnthropicPerplexityAppleCommon CrawlAmazonMetaByteDanceGooglebotGoogle-ExtendedGoogle-CloudVertexBotbingbotGPTBotOAI-SearchBotChatGPT-UserClaudeBotClaude-SearchBotClaude-UserPerplexityBotPerplexity-UserApplebotApplebot-ExtendedCCBotAmazonbotAmzn-SearchBotmeta-externalagentmeta-externalfetcherfacebookexternalhitBytespider
Кръгът е пълен само когато доставчикът е заявил това публично. Празният кръг не значи, че роботът нарушава, а че никой не е обещал.

Първите 2 реда слушат robots.txt. Третият е различен. Програмите, които действат по искане на човек, може да не спазват файла.

Промяната стига до доставчика с известно закъснение.

След промяна на robots.txt на системите на OpenAI им трябват около 24 часа, за да я отразят, тоест каквото напишете сутринта, ще важи чак утре по същото време.

И OpenAI, и Anthropic, и Perplexity публикуват списъци с IP адресите на роботите си, защото името може да бъде подправено, а адрес от списъка не.

Проверете:

  • кои от имената на OpenAI се появяват в дневника на сървъра ви;
  • има ли във файла robots.txt отделен ред за всяко от тях;
  • идва ли роботът от адрес в публикувания списък на доставчика.

Какво струва и какво носи

Решенията са 3 и ги взимате поотделно.

Искате ли страниците ви да учат чужди модели? Искате ли да излизате в търсенето на ChatGPT и на Perplexity? Искате ли човек, който ви е попитал в чат, да получи вашата страница?

Цената е един текстов файл и половин час.

Рискът е в другата посока: ред, който спира всичко на един доставчик, вади сайта и от търсенето му. Присъствието в търсенето на ChatGPT започва от един-единствен разрешен робот, OAI-SearchBot, и е част от услугата ни за присъствие в екосистемата на ChatGPT.

Кои роботи стигат до сайта ви, казва първата проверка.

Накъде отива

Списъкът расте, по цел, не по доставчик.

OpenAI вече има и OAI-AdsBot, който проверява страници, подадени като реклами в ChatGPT, и чиито данни не се ползват за обучение.

Следващите на ред при Google са агентите, които влизат в сайта, за да свършат задача вместо човека. Дали те ще имат отделни имена в robots.txt, засега не е казано.

2 примера

Магазин за резервни части иска да излиза в търсенето на ChatGPT, но не иска каталогът му да учи чужди модели.

Оставя OAI-SearchBot разрешен и добавя 2 реда за GPTBot със забрана за целия сайт, а точно това е и подредбата, която самият OpenAI препоръчва за такъв случай.

Perplexity показва обратния случай.

Perplexity-User по правило не слуша robots.txt, защото заявката идва от човек, затова Perplexity дава само списък с IP адреси за тези, които искат да го спрат на ниво сървър.

Въпросите, които ще ви хрумнат

Ако забраня „всички роботи“ в robots.txt, значи ли, че съм спрял AI?

Спрели сте повече, отколкото искате.

Редът за „всички“ удря и роботите за търсене, така че изчезвате и от търсенето в ChatGPT и Perplexity, а Googlebot също попада в „всички“, тоест губите и Google. Ако целта е само обучението, забранете по име: GPTBot, ClaudeBot и реда Google-Extended.

Кое се решава първо, обучението или търсенето?

Търсенето. То носи клиенти още днес.

Уверете се, че OAI-SearchBot, Claude-SearchBot и PerplexityBot са разрешени, и чак после решавайте за GPTBot и ClaudeBot, които са само за обучение.

Решението за обучение и решението за търсене са независими при всеки от доставчиците.

Как да проверя за 10 минути кои AI роботи идват при мен?

Отворете дневника на сървъра или таблото на хостинга и потърсете имената от таблицата: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot.

За всяко намерено име отворете robots.txt на сайта си и вижте дали има ред за него. Ако искате да сте сигурни, че роботът е истински, сравнете адреса му със списъка на доставчика, защото име може да се подправи.

Потърсете в дневника на сървъра или в таблото на хостинга кои от тези имена ви посещават. После отворете robots.txt и проверете дали сте казали на всяко от тях това, което наистина искате.