robots.txt w erze AI: trzy kategorie botów i trzy różne decyzje

Ostatnia aktualizacja: 1 sierpnia 2026. Konfiguracje botów i domyślne ustawienia CDN zmieniają się szybko, ten artykuł podlega przeglądowi co 2 miesiące. Jeśli w Twoim robots.txt jest jedna linia, która „blokuje boty AI”, prawie na pewno podejmujesz złą decyzję, tylko jeszcze o tym nie wiesz. Boty AI to nie jedna kategoria, tylko trzy, z osobnymi user-agentami […]

Ostatnia aktualizacja: 1 sierpnia 2026. Konfiguracje botów i domyślne ustawienia CDN zmieniają się szybko, ten artykuł podlega przeglądowi co 2 miesiące.

Jeśli w Twoim robots.txt jest jedna linia, która „blokuje boty AI”, prawie na pewno podejmujesz złą decyzję, tylko jeszcze o tym nie wiesz. Boty AI to nie jedna kategoria, tylko trzy, z osobnymi user-agentami i osobnymi konsekwencjami biznesowymi. Crawler treningowy, crawler wyszukiwawczy i agent uruchamiany przez użytkownika robią zupełnie co innego, a jedna dyrektywa zwijająca je do wspólnej blokady zamyka trzy różne pytania do jednej odpowiedzi (guptadeepak.com, VII 2026).

Najważniejsza rzecz do zapamiętania: jeśli w odruchu „nie chcę AI” zablokujesz naraz GPTBota, OAI-SearchBota, ClaudeBota i Claude-SearchBota, to owszem, zablokujesz trening, ale jednocześnie zamkniesz jedyny kanał, którym ChatGPT i Claude cytują Cię w odpowiedziach (jangwook.net, VII 2026). Blokada crawlera treningowego to legalna ochrona treści przed uczeniem modelu i nie obniża cytowalności. Blokada crawlera wyszukiwawczego to dobrowolne zniknięcie z wyników AI. To dwie różne decyzje i trzeba je podejmować osobno.

Ten artykuł rozkłada trzy kategorie na konkretne user-agenty, pokazuje skutek każdej blokady i podaje gotową konfigurację. Uwaga: mówimy tu o tym, jak skonfigurować dostęp. Czy w ogóle blokować boty AI, i jakie argumenty stoją po obu stronach, rozkładamy w osobnym artykule decyzyjnym dla zarządu.

Trzy kategorie botów, trzy różne skutki

Kluczowa zmiana ostatnich kilkunastu miesięcy: najwięksi dostawcy rozdzielili trening od wyszukiwania na osobne boty. GPTBot to nie OAI-SearchBot. ClaudeBot to nie Claude-SearchBot. Każdy ma własny user-agent i można go kontrolować niezależnie (DigitalApplied, VI 2026). To właśnie ten podział sprawia, że stara rada „zablokuj wszystkie boty AI” stała się cichą, samodzielnie zadaną stratą widoczności.

Crawlery treningowe. Pobierają treść, żeby budować zbiory uczące modele. Główne user-agenty: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl) oraz dyrektywa Google-Extended (token kontrolny, nie osobny crawler, właściwym pobieraniem dalej zajmuje się Googlebot). Możesz je legalnie zablokować. Blokada nie wpływa na cytowania w wyszukiwaniu AI (Semola Digital, VII 2026).

Crawlery wyszukiwawcze. Pobierają Twoje strony, żeby budować indeks, z którego model cytuje odpowiedzi z klikalnymi źródłami. Główne user-agenty: OAI-SearchBot (OpenAI), Claude-SearchBot (Anthropic), PerplexityBot (Perplexity). Zablokuj OAI-SearchBota i znikasz z wyników wyszukiwania ChatGPT. To zwykle ostatnia rzecz, którą chcesz zrobić, jeśli zależy Ci na obecności w AI.

Agenty uruchamiane przez użytkownika. Pobierają stronę w czasie rzeczywistym, gdy ktoś wprost poprosi asystenta o odczytanie adresu. User-agenty: ChatGPT-User (OpenAI), Claude-User (Anthropic), Perplexity-User. Dokumentacja OpenAI zaznacza, że skoro są uruchamiane przez użytkownika, reguły robots.txt mogą ich nie obejmować. Zwykle warto je wpuszczać, bo obsługują żywe cytowania podczas przeglądania przez asystenta.

Jeden ważny błąd do uniknięcia: starsze user-agenty anthropic-ai i Claude-Web są wycofane. Jeśli blokujesz tylko je, strzelasz do celu, którego już nie ma (jangwook.net, VII 2026).

Tabela decyzyjna: który bot, jaki skutek blokady

User-agentWłaścicielKategoriaSkutek zablokowania
GPTBotOpenAItreningTreść nie trafia do uczenia modelu, cytowalność bez zmian
OAI-SearchBotOpenAIwyszukiwanieZnikasz z wyników wyszukiwania ChatGPT
ChatGPT-UserOpenAIagent użytkownikaModel nie odczyta strony na żądanie użytkownika
ClaudeBotAnthropictreningTreść nie trafia do uczenia, cytowalność bez zmian
Claude-SearchBotAnthropicwyszukiwanieZnikasz z wyników wyszukiwania Claude
PerplexityBotPerplexitywyszukiwanieZnikasz z indeksu Perplexity
CCBotCommon CrawltreningTreść nie trafia do zbioru Common Crawl
Google-ExtendedGoogletoken treningowyTreść nie zasila trenowania Gemini, rankingi Google bez zmian

Skala zjawiska: kto jest najczęściej blokowany

Blokowanie botów AI nie jest niszą. GPTBot jest najczęściej blokowanym crawlerem AI, występując w 5,52% reguł DISALLOW w I kwartale 2026, przed CCBot (5,08%), ClaudeBotem (4,88%), Google-Extended (4,44%) i Bytespiderem (4,23%) (DigitalApplied, VI 2026). Część tych blokad jest świadoma i uzasadniona. Część to pozostałość po fali z lat 2023-2024, gdy firmy blokowały OpenAI w obawie przed scrapingiem treningowym, nie rozumiejąc, że tym samym zamykają sobie drogę do cytowań w wyszukiwaniu AI.

Uwaga krytyczna: domyślne ustawienia Cloudflare zmieniają się 15 września 2026

Tu jest zmiana, która sprawi, że część firm zablokuje boty AI bez podejmowania żadnej decyzji. Od 15 września 2026 nowe domeny wdrażane w Cloudflare dostają domyślnie zablokowane kategorie treningową i agentową na stronach wyświetlających reklamy, przy zachowaniu dostępu dla kategorii wyszukiwawczej (CLSkills Hub, VII 2026). To znaczy, że kontrola dostępu przenosi się częściowo z Twojego robots.txt na domyślną konfigurację CDN.

Praktyczny wniosek: dostęp botów kontrolujesz dziś na dwóch warstwach. Robots.txt mówi grzecznym botom, co mogą pobierać. Cloudflare (albo inny CDN) egzekwuje decyzję wobec botów, które nigdy nie pytają. Te dwie warstwy muszą się zgadzać. Badania sieci Cloudflare pokazały, że istotna część serwisów przypadkiem blokuje główne crawlery AI na poziomie CDN, podczas gdy ich robots.txt mówi „wpuszczaj” (dataimpulse.com, VII 2026). Jeśli Twój robots.txt i konfiguracja CDN mówią co innego, wygrywa CDN, a Ty tego nie widzisz.

Jest jeszcze jeden haczyk, który powinien kształtować całą decyzję: Googlebot crawluje zarówno pod wyszukiwarkę, jak i pod funkcje AI Google. Zbyt szeroka blokada kategorii treningowej przez kontrolki CDN może przypadkiem złapać Googlebota i uderzyć w Twoje zwykłe rankingi (CLSkills Hub, VII 2026). Nigdy nie blokuj Googlebota.

Gotowa konfiguracja: blokuj trening, wpuszczaj wyszukiwanie

Najczęstsza rozsądna polityka dla firm, którym zależy na cytowalności: zablokuj crawlery treningowe, wpuść wyszukiwawcze i agentów użytkownika.

# Crawlery treningowe: blokada
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Crawlery wyszukiwawcze i agenci: dostęp
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Googlebota nigdy nie blokujemy
User-agent: Googlebot
Allow: /

Jest jedna pułapka techniczna, o której łatwo się potknąć. Część parserów robots.txt działa na zasadzie pierwszego dopasowania (first-match). Przy takim parserze reguła Allow: / umieszczona wcześniej może przesłonić późniejsze Disallow. Praktyk, który wdrażał dokładnie tę politykę, opisał, że musiał umieścić linie Disallow przed Allow i zweryfikować identyczne zachowanie na obu rodzinach parserów (jangwook.net, VII 2026). Po każdej zmianie robots.txt sprawdź, czy zachowuje się tak, jak zakładasz.

Ograniczenie robots.txt: to prośba, nie zamek

Trzeba to powiedzieć wprost. Robots.txt (znormalizowany jako RFC 9309) to dobrowolna prośba, którą honorują dobrze zachowujące się crawlery. Nie ma mocy prawnej samej w sobie i technicznie niczego nie blokuje (dataimpulse.com, VII 2026). Realne egzekwowanie dzieje się na serwerze albo CDN.

Większość zgodnych botów AI (GPTBot, ClaudeBot, PerplexityBot, Google-Extended) respektuje robots.txt w pomiarach na poziomie stu procent. Ale są wyjątki. Cloudflare opublikował w sierpniu 2025 raport dokumentujący, że Perplexity używa niedeklarowanych crawlerów z rotującymi user-agentami i IP, które obchodzą dyrektywy robots.txt, i w konsekwencji usunął Perplexity ze swojego programu Verified Bots (Semola Digital, VII 2026). Jeśli chcesz twardo zablokować bota, który nie słucha, robots.txt nie wystarczy, potrzebujesz reguły na poziomie serwera lub CDN (na przykład odpowiedź 403 albo filtrowanie po zakresach IP).

FAQ

Które boty AI zablokować?
Zależy od celu. Jeśli chcesz chronić treść przed uczeniem modeli, ale zachować obecność w wyszukiwaniu AI, blokuj crawlery treningowe (GPTBot, ClaudeBot, CCBot, Google-Extended), a wpuszczaj wyszukiwawcze (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Nigdy nie blokuj Googlebota.

Czy blokowanie GPTBota usunie mnie z ChatGPT?
Nie z wyszukiwania. GPTBot to crawler treningowy. Za obecność w wynikach wyszukiwania ChatGPT odpowiada OAI-SearchBot. Blokada GPTBota chroni treść przed treningiem, ale nie rusza cytowalności. Dopiero blokada OAI-SearchBota usuwa Cię z wyników ChatGPT.

Jak sprawdzić, co mam w robots.txt?
Wejdź na twojadomena.pl/robots.txt w przeglądarce. Szukaj reguł Disallow zawierających GPTBot, ClaudeBot, OAI-SearchBot, PerplexityBot lub ogólnego User-agent: * Disallow: /. Jeśli blokujesz boty wyszukiwawcze albo agentów użytkownika, jesteś niewidoczny dla tych platform.

Czy robots.txt naprawdę blokuje boty?
Tylko te, które go respektują. To dobrowolna prośba bez mocy prawnej. Zgodne boty (GPTBot, ClaudeBot, PerplexityBot) słuchają, ale twarda blokada nieposłusznych crawlerów wymaga reguły na serwerze lub CDN.

Co zmienia Cloudflare 15 września 2026?
Nowe domeny w Cloudflare dostają domyślnie zablokowane kategorie treningową i agentową na stronach z reklamami, przy zachowaniu dostępu dla wyszukiwania. To znaczy, że część firm zablokuje boty bez świadomej decyzji, przez samą domyślną konfigurację CDN. Sprawdź, czy Twój robots.txt i ustawienia CDN mówią to samo.

Czy Perplexity respektuje robots.txt?
Nie zawsze. Cloudflare udokumentował, że Perplexity używa niedeklarowanych crawlerów obchodzących robots.txt, i usunął go z programu Verified Bots. Jeśli chcesz twardo zablokować Perplexity, potrzebujesz reguły na poziomie serwera lub CDN.

Jedna linia „blokuj boty AI” to prawie zawsze błąd, bo zwija trzy różne decyzje do jednej. Trening możesz blokować bez szkody dla cytowalności. Wyszukiwanie blokujesz tylko wtedy, gdy świadomie rezygnujesz z obecności w ChatGPT, Claude i Perplexity. Agentów użytkownika zwykle warto wpuszczać. Do tego dochodzi warstwa CDN, która od 15 września 2026 zacznie podejmować część tych decyzji za Ciebie, jeśli jej nie skonfigurujesz.

Zacznij od jednego kroku: wejdź na własny robots.txt i sprawdź, czy przypadkiem nie blokujesz crawlerów wyszukiwawczych. Jeśli chcesz, żeby robots.txt, reguły CDN i pomiar widoczności w AI działały jako jeden spójny system, tym zajmuje się audyt technicznego SEO Insightland. Sama decyzja „blokować czy wpuszczać”, z argumentami po obu stronach, to temat osobnego artykułu dla zarządu.


Konfiguracje i user-agenty botów weryfikowane na 1 sierpnia 2026 u źródeł: dokumentacja OpenAI i Anthropic, DigitalApplied, guptadeepak.com, Semola Digital, jangwook.net. Kategoria zmienia się szybko, przed użyciem sprawdź aktualność u źródła pierwotnego.

more

Related blog posts

Ads

Co naprawdę robi Performance Max i ile kontroli możesz odzyskać w 2026 roku

01 Aug 2026 • Insight Land

AI Search

E-E-A-T w erze AI Search: jak budować wiarygodność w wyszukiwarkach generatywnych

31 Jul 2025 • Insightland

Ads

Consent Mode i dane konwersji: co tracisz, jeśli wdrożenie jest niepełne

01 Aug 2026 • Insight Land