Generator robots.txt

Ustaw robota, którego chcesz objąć regułami, wypisz ścieżki do zablokowania i te do dopuszczenia, dodaj opcjonalny crawl-delay i wskaż mapę witryny, a generator złoży poprawnie sformatowany plik robots.txt, który możesz skopiować i wdrożyć. Zajmuje się dokładnym formatem wierszy i interpunkcją, więc nie musisz zapamiętywać składni ani pisowni nazw user-agent.

Jak wygenerować plik

  1. 1

    Ustaw user-agent

    Wpisz robota, którego dotyczą reguły, albo zostaw *, aby objąć wszystkie boty.

  2. 2

    Wypisz ścieżki do zablokowania

    Dodaj katalogi lub ścieżki do zablokowania, po jednej w wierszu, na przykład /admin/ lub /checkout/.

  3. 3

    Wypisz ścieżki do dopuszczenia

    Dodaj ścieżki, które mają pozostać dostępne do indeksowania, po jednej w wierszu, aby utworzyć wyjątki w szerszym Disallow.

  4. 4

    Dodaj mapę witryny i crawl-delay

    Zadeklaruj adres URL mapy witryny i, jeśli trzeba, crawl-delay w sekundach.

  5. 5

    Skopiuj i wdróż

    Skopiuj wygenerowany plik i umieść go w https://twojadomena.com/robots.txt, tylko w katalogu głównym, nie w podkatalogu.

Typowe szablony startowe

Zezwól na wszystko (większość witryn):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

Zablokuj staging / panel:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

Zablokuj roboty treningowe AI, zezwól wyszukiwarkom:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

User-agenty warte poznania

User-agent Właściciel Cel
Googlebot Google Search Indeksowanie sieci
Googlebot-Image Google Wyszukiwanie grafiki
Google-Extended Google Trening Bard/Gemini (opt-out)
Bingbot Microsoft Wyszukiwarka Bing
DuckDuckBot DuckDuckGo Wyszukiwarka DDG
GPTBot OpenAI ChatGPT / trening (opt-out)
ClaudeBot Anthropic Trening Claude (opt-out)
CCBot Common Crawl Korpus używany przez wiele LLM-ów
AhrefsBot Ahrefs Indeks linków zwrotnych SEO
SemrushBot Semrush Badania SEO
MJ12bot Majestic Badania SEO

Boty treningowe AI są opt-out z konwencji, nie z wymogu prawnego; operatorzy działający w dobrej wierze respektują dyrektywy, mniej skrupulatni nie.

Reguły dopasowania ścieżek

  • Ścieżki są względne wobec katalogu głównego domeny, zaczynają się od /.
  • * dopasowuje dowolne znaki. Disallow: /*.pdf$ blokuje wszystkie PDF-y.
  • $ kotwiczy na końcu URL-a. Disallow: /*/trash$ blokuje /foo/trash, ale nie /foo/trashes/....
  • Wygrywa najdłuższe dopasowanie. Allow: /admin/public/ nadpisuje Disallow: /admin/ dla tej podścieżki.
  • Ścieżki rozróżniają wielkość liter.

Czego robots.txt nie potrafi

  • Usunąć strony z Google. Użyj metatagu noindex na samej stronie.
  • Ochronić URL-a przed ludźmi. robots.txt jest publiczny i to tylko sugestie dla zgodnych botów.
  • Ograniczyć tempa Googlebota. Crawl-delay jest przez Google ignorowany; użyj Search Console.
  • Zablokować botów, które ignorują robots.txt. Spamowe scrapery nie czytają tego pliku.

Lista kontrolna wdrożenia

  1. Umieść w https://twojadomena.com/robots.txt, tylko w katalogu głównym.
  2. Serwuj z Content-Type: text/plain (większość serwerów robi to automatycznie).
  3. Rozmiar: poniżej 500 KB. Google obcina większe pliki.
  4. Po wdrożeniu sprawdź pobrany plik w teście robots.txt w Google Search Console.
  5. Przy usuwaniu Disallow pamiętaj, że deindeksacja może zająć tygodnie.

Najczęściej zadawane pytania

Nie koniecznie. Bez niego roboty zakładają „zezwól na wszystko”. Jeśli masz cokolwiek do zablokowania: staging, panel, koszyk, wewnętrzne wyszukiwanie: potrzebujesz go.

Możesz poprosić je o zaprzestanie blokami user-agent, takimi jak GPTBot, ClaudeBot, CCBot i Google-Extended. Główni operatorzy je respektują; mniej skrupulatne scrapery ignorują je całkowicie.

Roboty są wyrozumiałe: nieznane dyrektywy są ignorowane. Poważne błędy (HTTP 404 lub 500) są traktowane jako „zezwól na wszystko”. Zwaliduj plik przed wysłaniem.

Do katalogu głównego każdego hosta, który chcesz objąć: https://www.example.com/robots.txt i https://example.com/robots.txt to osobne pliki dla osobnych hostów.

Nie. Wpisane ścieżki służą wyłącznie do złożenia pliku; nie są zapisywane ani rejestrowane.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach