Generator robots.txt
Ustaw robota, którego chcesz objąć regułami, wypisz ścieżki do zablokowania i te do dopuszczenia, dodaj opcjonalny crawl-delay i wskaż mapę witryny, a generator złoży poprawnie sformatowany plik robots.txt, który możesz skopiować i wdrożyć. Zajmuje się dokładnym formatem wierszy i interpunkcją, więc nie musisz zapamiętywać składni ani pisowni nazw user-agent.
Jak wygenerować plik
-
1
Ustaw user-agent
Wpisz robota, którego dotyczą reguły, albo zostaw *, aby objąć wszystkie boty.
-
2
Wypisz ścieżki do zablokowania
Dodaj katalogi lub ścieżki do zablokowania, po jednej w wierszu, na przykład /admin/ lub /checkout/.
-
3
Wypisz ścieżki do dopuszczenia
Dodaj ścieżki, które mają pozostać dostępne do indeksowania, po jednej w wierszu, aby utworzyć wyjątki w szerszym Disallow.
-
4
Dodaj mapę witryny i crawl-delay
Zadeklaruj adres URL mapy witryny i, jeśli trzeba, crawl-delay w sekundach.
-
5
Skopiuj i wdróż
Skopiuj wygenerowany plik i umieść go w https://twojadomena.com/robots.txt, tylko w katalogu głównym, nie w podkatalogu.
Typowe szablony startowe
Zezwól na wszystko (większość witryn):
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
Zablokuj staging / panel:
User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml
Zablokuj roboty treningowe AI, zezwól wyszukiwarkom:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
User-agenty warte poznania
| User-agent | Właściciel | Cel |
|---|---|---|
| Googlebot | Google Search | Indeksowanie sieci |
| Googlebot-Image | Wyszukiwanie grafiki | |
| Google-Extended | Trening Bard/Gemini (opt-out) | |
| Bingbot | Microsoft | Wyszukiwarka Bing |
| DuckDuckBot | DuckDuckGo | Wyszukiwarka DDG |
| GPTBot | OpenAI | ChatGPT / trening (opt-out) |
| ClaudeBot | Anthropic | Trening Claude (opt-out) |
| CCBot | Common Crawl | Korpus używany przez wiele LLM-ów |
| AhrefsBot | Ahrefs | Indeks linków zwrotnych SEO |
| SemrushBot | Semrush | Badania SEO |
| MJ12bot | Majestic | Badania SEO |
Boty treningowe AI są opt-out z konwencji, nie z wymogu prawnego; operatorzy działający w dobrej wierze respektują dyrektywy, mniej skrupulatni nie.
Reguły dopasowania ścieżek
- Ścieżki są względne wobec katalogu głównego domeny, zaczynają się od
/. *dopasowuje dowolne znaki.Disallow: /*.pdf$blokuje wszystkie PDF-y.$kotwiczy na końcu URL-a.Disallow: /*/trash$blokuje/foo/trash, ale nie/foo/trashes/....- Wygrywa najdłuższe dopasowanie.
Allow: /admin/public/nadpisujeDisallow: /admin/dla tej podścieżki. - Ścieżki rozróżniają wielkość liter.
Czego robots.txt nie potrafi
- Usunąć strony z Google. Użyj metatagu
noindexna samej stronie. - Ochronić URL-a przed ludźmi. robots.txt jest publiczny i to tylko sugestie dla zgodnych botów.
- Ograniczyć tempa Googlebota.
Crawl-delayjest przez Google ignorowany; użyj Search Console. - Zablokować botów, które ignorują robots.txt. Spamowe scrapery nie czytają tego pliku.
Lista kontrolna wdrożenia
- Umieść w
https://twojadomena.com/robots.txt, tylko w katalogu głównym. - Serwuj z
Content-Type: text/plain(większość serwerów robi to automatycznie). - Rozmiar: poniżej 500 KB. Google obcina większe pliki.
- Po wdrożeniu sprawdź pobrany plik w teście robots.txt w Google Search Console.
- Przy usuwaniu Disallow pamiętaj, że deindeksacja może zająć tygodnie.
Najczęściej zadawane pytania
Nie koniecznie. Bez niego roboty zakładają „zezwól na wszystko”. Jeśli masz cokolwiek do zablokowania: staging, panel, koszyk, wewnętrzne wyszukiwanie: potrzebujesz go.
Możesz poprosić je o zaprzestanie blokami user-agent, takimi jak GPTBot, ClaudeBot, CCBot i Google-Extended. Główni operatorzy je respektują; mniej skrupulatne scrapery ignorują je całkowicie.
Roboty są wyrozumiałe: nieznane dyrektywy są ignorowane. Poważne błędy (HTTP 404 lub 500) są traktowane jako „zezwól na wszystko”. Zwaliduj plik przed wysłaniem.
Do katalogu głównego każdego hosta, który chcesz objąć: https://www.example.com/robots.txt i https://example.com/robots.txt to osobne pliki dla osobnych hostów.
Nie. Wpisane ścieżki służą wyłącznie do złożenia pliku; nie są zapisywane ani rejestrowane.
Powiązane narzędzia
Tabela ASCII
Pełna tabela ASCII od 0 do 127 z zapisem dziesiętnym, szesnastkowym, ósemkowym i binarnym oraz notacją numerycznych odwołań HTML, w tym kodami sterującymi NUL, LF i DEL.
Referencja znaków HTML
Przeszukiwalna lista encji HTML wraz z ich kodami nazwanymi i liczbowymi oraz kopiowaniem jednym kliknięciem specjalnych znaków i symboli.
Skróty klawiaturowe
Wyszukuj udokumentowane skróty domyślne VS Code, Chrome i Bash z GNU Readline w macOS, Windows i Linux.
Generator EditorConfig
Zbuduj plik .editorconfig z własnych reguł wcięć, końca linii i kodowania, a potem dodaj poprawną sekcję dla każdego języka w repozytorium: Python, Go, YAML, Makefile i więcej.
Walidator adresów e-mail
Zweryfikuj adres e-mail: sprawdzenie składni RFC 5322, sprawdzenie rekordu MX w czasie rzeczywistym oraz szczegóły dotyczące części lokalnej, domeny i długości. Żadna wiadomość nie jest wysyłana.
Formatowanie HTML
Formatuj HTML lokalnie w przeglądarce, używając wcięć dwóch lub czterech spacji. HTML nie jest wysyłany ani walidowany.
Narzędzie jest dostępne w innych językach
- Robots.txt-generator [NL]
- Générateur de Robots.txt [FR]
- مولد ملفات robots.txt [AR]
- Generator Robots.txt [ID]
- Robots.txt-Generator [DE]
- Generador de Robots.txt [ES]
- เครื่องมือสร้างไฟล์ robots.txt [TH]
- Robots.txtジェネレーター [JA]
- Robots.txt-generator [SV]
- Bộ tạo file robots.txt [VI]
- Robots.txt 생성기 [KO]
- Gerador de Robots.txt [PT]
- Robots.txt Generator [EN]
- Generatore di Robots.txt [IT]
- Генератор robots.txt [RU]
- Robots.txt Oluşturucu [TR]
- Robots.txt 生成器 [ZH]