Was ist die Robots.txt?

Die robots.txt ist eine einfache Textdatei, die im Hauptverzeichnis (Root-Verzeichnis) einer Website hinterlegt wird (z. B. ihredomain.de/robots.txt). Sie dient als wichtiges Instrument der Suchmaschinenoptimierung (SEO) und des Web-Managements. Die Datei kommuniziert direkt mit den automatisierten Web-Crawlern (auch Bots oder Spiders genannt) von Suchmaschinen wie Google oder Bing. Über standardisierte Befehle (das sogenannte Robots Exclusion Protocol) gibt sie den Crawlern Anweisungen darüber, welche Bereiche, Verzeichnisse oder einzelnen Seiten einer Website durchsucht (gecrawlt) werden dürfen und welche explizit ignoriert werden sollen.

Die wichtigsten Befehle und ihre Syntax

Die Steuerung der Crawler erfolgt über einfache, zeilenbasierte Anweisungen:

  • User-agent: Definiert, für welchen Bot die nachfolgende Regel gilt. Ein Sternchen (User-agent: *) spricht alle Suchmaschinen-Crawler an; spezifische Angaben wie Googlebot richten sich nur an Google.
  • Disallow: Sperrt bestimmte Verzeichnisse oder Seiten für das Crawling (z. B. Disallow: /admin/). Bots durchsuchen diese Bereiche dann nicht mehr.
  • Allow: Erlaubt das Crawlen eines Unterordners, selbst wenn das übergeordnete Verzeichnis per Disallow gesperrt wurde.
  • Sitemap: Verweist auf die XML-Sitemap der Website (z. B. Sitemap: https://ihredomain.de/sitemap.xml), um Suchmaschinen das Auffinden aller relevanten URLs zu erleichtern.
Erzähl uns von deiner Idee Say Hello