robots.txt
Die robots.txt ist eine einfache Textdatei im Wurzelverzeichnis einer Domain, die Suchmaschinen-Crawlern sagt, welche Bereiche sie abrufen dürfen und welche nicht. Sie steuert das Crawlen, nicht das Indexieren, und ist die erste Datei, die ein Bot wie der Googlebot auf einer Website liest.
Wenn du für deine Kunden Websites baust, ist die robots.txt der Wegweiser, den jeder Suchmaschinen-Bot zuerst aufschlägt. Sie liegt immer unter deinekunde.de/robots.txt und nirgends sonst, in einem Unterordner ignoriert Google sie. Mit Disallow sperrst du gezielt Pfade, etwa eine WordPress-Admin-URL oder eine Danke-Seite, die nicht im Google-Index landen soll. Wichtig für dein Kundengespräch: die Datei verhindert das Crawlen, nicht das Indexieren. Eine per Disallow gesperrte Seite kann trotzdem in den Suchergebnissen auftauchen, wenn andere Seiten darauf verlinken, weil Google dann nur die URL kennt, aber den Inhalt nie liest. Soll eine Seite wirklich aus dem Index raus, brauchst du den noindex-Tag, und der wiederum darf in der robots.txt nicht blockiert sein, sonst sieht der Bot die Anweisung nie.
Genau hier liegt ein wiederkehrender Verkaufsanlass. Bei einem Relaunch passiert es regelmäßig, dass die Staging-Site mit einem pauschalen Disallow: / abgeschottet war und beim Livegang vergessen wurde, sie zu öffnen, dann verschwindet die ganze Seite langsam aus Google. Wenn du bei der Akquise eine veraltete Kundenseite prüfst, lohnt der schnelle Blick in deren robots.txt: eine fehlende oder fehlerhafte Datei, ein versehentlich gesperrtes Verzeichnis oder eine nicht referenzierte XML-Sitemap sind handfeste technische Mängel, die du im Erstgespräch konkret benennen kannst. Pflege deshalb in die Datei immer den Verweis auf die Sitemap als voll qualifizierte URL ein, das hilft dem Crawler, alle relevanten Seiten zu finden.