ich habe ein etwas verzwacktes Problem mit der robots.txt…
Es gibt eine Reihe von URLs der Form
/calendar?todate=1268089200
Das sind so ein paar Millönchen URLs, die natürlich nicht indexiert werden sollen.
Da könnte man in die robots.txt natürlich schreiben:
Disallow: calendar
Disallow: /calendar
Leider geht das nicht, da dann auch URLs wie
/calendarium
o.ä. auch ausgeschlossen werden…
Nächste Idee:
Disallow: calendar?
Disallow: /calendar?
Nun meine Frage: Hätte das Fragezeichen an der Stelle eine steuernde Wirkung, oder kann man mit den beiden Zeilen wirklich erreichen, dass genau die gewünschten URLs ausgeschlossen werden?
Wir empfehlen grundsätzlich beim Aufbau einer Website darauf zu achten, dass Dateien, welche nicht durch Suchmaschinen indexiert werden sollen, in separaten Verzeichnissen abgelegt werden. Dieses Vorgehen dient nicht nur der Übersichtlichkeit und Ordnung in der Websitestruktur, sondern ermöglicht auch den Ausschluss ganzer Verzeichnisse über die Befehlsanweisungen in der robots.txt. Somit hat man sozusagen gleich „zwei Fliegen auf einen Schlag“ erwischt.
Hallo Herr Müller, danke für die schnelle Antwort. Da es sich um ein CMS handelt, habe ich keinen bzw. nur bedingt Einfluss auf die Verzeichnisstruktur…
Wenn Sie noch eine andere Idee hätten, wäre ich dankbar.
Vermutlich würde es in diesem Fall kein Unterschied machen. Ich würde jedoch trotzdem zu ersterem tendieren, da es hier nicht erheblich ist ob es sich um einen Ordner oder eine Datei handelt.
Getestet habe ich die Wildcards in robots.txt noch nicht.
Gruß
Gernot
mit dem „?“ sollte es funktionieren. Einfach mal ausprobieren und dann ein paar Tage später im Suchergebnis schauen, ob diese Links noch im Google Index stehen.