robots.txt



Kato

Registered User
Aus irgendeinem Grund wurde von einem Web die robots.txt gespidert. Das würde ich nun gerne korrigieren. Macht ein
Code:
Disallow: /robots.txt

da Sinn? Oder verhindert das dann, dass die gewünschten Einträge gespidert werden?
 
Überleg doch mal ganz kurz, welche Datei die Crawler herunterladen, um deinen Regeln gemäß zu crawlen…

Ist doch klar, dass die robots.txt von jedem (ordentlichen) Crawler heruntergeladen wird, selbst wenn sie "Disallow: *" enthält.
 
Überleg doch mal ganz kurz, welche Datei die Crawler herunterladen, um deinen Regeln gemäß zu crawlen…

Ist doch klar, dass die robots.txt von jedem (ordentlichen) Crawler heruntergeladen wird, selbst wenn sie "Disallow: *" enthält.

Ja natürlich ist das logisch. Nur dass sie als Suchergebnis bei Google auftaucht habe ich noch nie erlebt. Das ist offensichtlich bei manchen Präsenzen der Fall, bei manchen nicht.

Z.b. ergibt ein inurl:serversupportforum.de/robots.txt keine Ergebnisse außer von einem Mirror, dabei kann man die Datei http://serversupportforum.de/robots.txt ohne Probleme aufrufen. Aus irgendeinem Grund wird diese robots.txt also nicht in den Suchergebnissen gelistet. Das ist der Zustand, den ich gerne erreichen würde. Dabei ist mir völlig klar, dass sie von jedem aufgerufen werden kann und auch aufrufbar bleiben muss. Nur in den Suchergebnissen muss sich nicht unbedingt auftauchen.

Hast du dazu vielleicht eine Idee?
 
das klingt eher nach einem Bug in der Suchmaschine als an einem Problem, das man selbst angehen könnte...
 
das klingt eher nach einem Bug in der Suchmaschine
Ein Google-Bug? Klar kann auch sein. Das brachte mich auf die Idee ein bisschen weiter zu suchen und ich fand http://www.searchenginejournal.com/bot-herding-pagerank-sculpting/10352/

Und das ist nun richtig interessant:

b. Adding in your robots.txt the noindex directive using this:

User-agent: Googlebot
Noindex: /login.php

Did I say Noindex robots.txt directive? Yes! Unofficially Google supports the Noindex robots.txt directive, but at this moment it is not supported by other search engines. Using this directive you can block or advise Googlebot not to index a page (or de-index a page if previously indexed). But it will not hinder Googlebot to follow the links on page B and pass the incoming PageRank to the outgoing linked pages which are not protected.

Das werde ich dann gleich mal ausprobieren.
 
Back
Top