Mich täte nun interessieren, ob der PageRank bei Suchmaschinen erst beim durchsuchen des Datenbestandes berechnet wird, oder ob dies schon beim webcrawlen passiert?!
Vieleicht solltest du dich erstmal schlau machen, was der Pagerank überhaupt ist und wie er ermittelt wird, bevor du hier weiter wirre Vermutungen verkündest
Ich möchte es nur mal für den Eigengebrauch testen.
Hab bei mir Zuhaus einen Server, mit dem ich ein bisschen rumspiel, tja und jetzt möchte ich sowas mal versuchen.
Die Programmierung ansich ist nicht das Problem, doch mich interessiert der Aufbau des Systems(Cluster, Datnebanken,...).
Falls Du die "cache"-Seiten meinst: Wahrscheinlich in einem Filesystem.
Falls Du die erkannten Stichwörter und die Verlinkung meinst: So kommt bei Google eine eigens dafür entwickelte Datenbank-Engine zum tragen.
Was die Hardware/Technik angeht so betreibt Google inzwischen mehrere Rechenzentren die sich regelmässig (angeblich nicht ständig) gegenseitig aktualisieren. Pro RZ steht natürlich ein entsprechender Cluster der z.T. mit RoundRobin-IP und LoadBalancer für die Suchanfragen angesteuert wird.
Google setzt angeblich durchweg Linux ein. Was ich mir aber anhand des Alters der Suchmaschine nicht wirklich vorstellen kann.