Google

Hallo,

wie schafft es eigentlich Google innerhalb weniger Sekunden 8 Mrd. Webseiten nach einem bestimmten Wort zu durchsuchen??

Gruß
Oliver

wie schafft es eigentlich Google innerhalb weniger Sekunden 8
Mrd. Webseiten nach einem bestimmten Wort zu durchsuchen??

Sie setzen dazu Computer ein!

Nun es funktioniert nach normalen indizieren Datenbanken. Alle Wörter einer Seite werden in eine Datenbankdatei geschrieben. Dort werden sie nach Alphabet (z.B.) sortiert, und zwar nicht die Datensätze sondern eine indexdatei bzw. Pointer-Datei …

In dieser Pointer-Datei steht dann das Stichwort und die Nummer des Datensatzes in dem sich das Wort befindet. Dann wird nach einem Halbierungsverfahren gerchnet:
Ist das gesuchte Wort in A-K oder L-Z enthalten, ist A-K richtig, dann a-f g-k usw.

So wird die Suche recht schnell eingegrenzt. Dieser Schemenhafte überblick den ich jetzt versucht habe wieder zu geben ist nur das Grobe Schema, natürlich kann man mathematisch noch wesentlich feiner arbeiten (ich nicht :smile:).

Jedenfalls steht wahrscheinliche jedes Suchwort in einem eigenen Datensatz und es gibt ein Verweis auf den Seiteneintrag in der Datenbank in dem sich die Seiteninformationen befinden.

Natürlich werden vorher alles unwichtigen Wörter wie „und, ein, alles, der, die das, usw. …“ ausgefiltert.

Ein Vorteil von Computern ist es, viele Berechnungen in einer Sekunde zu machen, folglich bekommt man auch ein passendes Ergebnis :smile:

Achja und natürlich sind alle Seiten die durchsucht werden auch in deren Datenbanken gespeichert, also quasi ein Backup des Internets … jedenfalls was die sichtbaren und trackbaren Seiten angeht.

Folglich muss Google nicht jedesmal auf all die Seiten zugreifen! sondern verwendet werden die Seiten aus der Datenbank der Suchmaschine und ein lokales Suchen geht ja auch bei Deinem PC einiger massen hurtig, insbesondere wenn du indizierte Dateien suchst.

GRuß aus Hamburg
Knud Schiffmann
http://internet-partner.de

Hallo,

achso, also wenn ich z.B. das Wort „Rosinenbomber“ eingebe, dann gibt es eine Pointer-Datei names „Rosinenbomber“ und darin stehen dann die Nummern sämtlicher 8590 Datensätze, wo dieses Wort enthalten ist und die Internetadressen der ersten 10, inklisve eines kurzen Textauszuges werden mir dann angezeigt. Hab ich das jetzt halbwegs richtig verstanden?

Achja und natürlich sind alle Seiten die durchsucht werden
auch in deren Datenbanken gespeichert, also quasi ein Backup
des Internets … jedenfalls was die sichtbaren und trackbaren
Seiten angeht.

Donnerwetter!
Und weißt du zufällig wie groß dieses „Internet-Backup“ ist? Das würde mich mal interessieren…
Und noch was: Wie schafft es Google eigentlich immer auf dem Laufenden zu sein? Kümmern die sich da selbst drum oder müssen die Seitenbetreiber ständig eine aktuelle Version ihrer Seite an Google schicken?

Gruß
Oliver

Hallo,

achso, also wenn ich z.B. das Wort „Rosinenbomber“ eingebe,
dann gibt es eine Pointer-Datei names „Rosinenbomber“ und
darin stehen dann die Nummern sämtlicher 8590 Datensätze, wo
dieses Wort enthalten ist und die Internetadressen der ersten
10, inklisve eines kurzen Textauszuges werden mir dann
angezeigt. Hab ich das jetzt halbwegs richtig verstanden?

nein, nicht unbedingt…
Es kann durchaus sein dass für die Seiten separate Datenbanken vorhanden sind, die dann die Seiteninformationen beinhalten…
Also etwa die ersten 200 Zeichen einer Seite oder sowas

Achja und natürlich sind alle Seiten die durchsucht werden
auch in deren Datenbanken gespeichert, also quasi ein Backup
des Internets … jedenfalls was die sichtbaren und trackbaren
Seiten angeht.

Donnerwetter!
Und weißt du zufällig wie groß dieses „Internet-Backup“ ist?
Das würde mich mal interessieren…

Man kann davon ausgehen dass die Datenbankbackups mehrere GB vmtl sogar mehrere TB gross sind. Aber es ist kein Internet-Backup… Schliesslich werden keine Bilder oder auch keine html tags gespeichert sondern nur der reine Text, der sich auch auf der Seite wiederfindet - und selbst der nur zu einem Teil.

Und noch was: Wie schafft es Google eigentlich immer auf dem
Laufenden zu sein? Kümmern die sich da selbst drum oder müssen
die Seitenbetreiber ständig eine aktuelle Version ihrer Seite
an Google schicken?

Das übernehmen sogenannte Robots, die die Seiten „spidern“. d.h. die suchen sich einmal am Tag durch eine Liste von Seiten und werten diese aus und legen die gewonnenen Daten eben in diese Datenbank und überschreiben falls die Seite schon bekannt ist die alten Einträge

Man kann davon ausgehen dass die Datenbankbackups mehrere GB
vmtl sogar mehrere TB gross sind. Aber es ist kein
Internet-Backup… Schliesslich werden keine Bilder oder auch
keine html tags gespeichert sondern nur der reine Text, der
sich auch auf der Seite wiederfindet - und selbst der nur zu
einem Teil.

Also was die Datenbank angeht seh ich das so ähnlich, aber ich glaube mit dem „keine Bilder“ usw. nicht ganz, denn Du kannst bei Google die Seiten im Cache lesen und anschauen, ohne dass diese auf dem gehosteten Server zugreifen, was wohl nur geht, wenn die kpl. Seite gespeichert ist?

Wäre allerdings wirklich interessant wie groß so eine Datenbank ist … muss schon was größeres als ein 486er mit 20 MB HD hinter stehen :smile:

Gruß aus Hamburg
Knud Schiffmann
http://internet-partner.de

Google technische Infos
Hi,

ein bisschen was darüber findest Du auch bei Google selbst:
http://www.google.de/intl/de/corporate/tech.html

Und dann gibts hier http://en.wikipedia.org/wiki/Google noch einige sehr interessante Informationen:

_Based on the Google IPO S-1 form released in April 2004, Tristan Louis, the Vice President of application development for the Internet unit of a large financial firm, estimated the current server farm to contain something like the following [4] (http://www.tnl.net/blog/entry/How_many_Google_machines):

* 719 racks
* 63,272 machines
* 126,544 CPUs
* 253,088 GHz of processing power
* 126,544 GB of RAM
* 5,062 TB of hard drive space

According to this estimate, the Google server farm constitutes one of the most powerful supercomputers in the world, at 126-316 teraflops, being able to perform at least three times as many calculations per second as the Earth Simulator._

Gruss,

Herb

[Bei dieser Antwort wurde das Vollzitat nachträglich automatisiert entfernt]

ok, das stimmt schon :wink:

Also was die Datenbank angeht seh ich das so ähnlich, aber ich
glaube mit dem „keine Bilder“ usw. nicht ganz, denn Du kannst
bei Google die Seiten im Cache lesen und anschauen, ohne dass
diese auf dem gehosteten Server zugreifen, was wohl nur geht,
wenn die kpl. Seite gespeichert ist?

gerade wenn ich an die Bildersuche denke begegnen einem da auch immer wieder pics, die dann gar nicht mehr auf dem Server sind, aber man kann ja auch binärdaten in einer Datenbank haben…
Wie das nun genau mit dem google cache funktioniert weiss sicher nur google mit sicherheit und ich denke die haben kein grosses interesse daran uns ihr Geheimnis mitzuteilen :wink:

Wäre allerdings wirklich interessant wie groß so eine
Datenbank ist … muss schon was größeres als ein 486er mit 20
MB HD hinter stehen :smile:

das definitiv :smiley:

http://www.archive.org

Das Internetarchiv! Fast alle Seiten seit 1996 archiviert:

The Internet Archive Wayback Machine contains approximately 1 petabyte of data and is currently growing at a rate of 20 terabytes per month. This eclipses the amount of text contained in the world’s largest libraries, including the Library of Congress. If you tried to place the entire contents of the archive onto floppy disks (we don’t recommend this!) and laid them end to end, it would stretch from New York, past Los Angeles, and halfway to Hawaii.

Ciao! Bjoern

PS: auch wer-weiss-was.de ist in einer (fast) Erstlingsversion vorhanden, manche werden sich an das „Design“ noch erinnern