Extraktion
Die Extraktion liest die Seiten jeder Website in einem Cluster und holt die Teile heraus, die zu einem Ausdruck passen. Aus einem Cluster von Websites wird eine Tabelle mit Telefonnummern, Social-Media-Konten, Adressen, Plugin-Namen - mit allem, was das Muster erfasst.
Was gelesen wird
Alles, was PublicWWW für diese Websites indexiert hat, Unterseiten inklusive - nicht nur die Startseite, auf die eine Suche gepasst hat. Auch eine Kontaktangabe, die nur auf einer „Über uns“-Seite steht, wird gefunden.
Vorlagen und eigene Muster
Für das, wonach am häufigsten gefragt wird - E-Mail-Adressen, Telefonnummern -,
gibt es Vorlagen, und stattdessen kann jeder beliebige reguläre Ausdruck verwendet
werden. Der Ausdruck funktioniert genauso wie
snipexp: in einer Suche: Die
Erfassungsgruppe bestimmt, was in der Spalte landet, und ein Ausdruck ohne
sie liefert leere Ergebnisse.
|/wp-content/plugins/([\w\d\-\.\_]+)/|
Testen Sie zuerst an einem kleinen Cluster. Der Ausdruck lässt sich mit einer Obergrenze für die Zahl der zu holenden Datensätze ausprobieren, anpassen und erneut ausprobieren, sodass ein falsches Muster fast nichts kostet - warum das wichtig ist, steht unter Limits.
Das Ergebnis exportieren
Die extrahierte Tabelle wird als Datei heruntergeladen und lässt sich in einer Tabellenkalkulation öffnen. Jede Zeile ist eine Website mit dem, was auf ihr gefunden wurde; eine Website ohne Treffer wird trotzdem aufgeführt, sodass Lücken sichtbar bleiben, statt stillschweigend zu verschwinden.
Suchen mit einem Cluster filtern
Ein Cluster funktioniert auch in der umgekehrten Richtung als Filter. Laden Sie Ihre eigene Liste von Domains, URLs oder E-Mail-Adressen hoch und grenzen Sie Suchergebnisse damit auf die Websites dieser Liste ein - oder, per Differenz, auf alle außer ihnen.
Telefonnummern und E-Mail-Adressen extrahieren zeigt den gesamten Ablauf, von zwei Suchen bis zur fertigen Tabelle.
Weiter Limits