Jemand schickt dir einen Link zu einem Verzeichnis mit 900 Einträgen und bittet dich, diese bis morgen in eine Tabelle zu übertragen.
Du könntest einen Scraper programmieren. Du könntest auch drei Stunden lang kopieren und einfügen. Oder du installierst eine kostenlose Chrome-Erweiterung, klickst viermal und hast in neunzig Sekunden eine CSV-Datei.
Instant Data Scraper, entwickelt von WebRobots, ist die dritte Option. Es scannt die Seite, auf der du dich befindest, erkennt, welcher Teil davon die Daten enthält, und exportiert das Ergebnis als CSV-Datei oder in Excel. Es ist kein Konto, kein Code und keine Gebühr erforderlich.
Es ist auch das Tool, aus dem die meisten Nutzer innerhalb eines Monats herauswachsen, und die Gründe dafür sind so einheitlich, dass sie sich vorhersagen lassen.
Dieser Leitfaden behandelt, was die Erweiterung leistet, wie man sie richtig einsetzt, die fünf konkreten Punkte, an denen sie nicht mehr funktioniert, und welche Alternativen in jedem dieser Fälle zur Verfügung stehen.
Wir veröffentlichen diesen Artikel als Geonode, einem Anbieter von Residential-Proxys. Proxys sind genau für einen der fünf unten aufgeführten Fehlerpunkte relevant, und der Artikel nennt diesen – für die anderen vier ist die Lösung ein völlig anderes Tool.
Was „Instant Data Scraper“ tatsächlich leistet
Die Erweiterung löst ein ganz bestimmtes Problem: Sie wandelt sich wiederholende Strukturen auf einer Webseite in Zeilen einer Tabelle um.
Die meisten Daten im Internet liegen in bestimmten Mustern vor – Produktraster, Suchergebnisse, Verzeichniseinträge, Kommentar-Threads, Preistabellen. Jedes Element hat dieselbe HTML-Struktur wie seine Nachbarn. „Instant Data Scraper“ sucht nach diesen sich wiederholenden Strukturen und schließt daraus, dass es sich dabei um die gewünschten Daten handelt.
Sie müssen keine Selektoren schreiben. Sie müssen keine Entwicklertools öffnen. Die Erweiterung macht einen Vorschlag, zeigt Ihnen eine Vorschautabelle an, und Sie akzeptieren diesen entweder oder weisen sie auf einen anderen Block auf der Seite hin.
Was ist im Lieferumfang enthalten?
Automatische Erkennung. Die Erweiterung scannt die Seite und schlägt vor, was extrahiert werden soll – dadurch entfällt der Schritt, an dem die meisten Nicht-Entwickler scheitern.
Umgang mit Paginierung. Zeigen Sie auf die Schaltfläche „Nächste Seite“, und die Erweiterung durchläuft die Sequenz selbstständig und fügt dabei nach und nach Zeilen hinzu.
Unendliches Scrollen. Bei Seiten, die beim Scrollen weitere Inhalte laden, anstatt zu paginieren, kann die Erweiterung weiter scrollen und Daten erfassen.
Spaltensteuerung. Benennen Sie Spalten um, blenden Sie unerwünschte Spalten aus und filtern Sie vor dem Export.
CSV- und Excel-Export. Direkt in XLS, XLSX oder CSV.
Kostenlos, ohne Stufen. Kein Konto, keine Testphase, keine Zeilenbegrenzung. Das ist so ungewöhnlich, dass es sich lohnt, es ausdrücklich zu erwähnen.
Was es nicht ist
Es ist kein Scheduler – es kann nicht selbstständig jede Nacht ausgeführt werden. Es ist keine API – es kann von keinem nachgelagerten System aufgerufen werden. Es ist kein Crawler – es funktioniert auf der Seite, die Sie gerade betrachten, nicht siteweit. Und es löst das Problem der Blockierung nicht, da es Ihre eigene Verbindung nutzt.
So funktioniert es in vier Schritten
1. Öffnen Sie die Seite, auf der sich die Daten befinden
Navigieren Sie zur eigentlichen Auflistung, nicht zur Startseite der Website. Befinden sich die Daten hinter einer Suchfunktion, führen Sie diese zunächst aus. Befinden sie sich hinter einem Login, für das Sie berechtigte Zugangsdaten besitzen, melden Sie sich zunächst an – die Erweiterung sieht alles, was Ihr Browser sieht.
Stellen Sie die Seitengröße so hoch ein, wie es die Website zulässt, bevor Sie beginnen. Eine Website, die „100 pro Seite“ statt „20“ anbietet, reduziert Ihren Aufwand für die Paginierung um vier Fünftel.
2. Starten Sie die Erweiterung und überprüfen Sie den Vorschlag
Klicken Sie auf das Symbol der Erweiterung. Sie scannt die Seite und zeigt eine Vorschautabelle an.
Bei herkömmlichen Layouts ist der Vorschlag meistens richtig. Wenn er falsch ist, hat die Erweiterung in der Regel ein Navigationsmenü oder eine Seitenleiste anstelle des Hauptinhalts erfasst – die Erweiterung bietet weitere erkannte Tabellen an, also blättere durch diese, bis die Vorschau dem entspricht, was du tatsächlich willst.
Überprüfen Sie die Vorschau sorgfältig, bevor Sie fortfahren. Vergewissern Sie sich, dass die Zeilenanzahl plausibel erscheint, die Spalten übereinstimmen und nichts um eine Position verschoben ist. Wenn Sie eine Fehlausrichtung jetzt erkennen, ersparen Sie sich die erneute Ausführung des gesamten Vorgangs.
3. Paginierung oder Bildlauf einrichten
Verwenden Sie bei paginierten Websites das Steuerelement „Locate Next“ und klicken Sie auf die siteeigene Schaltfläche für die nächste Seite. Die Erweiterung speichert dieses Element und verwendet es wieder.
Bei unendlichem Bildlauf wechseln Sie stattdessen in den Bildlaufmodus.
Legen Sie die Verzögerung zwischen den Seiten bewusst fest. Die Standardeinstellung ist „schnell“. Eine Erhöhung auf zwei oder drei Sekunden ist die wichtigste Änderung, die Sie vornehmen können – sie verringert die Wahrscheinlichkeit einer Ratenbegrenzung während des Vorgangs erheblich, und bei einem Auftrag mit 40 Seiten kostet Sie das lediglich zwei Minuten.
4. Ausführen und Exportieren
Starten Sie den Crawl und lassen Sie den Tab in Ruhe. Die Erweiterung benötigt die Seite geöffnet und aktiv; das Wechseln zwischen Tabs oder das Versetzen des Computers in den Ruhezustand kann den Vorgang unterbrechen.
Wenn der Vorgang abgeschlossen ist, benennen Sie die Spalten um und entfernen Sie überflüssige Spalten, dann exportieren Sie die Daten als CSV oder XLSX.
Überprüfen Sie die Ausgabe, bevor Sie sie verwenden. Vergleichen Sie die Zeilenanzahl mit den Angaben der Website, überprüfen Sie stichprobenartig einige Zeilen anhand der Live-Seite und sehen Sie sich insbesondere die letzte Seite an – am Ende zeigen sich eventuelle Abschneidungen.
Was es gut kann
Eine genaue Beschreibung der Stärken ist aussagekräftiger als eine Liste von Funktionen.
Einmalige Datenextraktionen. Eine einzelne Liste, die Sie heute einmal benötigen. Die Einrichtungszeit beträgt weniger als eine Minute – das kann kein skriptbasierter Ansatz toppen.
Herkömmliche Layouts. Server-gerenderte Tabellen, Produktraster, Verzeichnisauflistungen, Suchergebnisse – alles mit einer klaren, sich wiederholenden Struktur.
Kleine bis mittlere Datenmengen. Bis zu einigen Tausend Zeilen auf ein paar Dutzend Seiten sind kein Problem.
Nicht-technische Nutzer. Das ist der eigentliche Mehrwert. Selbst jemand, der noch nie ein Terminal geöffnet hat, kann innerhalb von Minuten strukturierte Daten aus einer Website extrahieren – und das beseitigt einen Engpass, der sonst bei einem Entwickler liegen würde.
Explorative Arbeit. Bevor Entwicklungszeit in einen Scraper investiert wird, beantwortet die Erweiterung in neunzig Sekunden die Frage: „Sind diese Daten überhaupt so aufgebaut, wie ich es mir vorstelle?“
Wenn Ihre Aufgabe dieser Beschreibung entspricht, hören Sie hier auf zu lesen – die Erweiterung ist die richtige Lösung, und alles, was im Folgenden steht, betrifft Probleme, die Sie nicht haben.
Wo es hakt
Fünf Schwachstellen, in der Reihenfolge, in der die meisten Nutzer darauf stoßen.
1. Umfang
Die Erweiterung läuft in Ihrem Browser mit Browser-Geschwindigkeit und jeweils auf einer Seite. Ein paar Dutzend Seiten sind kein Problem. Bei einigen Tausend muss man einen Tab stundenlang offen lassen, ohne die Möglichkeit, den Vorgang sauber fortzusetzen, falls er unterbrochen wird.
Es gibt keine Parallelität, keine Warteschlange und keinen Checkpoint. Ein Crawl, der bei Seite 300 von 400 abstürzt, bedeutet in der Regel, dass man von vorne anfangen muss.
2. Ratenbegrenzung und Sperren
Dies ist der Punkt, bei dem Proxys die eigentliche Lösung darstellen, daher wird ihm der größte Platz eingeräumt.
Jede Anfrage wird von Ihrer eigenen IP-Adresse gesendet. Websites, die die Anfragefrequenz überwachen, sehen eine Adresse, von der aus stetige, in gleichmäßigen Abständen erfolgende und strukturell identische Anfragen gesendet werden – was nicht dem Surfverhalten eines Menschen entspricht.
Was folgt, ist in der Regel ein CAPTCHA, dann eine Drosselung und schließlich eine vorübergehende Sperre. Auf einer Website, die für Ihr Unternehmen wichtig ist, stellt die Kennzeichnung Ihrer Büro-IP-Adresse einen echten Kostenfaktor dar.
Eine Verlangsamung hilft und ist der erste Schritt, den man versuchen sollte. Ab einem bestimmten Volumen reicht das jedoch nicht mehr aus, denn das Problem ist nicht die Geschwindigkeit – sondern dass jede Anfrage von einer einzigen Adresse kommt. Die Verteilung der Anfragen auf viele Adressen ist die eigentliche Lösung, und das bedeutet den Einsatz eines Proxys, den eine Browser-Erweiterung nicht für jede einzelne Anfrage nutzen kann.
3. Zeitplanung
Die Erweiterung kann nicht eigenständig laufen. Wenn Sie jeden Morgen um sechs Uhr Preise benötigen, muss jemand einen Browser öffnen und klicken. Jeder wiederkehrende Auftrag erfordert einen skriptgesteuerten Scraper oder einen gehosteten Dienst.
4. Unübersichtliche Strukturen
Die automatische Erkennung setzt ein sich wiederholendes Muster voraus. Sie hat Schwierigkeiten mit Daten, die über eine Seite verteilt statt aufgelistet sind, mit Inhalten hinter Interaktionen wie Registerkarten und Akkordeons, mit Detailseiten, die zeilenweise aufgerufen werden müssen, sowie mit stark JavaScript-gesteuerten Oberflächen, die Inhalte auf ungewöhnliche Weise zusammenstellen.
Außerdem kann sie einem Link von einer Auflistung zu einer Detailseite nicht folgen und dann zurückkehren – eine sehr häufige Anforderung und ein entscheidendes Hindernis.
5. Integration
Die Ausgabe erfolgt als Datei, die ein Mensch herunterladen muss. Wenn eine Pipeline, ein Dashboard oder ein Modell die Daten benötigt, muss jemand diese Datei jedes Mal manuell übertragen. Es gibt weder eine API noch einen Webhook.
Wissenswertes zu Alternativen
Wählen Sie das passende Tool für das jeweilige Problem aus.
Andere Browser-Erweiterungen
Mehrere Erweiterungen decken einen ähnlichen Bereich ab, wobei einige eine KI-gestützte Felderkennung oder Cloud-Ausführungen bieten. Sie sind einen Versuch wert, wenn die Erkennung Ihr spezifisches Problem ist – doch sie unterliegen denselben grundlegenden Einschränkungen: Ihr Browser, Ihre IP-Adresse, Ihre Klicks.
Ein Wechsel der Erweiterung löst zwar Erkennungsprobleme, nicht jedoch Probleme hinsichtlich Volumen, Zeitplanung, Blockierung oder Integration.
Visuelle Scraper-Anwendungen
Desktop- und Cloud-Tools mit Point-and-Click-Baukästen liegen eine Stufe höher. Sie bewältigen mehrstufige Abläufe, Besuche von Detailseiten und geplante Cloud-Läufe. Die meisten sind kostenpflichtig.
Dies ist der richtige Schritt, wenn Ihre Struktur für die automatische Erkennung zu komplex ist, Sie aber dennoch keinen Code schreiben möchten.
Eigene Skripte schreiben
Python mit requests und BeautifulSoup deckt servergerenderte Seiten ab. Playwright oder Selenium bewältigt JavaScript-lastige Websites. Scrapy ermöglicht Crawling in großem Maßstab mit integrierten Wiederholungsversuchen und Parallelität.
Dies ist die flexibelste Lösung, erfordert aber auch den größten Aufwand. Es lohnt sich, sobald ein Auftrag wiederkehrend ist, da man ihn einmal schreibt und er dann dauerhaft läuft.
Scraping-APIs
Dienste, die eine URL entgegennehmen und geparste Daten zurückgeben, wobei die Rotation und das Rendern serverseitig erfolgen. Man tauscht die Kosten pro Anfrage gegen den Verzicht auf die Wartung einer eigenen Infrastruktur ein.
Gut geeignet, wenn Sie Daten benötigen, ohne die technische Infrastruktur selbst betreiben zu müssen.
Proxys mit eigenem Code
Sie behalten die Kontrolle über den Scraper und leiten Anfragen über wechselnde Adressen weiter. Mehr Aufwand als bei einer API, bei großem Datenvolumen kostengünstiger, und Sie haben die volle Kontrolle über die Logik.
Hier landen die meisten Teams, sobald ein Scraping-Auftrag dauerhaft wird.
Skalierung über die Erweiterung hinaus
Wenn aus einer einmaligen Aufgabe ein wiederkehrender Auftrag wird, ändert sich die Problemstellung.
Den richtigen Zeitpunkt erkennen
Handeln Sie, wenn einer der folgenden Punkte zutrifft: Der Auftrag wird mehr als einmal ausgeführt, er umfasst mehr als ein paar hundert Seiten, Sie wurden einer Ratenbegrenzung unterzogen, die Ausgabe speist einen automatisierten Prozess oder die Struktur erfordert das Verfolgen von Links zu Detailseiten.
So sieht die Alternative aus
Eine einfache Skriptversion dessen, was die Erweiterung leistet:
import time
import requests
from bs4 import BeautifulSoup
proxies = {
"http": "http://USERNAME:PASSWORD@proxy.geonode.io:9000",
"https": "http://USERNAME:PASSWORD@proxy.geonode.io:9000",
}
rows = []
for page in range(1, 41):
r = requests.get(
f"https://example.com/listings?page={page}",
proxies=proxies,
timeout=30,
)
if r.status_code != 200:
print(f"page {page}: HTTP {r.status_code}")
continue
soup = BeautifulSoup(r.text, "html.parser")
for item in soup.select(".listing-item"):
rows.append({
"title": item.select_one(".title").get_text(strip=True),
"price": item.select_one(".price").get_text(strip=True),
})
time.sleep(2)
print(f"collected {len(rows)} rows")
Etwa dreißig Zeilen, und sie bietet das, was die Erweiterung nicht leisten kann: Sie läuft unbeaufsichtigt, setzt den Vorgang ab einer bekannten Seite fort und verteilt die Anfragen auf viele Adressen, anstatt eine einzige zu überlasten.
Was Proxys in dieser Größenordnung kosten
Text-Scraping ist ressourcenschonend. Eine HTML-Seite ohne Bilder ist in der Regel 50–200 KB groß, sodass 10.000 Seiten etwa 1–2 GB ausmachen.
Bei [Geonode
s](https://geonode.com/pricing) Einstiegspreis von 0,79 $ pro GB sind das ungefähr 1 bis 2 $ für den gesamten Auftrag – und neue Konten erhalten 1 TB kostenlos, was eine Vielzahl von Aufträgen dieser Größe abdeckt, bevor überhaupt Geld den Besitzer wechselt. Die Preise sinken bei 100 GB auf 0,50 $ pro GB und bei 1 TB auf 0,27 $.
Um es ehrlich zu sagen: Bei zehntausend Seiten sind die Kosten so oder so vernachlässigbar, und der Grund für einen Wechsel ist die Zuverlässigkeit, nicht der Preis. Der Preis spielt erst bei Millionen von Seiten eine Rolle – und genau dort summieren sich die Preise pro GB der verschiedenen Anbieter, die zwischen 0,79 und 7,00 US-Dollar liegen, zu einer nennenswerten Summe.
Behalten Sie die Erweiterung bei
Selbst wenn Sie bereits über eine funktionierende Pipeline verfügen, bleibt die Erweiterung nützlich für genau das, was sie am besten kann: zu prüfen, ob es sich lohnt, eine neue Quelle zu integrieren, bevor Sie auch nur eine Zeile Code schreiben.
Auf der sicheren Seite bleiben
Die Erweiterung erleichtert das Erfassen von Daten, wodurch man leicht die Frage außer Acht lässt, ob man dies überhaupt tun sollte.
Lesen Sie die Nutzungsbedingungen. Viele Websites verbieten das automatisierte Erfassen von Daten ausdrücklich. Dass ein Tool kostenlos und einfach zu bedienen ist, ändert nichts an dem, womit Sie bei der Nutzung der Website eingestimmt haben.
Bevorzugen Sie öffentliche Daten. Öffentlich einsehbare Einträge, Preise und Spezifikationen sind wesentlich unbedenklicher als alles, was hinter einer Anmeldung verborgen ist, oder als persönliche Daten. Sammeln Sie keine personenbezogenen Daten über Einzelpersonen ohne rechtmäßige Grundlage.
Respektieren Sie die Kapazität der Website. Selbst dort, wo das Erfassen erlaubt ist, beeinträchtigen aggressive Zugriffsraten den Service für die tatsächlichen Nutzer. Wartezeiten zwischen den Anfragen sind eine Höflichkeitsgeste, die zudem dafür sorgt, dass Sie nicht gesperrt werden.
Prüfen Sie „robots.txt“. Es handelt sich dabei zwar nicht um ein Rechtsinstrument, aber es gibt Aufschluss darüber, was der Betreiber bevorzugt, und eine Missachtung untergräbt spätere Argumente, die auf gutem Glauben beruhen.
Das Urheberrecht gilt weiterhin. Fakten sind in der Regel nicht geschützt; kreative Inhalte hingegen schon. Das Extrahieren von Preisen unterscheidet sich von der Wiederveröffentlichung von Artikeln.
Die Rechtslage variiert. Die Vorschriften unterscheiden sich je nach Land und können davon abhängen, wo Sie tätig sind, wo sich Ihre Infrastruktur befindet und wo sich die betroffenen Personen befinden. Lassen Sie sich bei kommerziell bedeutenden Vorhaben spezifisch auf Ihre Situation beraten.
Häufig gestellte Fragen
Ist Instant Data Scraper kostenlos?
Ja. Die Chrome-Erweiterung ist kostenlos, bietet den vollen Funktionsumfang und hat weder kostenpflichtige Stufen noch Nutzungsbeschränkungen, was in dieser Kategorie ungewöhnlich ist. Es ist weder ein Konto erforderlich noch gibt es eine Testphase.
Funktioniert es auf jeder Website?
Nein. Es funktioniert gut auf Seiten mit klaren, sich wiederholenden Strukturen – Tabellen, Produktübersichten, Suchergebnisse, Verzeichniseinträge. Es hat Schwierigkeiten mit Daten, die über eine Seite verstreut sind, anstatt aufgelistet zu sein, mit Inhalten hinter Registerkarten oder Akkordeons sowie mit Websites, bei denen man Links zu Detailseiten folgen und dann zurückkehren muss.
Warum wurde mein Scraping auf halbem Weg unterbrochen?
In der Regel liegt es an der Ratenbegrenzung. Jede Anfrage erfolgt von Ihrer eigenen IP-Adresse aus in einem gleichmäßigen, maschinenartigen Rhythmus, und viele Websites drosseln oder blockieren dieses Muster. In den meisten Fällen hilft es, die Verzögerung zwischen den Seiten auf zwei oder drei Sekunden zu erhöhen. Ab einem bestimmten Volumen besteht die Lösung darin, die Anfragen auf mehrere Adressen zu verteilen, was eine Browser-Erweiterung jedoch nicht leisten kann.
Kann ich die Ausführung automatisch planen?
Nein. Die Erweiterung benötigt einen geöffneten Browser-Tab und eine Person, die sie startet. Für wiederkehrende Aufgaben ist ein skriptgesteuerter Scraper oder ein gehosteter Scraping-Dienst erforderlich.
Wird meine IP-Adresse durch die Nutzung gesperrt?
Das kann passieren, insbesondere auf Websites, die die Anfragefrequenz aktiv überwachen. Das Risiko steigt mit dem Umfang und der Geschwindigkeit. Wenn die Website für Ihr Unternehmen wichtig ist, sollten Sie bei den Verzögerungen vorsichtig sein – die Sperrung Ihrer Büro-IP-Adresse ist mit echten Kosten verbunden.
Wann sollte ich auf eine andere Lösung umsteigen?
Wenn sich der Auftrag wiederholt, mehrere hundert Seiten umfasst, bereits eine Ratenbegrenzung ausgelöst hat, ein automatisiertes System speist oder Links zu Detailseiten folgen muss. Jeder dieser Punkte ist ein vernünftiger Auslöser.
Brauche ich Proxys für eine Browser-Erweiterung?
Nein – und bei einer solchen Erweiterung kannst du sie ohnehin nicht pro Anfrage nutzen. Proxys werden relevant, wenn du auf einen skriptgesteuerten Scraper umsteigst; das ist auch der Punkt, an dem Blockierungen in der Regel zum entscheidenden Problem werden.
Fazit
Instant Data Scraper ist in einer Sache besonders gut: Er wandelt eine strukturierte Seite kostenlos, in weniger als einer Minute und ganz ohne Programmierkenntnisse in eine Tabellenkalkulation um. Für eine einmalige Datenextraktion aus einer herkömmlichen Auflistung ist es in puncto Zeit bis zum Ergebnis unschlagbar.
Es gibt fünf Einschränkungen, die jedoch vorhersehbar sind. Das Volumen, da das Tool mit Browser-Geschwindigkeit arbeitet und jeweils nur eine Seite gleichzeitig verarbeitet. Ratenbegrenzung, da jede Anfrage von Ihrer eigenen IP-Adresse ausgeht. Zeitplanung, da ein Mensch und ein geöffneter Tab erforderlich sind. Struktur, da die automatische Erkennung wiederkehrende Muster voraussetzt und Links zu Detailseiten nicht verfolgen kann. Integration, da die Ausgabe eine Datei und kein Endpunkt ist.
Welche Grenze Sie erreichen, bestimmt, auf welche Alternative Sie ausweichen. Erkennungsprobleme deuten auf eine andere Erweiterung oder einen visuellen Scraper hin. Zeitplanung und Struktur deuten darauf hin, dass Sie Ihr eigenes Programm schreiben sollten. Integration deutet auf eine Scraping-API hin. Bei Blockierungen sind Proxys die Lösung, da das zugrunde liegende Problem nicht die Geschwindigkeit ist, sondern die Tatsache, dass jede Anfrage von einer einzigen Adresse stammt.
Und wenn man doch umsteigt, sind die Zahlen geringer, als die meisten erwarten: Zehntausend Textseiten entsprechen etwa 1–2 GB, was bei Einstiegstarifen ein paar Dollar kostet und gut innerhalb eines kostenlosen Kontingents liegt. In dieser Größenordnung ist der Grund für den Wechsel die Zuverlässigkeit, nicht die Kosten.
Es ist sinnvoll, beides beizubehalten. Die Erweiterung dient der Erkundung – lohnt es sich, auf dieser Quelle aufzubauen? Die Pipeline für alles, was zweimal ausgeführt werden muss.