Geonode logo
Geonode Team

Geonode Team

Aktualisiert: 7. Oktober 2026

Veröffentlicht: 02.09.2026

So crawlen Sie eine Website, ohne blockiert zu werden

Die meisten Crawler werden aufgrund ihres Verhaltens blockiert, nicht wegen ihrer Identität. Sie sind zu schnell, versuchen es trotz Fehlermeldungen immer wieder, ignorieren die Anweisungen des Servers und rufen dieselbe, unveränderte Seite tausendmal ab. Das bedeutet, dass die meisten Ratschläge zu diesem Thema – dies rotieren, jenes randomisieren – die falsche Ebene ansprechen. Die zuverlässige Lösung besteht darin, ein Crawler zu sein, den ein Websitebetreiber keinen Grund hat zu blockieren. Dieser Leitfaden behandelt, was tatsächlich funktioniert, und zwar in der Reihenfolge, die pro Aufwandseinheit das größte Risiko beseitigt.

Unsere Position ist klar: Wir sind Geonode und verkaufen Proxys – genau das Produkt, um dessen Verkauf es in den meisten Artikeln zu diesem Thema geht. In einer ehrlichen Rangliste würden Proxys etwa an sechster Stelle stehen, und die fünf Punkte darüber sind kostenlos. Pacing, Identifizierung, Caching, die Einhaltung von Retry-After und das Lesen von robots.txt verhindern mehr Sperrungen als jede noch so umfangreiche Adressrotation, da sie den eigentlichen Grund angehen, aus dem Websites Crawler sperren – Auslastung und Unvorhersehbarkeit –, anstatt nur das Symptom zu bekämpfen. Proxys helfen tatsächlich bei einem ganz bestimmten Problem, auf das später eingegangen wird. Wenn Sie zuerst darauf zurückgreifen, geben Sie Geld aus und werden trotzdem gesperrt.

Warum Crawler tatsächlich blockiert werden

Vier Ursachen, in absteigender Reihenfolge ihrer Häufigkeit.

Rate. Sie haben zu viele Anfragen zu schnell gestellt. Dies ist bei weitem der häufigste Grund, und Sie haben die volle Kontrolle darüber. Eine Website weiß nicht und interessiert sich auch nicht dafür, wer Sie sind, wenn sie entscheidet, dass dreißig Anfragen pro Sekunde von einer Adresse ein Problem darstellen.

Unvorhersehbarkeit. Spitzenbelastungen, Wiederholungsversuche bei Fehlern, das wiederholte Crawlen derselben Seiten, das Verfolgen unendlicher URL-Räume. Eine Belastung, die eine Website nicht einplanen kann, ist schlimmer als eine, die sie einplanen kann.

Anonymität. Ein nicht identifizierter Client, der unerklärlichen Traffic erzeugt, ist ein Problem, das gestoppt werden muss. Bei einem identifizierten Client muss eine Entscheidung getroffen werden – und häufig lautet diese Entscheidung, ihn zuzulassen.

Identitätsmerkmale. Adresstyp, TLS-Fingerabdruck, Zusammensetzung der Header. Echt, und an letzter Stelle dieser Liste, weil sie vor allem dann eine Rolle spielen, wenn eine Website bereits entschieden hat, dass sie nicht identifizierte Automatisierung nicht zulassen will – und weil sie am schwersten ehrlich zu ändern sind.

Beachten Sie, dass drei der vier Punkte das Verhalten betreffen. Der Fokus der Branche auf den vierten Punkt hängt davon ab, was sich am einfachsten verkaufen lässt, nicht davon, was die meisten Blockierungen verursacht.

Beginnen Sie damit, gar nicht erst crawlen zu müssen

Die Maßnahme mit dem besten Ertrag – und die, die am häufigsten übersprungen wird.

Prüfen Sie, ob es eine API gibt. Viele Websites stellen eine zur Verfügung, und diese ist stabil, strukturiert und offiziell anerkannt. Das Crawlen einer Website, die eine API anbietet, bedeutet mehr Arbeit für ein schlechteres Ergebnis.

Prüfen Sie, ob es einen Partner- oder Affiliate-Feed gibt. Ganze Branchen – Stellenmarkt, Immobilien, Einzelhandel, Reisen – veröffentlichen speziell für Aggregatoren Massen-Feeds, da Aggregatoren ihnen Traffic zuführen. Fragen Sie nach, bevor Sie etwas entwickeln. Eine überraschend große Anzahl von Websites sagt „Ja“.

Prüfen Sie, ob eine Sitemap vorhanden ist. Sie liefert Ihnen eine URL-Übersicht sowie Zeitstempel von „lastmod“, sodass Sie nur die geänderten Inhalte abrufen können, anstatt alles.

Prüfen Sie, ob strukturierte Daten eingebettet sind. JSON-LD in einem „<script type="application/ld+json">“-Block ist maschinenlesbar, überdauert Neugestaltungen und befindet sich bereits auf der Seite, die Sie abrufen wollten.

Prüfen Sie, ob die Daten an anderer Stelle vorhanden sind. Öffentliche Datensätze, Archive, amtliche Unterlagen.

Jede dieser Maßnahmen beseitigt das Problem vollständig, anstatt es nur abzumildern. Der Reflex, zuerst einen Crawler zu schreiben, ist die kostspieligste Angewohnheit in diesem Bereich, und deshalb haben wir diesen Abschnitt vor allen technischen Aspekten platziert. Die gesamte Quellhierarchie haben wir unter So finden Sie alle Seiten einer Website behandelt.

Lesen Sie zuerst die Regeln: „

robots.txt“ ist mittlerweile ein Standard RFC 9309, und dessen korrekte Einhaltung dient sowohl der Konformität als auch dem eigenen Interesse.

Die für den Betrieb wichtigen Punkte: Die Übereinstimmung erfolgt nach Spezifität statt nach Reihenfolge – die Regel mit der größten Übereinstimmung hat Vorrang; eine 5xx-Antwort bedeutet vollständige Ablehnung, nicht „weitermachen“; eine 404 bedeutet keine Einschränkungen; und die Datei muss mindestens alle 24 Stunden aktualisiert werden, anstatt nur einmal beim Start abgerufen zu werden.

Verwenden Sie einen gepflegten Parser. Sowohl die Spezifitätsregel als auch die Normalisierung der Prozent-Kodierung können leicht falsch interpretiert werden, und ein Crawler, der die Datei falsch liest, glaubt, konform zu sein, ist es aber nicht. Wir haben die Details in „Wie man eine robots.txt-Datei liest“ behandelt.

Lesen Sie anschließend die Nutzungsbedingungen. „robots.txt“ ist keine Autorisierung – das besagt der RFC ausdrücklich –, und eine Website kann den automatisierten Zugriff untersagen, unabhängig davon, was die Datei zulässt. Es ist besser, dies bereits vor dem Start zu wissen, als es erst in einem Schreiben zu erfahren.

Das richtige Tempo finden

Die wertvollste technische Maßnahme – und zugleich die kostengünstigste.

Eine Anfrage alle ein bis zwei Sekunden pro Domain ist ein vernünftiger Standardwert. Bei kleinen Websites sollte das Tempo langsamer sein, und es sollte nicht schneller sein, ohne dass nachweislich klar ist, dass das Zielsystem dies zulässt.

Beachten Sie „Crawl-delay“, sofern unter robots.txt ein Wert festgelegt ist. Es handelt sich dabei eher um eine Erweiterung als um einen Teil des Standards, und die Einhaltung kostet nichts und signalisiert guten Willen.

Fügen Sie Jitter hinzu. Anfragen in exakt regelmäßigen Abständen sind ein Muster, das kein Mensch erzeugt. Eine Zufallsverteilung zwischen beispielsweise 1,0 und 2,5 Sekunden beseitigt dies ohne zusätzlichen Aufwand.

Begrenzen Sie die Parallelität pro Domain, nicht global. Acht gleichzeitige Anfragen, verteilt auf acht Domains, sind angemessen. Acht Anfragen auf eine einzige Domain sind es nicht.

Crawlen Sie nach Möglichkeit außerhalb der Spitzenzeiten. Die Belastbarkeit einer Website ist geringer, wenn viel los ist, und ein Job, der über Nacht läuft, kostet Sie nichts extra.

Und erweitern Sie Ihr Zeitfenster, bevor Sie Kapazitäten hinzufügen. Dies ist der nützlichste Ansatz, den es gibt: Fünfzigtausend Seiten, verteilt auf vierundzwanzig Stunden, benötigen etwa zwei gleichzeitige Verbindungen; dieselben fünfzigtausend in zwei Stunden benötigen zwanzig. Wenn nichts davon abhängt, dass der Job schnell abgeschlossen wird – und normalerweise ist das nicht der Fall –, ist der Zeitplan der kostengünstigste Hebel, den Sie haben. Wir haben die Berechnungen in Wie viele Proxys benötigen Sie? durchgespielt.

Identifizieren Sie sich

Entgegen der Intuition und durchweg effektiv.

User-Agent: AcmePriceBot/1.2 (+https://acme.example.com/bot)

Ein Name, eine Version und eine URL, unter der man herausfinden kann, wer Sie sind und wie man Sie erreichen kann. Drei echte Vorteile:

**robots.txt

kann Sie gezielt ansprechen.** Regeln werden anhand des Produkt-Tokens abgeglichen, sodass eine Website Ihrem Crawler eine Berechtigung erteilen kann, die sie nicht jedem gewährt. Das ist nicht möglich, wenn Sie anonym sind.

Betreiber können Sie kontaktieren, anstatt Sie zu blockieren. Das kommt häufiger vor, als man denkt, und ist ein weitaus besseres Ergebnis, als erst drei Wochen später festzustellen, dass man blockiert wurde.

Es unterstützt die Einholung von Zugriffsberechtigungen. „Wir sind der als AcmePriceBot identifizierte Crawler; hier ist, was wir erfassen und warum“ – das ist ein Gespräch, das zu etwas führen kann.

Die Alternative – eine kopierte Chrome-Zeichenkette – führt eher zu einem Widerspruch als zu einer Tarnung, denn ein Browser-User-Agent bei einer Verbindung, deren TLS-Fingerabdruck und Header-Satz eindeutig nicht zu einem Browser gehören, ist leichter zu identifizieren als ein ehrliches Eingeständnis. Darauf sind wir im Artikel „Ein benutzerdefinierten User-Agent mit curl festlegen“ eingegangen.

Zwischenspeichern und bedingte Anfragen nutzen

Die Maßnahme, die die Auslastung senkt, ohne die Abdeckung zu verringern.

Rufen Sie dieselbe unveränderte Ressource niemals zweimal ab. Speichern Sie die abgerufenen Daten zusammen mit den Werten für „ETag“ und „Last-Modified“ und senden Sie anschließend bedingte Anfragen:

curl -sS -H 'If-None-Match: "abc123"' https://example.com/page

Ein „304 Not Modified“ benötigt nur wenige hundert Byte statt einer ganzen Seite. Bei einem erneuten Crawl, bei dem die meisten Seiten unverändert sind, reduziert dies sowohl Ihre Bandbreitenkosten als auch die Auslastung des Zielservers um eine Größenordnung.

Verwenden Sie „lastmod“ aus der Sitemap, um zu entscheiden, was überhaupt abgerufen werden soll. Eine Website mit fünfzigtausend Seiten, von denen sich heute zweihundert geändert haben, bedeutet einen Crawl von zweihundert Seiten und keinen von fünfzigtausend.

Speichern Sie die Rohantworten. Wenn ein Parser ausfällt, parsen Sie die vorhandenen Daten erneut, anstatt sie erneut abzurufen. Das spart Kosten und ist gleichzeitig eine Höflichkeit.

URLs ordnungsgemäß deduplizieren. Normalisieren Sie abschließende Schrägstriche, die Reihenfolge der Abfrageparameter und die Groß-/Kleinschreibung von Hostnamen und entfernen Sie Tracking-Parameter. Ein Crawler ohne Normalisierung besucht dieselbe Seite viele Male und wirkt dadurch wie ein viel schwerfälligerer Client, als er tatsächlich ist.

Behandeln Sie Fehler so, wie es der Server verlangt

Server geben Ihnen Anweisungen, was zu tun ist. Das Befolgen dieser Anweisungen ist sowohl richtig als auch der schnellste Weg, um den Betrieb wiederherzustellen.

** „429 Too Many Requests“** ist in RFC 6585 als Hinweis darauf definiert, „dass der Benutzer innerhalb eines bestimmten Zeitraums zu viele Anfragen gesendet hat („Ratenbegrenzung“)“. Die Antwort „KANN einen Retry-After-Header enthalten, der angibt, wie lange gewartet werden muss, bevor eine neue Anfrage gestellt werden kann“.

503 Service Unavailable bedeutet, dass der Server „die Anfrage derzeit aufgrund einer vorübergehenden Überlastung oder geplanter Wartungsarbeiten nicht bearbeiten kann“ und dass er „ein ‚Retry-After‘-Header-Feld senden KANN …, um dem Client eine angemessene Wartezeit vorzuschlagen“.

** „Retry-After“** nimmt gemäß RFC 9110 entweder ein HTTP-Datum oder eine Anzahl von Sekunden an – „Retry-After: 120“ bedeutet, zwei Minuten zu warten.

Das korrekte Verhalten bei einem 429- oder 503-Fehler:

Hör für diese Domain auf. Nicht verlangsamen, sondern für mindestens das angegebene Intervall ganz aufhören. Wenn kein „Retry-After“ vorhanden ist, wende ein exponentielles Backoff an mit einem großzügigen Startwert. Reduzieren Sie anschließend Ihre Dauerrate, da Ihnen gerade mitgeteilt wurde, dass diese zu hoch war. Versuchen Sie es niemals sofort erneut. Wiederholte Versuche bei einer Ratenbegrenzung führen dazu, dass aus einer vorübergehenden Einschränkung eine dauerhafte Sperre wird, und dies ist der häufigste selbstverschuldete Fehler beim Crawling.

Beachten Sie außerdem, dass RFC 6585 besagt: „Antworten mit dem Statuscode 429 DÜRFEN NICHT von einem Cache gespeichert werden“ – eine Caching-Schicht schützt Sie also nicht davor, den Fehler zu wiederholen.

Wo Proxys wirklich helfen

Unser eigenes Produkt, so genau wie möglich beschrieben.

Sie helfen, wenn: Sie Ihre Rate optimiert haben und dennoch einen Durchsatz benötigen, den eine einzelne Adresse nicht bereitstellen kann; Sie regionsspezifische Inhalte aufrufen müssen, wobei es gerade darauf ankommt, den Anschein zu erwecken, sich an einem bestimmten Ort zu befinden; Sie verteilte Crawler betreiben und möchten, dass diese wie separate Clients wirken und nicht wie ein einziger Rechner mit vielen Threads; oder die Adresse, von der aus Sie zugreifen, einen schlechten Ruf hat, ohne dass Sie daran Schuld haben.

Sie helfen nicht, wenn: Sie zu schnell vorgehen – dieselbe Rate von mehr Adressen ist immer noch dieselbe Rate, und nun haben Sie einen Pool statt einer einzelnen Adresse als verdächtig markiert. Auch nicht, wenn Ihr Anfrageprofil anhand von TLS-Fingerabdrücken oder der Zusammensetzung der Header identifiziert wird, da diese mit Ihnen mitwandern. Ebenso wenig, wenn eine Website Nutzungsbedingungen hat, die automatisierten Zugriff verbieten – daran ändert sich durch mehr Adressen nichts.

Welcher Typ: Rechenzentrum für die meisten Crawling-Aufträge, da dies um ein Vielfaches günstiger ist und öffentliche Seiten in der Regel nichts weiter erfordern – bei uns beginnt der Preis bei 0,14 $/GB. Wechseln Sie erst dann auf Privathaushalte ab 0,79 $/GB um, wenn das Rechenzentrum nachweislich versagt oder wenn Sie eine Geolokalisierung über das Verbrauchernetzwerk benötigen. Zahlen stammen von unserer Preisseite, Stand: September 2026.

Die Kosten, die viele überraschen: Headless-Browser. Ein Browser ruft jedes Bild, jede Schriftart und jedes Skript ab, sodass die Bandbreite im Vergleich zu reinem HTTP um etwa eine Größenordnung steigt. Wenn eine Seite kein JavaScript benötigt, rendern Sie sie nicht – und wenn doch, blockieren Sie Ressourcentypen, die Sie nicht benötigen.

Wie man einen „Hard Block“ von einem „Soft Block“ unterscheidet

Der Fehlermodus, der am meisten kostet, weil er nicht wie ein Fehler aussieht.

Ein „Hard Block“ gibt einen 403-Fehler, eine Challenge-Seite oder eine Verbindungsverweigerung zurück. Auffällig, offensichtlich und sofort behebbar.

Eine „weiche“ Blockierung gibt den Status 200 mit reduziertem Inhalt zurück: weniger Elemente, entfernte Felder, veraltete Daten oder eine generische Seite anstelle der spezifischen. Ihre Erfolgsquote bleibt bei 99 %, während sich Ihre Daten unbemerkt verschlechtern. Dies ist die häufigere Reaktion anspruchsvoller Websites – gerade weil sie Ihr Budget verschwendet, ohne Ihnen etwas zu verraten.

Schützen Sie sich ausdrücklich davor:

Prüfen Sie den Inhalt, nicht den Status. Suchen Sie auf der Seite nach einem bekanntermaßen stabilen Marker und behandeln Sie dessen Fehlen als Fehler. Prüfen Sie die Anzahl. Wenn eine Kategorieseite noch nie weniger als zwanzig Elemente hatte, werten Sie weniger als zwanzig als Fehler aus. Segmentieren Sie Kennzahlen nach Ziel. Zwölf Ziele bei 99 % und eines bei 40 % ergeben im Durchschnitt einen Wert, der als einwandfrei erscheint. Vergleichen Sie regelmäßig mit einem Browser. Rufen Sie eine Seite manuell ab und vergleichen Sie sie mit dem, was Ihr Crawler erhalten hat.

Dies ist dasselbe Muster „stiller Fehler“, das wir in Warum das Testen von Proxys wichtig ist beschrieben haben, und es ist der Grund, warum „wir drei Wochen lang blockiert waren und es nicht bemerkt haben“ eine echte Kategorie von Vorfällen darstellt.

Wann man aufhören sollte

Der Abschnitt, für den ein Proxy-Anbieter am wenigsten Anreiz hat, ihn zu verfassen.

Wenn die Nutzungsbedingungen dies verbieten. Einige Websites weisen ausdrücklich darauf hin und setzen dies auch durch. Ein ausgewiesenes Verbot zu umgehen, ist eine Entscheidung mit Konsequenzen, die über den rein technischen Bereich hinausgehen.

Wenn Sie aufgefordert wurden, damit aufzuhören. Eine direkte Aufforderung durch einen Websitebetreiber beendet die Diskussion.

Wenn der Aufwand den Nutzen übersteigt. Wenn Sie Ihren Ansatz alle zwei Wochen neu ausrichten müssen, kosten die Daten mehr, als sie wert sind. Das ist eine geschäftliche Schlussfolgerung, kein technisches Scheitern.

Wenn es einen legitimen Weg gibt. Eine API, ein Feed, ein lizenzierter Datensatz. Für einen genehmigten Zugriff zu bezahlen ist oft günstiger als die Entwicklungszeit, die man aufwendet, um ihn zu umgehen – und es gibt keine Ausfälle.

Wenn die Website Fallen eingesetzt hat. Tarpits und generierte Labyrinthe sind so konzipiert, dass sie Sie mehr kosten als die Website selbst – sie liefern zwischengespeicherte Inhalte, während Sie pro Gigabyte und pro Rechenstunde bezahlen. Diese Asymmetrie ist beabsichtigt und lässt sich nicht durch Aufwand überwinden.

Fragen Sie zuerst nach. Eine E-Mail, in der Sie erklären, wer Sie sind, was Sie benötigen und in welchem Umfang, löst das Problem häufiger, als die Diskussion vermuten lässt, und verschafft Ihnen einen Zugang, der dauerhaft funktioniert.

Häufig gestellte Fragen

Warum wird mein Crawler immer wieder blockiert?

Meistens liegt es an der Zugriffsrate. Zu viele Anfragen in zu kurzer Zeit von einer Adresse aus sind mit Abstand die häufigste Ursache, und darauf haben Sie vollständigen Einfluss. Unvorhersehbare Muster, wiederholte Versuche bei Fehlern und anonyme Identifizierung machen den Großteil der übrigen Ursachen aus.

Wie schnell kann ich eine Website crawlen?

Beginnen Sie mit einer Anfrage alle ein bis zwei Sekunden pro Domain und erhöhen Sie die Geschwindigkeit erst, wenn Sie Anzeichen dafür haben, dass das Ziel dies toleriert. Halten Sie sich an „Crawl-delay“, falls unter „robots.txt“ eine solche festgelegt ist. Wenn Sie mehr Durchsatz benötigen, ist es kostengünstiger und sicherer, Ihr Zeitfenster zu erweitern, als die Parallelität zu erhöhen.

Verhindern Proxys, dass man blockiert wird?

Nur bei adressspezifischen Sperren. Wenn man zu schnell vorgeht, entspricht die gleiche Rate von mehreren Adressen immer noch derselben Rate und löst nun eine Warnung für den gesamten Pool aus. Wenn das Muster Ihrer Anfragen anhand von TLS-Fingerabdrücken oder Headern identifiziert wird, begleitet Sie dieses unabhängig von der Adresse.

Sollte ich User-Agents rotieren lassen?

Nein. Eine zufällige Rotation innerhalb einer Sitzung führt dazu, dass der Client den Anschein erweckt, als würde er mitten im Besuch den Browser wechseln, was eher eine Inkonsistenz als eine Tarnung darstellt. Ein einziger ehrlicher User-Agent mit einer Kontakt-URL wird seltener blockiert als jedes Rotationsschema.

Was soll ich tun, wenn ich einen 429-Fehler erhalte?

Hören Sie für diese Domain auf und warten Sie mindestens so lange, wie unter Retry-After angegeben. Ohne diesen Header sollten Sie sich exponentiell von einem großzügigen Ausgangspunkt zurückziehen und dann Ihre Dauerrate reduzieren – Ihnen wurde gerade mitgeteilt, dass sie zu hoch war. Versuchen Sie es niemals sofort erneut.

Woran erkenne ich, ob ich soft-blockiert werde?

Verlassen Sie sich eher auf Inhalte als auf Statuscodes. Suchen Sie auf jeder Seite nach einem bekanntermaßen stabilen Marker, überprüfen Sie die erwartete Anzahl von Elementen, segmentieren Sie Erfolgskennzahlen nach Ziel statt aggregiert und vergleichen Sie regelmäßig eine gecrawlte Seite mit einer im Browser abgerufenen Seite.

Ist das Crawlen einer Website legal?

Das hängt von der Rechtsordnung, den Nutzungsbedingungen der Website, den betroffenen Daten und Ihrer Verwendung dieser Daten ab. Die Einhaltung von „robots.txt“, die Identifizierung Ihres Crawlers und die Beibehaltung einer moderaten Crawling-Rate sind gängige Praxis und stehen nicht im Widerspruch zu Nutzungsbedingungen oder Urheberrechten. Lassen Sie sich bei kommerziell bedeutsamen Vorhaben beraten.

Was ist die effektivste Maßnahme, die ich ergreifen kann?

Machen Sie langsam und prüfen Sie, ob ein Crawling überhaupt notwendig ist. Eine API, ein Partner-Feed oder eine Sitemap mit Zeitstempeln nach dem „lastmod“-Prinzip beseitigt das Problem, anstatt es nur zu mildern – und wo ein Crawling wirklich notwendig ist, verhindert eine angemessene Auslastung mehr Sperrungen als alle anderen Maßnahmen zusammen.

Fazit

Der Ansatz, der dies lösbar macht, besteht darin, dass das Blockieren eine Reaktion auf Belastung und Unvorhersehbarkeit ist, nicht auf Identität. Websites haben nichts dagegen, gelesen zu werden; sie haben etwas dagegen, von etwas überlastet zu werden, das sie nicht einplanen können und mit dem sie keinen Kontakt herstellen können.

Dadurch ergeben sich wirksame Maßnahmen in einer Reihenfolge, die in den meisten Artikeln umgekehrt dargestellt wird. Prüfen Sie, ob Sie überhaupt crawlen müssen, denn eine API oder ein Partner-Feed beseitigt das Problem vollständig. Lesen Sie „robots.txt“ und befolgen Sie die Vorgaben korrekt, einschließlich der Abschnitte über Specificity-Matching und die Bedeutung von 5xx-Fehlern als Stoppzeichen. Gehen Sie bedächtig vor und fügen Sie Jitter hinzu. Identifizieren Sie sich mit einem Namen und einer Kontakt-URL. Cachen Sie aggressiv und nutzen Sie bedingte Anfragen, damit Sie niemals erneut Daten abrufen, die sich nicht geändert haben. Befolgen Sie die Anweisungen unter Retry-After.

All das ist kostenlos und verhindert mehr Sperrungen als jede Investition in Infrastruktur. Proxys helfen bei einem konkreten und enger gefassten Problem – dem Durchsatz, der die Obergrenze einer einzelnen Adresse überschreitet, sowie bei regional unterschiedlichen Inhalten – und sie helfen bei nichts anderem auf der Liste.

Und behalten Sie den letzten Abschnitt im Blick. Eine Website, die Bedingungen festgelegt, Sperren eingerichtet oder Sie aufgefordert hat, damit aufzuhören, hat Ihnen etwas mitgeteilt, und die Alternativen dazu, diese Maßnahmen technisch zu umgehen, sind in der Regel kostengünstiger und immer nachhaltiger.