Die meisten Scraping-Projekte scheitern nicht am Code, sondern an der IP-Strategie: Es wird der falsche Proxy-Typ gewählt, das Budget reicht nicht aus oder wird verschwendet, und sobald sich das Ziel ändert, bricht die Architektur zusammen. Dieser Beitrag macht aus der Proxy-Auswahl einen systematischen Entscheidungsprozess.
Schritt 1: Analysieren Sie Ihr Ziel
Die Auswahl beginnt beim Ziel. Beantworten Sie drei Fragen:
- Wie hoch ist das Schutzniveau? Einfacher Test: Senden Sie 50–100 Anfragen von einer Datacenter-IP. Läuft das reibungslos, ist das Ziel tolerant; kommen CAPTCHA/403, ist es geschützt.
- Wird eine Session benötigt? Gibt es Login, Warenkorb oder mehrstufige Formulare, benötigen Sie Sticky Sessions.
- Ist der Standort relevant? Ändern sich Inhalte/Preise je nach Region, ist Targeting erforderlich.
Schritt 2: Entscheidung über den Typ
| Zielprofil | Richtiger Typ | Budgetauswirkung |
|---|---|---|
| Tolerant (offene Daten, kleine Websites) | Datacenter | Am niedrigsten — unbegrenzter Traffic |
| Mittel geschützt (Nachrichten, Kleinanzeigen, Kataloge) | Rotating Residential | Auf GB-Basis, mittel |
| Aggressiv geschützt (Marktplätze, Buchungsportale) | Residential + Städte-Targeting | Auf GB-Basis, planungsbedürftig |
| Große Ziele mit IPv6-Unterstützung | IPv6-Subnetz | Ein Zehntel der Kosten |
| Inhalte sozialer Plattformen | Mobil (letztes Mittel/gemischt) | Auf Port-Basis, hoch |
Eine gemischte Architektur ist meist am effizientesten: Listenseiten über Datacenter, geschützte Detailseiten über Residential.
Schritt 3: Rotationsstrategie
- Rotation pro Request: Standard für unabhängige Seiten.
- Sticky Session: für Session-Abläufe; trennen Sie die Session-ID pro Thread.
- Tempo: zufällige Verzögerungen von 1–5 Sekunden; erhöhen Sie das Volumen in den Nachtstunden des Ziels.
- Retry-Strategie: Beharren Sie bei 403/429 nicht auf derselben IP; verwenden Sie eine neue IP plus exponentielles Warten.
Schritt 4: Berechnen Sie die Kosten im Voraus
Eine einfache Formel, damit es bei GB-basierten Paketen keine Überraschungen gibt:
Monatlicher Traffic ≈ Seitenanzahl × durchschnittliche Seitengröße × (1 + Retry-Quote)
Beispiel: 20.000 Seiten pro Tag × 0,6 MB (nur HTML) × 30 Tage ≈ 360 GB/Monat — dieses Volumen ist ein Fall für einen Unternehmenstarif. Bilder nicht herunterzuladen, gzip zu akzeptieren und unnötige Ressourcen zu blockieren (Bild-/CSS-Blocking im Headless-Browser) reduziert den Traffic um 50–80 %.
Schritt 5: Checkliste für den Produktivbetrieb
- Ich protokolliere Erfolgsquote (2xx), CAPTCHA-Rate und Latenzmetriken.
- Die Proxy-Zugangsdaten stehen nicht im Code, sondern in Umgebungsvariablen.
- Für jedes Ziel sind separate Session-Pools definiert.
- robots.txt und die Nutzungsbedingungen des Ziels wurden geprüft.
- Notfallplan: Ist der primäre Pool blockiert, übernimmt ein zweiter Typ.
Kann man kostenlos starten?
Für den Prototyp ja: kostenlose Proxy-Adressen sind ideal, um die Proxy-Integration Ihres Codes zu verifizieren. Für produktives Scraping sind sie jedoch ungeeignet — Schwankungen, Langsamkeit und die geteilte IP-Reputation sabotieren den Prozess. Prototyp → kostenlos, Produktion → kostenpflichtiger Pool ist der natürliche Ablauf.