Scraping projelerinin çoğu kod yüzünden değil, IP stratejisi yüzünden başarısız olur: yanlış proxy türü seçilir, bütçe ya yetmez ya israf edilir, hedef değişince mimari çöker. Bu yazı, proxy seçimini sistematik bir karar sürecine dönüştürüyor.
Adım 1: Hedefinizi Analiz Edin
Seçim hedefle başlar. Üç soruya yanıt verin:
- Koruma seviyesi nedir? Basit test: datacenter IP'sinden 50-100 istek atın. Sorunsuz geçiyorsa hedef toleranslı; CAPTCHA/403 geliyorsa korumalı demektir.
- Oturum gerekiyor mu? Login, sepet, çok adımlı form varsa sticky session ihtiyacınız var.
- Lokasyon önemli mi? İçerik/fiyat bölgeye göre değişiyorsa hedefleme gerekir.
Adım 2: Tür Kararı
| Hedef Profili | Doğru Tür | Bütçe Etkisi |
|---|---|---|
| Toleranslı (açık veri, küçük siteler) | Datacenter | En düşük — sınırsız trafik |
| Orta korumalı (haber, ilan, kataloglar) | Rotating residential | GB bazlı, orta |
| Agresif korumalı (pazaryerleri, rezervasyon) | Residential + şehir hedefleme | GB bazlı, planlanmalı |
| IPv6 destekli dev hedefler | IPv6 subnet | Onda bir maliyet |
| Sosyal platform içerikleri | Mobil (son çare/karma) | Port bazlı, yüksek |
Karma mimari çoğu zaman en verimlisidir: listeleme sayfaları datacenter'dan, korumalı detay sayfaları residential'dan.
Adım 3: Rotasyon Stratejisi
- Request bazlı rotasyon: bağımsız sayfalar için varsayılan.
- Sticky session: oturum akışları için; session kimliğini iş parçacığı başına ayırın.
- Tempo: rastgele 1-5 sn gecikmeler; hedefin gece saatlerinde hacmi artırın.
- Retry politikası: 403/429'da aynı IP ile ısrar etmeyin; yeni IP + üstel bekleme uygulayın.
Adım 4: Maliyeti Önceden Hesaplayın
GB bazlı paketlerde sürpriz yaşamamak için basit formül:
Aylık trafik ≈ sayfa sayısı × ortalama sayfa boyutu × (1 + retry oranı)
Örnek: günde 20.000 sayfa × 0.6 MB (yalnızca HTML) × 30 gün ≈ 360 GB/ay — bu hacim kurumsal plan konusudur. Görselleri indirmemek, gzip kabul etmek ve gereksiz kaynakları engellemek (headless tarayıcıda resim/CSS bloklama) trafiği %50-80 azaltır.
Adım 5: Üretim Kontrol Listesi
- Başarı oranı (2xx), CAPTCHA oranı ve gecikme metriklerini logluyorum.
- Proxy kimlik bilgileri kodda değil, ortam değişkeninde.
- Hedef bazlı ayrı session havuzları tanımlı.
- robots.txt ve hedefin kullanım şartları gözden geçirildi.
- Yedek plan: birincil havuz tıkanırsa ikinci tür devrede.
Ücretsizle Başlanır mı?
Prototip için evet: ücretsiz proxy adresleri kodunuzun proxy entegrasyonunu doğrulamak için idealdir. Ancak üretim scraping'i için uygun değildir — değişkenlik, yavaşlık ve paylaşımlı IP itibarı süreci sabote eder. Prototip → ücretsiz, üretim → ücretli havuz doğal akıştır.