Korumalı bir siteden düzenli veri toplamak, "proxy ekleyip çalıştır" kadar basit değildir. Residential proxy güçlü bir araçtır ama yanlış kurgulandığında hem pahalıya mal olur hem beklenen başarıyı vermez. Fark, mimaride ve ayarlardadır.
Bu yazı, residential havuz üzerine kurulu bir veri toplama hattının nasıl tasarlanacağını uçtan uca ele alıyor. Temel kavramlar için önce web scraping için proxy yazımıza göz atabilirsiniz.
Mimari: Katmanları Ayırın
Doğrulama katmanı kritiktir: HTTP 200 dönen bir CAPTCHA sayfası "başarılı" sayılırsa veri sessizce bozulur.
Durum kodunun 200 olması içeriğin doğru olduğu anlamına gelmez. Engel sayfaları, boş şablonlar ve "bölgenizde kullanılamıyor" ekranları da 200 döner. Her yanıtı içerik düzeyinde doğrulayın.
Oturum Stratejisi Seçimi
Oturumsuz çalışabiliyorsanız çalışın: en ucuz, en hızlı ve en dayanıklı model budur.
Hız Ayarı: En Belirleyici Parametre
Başarı oranını en çok etkileyen tek ayar, istek hızıdır. Çoğu engellenme, IP kalitesinden değil fazla hızlı gitmekten kaynaklanır.
Başarı oranı düşse de saatlik toplam çıktı bir noktaya kadar artar. Optimum nokta, başarısız isteklerin maliyetinin kazancı aşmaya başladığı yerdir — bu örnekte 2/sn civarı.
Toplam maliyeti "başarılı istek başına GB" olarak hesaplayın. Hız arttıkça başarısız istekler de trafik harcar; bir noktadan sonra hızlanmak sizi daha pahalıya götürür.
Kaynak Filtreleme ile Maliyet Kontrolü
Residential trafik GB bazlı ücretlendirildiği için indirilen her gereksiz bayt doğrudan faturaya yazılır. Tarayıcı kullanıyorsanız kaynak filtreleme zorunludur:
locale ve timezone_id değerlerini çıkış ülkesiyle uyumlu tutun. IP Türkiye'yi gösterirken tarayıcı saat dilimi ABD'yi gösterirse bu tutarsızlık tespit edilir.
Ayrıntılı tüketim hesabı için bant genişliği hesaplama yazımıza bakın.
Hata Yönetimi ve Yeniden Deneme
5xx hatalarında IP değiştirmek gereksiz kota harcar — sorun hedefte olduğu için yeni IP de aynı yanıtı alır.
Kademeli Kaynak Kullanımı
Her isteği residential havuzdan geçirmek maliyeti gereksiz büyütür. Hedefin zorluğuna göre kademelendirin:
İsteklerin yalnızca bir kısmı gerçekten residential gerektirir. Kademeli model, tipik bir operasyonda toplam maliyeti yarıya yakın düşürebilir.
Ürün seçenekleri: datacenter, ISP ve residential proxy sayfalarımızda kapasite ve fiyat ayrıntıları bulunur.
İzleme: Neyi Loglamalısınız?
- Her istek için: hedef, durum kodu, süre, oturum anahtarı, deneme numarası.
- Her oturum için: çıkış IP'si, ülke, toplam istek, engellenme anı.
- Saatlik toplamlar: başarı oranı, CAPTCHA oranı, tüketilen GB.
- Hedef bazlı: hangi site hangi saatte daha toleranslı davranıyor?
Bu veriler olmadan hız ayarını optimize edemez, maliyeti kontrol edemezsiniz.
Yasal ve Etik Çerçeve
Veri toplarken teknik başarı kadar hukuki uygunluk da önemlidir. Genel ilkeler:
- Yalnızca herkese açık verileri toplayın; giriş duvarının arkasındaki içerik için izin gerekir.
- Kişisel veri topluyorsanız KVKK/GDPR yükümlülüklerini değerlendirin.
- Hedefin kullanım koşullarını okuyun; sözleşmesel kısıtlar teknik izinden bağımsızdır.
- Hedef sunucuya zarar verecek yoğunlukta istek göndermeyin.
- Telif korumalı içeriği yeniden yayımlamayın.
Özet
Residential proxy ile scraping, doğru mimari ve doğru hız ayarıyla yüksek başarı verir. Katmanları ayırın, engel sayfalarını içerik düzeyinde tespit edin, hız kapısını hedef bazında kurun, kaynak filtrelemesiyle kotayı koruyun ve kaynakları kademeli kullanın. En belirleyici parametre IP kalitesi değil, istek hızıdır. Kurulumunuzu test etmek için proxy kontrol aracını, senaryo ayrıntıları için web scraping proxy sayfamızı inceleyebilirsiniz.