Tutte le posizioni attive · 99.99% uptime
Residential Proxy

Web scraping con proxy residenziali

Raccogliere dati con regolarità da un sito protetto non è semplice come "aggiungi un proxy ed esegui". Il residential proxy è uno strumento potente, ma se configurato male costa caro e non dà il risultato atteso. La differenza sta nell'architettura e nelle impostazioni.

Questo articolo affronta end-to-end la progettazione di una pipeline di raccolta dati basata su un pool residential. Per i concetti di base, prima proxy per il web scraping .

Architettura: separa i livelli

FIGURAPipeline di raccolta basata su pool residential
ARCHITETTURACoda di URLpriorità + ripetizionedestinazioni da elaborareGate di velocitàtoken per targetrichieste pianificateLivello richiestaproxy + sessionerisposta grezzaVerificadistinzione contenuto/bloccoi falliti tornano in codaParsingselettore + schemadati strutturatiOgni livello deve poter scalare in modo indipendente

Il livello di validazione è critico: se una pagina CAPTCHA che risponde HTTP 200 viene considerata "riuscita", i dati si corrompono silenziosamente.

Errore frequente

Un codice di stato 200 non significa che il contenuto sia corretto. Anche pagine di blocco, template vuoti e schermate "non disponibile nella tua area" restituiscono 200. Valida ogni risposta a livello di contenuto.

Scelta della strategia di sessione

FIGURAQuale modello di sessione?
DECISIONECome si comporta la pagina target?Non servono cookie, ogni pagina è indipendenteRotazione senza sessioneNOGuarda sottoLa più semplice ed economicaServe un cookie di filtro/linguaSticky breve (2–5 min)NOGuarda sottoRisultati coerentiÈ necessario effettuare il loginSticky lungo + e… per accountNOIP staticoUscita fissa per account

Se puoi lavorare senza sessione, fallo: è il modello più economico, più veloce e più resiliente.

Regolazione della velocità: il parametro più determinante

L'unica impostazione che incide di più sul tasso di successo è la velocità delle richieste. Gran parte dei blocchi non deriva dalla qualità dell'IP, ma dall'andare troppo veloce.

FIGURARelazione tra velocità di richiesta e tasso di successo (misurazione di esempio)
IMPOSTAZIONE0275582109Tasso di successo (%)Richieste riuscite all'ora (×100)0,2/s0,5/s1/s2/s4/s8/s

Anche se il tasso di successo cala, l'output totale orario cresce fino a un certo punto. Il punto ottimale è là dove il costo delle richieste fallite inizia a superare il guadagno — in questo esempio intorno a 2/s.

Punto ottimale

Calcola il costo totale come "GB per richiesta riuscita". All'aumentare della velocità anche le richieste fallite consumano traffico; oltre un certo punto accelerare ti costa di più .

Controllo dei costi con il filtraggio delle risorse

Poiché il traffico residential si paga a GB, ogni byte superfluo scaricato finisce direttamente in fattura. Se usi un browser, il filtraggio delle risorse è obbligatorio:

FIGURABloccare richieste di immagini, media e tracciamento
Playwright — configurazione orientata al costo01BLOK_TIP = {"image", "media", "font", "stylesheet"}02BLOK_HOST = ("googletagmanager", "google-analytics", "doubleclick",03 "facebook.net", "hotjar", "clarity.ms")0405async def filtre(route):06 r = route.request07 if r.resource_type in BLOK_TIP:08 return await route.abort()09 if any(h in r.url for h in BLOK_HOST):10 return await route.abort()11 await route.continue_()1213ctx = await browser.new_context(14 proxy={"server": "http://gateway.example.com:8000",15 "username": PROXY_USER, "password": PROXY_PASS},16 locale="tr-TR", timezone_id="Europe/Istanbul")17await ctx.route("**/*", filtre)

locale e timezone_id mantieni i valori coerenti con il paese di uscita. Se l'IP indica la Turchia mentre il fuso orario del browser indica gli Stati Uniti, questa incoerenza viene rilevata.

Per un calcolo dettagliato del consumo al nostro articolo sul calcolo della banda consultalo.

Gestione degli errori e nuovi tentativi

FIGURAInterpretazione delle risposte ricevute durante lo scraping
MAPPA DELLE RISPOSTECODICE / SINTOMOPOSSIBILE CAUSASOLUZIONE200 + contenuto attesoTutto regolareContinua con lo stesso IP200 + CAPTCHA/bloccoL'IP è stato segnalato su questo targetRinnova la sessione, aggiungi attesa403 ForbiddenIP o pattern bloccatoNuova sessione + quarantena del target429 Too Many RequestsRate limitBackoff esponenziale, riduci la velocità5xxProblema del server targetRimetti in coda, non cambiare IPTimeoutNodo lento o cadutoUn solo nuovo tentativo, poi rinnova la sessione

Cambiare IP sugli errori 5xx consuma quota inutilmente: poiché il problema è sul target, anche un nuovo IP riceverà la stessa risposta.

Uso graduale delle risorse

Far passare ogni richiesta dal pool residential gonfia inutilmente i costi. Gradua in base alla difficoltà del target:

FIGURATentativi graduali orientati al costo
LIVELLOConnessione direttatarget non protetti100Datacenter proxyprotezione leggera62%62ISP proxyprotezione media28%45Residentialprotezione rigida11%39

Solo una parte delle richieste necessita davvero di residential. Il modello graduale può ridurre quasi della metà il costo totale in un'operazione tipica.

Opzioni di prodotto: datacenter, ISP e residenziale nelle nostre pagine proxy trovi i dettagli su capacità e prezzi.

Monitoraggio: cosa loggare?

  • Per ogni richiesta: target, codice di stato, durata, chiave di sessione, numero del tentativo.
  • Per ogni sessione: IP di uscita, paese, richieste totali, momento del blocco.
  • Totali orari: tasso di successo, tasso di CAPTCHA, GB consumati.
  • Per target: quale sito è più tollerante e in quale fascia oraria?

Senza questi dati non puoi ottimizzare la velocità né controllare i costi.

Quadro legale ed etico

Nella raccolta dati la conformità legale conta quanto il successo tecnico. Principi generali:

  • Raccogli solo dati pubblicamente accessibili; per i contenuti dietro un login serve un'autorizzazione.
  • Se raccogli dati personali, valuta gli obblighi KVKK/GDPR.
  • Leggi le condizioni d'uso del target; i vincoli contrattuali sono indipendenti dal permesso tecnico.
  • Non inviare richieste a un'intensità tale da danneggiare il server target.
  • Non ripubblicare contenuti protetti da copyright.

Riepilogo

Lo scraping con residential proxy dà un alto tasso di successo con l'architettura e la velocità giuste. Separa i livelli, rileva le pagine di blocco a livello di contenuto, imposta il gate di velocità per singolo target, proteggi la quota con il filtraggio delle risorse e usa le risorse in modo graduale. Il parametro più determinante non è la qualità dell'IP, ma la velocità delle richieste. Per testare la tua configurazione Se un datacenter proxy sia sufficiente dipende dal livello di protezione del target, ed è una cosa misurabile. Prendi come riferimento la connessione diretta ed esegui un test comparativo alla stessa velocità; scegli il livello in base al tasso di successo. Costruire una logica di escalation a livelli e accumulare statistiche per target riduce al minimo sia i costi sia la perdita di velocità. Per iniziare, per i dettagli degli scenari proxy per web scraping puoi consultare la nostra pagina.

Domande frequenti

01Quanti IP servono per lo scraping?

Più del numero di IP conta la velocità delle richieste. Il metodo più affidabile è partire da valori conservativi — 0,5 richieste al secondo per target e 20–40 richieste per IP — misurare e aumentare gradualmente.

02Ho ricevuto un HTTP 200 ma nessun dato: perché?

Con ogni probabilità hai ricevuto una pagina di blocco o di verifica. Controlla la firma del contenuto invece del codice di stato: non considerare riuscita una risposta senza aver verificato la presenza di un selettore atteso.

03Devo per forza usare un browser?

No, se il dato è presente nel sorgente HTML o in una risposta XHR. Le richieste HTTP semplici sono molto più economiche e molto più veloci. Usa il browser solo se il contenuto viene generato in JavaScript.

04Come riduco il tasso di CAPTCHA?

Prima riduci la velocità e aggiungi jitter; nella maggior parte dei casi basta questo da solo. Poi assicurati che lingua del browser, fuso orario e ordine degli header siano coerenti con il paese di uscita.

05Come rendo più economico il traffico residential?

Blocca immagini, font e richieste di tracciamento, mantieni la compressione, indirizza i target facili al pool economico e riduci il tasso di richieste fallite. Questi quattro passaggi abbassano sensibilmente la bolletta tipica.

Articoli e pagine correlati

PROSSIMO PASSO

Potenzia oggi la tua infrastruttura proxy.

Inizia in pochi minuti con i pacchetti a pagamento oppure prova prima il nostro elenco di proxy gratuiti.

FREEPROXY.TR

Se cerchi proxy gratuiti, sei nel posto giusto

Una piattaforma proxy completa dove consultare indirizzi proxy gratuiti aggiornati, confrontare i tipi di proxy HTTP e SOCKS e verificare le tue connessioni proxy con strumenti gratuiti.