Le operazioni condotte con un solo IP prima o poi sbattono contro un muro: il sito di destinazione si accorge del numero di richieste, applica un rate limit e alla fine blocca. Pool di proxy, è la struttura che gestisce più IP di uscita come un'unica risorsa logica per risolvere questo problema. Un pool ben configurato distribuisce le richieste, disattiva gli IP problematici e compensa automaticamente i fallimenti.
In questo articolo trattiamo i componenti tecnici del pool, la logica di dimensionamento e i pattern di gestione che funzionano in ambiente di produzione.
Da quanti livelli è composto un pool?
Un pool di proxy non è solo un "elenco di IP". Un pool che funziona in produzione contiene almeno quattro componenti:
Un pool privo del livello di feedback diventa cieco in poco tempo: gli IP non sani continuano a essere usati e il tasso di successo cala.
Come si calcola la dimensione del pool?
Alla domanda "quanti IP servono?" non c'è una risposta unica, ma esiste un quadro calcolabile. Guarda tre variabili: la frequenza di richieste tollerata per IPdalla destinazione, la tua frequenza totale di richieste e il margine di sicurezza.
Esempio: invierai 20 richieste al secondo e il sito di destinazione accetta senza problemi 0,5 richieste al secondo per IP. Calcolo approssimativo: 20 / (0,5 × 0,7) ≈ 57 IP. Il coefficiente 0,7 rappresenta l'ipotesi che in ogni momento una parte del pool sarà in quarantena o lenta.
Invece di provare a stimare la frequenza sicura per IP, misurala. Partire da un pool piccolo e individuare sperimentalmente la soglia che innesca il rate limit è molto più economico che acquistare subito un pool di grandi dimensioni.
Controllo di stato: cosa misurare?
Non basta che un IP "funzioni"; deve essere abbastanza buono da servire al tuo lavoro . In pratica si monitorano quattro metriche:
| Metrica | Cosa misura | Soglia tipica | Se la soglia viene superata |
|---|---|---|---|
| Disponibilità | La connessione TCP viene stabilita? | 3 fallimenti consecutivi | Metti in quarantena |
| Latenza | Tempo al primo byte | 3 volte la mediana del pool | Riduci il peso |
| Tasso di successo | Percentuale di richieste con risposta 2xx | Sotto l'85% | Metti in osservazione |
| Blocco | Tasso di 403 / 429 / CAPTCHA | Sopra il 10% | Quarantena lunga |
È importante eseguire il controllo di stato non verso il sito di destinazione, ma verso un endpoint neutro . Ogni richiesta di controllo inviata alla destinazione consuma il budget riservato al lavoro vero. Il nostro strumento di controllo proxy usa esattamente per questo scopo un punto di controllo neutro e riporta insieme l'IP di uscita e il livello di anonimato.
Mettere un IP in quarantena progressiva invece di eliminarlo definitivamente evita di rimpicciolire inutilmente il pool in caso di problemi di rete temporanei.
Strategie di selezione
Ci sono più modi per scegliere un IP dal pool e la logica di selezione incide direttamente sul tasso di successo:
Round-robin (sequenziale)
Il metodo più semplice: gli IP vengono usati in sequenza. È prevedibile ed equo, ma non tiene conto delle differenze di velocità; un IP lento rallenta la coda.
Casuale ponderato
A ogni IP viene assegnato un peso in base al tasso di successo e alla latenza; la selezione avviene in modo casuale secondo questi pesi. È il metodo bilanciato più usato in produzione.
Meno utilizzato
Viene scelto l'IP con il minor numero di connessioni aperte in quel momento. Nei lavori con richieste di lunga durata bilancia davvero il carico.
Associazione sticky
Una determinata sessione o account si collega sempre allo stesso IP. È obbligatoria nei lavori con login; con la logica di rotazione va progettata insieme.
La selezione ponderata permette al pool di "auto-ripararsi": gli IP con prestazioni scarse vengono usati spontaneamente sempre meno.
Logica di quarantena e reintegro
Il fatto che un IP riceva un 429 (Too Many Requests) non significa che sia guasto; indica soltanto che per quella destinazione è stato usato temporaneamente troppo. Per questo la quarantena va mantenuta per destinazione . Lo stesso IP può funzionare ancora perfettamente per un altro dominio.
Uno schema di quarantena pratico:
- 429 / 503: fai una pausa di 60 secondi per quella destinazione, poi riprova con una singola richiesta.
- 403 persistente: 6 ore di quarantena per quella destinazione; continua a usarlo per le altre destinazioni.
- CAPTCHA: chiudi la sessione, aprine una nuova con un nuovo IP; non usare lo stesso IP per 30 minuti.
- Errore di connessione: l'IP è problematico in generale; 5 minuti di quarantena per tutte le destinazioni.
Mescolare le fonti del pool
I pool composti da un solo tipo di IP sono fragili. La maggior parte delle operazioni serie costruisce un pool misto:
Inviare ogni richiesta al pool più costoso fa lievitare inutilmente i costi. L'escalation progressiva (prima l'economico, se fallisce il costoso) dimezza i costi nella maggior parte delle operazioni.
Questo modello progressivo ti consente di scegliere la risorsa in base al grado di difficoltà della destinazione. Per l'equilibrio tra potenza e costo dei diversi tipi di proxy consulta il nostro confronto tra residential e datacenter, e per la scelta del tipo residenziale, ISP e datacenter puoi consultare le nostre pagine prodotto.
Errori frequenti nella gestione del pool
Buone abitudini
- Eseguire il controllo di stato su un endpoint indipendente dalla destinazione.
- Mantenere la quarantena per destinazione.
- Loggare costantemente le metriche del pool (dimensione, percentuale di IP sani, latenza mediana).
- Innescare la rotazione in base all'esito, non al numero di richieste.
- Rendere obbligatoria l'associazione sticky nei lavori che richiedono una sessione.
Errori frequenti
- Eliminare definitivamente un IP fallito: il pool si erode nel tempo.
- Tenere un'unica lista di quarantena per tutte le destinazioni.
- Eseguire il controllo di stato sulla destinazione reale consumando la quota.
- Tenere il pool più grande del necessario gonfiando i costi.
- Ruotare a metà sessione facendo cadere i login.
Lo scheletro di un piccolo gestore di pool
Questo scheletro non è sufficiente per la produzione (mancano persistenza, lock di concorrenza e quarantena per destinazione), ma mostra chiaramente la logica: la selezione dipende dal peso e il peso dall'esito.
Riepilogo
Un pool di proxy non è un elenco di IP; è un piccolo sistema fatto di registry, controlli di stato, selezione e ciclo di feedback. Calcola la dimensione del pool a partire dalla soglia di tolleranza della destinazione, mantieni la quarantena per destinazione, lega la selezione alle metriche di esito e scala le risorse in ordine di costo. Per testare in blocco gli indirizzi del tuo pool puoi Se un datacenter proxy sia sufficiente dipende dal livello di protezione del target, ed è una cosa misurabile. Prendi come riferimento la connessione diretta ed esegui un test comparativo alla stessa velocità; scegli il livello in base al tasso di successo. Costruire una logica di escalation a livelli e accumulare statistiche per target riduce al minimo sia i costi sia la perdita di velocità. Per iniziare usare, e per scenari su larga scala proxy per web scraping puoi consultare la nostra pagina.