Come utilizzare i proxy per il web scraping
I proxy mantengono nascosto il server di origine del tuo scraper e distribuiscono le richieste tra gli IP in modo che un singolo indirizzo non venga limitato o bloccato. Questa guida tratta la scelta dei proxy e il loro collegamento a Python, Scrapy e Playwright.
Perché il tuo scraper ha bisogno di un proxy
Due problemi guidano quasi ogni configurazione di scraping: proteggere il tuo IP reale e rimanere sotto i limiti di tariffa per IP.
Quando un crawler invia migliaia di richieste da un indirizzo, il sito target vede un singolo IP comportarsi come un bot. Il risultato abituale è un rallentamento, un muro CAPTCHA o un blocco totale — e peggio, l'indirizzo bloccato è il tuo server di origine, la macchina che esegue la logica della tua attività. Un proxy si trova tra il tuo scraper e il target, quindi il sito vede solo l'IP di uscita del proxy, mai il tuo reale.
Due preoccupazioni plasmano quasi ogni configurazione di scraping:
- Proteggere la tua origine. Se l'IP del tuo server di produzione viene inserito nella blacklist, il danno supera il periodo di scraping. Instradare tramite un proxy mantiene quell'indirizzo pulito e non collegato al crawl.
- Distribuire il carico. Diffondere le richieste su diversi IP di uscita mantiene ciascuno di essi al di sotto del limite di velocità per IP del target, così puoi raccogliere dati senza attivare le difese contro gli abusi.
s4m fornisce proxy SOCKS5 e HTTP autenticati da datacenter proprio per questo. Sono veloci ed economici, il che si adatta a target ad alto volume e tolleranti — ma poiché sono IP di datacenter, siti rigorosi possono identificarli più facilmente rispetto agli indirizzi residenziali, quindi imposta le aspettative di conseguenza. Per esperimenti rapidi puoi prelevare endpoint usa e getta dalla lista pubblica di proxy gratuita, proxy di terze parti validati continuamente ma usali a tuo rischio e pericolo. Se vuoi anche nascondere un'intera app o server piuttosto che un singolo client, un tunnel VPN copre tutto il suo traffico. Vedi prezzi per le tariffe dei proxy a consumo.
Scelta dei proxy per lo scraping
Abbina lo strumento al lavoro. Ecco come le opzioni di s4m si confrontano per un carico di scraping.
Datacenter SOCKS5 / HTTP
Proxy a consumo, paghi per quello che usi su proxy.s4m.online — porta 1080 per SOCKS5, 3128 per HTTP, autenticati con USER:PASS. Veloci ed economici per il crawling in massa di obiettivi che non valutano aggressivamente la reputazione IP. Questo è il cavallo da lavoro per lo scraping in produzione.
Lista di proxy pubblici gratuiti
Proxy di terze parti raccolti da fonti aperte e continuamente ri-validati, filtrabili per paese, protocollo e anonimato. Ideale per prototipare un scraper prima di impegnare un budget — ma inaffidabile e da utilizzare a proprio rischio, mai adatto per lavori di produzione.
IP personale dedicato
Un IP statico opzionale che è solo tuo, collegabile al tuo proxy e opzionalmente non collegato alla tua identità. Utile quando un obiettivo autorizza un singolo indirizzo, o quando hai bisogno di una sessione stabile e persistente che non ruota mai.
Integra e controlla il tuo crawl
Da una prima richiesta autenticata a sessioni, rotazione, limiti di velocità e controllo dei costi.
Punta il tuo client al proxy
In Python requests, imposta il dizionario dei proxy su socks5://USER:PASS@proxy.s4m.online:1080 (installa requests[socks]) o l'endpoint HTTP su 3128. In Scrapy, abilita HttpProxyMiddleware e imposta il proxy per richiesta o tramite la variabile di ambiente http_proxy. In Playwright, passa proxy={"server": ...} a browser.launch().
Scegli sessioni vs rotazione
Usa una sessione di richieste persistente — o un IP personale dedicato — quando il target lega i cookie e lo stato di accesso a un IP, poiché cambiare durante la sessione appare sospetto. Ruota tra molti IP di uscita quando esplori elenchi pubblici, per rimanere sotto i limiti per IP. Non mescolare i due per la stessa identità logica.
Limita e rispetta il target
Rispetta robots.txt, leggi i termini di servizio del sito e aggiungi ritardi: time.sleep in requests, DOWNLOAD_DELAY e AutoThrottle in Scrapy. Tassi di richiesta costanti e su scala umana vengono bloccati molto meno spesso rispetto a picchi — fare scraping in modo responsabile è sia la scelta etica che quella efficace.
Limita la tua spesa
Poiché i proxy datacenter sono a consumo, fai attenzione all'uso. s4m consente agli amministratori di impostare limiti su tre assi — per tipo di account, per IP e per account — in modo che un crawler fuori controllo non possa silenziosamente bruciare il tuo budget. Imposta un tetto per account prima di avviare un grande lavoro.
Python: esegui lo scraping tramite il proxy s4m
Un estrattore di richieste minimale e cortese che esce attraverso il tuo proxy del datacenter s4m invece del tuo server di origine.
import time
import requests
# s4m datacenter proxy endpoints:
# SOCKS5 -> proxy.s4m.online:1080 (pip install "requests[socks]")
# HTTP -> proxy.s4m.online:3128
PROXY = "socks5://USER:PASS@proxy.s4m.online:1080"
# PROXY = "http://USER:PASS@proxy.s4m.online:3128"
session = requests.Session()
session.proxies.update({"http": PROXY, "https": PROXY})
session.headers.update(
{"User-Agent": "my-scraper/1.0 (+contact@example.com)"}
)
# Confirm requests now exit through the proxy, not your real IP:
print("exit IP:", session.get("https://api.ipify.org", timeout=15).text)
for page in range(1, 6):
r = session.get(f"https://example.com/list?page={page}", timeout=20)
r.raise_for_status()
# ... parse r.text here ...
time.sleep(1.5) # throttle: stay within the target's rate limits
Domande, risposte
I proxy s4m sono residenziali?
No. s4m fornisce proxy SOCKS5 e HTTP di datacenter autenticati. Sono veloci ed economici, ma poiché sono IP di datacenter, i siti che valutano la reputazione degli IP possono rilevarli più facilmente rispetto agli indirizzi residenziali. Non vendiamo né rivendichiamo proxy residenziali.
Posso ruotare gli IP automaticamente?
Tu gestisci la rotazione dal tuo lato ciclando tra richieste o sessioni. Per un'uscita fissa e non rotante, aggiungi un IP personale dedicato e collegalo al tuo proxy. Abbina uno dei due approcci con i limiti di utilizzo per IP e per account di s4m per mantenere sia il comportamento che i costi prevedibili.
SOCKS5 o HTTP — quale dovrei usare per lo scraping?
Entrambi funzionano. SOCKS5 (porta 1080) è agnostico rispetto al protocollo e gestisce qualsiasi traffico TCP, il che è conveniente per l'automazione del browser come Playwright. HTTP (porta 3128) è la soluzione più semplice per script basati su richieste semplici. Scegli quello che il tuo client supporta meglio.
Posso usare la lista di proxy gratuita per scraping in produzione?
Conservalo per i test. La lista gratuita aggrega proxy di terze parti da fonti aperte; vengono convalidate continuamente ma possono scomparire o rallentare in qualsiasi momento, e li usi a tuo rischio. Per lavori affidabili, usa i proxy datacenter autenticati di s4m.
È legale fare web scraping attraverso un proxy?
Un proxy cambia quale IP un sito vede; non concede permessi. Controlla sempre i termini di servizio e il robots.txt del target, evita dati personali o protetti da copyright che non sei autorizzato a raccogliere e mantieni tassi di richiesta ragionevoli. Un proxy non è un sostituto per lo scraping legale ed etico.
Inizia a fare scraping senza esporre la tua origine
Avvia proxy SOCKS5 e HTTP autenticati in datacenter, oppure prototipa prima con l'elenco pubblico gratuito. Account anonimi, senza registri per design, e paghi solo per i dati che misuri.
Le persone hanno trovato questa pagina cercando
- come utilizzare i proxy per il web scraping
- split tunneling
- indirizzo ip per scraping
- indirizzo ip
- vpn kill switch per scraping
- proxy per scraping
- lista di proxy gratuiti
- configurazione del proxy
- double VPN / multi-hop
- come usare un proxy con wget
Frasi di ricerca reali a cui questa pagina risponde — i collegamenti aprono la pagina che le tratta in dettaglio.