Come evitare i ban IP durante lo scraping
I ban IP di solito derivano dal comportamento, non dalla sfortuna — troppe richieste, intestazioni imprecise e un'impronta digitale che grida "bot". Ecco come fare scraping nel rispetto delle regole e mantenere le tue richieste fluide.
Perché i siti bloccano gli IP (e cosa risolvere per primo)
La maggior parte dei blocchi è attivata da come richiedi, non da chi sei.
Tre segnali fanno il lavoro pesante dietro la maggior parte dei divieti:
- Tasso & volume — troppe richieste al secondo da un IP, o un ritmo perfettamente uniforme che nessun umano produrrebbe.
- Impronta — ordine dei frame TLS/JA3, HTTP/2 e ordinamento delle intestazioni che non corrispondono al browser che affermi di essere.
- Intestazioni — un
User-Agentmancante o predefinito, nessunAccept-Language, unRefererobsoleto o assente.
Prima di ottimizzare tutto questo, leggi il robots.txt e i Termini di Servizio del target. Estrarre dati pubblici è spesso accettabile; colpire un endpoint, ignorare i limiti di frequenza pubblicati o raccogliere dati personali può violare i ToS e, in alcune giurisdizioni, la legge. Rispetta il crawl-delay, memorizza nella cache ciò che recuperi e non riprovare un sito fino a farlo crollare.
Una volta che stai estraendo dati in modo responsabile, la tua leva principale è come vengono assegnati gli IP:
| Approccio | Migliore per | Compromesso |
|---|---|---|
| Rotazione (nuovo IP per richiesta/lotti) | Pagine pubbliche ad alto volume, estrazioni in stile ricerca | Distribuisce il carico, ma interrompe sessioni, carrelli e accessi |
| Fisso / sessione (stesso IP per un po') | Flussi con accesso effettuato, navigazione multi-passaggio, paginazione | Sembra umano, ma concentra il carico su un'uscita |
s4m esegue proxy datacenter — SOCKS5 + HTTP autenticati, non residenziali. Sono veloci e economici per GB, ma alcuni siti consumer segnalano più facilmente gli intervalli di datacenter, quindi abbinali a intestazioni pulite e limiti di frequenza onesti. Hai bisogno di un'uscita stabile per gli accessi? Aggiungi un IP dedicato. Preferisci un tunnel completo? Vedi /vpn/, valuta le opzioni su /compare/, o leggi ulteriori guide.
Le leve che ti mantengono non bannato
Combina questi — nessun trucco singolo batte un buon sistema anti-bot.
Limitazione della velocità e jitter
Limita la concorrenza, aggiungi ritardi casuali tra le richieste e rispetta il crawl-delay più eventuali 429 / Retry-After che il server invia.
Ruota o rimani stabile
Ruota gli IP per crawls stateless ad alto volume; mantieni un'uscita persistente per flussi multi-passaggio con accesso effettuato. Molti lavori mescolano entrambi.
Impronta pulita
Invia intestazioni del browser realistiche con un Accept-Language e Referer coerenti invece dei valori predefiniti della libreria che ti contrassegnano come un bot.
Ritirati in caso di fallimento
Usa il backoff esponenziale con jitter su risposte 429 e 5xx, e fermati completamente quando un sito segnala chiaramente di fermarsi.
Controllo dell'uso per IP
I limiti s4m sono regolabili dall'amministratore per IP, account e tipo di account, quindi un lavoro fuori controllo non può bruciare un'uscita condivisa o il tuo budget.
Nessun log, RAM-first
Proxy autenticati su TLS, senza log per design. La tua lista di obiettivi e il traffico rimangono tuoi, su carta o cripto.
Un setup di scraping resistente ai divieti
Sei passaggi dalla prima richiesta a un crawler durevole.
Controlla robots.txt e ToS
Conferma che l'endpoint consenta l'accesso automatizzato, annota eventuali ritardi di scansione e salta dati personali o chiaramente off-limits.
Imposta un budget per la richiesta
Scegli un limite di concorrenza e un obiettivo di richieste al secondo ben al di sotto di ciò che apparirebbe abusivo, quindi aggiungi un ritardo casuale.
Invia intestazioni realistiche
Imposta un vero User-Agent, Accept e Accept-Language, e mantienili coerenti per tutta la durata di una sessione.
Scegli rotante vs fisso
Ruota le uscite per pagine stateless; riutilizza un'uscita sticky per ogni sessione loggata in modo che lo stato non si interrompa a metà flusso.
Aggiungi un backoff esponenziale
Su 429 / 503, aspetta Retry-After (o 2^n) più jitter e riprova alcune volte, poi arrenditi con grazia.
Limite di utilizzo per IP
Usa limiti per IP s4m in modo che un singolo scraping non possa esaurire un'uscita e monitora l'uso a consumo mentre scalate.
Python: crawler educato su proxy s4m
Sessione persistente, intestazioni realistiche, backoff con jitter. Sostituisci USER:PASS con le tue credenziali — non codificare mai un IP reale.
import random
import time
import requests
# s4m datacenter proxies (authenticated). Placeholder host only.
USER, PASS = "USER", "PASS"
HTTP = f"http://{USER}:{PASS}@proxy.s4m.online:3128"
SOCKS = f"socks5://{USER}:{PASS}@proxy.s4m.online:1080" # pip install requests[socks]
PROXIES = {"http": HTTP, "https": HTTP}
HEADERS = {
"User-Agent": (
"Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 "
"(KHTML, like Gecko) Chrome/125.0 Safari/537.36"
),
"Accept": "text/html,application/xhtml+xml;q=0.9,*/*;q=0.8",
"Accept-Language": "en-US,en;q=0.9",
}
def polite_get(url, session, max_retries=5):
for attempt in range(max_retries):
r = session.get(url, headers=HEADERS, proxies=PROXIES, timeout=20)
if r.status_code == 429 or r.status_code >= 500:
wait = float(r.headers.get("Retry-After", 2 ** attempt))
time.sleep(wait + random.uniform(0, 1)) # backoff + jitter
continue
r.raise_for_status()
return r
raise RuntimeError(f"gave up after {max_retries} tries: {url}")
def crawl(urls):
# One Session = one sticky exit for this run; open a new one to rotate.
with requests.Session() as s:
for url in urls:
resp = polite_get(url, s)
yield url, resp.text
time.sleep(random.uniform(1.5, 4.0)) # rate-limit + jitter
if __name__ == "__main__":
for url, html in crawl(["https://example.com/page/1"]):
print(url, len(html))Domande, risposte
I proxy di data center sono sufficienti per evitare divieti?
Nascondono il tuo IP di origine e distribuiscono il carico, il che previene molti blocchi basati sul tasso. Ma i proxy s4m sono di datacenter, non residenziali, e alcuni siti consumer segnalano più facilmente gli intervalli di datacenter — quindi combinali con intestazioni pulite, limiti di tasso ragionevoli e sessioni sticky dove lo stato è importante.
Dovrei usare proxy rotanti o persistenti?
Ruota le uscite per pagine pubbliche senza stato e ad alto volume in modo che nessun singolo IP attiri attenzione. Mantieni una sessione stabile quando sei connesso o segui un flusso a più passaggi, poiché un IP che cambia durante la sessione appare sospetto e può interrompere carrelli o autenticazioni. Molti lavori mescolano entrambi.
Lo scraping web è legale?
Dipende dalla tua giurisdizione, dai dati e dai termini del sito. I dati pubblici e non personali sono spesso accettabili, ma i ToS di una piattaforma possono vietare l'accesso automatizzato anche quando è tecnicamente possibile, e i dati personali comportano regole aggiuntive. Controlla sempre robots.txt e ToS, e fai scraping in modo conservativo.
Come posso fermare un lavoro che consuma tutto il mio quota?
I proxy s4m sono misurati e paghi per quello che usi, con limiti regolabili dall'amministratore per IP, per account e per tipo di account. Limita la concorrenza nel tuo crawler e imposta un limite di utilizzo per IP in modo che un ciclo incontrollato non possa prosciugare il tuo budget o un'uscita condivisa.
Posso ottenere un IP stabile per scraping con accesso effettuato?
Sì. L'add-on IP personale dedicato è un'uscita statica che puoi opzionalmente scollegare dalla tua identità e collegare a un proxy o alla VPN — utile quando un obiettivo lega una sessione a un indirizzo consistente.
Raccogli in modo più intelligente, non più difficile
Proxy datacenter SOCKS5 + HTTP autenticati, a pagamento a consumo, con limiti di utilizzo per IP e un IP dedicato opzionale. No-logs per design — e onesti sul fatto che questi sono uscite da datacenter, non residenziali.
Le persone hanno trovato questa pagina cercando
- come evitare i ban IP durante lo scraping
- cosa sono i proxy ISP (residenziali statici)
- proxy per scraping con pagamento in criptovaluta
- come impostare un proxy in Chrome e Firefox
- impostazione del proxy Puppeteer con autenticazione
- fresco lista di proxy gratuiti
- come lista di proxy gratuiti funziona
- proxy http
- vpn kill switch
- WireGuard vs OpenVPN
- proxy socks5 per affari
- openvpn
- autenticazione proxy tutorial
- come configurare indirizzo ip
- indirizzo ip
- autenticazione proxy
Frasi di ricerca reali a cui questa pagina risponde — i collegamenti aprono la pagina che le tratta in dettaglio.