Guida allo scraping · 2 min di lettura

Come evitare i ban IP durante lo scraping

I ban IP di solito derivano dal comportamento, non dalla sfortuna — troppe richieste, intestazioni imprecise e un'impronta digitale che grida "bot". Ecco come fare scraping nel rispetto delle regole e mantenere le tue richieste fluide.

Perché i siti bloccano gli IP (e cosa risolvere per primo)

La maggior parte dei blocchi è attivata da come richiedi, non da chi sei.

Tre segnali fanno il lavoro pesante dietro la maggior parte dei divieti:

  • Tasso & volume — troppe richieste al secondo da un IP, o un ritmo perfettamente uniforme che nessun umano produrrebbe.
  • Impronta — ordine dei frame TLS/JA3, HTTP/2 e ordinamento delle intestazioni che non corrispondono al browser che affermi di essere.
  • Intestazioni — un User-Agent mancante o predefinito, nessun Accept-Language, un Referer obsoleto o assente.

Prima di ottimizzare tutto questo, leggi il robots.txt e i Termini di Servizio del target. Estrarre dati pubblici è spesso accettabile; colpire un endpoint, ignorare i limiti di frequenza pubblicati o raccogliere dati personali può violare i ToS e, in alcune giurisdizioni, la legge. Rispetta il crawl-delay, memorizza nella cache ciò che recuperi e non riprovare un sito fino a farlo crollare.

Una volta che stai estraendo dati in modo responsabile, la tua leva principale è come vengono assegnati gli IP:

ApproccioMigliore perCompromesso
Rotazione (nuovo IP per richiesta/lotti)Pagine pubbliche ad alto volume, estrazioni in stile ricercaDistribuisce il carico, ma interrompe sessioni, carrelli e accessi
Fisso / sessione (stesso IP per un po')Flussi con accesso effettuato, navigazione multi-passaggio, paginazioneSembra umano, ma concentra il carico su un'uscita

s4m esegue proxy datacenter — SOCKS5 + HTTP autenticati, non residenziali. Sono veloci e economici per GB, ma alcuni siti consumer segnalano più facilmente gli intervalli di datacenter, quindi abbinali a intestazioni pulite e limiti di frequenza onesti. Hai bisogno di un'uscita stabile per gli accessi? Aggiungi un IP dedicato. Preferisci un tunnel completo? Vedi /vpn/, valuta le opzioni su /compare/, o leggi ulteriori guide.

Le leve che ti mantengono non bannato

Combina questi — nessun trucco singolo batte un buon sistema anti-bot.

Limitazione della velocità e jitter

Limita la concorrenza, aggiungi ritardi casuali tra le richieste e rispetta il crawl-delay più eventuali 429 / Retry-After che il server invia.

Ruota o rimani stabile

Ruota gli IP per crawls stateless ad alto volume; mantieni un'uscita persistente per flussi multi-passaggio con accesso effettuato. Molti lavori mescolano entrambi.

Impronta pulita

Invia intestazioni del browser realistiche con un Accept-Language e Referer coerenti invece dei valori predefiniti della libreria che ti contrassegnano come un bot.

Ritirati in caso di fallimento

Usa il backoff esponenziale con jitter su risposte 429 e 5xx, e fermati completamente quando un sito segnala chiaramente di fermarsi.

Controllo dell'uso per IP

I limiti s4m sono regolabili dall'amministratore per IP, account e tipo di account, quindi un lavoro fuori controllo non può bruciare un'uscita condivisa o il tuo budget.

Nessun log, RAM-first

Proxy autenticati su TLS, senza log per design. La tua lista di obiettivi e il traffico rimangono tuoi, su carta o cripto.

Un setup di scraping resistente ai divieti

Sei passaggi dalla prima richiesta a un crawler durevole.

Controlla robots.txt e ToS

Conferma che l'endpoint consenta l'accesso automatizzato, annota eventuali ritardi di scansione e salta dati personali o chiaramente off-limits.

Imposta un budget per la richiesta

Scegli un limite di concorrenza e un obiettivo di richieste al secondo ben al di sotto di ciò che apparirebbe abusivo, quindi aggiungi un ritardo casuale.

Invia intestazioni realistiche

Imposta un vero User-Agent, Accept e Accept-Language, e mantienili coerenti per tutta la durata di una sessione.

Scegli rotante vs fisso

Ruota le uscite per pagine stateless; riutilizza un'uscita sticky per ogni sessione loggata in modo che lo stato non si interrompa a metà flusso.

Aggiungi un backoff esponenziale

Su 429 / 503, aspetta Retry-After (o 2^n) più jitter e riprova alcune volte, poi arrenditi con grazia.

Limite di utilizzo per IP

Usa limiti per IP s4m in modo che un singolo scraping non possa esaurire un'uscita e monitora l'uso a consumo mentre scalate.

Python: crawler educato su proxy s4m

Sessione persistente, intestazioni realistiche, backoff con jitter. Sostituisci USER:PASS con le tue credenziali — non codificare mai un IP reale.

python
import random
import time
import requests

# s4m datacenter proxies (authenticated). Placeholder host only.
USER, PASS = "USER", "PASS"
HTTP  = f"http://{USER}:{PASS}@proxy.s4m.online:3128"
SOCKS = f"socks5://{USER}:{PASS}@proxy.s4m.online:1080"  # pip install requests[socks]

PROXIES = {"http": HTTP, "https": HTTP}

HEADERS = {
    "User-Agent": (
        "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 "
        "(KHTML, like Gecko) Chrome/125.0 Safari/537.36"
    ),
    "Accept": "text/html,application/xhtml+xml;q=0.9,*/*;q=0.8",
    "Accept-Language": "en-US,en;q=0.9",
}


def polite_get(url, session, max_retries=5):
    for attempt in range(max_retries):
        r = session.get(url, headers=HEADERS, proxies=PROXIES, timeout=20)
        if r.status_code == 429 or r.status_code >= 500:
            wait = float(r.headers.get("Retry-After", 2 ** attempt))
            time.sleep(wait + random.uniform(0, 1))  # backoff + jitter
            continue
        r.raise_for_status()
        return r
    raise RuntimeError(f"gave up after {max_retries} tries: {url}")


def crawl(urls):
    # One Session = one sticky exit for this run; open a new one to rotate.
    with requests.Session() as s:
        for url in urls:
            resp = polite_get(url, s)
            yield url, resp.text
            time.sleep(random.uniform(1.5, 4.0))  # rate-limit + jitter


if __name__ == "__main__":
    for url, html in crawl(["https://example.com/page/1"]):
        print(url, len(html))
FAQ

Domande, risposte

I proxy di data center sono sufficienti per evitare divieti?

Nascondono il tuo IP di origine e distribuiscono il carico, il che previene molti blocchi basati sul tasso. Ma i proxy s4m sono di datacenter, non residenziali, e alcuni siti consumer segnalano più facilmente gli intervalli di datacenter — quindi combinali con intestazioni pulite, limiti di tasso ragionevoli e sessioni sticky dove lo stato è importante.

Dovrei usare proxy rotanti o persistenti?

Ruota le uscite per pagine pubbliche senza stato e ad alto volume in modo che nessun singolo IP attiri attenzione. Mantieni una sessione stabile quando sei connesso o segui un flusso a più passaggi, poiché un IP che cambia durante la sessione appare sospetto e può interrompere carrelli o autenticazioni. Molti lavori mescolano entrambi.

Lo scraping web è legale?

Dipende dalla tua giurisdizione, dai dati e dai termini del sito. I dati pubblici e non personali sono spesso accettabili, ma i ToS di una piattaforma possono vietare l'accesso automatizzato anche quando è tecnicamente possibile, e i dati personali comportano regole aggiuntive. Controlla sempre robots.txt e ToS, e fai scraping in modo conservativo.

Come posso fermare un lavoro che consuma tutto il mio quota?

I proxy s4m sono misurati e paghi per quello che usi, con limiti regolabili dall'amministratore per IP, per account e per tipo di account. Limita la concorrenza nel tuo crawler e imposta un limite di utilizzo per IP in modo che un ciclo incontrollato non possa prosciugare il tuo budget o un'uscita condivisa.

Posso ottenere un IP stabile per scraping con accesso effettuato?

Sì. L'add-on IP personale dedicato è un'uscita statica che puoi opzionalmente scollegare dalla tua identità e collegare a un proxy o alla VPN — utile quando un obiettivo lega una sessione a un indirizzo consistente.

Raccogli in modo più intelligente, non più difficile

Proxy datacenter SOCKS5 + HTTP autenticati, a pagamento a consumo, con limiti di utilizzo per IP e un IP dedicato opzionale. No-logs per design — e onesti sul fatto che questi sono uscite da datacenter, non residenziali.

Le persone hanno trovato questa pagina cercando

Frasi di ricerca reali a cui questa pagina risponde — i collegamenti aprono la pagina che le tratta in dettaglio.