Raccolta Dati · 3 min di lettura

Proxy per scraping Wildberries, Ozon e Avito

Raccogliere prezzi e elenchi da marketplace come Wildberries, Ozon e Avito significa affrontare limiti di velocità, prezzi regionali e difese anti-bot. Ecco come si inseriscono i proxy — e dove gli IP dei datacenter raggiungono il loro limite.

Perché lo scraping di marketplace ha bisogno di proxy

I limiti di velocità e i prezzi regionali sono i due ostacoli che incontri per primi.

Il monitoraggio dei prezzi, l'analisi dell'assortimento e la modifica dei prezzi su Wildberries, Ozon e Avito si basano sulla raccolta rapida e ripetuta di molte pagine. Due problemi si presentano quasi immediatamente, e entrambi sono risolti instradando le richieste attraverso proxy piuttosto che il proprio IP.

Il primo è il limite di velocità. Invia centinaia di richieste da un singolo indirizzo e il marketplace lo limita o lo blocca — inizi a vedere risposte lente, captcha o divieti totali. Distribuire le richieste su un pool di IP mantiene ciascuno sotto il radar. Il secondo è il prezzo regionale: queste piattaforme mostrano prezzi, disponibilità e termini di consegna diversi a seconda della regione dell'acquirente, quindi per catturare il prezzo che un acquirente in una determinata città vede effettivamente, la tua richiesta deve apparire provenire da una posizione pertinente.

Un proxy risponde a entrambi cambiando l'IP da cui proviene ogni richiesta. La verità onesta — trattata di seguito — è che tipo di IP, perché i marketplace investono molto nel rilevare il traffico automatizzato. Se sei nuovo a questo, inizia con la guida generale sugli proxy per scraping, poi torna per i dettagli specifici del marketplace.

Le vere sfide

Cosa rompe realmente un scraper di marketplace.

Limiti di velocità e divieti

Troppe richieste da un IP attivano il throttling, i captcha e i blocchi. Ruotare tra molti IP e dosare le richieste mantiene ogni indirizzo simile a un traffico ordinario invece di un scraper.

Prezzi regionali

Wildberries, Ozon e Avito localizzano prezzo, stock e consegna per regione. Per registrare ciò che un vero acquirente vede, le richieste devono apparire originate da una posizione pertinente — una dimensione geo che un singolo IP domestico non può fornire.

Rilevamento anti-bot

Oltre all'IP, queste piattaforme identificano i browser, controllano gli header, il timing e il comportamento. I proxy gestiscono solo il livello IP; un scraper ingenuo viene comunque catturato dagli altri segnali.

Datacenter vs residenziali

I marketplace segnalano più facilmente gli intervalli di datacenter noti rispetto agli indirizzi di ISP domestici. I proxy di datacenter sono veloci ed economici e funzionano per molti endpoint, ma pagine ostili possono richiedere IP di tipo residenziale.

Una configurazione pratica

Raccogli dati senza bruciare il tuo pool il primo giorno.

Concentrati e unisci le tue richieste

Non colpire da un solo IP. Ruota attraverso un pool e aggiungi ritardi e jitter tra le richieste in modo che il traffico sembri umano, non come un bot a intervallo fisso.

Abbina la regione ai dati

Se hai bisogno del prezzo mostrato in una città particolare, il tuo IP di uscita deve essere plausibile per quella regione. Decidi in anticipo quali regioni devi coprire e instrada di conseguenza.

Invia richieste realistiche

Imposta intestazioni corrette e un vero User-Agent, gestisci cookie e sessioni, e dove una pagina è pesante in JavaScript, rendila. I proxy fissano l'IP; il resto della richiesta deve comunque sembrare genuino.

Rispetta i limiti e allontanati

Quando ricevi un 429 o un captcha, rallenta invece di spingere di più — vedi la nota sulla gestione del 429. L'aggressività brucia gli IP e fa segnalare più rapidamente l'intero pool.

Proxy rotanti in Python

Un modello di rotazione minimo: cicla un pool di proxy e regola le richieste. Compila la tua lista di proxy.

python
import itertools, random, time, requests

# HOST:PORT per entry — e.g. authenticated s4m proxies or entries
# validated from the free list.
POOL = [
    "USER:PASS@proxy.s4m.online:1080",
    # add more endpoints here
]
cycle = itertools.cycle(POOL)

def fetch(url):
    proxy = next(cycle)
    proxies = {"http": f"socks5h://{proxy}", "https": f"socks5h://{proxy}"}
    headers = {"User-Agent": "Mozilla/5.0 (compatible; price-monitor/1.0)"}
    r = requests.get(url, proxies=proxies, headers=headers, timeout=15)
    time.sleep(random.uniform(1.5, 4.0))  # pace + jitter, stay polite
    return r

# for url in product_urls:
#     resp = fetch(url)
#     if resp.status_code == 429:  # slow down, do not push harder
#         time.sleep(30)

I limiti onesti — e dove si inserisce s4m

Cosa possono e non possono fare qui i proxy dei datacenter.

We will be straight about this. s4m sells authenticated datacenter SOCKS5 and HTTP proxies — fast, stable and metered pay-as-you-go. They are excellent for many collection jobs, hiding your origin IP, and distributing load across addresses. But marketplaces actively flag datacenter ranges, so on the most aggressively defended pages you may need residential-type IPs that look like ordinary home connections. s4m does not sell residential proxies and will not pretend to. What we do offer is the free public proxy list — third-party proxies, some residential-type, harvested from open sources and continuously validated — which you can filter by country and protocol to test whether a given target lets them through. Treat those as use-at-your-own-risk, never for sensitive data.

Due punti onesti in più. Primo, i proxy risolvono solo il livello IP; hai ancora bisogno di richieste realistiche per superare il fingerprinting e i controlli comportamentali. Secondo, lo scraping si trova in un'area grigia legale e di termini di servizio: i termini dei marketplace spesso limitano la raccolta automatizzata, e sei responsabile del rispetto delle regole della piattaforma e della legge applicabile. Raccogli responsabilmente — dati pubblici, tariffe ragionevoli, nessun uso improprio dei dati personali. Per un'identità stabile sui punti finali dove gli IP di datacenter funzionano, aggiungi un IP personale dedicato.

FAQ

Domande, risposte

I proxy dei data center funzioneranno per lo scraping di Wildberries, Ozon o Avito?

Per molti endpoint, sì — i proxy dei datacenter sono veloci e ti permettono di distribuire il carico e nascondere il tuo IP di origine. Ma questi marketplace segnalano gli intervalli dei datacenter, quindi su pagine difese in modo aggressivo potresti incontrare captcha o blocchi e aver bisogno di IP di tipo residenziale. Testa i tuoi obiettivi specifici prima di scalare e dosare le tue richieste.

Ho bisogno di proxy da una regione specifica?

Se stai catturando prezzi, stock o termini di consegna specifici per regione, allora sì — il tuo IP di uscita deve essere plausibile per la regione i cui prezzi vuoi registrare, perché queste piattaforme localizzano ciò che mostrano. Per una struttura di elenco generale che non varia per regione, qualsiasi uscita funzionante va bene.

S4m vende proxy residenziali per i marketplace?

No. s4m vende proxy di datacenter autenticati e pubblica una lista di proxy pubblici gratuita e continuamente validata che include IP di tipo residenziale di terze parti per test. Se un obiettivo accetta solo IP residenziali, utilizza la lista gratuita per verificare la fattibilità e tratta quei proxy come utilizzo a tuo rischio.

È legale fare scraping nei marketplace?

Dipende dalla giurisdizione e dai termini di servizio della piattaforma, che spesso limitano la raccolta automatizzata. Lo scraping di dati visibili pubblicamente è trattato diversamente dal bypassare i controlli di accesso o dall'abuso di dati personali. Sei responsabile del rispetto delle regole della piattaforma e della tua legge locale — un proxy non cambia questo.

Raccogli dati di mercato in modo onesto

Colleziona prezzi e liste di routing attraverso proxy di datacenter autenticati, aggiungi un IP dedicato per un'identità stabile, o testa prima la fattibilità sulla lista gratuita. Veloce, misurato, senza log — con comunicazioni chiare su dove è necessario il residenziale.

Le persone hanno trovato questa pagina cercando

Frasi di ricerca reali a cui questa pagina risponde — i collegamenti aprono la pagina che le tratta in dettaglio.