Scraping di Amazon: Proxy, Intestazioni e Limiti di Velocità
Amazon è uno dei siti più scrutati del web e uno dei più difensivi. Raccogliere prezzi, recensioni o dati di catalogo su larga scala significa distribuire richieste, inviare intestazioni realistiche e gestire i CAPTCHA e le pagine bot che Amazon restituisce. Ecco una guida pratica e onesta.
Come Amazon combatte gli scraper
Amazon difende il suo catalogo con rilevamenti stratificati: limiti di velocità per IP, la pagina CAPTCHA "Controllo Robot" / "Inserisci i caratteri che vedi", pagine di errore dog, TLS e fingerprinting dell'intestazione, e controlli comportamentali. Colpisci le pagine prodotto da un indirizzo e vedrai rapidamente CAPTCHA, poi limitazioni o blocchi. Il sito varia anche le pagine per regione e testa layout A/B, quindi il tuo parser deve tollerare i cambiamenti.
Due avvertenze oneste prima di iniziare. I termini di Amazon vietano lo scraping, e Amazon offre percorsi ufficiali — l'API di Pubblicità dei Prodotti e l'API del Partner di Vendita — per l'accesso ai dati approvato; valuta prima questi. E nessun setup scrapes Amazon in modo affidabile per sempre; l'obiettivo è un tasso di raccolta sostenibile, non invisibilità. Per i casi d'uso comuni dell'e-commerce — monitoraggio dei prezzi, ricerca competitiva — vedi le nostre pagine di monitoraggio dei prezzi e proxy Amazon.
Un setup di scraping sostenibile
L'approccio vincente imita molti acquirenti ordinari:
- Ruota un pool di proxy in modo che nessun singolo IP superi la tolleranza di Amazon. Questa è la principale difesa contro il throttling per IP.
- Invia intestazioni complete e realistiche — User-Agent, Accept, Accept-Language, e mantienile coerenti internamente. Un'intestazione predefinita di richieste è un segnale immediato.
- Pacing con jitter — ritardi randomizzati superano gli intervalli fissi. Preferisci un flusso costante rispetto a esplosioni.
- Fissa una regione — usa un paese di uscita e un corrispondente Accept-Language e codice postale in modo che i prezzi e la disponibilità siano coerenti; cambiare regione a metà corsa scombina i tuoi dati.
- Rileva la pagina del bot — controlla i marcatori CAPTCHA / Robot Check e allontanati da quell'IP piuttosto che analizzare spazzatura.
- Usa un browser headless solo quando necessario — gran parte di una pagina prodotto è nell'HTML iniziale; riserva strumenti più pesanti per le sezioni renderizzate in JS.
Amazon valuta gli IP dei datacenter, quindi lo scraping aggressivo è un caso in cui i proxy residenziali spesso sopravvivono più a lungo. s4m vende proxy di datacenter; un IP dedicato ti offre una regione stabile per la raccolta di prezzi coerenti a volumi modesti, ma sii realistico riguardo alla rilevazione dei datacenter ad alto volume.
Recupera una pagina prodotto tramite un proxy
Percorri attraverso un proxy s4m con un set completo di intestazioni e rileva la pagina bot di Amazon in modo da poter ruotare invece di analizzare un errore.
import requests
proxies = {
"http": "http://USER:PASS@proxy.s4m.online:3128",
"https": "http://USER:PASS@proxy.s4m.online:3128",
}
headers = {
"User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
"AppleWebKit/537.36 (KHTML, like Gecko) "
"Chrome/122.0 Safari/537.36",
"Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
"Accept-Language": "en-US,en;q=0.9",
}
r = requests.get("https://www.amazon.com/dp/B0EXAMPLE",
headers=headers, proxies=proxies, timeout=20)
if "api-services-support@amazon.com" in r.text or "Robot Check" in r.text:
raise RuntimeError("Hit Amazon bot page - rotate IP and back off")
parse_product(r.text) # your parserDomande, risposte
È consentito fare scraping su Amazon?
Le Condizioni d'uso di Amazon vietano lo scraping e ci possono essere rischi legali a seconda della giurisdizione e dei dati. Amazon fornisce API ufficiali (Product Advertising API, Selling Partner API) per accesso approvato. Considera prima quelle e ottieni consulenza legale per qualsiasi cosa su larga scala.
Perché i miei prezzi su Amazon continuano a cambiare tra le richieste?
Amazon localizza i prezzi e la disponibilità per regione e esegue test A/B. Se il tuo pool di proxy esce da paesi diversi, raccoglierai dati incoerenti. Fissa una regione di uscita e un corrispondente Accept-Language e codice postale, e un IP dedicato aiuta a mantenerlo stabile.
I proxy di data center funzionano per Amazon?
Per una raccolta modesta e ben ritmata, spesso sì. Amazon assegna intervalli di datacenter, quindi a volume elevato vedrai più CAPTCHAs rispetto agli IP residenziali. s4m vende proxy di datacenter; rotazione, ritmo e intestazioni realistiche contano tanto quanto il tipo di IP, ma nessuna configurazione è a prova di blocco.
Raccogli dati e-commerce in modo pulito
Instrada il scraping di prodotti e prezzi attraverso proxy datacenter s4m autenticati, fissa una regione con un IP dedicato e pianifica i tuoi lavori. Pagamento a consumo, account anonimi, crypto accettata.
Le persone hanno trovato questa pagina cercando
- scraping di Amazon
- scraping di Amazon per android
- come testare le perdite DNS
- come configurare scraping di Amazon
- come controllare scraping di Amazon
- indirizzo ip
- proxy dei datacenter vs residenziali vs mobili
- migliore vpn kill switch 2026
- quanto tempo vivono i proxy gratuiti
- lista di proxy gratuiti
Frasi di ricerca reali a cui questa pagina risponde — i collegamenti aprono la pagina che le tratta in dettaglio.