Web scraping · 2 min de lecture

Scraping d'Amazon : Proxys, En-têtes et Limites de Taux

Amazon est l'un des sites les plus scrutés sur le web et l'un des plus défensifs. Collecter des prix, des avis ou des données de catalogue à grande échelle signifie distribuer des demandes, envoyer des en-têtes réalistes et gérer les CAPTCHA et les pages de bots qu'Amazon renvoie. Voici un guide pratique et honnête.

Comment Amazon lutte contre les scrapers

Amazon défend son catalogue avec une détection en couches : des limites de taux par IP, la page CAPTCHA "Vérification Robot" / "Entrez les caractères que vous voyez", des pages d'erreur de chien, le TLS et le fingerprinting des en-têtes, et des vérifications comportementales. Si vous bombardez les pages produits depuis une seule adresse, vous verrez rapidement des CAPTCHAs, puis un ralentissement ou des blocages. Le site varie également les pages par région et teste des mises en page A/B, donc votre analyseur doit tolérer le changement.

Deux mises en garde honnêtes avant de commencer. Les conditions d'Amazon interdisent le scraping, et Amazon propose des voies officielles — l'API de Publicité Produit et l'API de Partenaire de Vente — pour un accès aux données approuvé ; pesez celles-ci en premier. Et aucun scraping de configuration ne permet d'accéder à Amazon de manière fiable pour toujours ; l'objectif est un taux de collecte durable, pas l'invisibilité. Pour les cas d'utilisation e-commerce courants — surveillance des prix, recherche concurrentielle — consultez nos pages surveillance des prix et proxy Amazon.

Une configuration d'extraction durable

L'approche gagnante imite de nombreux acheteurs ordinaires :

  • Faites tourner un pool de proxies afin qu'aucune IP unique ne dépasse la tolérance d'Amazon. C'est la principale défense contre le throttling par IP.
  • Envoyez des en-têtes complets et réalistes — User-Agent, Accept, Accept-Language, et gardez-les cohérents en interne. Un en-tête par défaut de requête est un indicateur instantané.
  • Rythmez avec du jitter — des délais randomisés surpassent les intervalles fixes. Préférez un flux constant plutôt que des pics.
  • Fixez une région — utilisez un pays de sortie et un Accept-Language et un code postal correspondants afin que les prix et la disponibilité soient cohérents ; changer de région en cours de route brouille vos données.
  • Détectez la page du bot — vérifiez les marqueurs CAPTCHA / Robot Check et éloignez-vous de cette IP plutôt que de parser des données inutiles.
  • Utilisez un navigateur sans tête uniquement lorsque c'est nécessaire — une grande partie d'une page produit se trouve dans le HTML initial ; réservez des outils plus lourds pour les sections rendues par JS.

Amazon note les IP des centres de données, donc le scraping agressif est un cas où les proxies résidentiels survivent souvent plus longtemps. s4m vend des proxies de centre de données ; une IP dédiée vous donne une région stable pour une collecte de prix cohérente à des volumes modestes, mais soyez réaliste quant à la détection des centres de données à volume élevé.

Récupérer une page produit via un proxy

Routage via un proxy s4m avec un ensemble d'en-têtes complet, et détectez la page bot d'Amazon afin de pouvoir faire tourner au lieu d'analyser une erreur.

python
import requests

proxies = {
    "http":  "http://USER:PASS@proxy.s4m.online:3128",
    "https": "http://USER:PASS@proxy.s4m.online:3128",
}
headers = {
    "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
                  "AppleWebKit/537.36 (KHTML, like Gecko) "
                  "Chrome/122.0 Safari/537.36",
    "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
    "Accept-Language": "en-US,en;q=0.9",
}

r = requests.get("https://www.amazon.com/dp/B0EXAMPLE",
                 headers=headers, proxies=proxies, timeout=20)

if "api-services-support@amazon.com" in r.text or "Robot Check" in r.text:
    raise RuntimeError("Hit Amazon bot page - rotate IP and back off")

parse_product(r.text)   # your parser
Share this page
FAQ

Questions, réponses

Le scraping d'Amazon est-il autorisé ?

Les conditions d'utilisation d'Amazon interdisent le scraping, et il peut y avoir un risque légal selon la juridiction et les données. Amazon fournit des API officielles (API de publicité produit, API de partenaire de vente) pour un accès approuvé. Considérez-les en premier et obtenez des conseils juridiques pour toute opération à grande échelle.

Pourquoi mes prix Amazon continuent-ils de changer entre les requêtes ?

Amazon localise les prix et la disponibilité par région et effectue des tests A/B. Si votre pool de proxy sort de différents pays, vous collecterez des données incohérentes. Fixez une région de sortie et un Accept-Language et un code postal correspondants, et une IP dédiée aide à maintenir la stabilité.

Les proxies de datacenter fonctionnent-ils pour Amazon ?

Pour une collecte modeste et bien rythmée, souvent oui. Amazon attribue des plages de centres de données, donc à volume élevé, vous verrez plus de CAPTCHAs qu'avec des IP résidentielles. s4m vend des proxys de centres de données ; la rotation, le rythme et des en-têtes réalistes comptent autant que le type d'IP, mais aucune configuration n'est à l'abri des blocages.

Récupérer des données e-commerce proprement

Routez le scraping de produits et de prix via des proxies de datacenter s4m authentifiés, fixez une région avec une IP dédiée, et rythme vos tâches. Paiement à l'utilisation, comptes anonymes, crypto acceptée.

Les gens ont trouvé cette page en recherchant

Vraies phrases de recherche auxquelles cette page répond — les liens ouvrent la page qui les couvre en profondeur.