Web-Scraping · 1 Min Lesezeit

Scraping von Amazon: Proxys, Header und Ratenlimits

Amazon ist eine der am häufigsten gescrapten Seiten im Web und eine der defensivsten. Preise, Bewertungen oder Katalogdaten in großem Maßstab zu sammeln, bedeutet, Anfragen zu verteilen, realistische Header zu senden und die CAPTCHAs und Bot-Seiten zu bewältigen, die Amazon zurückwirft. Hier ist ein praktischer, ehrlicher Leitfaden.

Wie Amazon gegen Scraper kämpft

Amazon verteidigt sein Katalog mit mehrschichtiger Erkennung: pro-IP-Datenratenbegrenzungen, die "Robot Check" / "Geben Sie die Zeichen ein, die Sie sehen" CAPTCHA-Seite, Fehlerseiten, TLS- und Header-Fingerprinting sowie Verhaltensprüfungen. Wenn Sie Produktseiten von einer Adresse aus überlasten, werden Sie schnell CAPTCHAs sehen, gefolgt von Drosselung oder Sperren. Die Seite variiert auch Seiten nach Region und testet Layouts A/B, sodass Ihr Parser Änderungen tolerieren muss.

Zwei ehrliche Vorbehalte, bevor Sie beginnen. Die Bedingungen von Amazon verbieten das Scraping, und Amazon bietet offizielle Wege — die Product Advertising API und die Selling Partner API — für genehmigten Datenzugang; wägen Sie diese zuerst ab. Und kein Setup scrapes Amazon zuverlässig für immer; das Ziel ist eine nachhaltige Erfassungsrate, nicht Unsichtbarkeit. Für die gängigen E-Commerce-Anwendungsfälle — Preisüberwachung, Wettbewerbsforschung — siehe unsere Preisüberwachungs und Amazon-Proxy Seiten.

Ein nachhaltiges Scraping-Setup

Der gewinnende Ansatz ahmt viele gewöhnliche Käufer nach:

  • Drehen Sie einen Proxy-Pool, damit keine einzelne IP die Toleranz von Amazon überschreitet. Dies ist die primäre Verteidigung gegen pro-IP-Drosselung.
  • Senden Sie vollständige, realistische Header — User-Agent, Accept, Accept-Language, und halten Sie sie intern konsistent. Ein nackter Standard-Header für Anfragen ist ein sofortiger Hinweis.
  • Pacing mit Jitter — randomisierte Verzögerungen schlagen feste Intervalle. Bevorzugen Sie einen stetigen Fluss über Ausbrüche.
  • Einen Bereich festlegen — verwenden Sie ein Ausfuhrland und passende Accept-Language und Postleitzahl, damit Preise und Verfügbarkeit konsistent sind; das Wechseln der Regionen während des Laufs verwirrt Ihre Daten.
  • Erkennen Sie die Bot-Seite — überprüfen Sie die CAPTCHA / Robot Check-Marker und ziehen Sie sich von dieser IP zurück, anstatt Müll zu parsen.
  • Verwenden Sie einen headless Browser nur bei Bedarf — ein Großteil einer Produktseite befindet sich im ursprünglichen HTML; reservieren Sie schwerere Werkzeuge für JS-gerenderte Abschnitte.

Amazon bewertet Rechenzentrums-IPs, daher ist aggressives Scraping ein Fall, in dem Wohnproxies oft länger überleben. s4m verkauft Rechenzentrums-Proxys; eine dedizierte IP gibt Ihnen eine stabile Region für eine preislich konsistente Sammlung bei moderaten Volumina, aber seien Sie realistisch hinsichtlich der Erkennung von Rechenzentren bei hohem Volumen.

Eine Produktseite über einen Proxy abrufen

Leiten Sie über einen s4m-Proxy mit einem vollständigen Header-Set und erkennen Sie die Bot-Seite von Amazon, damit Sie rotieren können, anstatt einen Fehler zu parsen.

python
import requests

proxies = {
    "http":  "http://USER:PASS@proxy.s4m.online:3128",
    "https": "http://USER:PASS@proxy.s4m.online:3128",
}
headers = {
    "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
                  "AppleWebKit/537.36 (KHTML, like Gecko) "
                  "Chrome/122.0 Safari/537.36",
    "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
    "Accept-Language": "en-US,en;q=0.9",
}

r = requests.get("https://www.amazon.com/dp/B0EXAMPLE",
                 headers=headers, proxies=proxies, timeout=20)

if "api-services-support@amazon.com" in r.text or "Robot Check" in r.text:
    raise RuntimeError("Hit Amazon bot page - rotate IP and back off")

parse_product(r.text)   # your parser
Share this page
FAQ

Fragen, beantwortet

Ist das Scraping von Amazon erlaubt?

Die Nutzungsbedingungen von Amazon verbieten das Scraping, und es kann je nach Gerichtsbarkeit und Daten rechtliche Risiken geben. Amazon bietet offizielle APIs (Product Advertising API, Selling Partner API) für genehmigten Zugriff an. Ziehen Sie diese zuerst in Betracht und holen Sie sich rechtlichen Rat für alles in großem Maßstab.

Warum ändern sich meine Amazon-Preise zwischen den Anfragen ständig?

Amazon lokalisiert Preise und Verfügbarkeit nach Region und führt A/B-Tests durch. Wenn Ihr Proxy-Pool aus verschiedenen Ländern stammt, sammeln Sie inkonsistente Daten. Wählen Sie eine Ausgangsregion und die passende Accept-Language und Postleitzahl, und eine dedizierte IP hilft, sie stabil zu halten.

Funktionieren Rechenzentrumsproxys für Amazon?

Für bescheidene, gut abgestimmte Sammlungen oft ja. Amazon bewertet Rechenzentrumsbereiche, sodass Sie bei hohem Volumen mehr CAPTCHAs sehen werden als mit Wohn-IP-Adressen. s4m verkauft Rechenzentrumsproxys; Rotation, Tempo und realistische Header sind ebenso wichtig wie der IP-Typ, aber keine Einrichtung ist block-sicher.

E-Commerce-Daten sauber scrapen

Leiten Sie Produkt- und Preis-Scraping über authentifizierte s4m-Datacenter-Proxys, pinnen Sie eine Region mit einer dedizierten IP und takten Sie Ihre Jobs. Abgerechnet nach Verbrauch, anonyme Konten, Krypto akzeptiert.

Menschen fanden diese Seite durch die Suche nach

Echte Suchphrasen, auf die diese Seite antwortet — die verlinkten öffnen die Seite, die sie ausführlich behandelt.