Web scraping · 1 min czytania

Zbieranie danych z Amazonu: Proxy, nagłówki i limity prędkości

Amazon jest jedną z najczęściej skanowanych stron w sieci i jedną z najbardziej defensywnych. Zbieranie cen, recenzji lub danych katalogowych na dużą skalę oznacza rozdzielanie żądań, wysyłanie realistycznych nagłówków i radzenie sobie z CAPTCHA i stronami botów, które Amazon zwraca. Oto praktyczny, szczery przewodnik.

Jak Amazon walczy z zbieraczami danych

Amazon broni swojego katalogu za pomocą warstwowego wykrywania: ograniczenia prędkości per-IP, strona CAPTCHA "Robot Check" / "Wprowadź widoczne znaki", strony błędów psa, TLS i odcisków nagłówków oraz kontrole behawioralne. Uderz w strony produktów z jednego adresu, a szybko zobaczysz CAPTCHA, a potem ograniczenia lub blokady. Strona również zmienia strony w zależności od regionu i testuje układy A/B, więc twój parser musi tolerować zmiany.

Dwa uczciwe zastrzeżenia przed rozpoczęciem. Warunki Amazonu zabraniają skrobania, a Amazon oferuje oficjalne drogi — Product Advertising API i Selling Partner API — do zatwierdzonego dostępu do danych; rozważ je najpierw. I żadne ustawienie nie skrobie Amazonu niezawodnie na zawsze; celem jest zrównoważona stawka zbierania, a nie niewidzialność. Dla typowych przypadków użycia w e-commerce — monitorowanie cen, badania konkurencji — zobacz nasze strony monitorowanie cen i proxy Amazonu.

Zrównoważona konfiguracja do scrapingu

Zwycięskie podejście naśladuje wielu zwykłych kupujących:

  • Rotuj pulę proxy, aby żaden pojedynczy adres IP nie przekraczał tolerancji Amazonu. To jest główna obrona przed ograniczaniem na poziomie IP.
  • Wyślij pełne, realistyczne nagłówki — User-Agent, Accept, Accept-Language, i utrzymuj je wewnętrznie spójne. Nagłówek domyślny dla prostych żądań to natychmiastowy wskaźnik.
  • Utrzymuj tempo z jitterem — losowe opóźnienia są lepsze niż stałe interwały. Preferuj stały strumień zamiast wybuchów.
  • Przypnij region — użyj jednego kraju wyjścia i odpowiadającego Accept-Language oraz kodu pocztowego, aby ceny i dostępność były spójne; zmiana regionów w trakcie działania zakłóca twoje dane.
  • Wykryj stronę bota — sprawdź oznaczenia CAPTCHA / Robot Check i wycofaj ten adres IP zamiast analizować śmieci.
  • Używaj przeglądarki bez interfejsu tylko wtedy, gdy to konieczne — wiele z treści strony produktu znajduje się w początkowym HTML; zarezerwuj cięższe narzędzia dla sekcji renderowanych przez JS.

Amazon ocenia adresy IP z centrów danych, więc agresywne skanowanie to przypadek, w którym proxy mieszkalne często przetrwają dłużej. s4m sprzedaje proxy z centrów danych; dedykowany IP daje ci stabilny region do zbierania danych o cenach w umiarkowanych ilościach, ale bądź realistyczny w kwestii wykrywania centrów danych przy dużych wolumenach.

Pobierz stronę produktu przez proxy

Przekieruj przez proxy s4m z pełnym zestawem nagłówków i wykryj stronę bota Amazona, aby móc rotować zamiast analizować błąd.

python
import requests

proxies = {
    "http":  "http://USER:PASS@proxy.s4m.online:3128",
    "https": "http://USER:PASS@proxy.s4m.online:3128",
}
headers = {
    "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
                  "AppleWebKit/537.36 (KHTML, like Gecko) "
                  "Chrome/122.0 Safari/537.36",
    "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
    "Accept-Language": "en-US,en;q=0.9",
}

r = requests.get("https://www.amazon.com/dp/B0EXAMPLE",
                 headers=headers, proxies=proxies, timeout=20)

if "api-services-support@amazon.com" in r.text or "Robot Check" in r.text:
    raise RuntimeError("Hit Amazon bot page - rotate IP and back off")

parse_product(r.text)   # your parser
Share this page
FAQ

Pytania, odpowiedzi

Czy skrobanie Amazon jest dozwolone?

Warunki korzystania z Amazonu zabraniają skrobania, a w zależności od jurysdykcji i danych mogą wystąpić ryzyka prawne. Amazon udostępnia oficjalne API (Product Advertising API, Selling Partner API) do zatwierdzonego dostępu. Rozważ te opcje najpierw i uzyskaj porady prawne w przypadku działań na dużą skalę.

Dlaczego moje ceny na Amazonie ciągle się zmieniają między zapytaniami?

Amazon lokalizuje ceny i dostępność według regionu i przeprowadza testy A/B. Jeśli twoja pula proxy wychodzi z różnych krajów, zbierzesz niespójne dane. Ustal jeden region wyjścia oraz odpowiadający mu Accept-Language i kod pocztowy, a dedykowany IP pomoże utrzymać stabilność.

Czy proxy z centrum danych działają dla Amazona?

Dla skromnej, dobrze zorganizowanej zbiórki, często tak. Amazon przydziela zakresy adresów IP z centrów danych, więc przy dużym wolumenie zobaczysz więcej CAPTCHA niż przy adresach IP z mieszkań. s4m sprzedaje proksy z centrów danych; rotacja, tempo i realistyczne nagłówki mają znaczenie tak samo jak typ IP, ale żaden setup nie jest odporny na blokady.

Czyste zbieranie danych e-commerce

Przekieruj zbieranie danych o produktach i cenach przez uwierzytelnione proxy s4m w centrum danych, przypnij region z dedykowanym adresem IP i dostosuj tempo swoich zadań. Płatność metrowa, anonimowe konta, akceptowane kryptowaluty.

Ludzie znaleźli tę stronę, szukając

Rzeczywiste frazy wyszukiwania, na które ta strona odpowiada — powiązane otwierają stronę, która je szczegółowo omawia.