वेब स्क्रैपिंग · 2 मिनट पढ़ें

अमेज़न को स्क्रैप करना: प्रॉक्सी, हेडर और दर सीमाएँ

Amazon वेब पर सबसे अधिक स्क्रैप की गई साइटों में से एक है और सबसे अधिक रक्षात्मक भी। बड़े पैमाने पर कीमतें, समीक्षाएँ या कैटलॉग डेटा एकत्र करना अनुरोधों को वितरित करने, यथार्थवादी हेडर भेजने, और CAPTCHAs और बॉट पृष्ठों को संभालने का मतलब है जो Amazon वापस फेंकता है। यहाँ एक व्यावहारिक, ईमानदार वॉकथ्रू है।

अमेज़न स्क्रैपर्स से कैसे लड़ता है

Amazon अपने कैटलॉग की रक्षा परतदार पहचान के साथ करता है: प्रति-IP दर-सीमाएँ, "Robot Check" / "आप जो अक्षर देखते हैं उन्हें दर्ज करें" CAPTCHA पृष्ठ, कुत्ते की त्रुटि पृष्ठ, TLS और हेडर फिंगरप्रिंटिंग, और व्यवहार संबंधी जांच। एक पते से उत्पाद पृष्ठों पर हमला करें और आप जल्दी ही CAPTCHA देखेंगे, फिर थ्रॉटलिंग या ब्लॉक्स। साइट क्षेत्र के अनुसार पृष्ठों को भी बदलती है और A/B परीक्षण लेआउट करती है, इसलिए आपका पार्सर परिवर्तन को सहन करना चाहिए।

शुरू करने से पहले दो ईमानदार चेतावनियाँ। Amazon की शर्तें स्क्रैपिंग की अनुमति नहीं देती हैं, और Amazon आधिकारिक मार्ग प्रदान करता है — उत्पाद विज्ञापन API और बिक्री भागीदार API — अनुमोदित डेटा पहुंच के लिए; पहले उन पर विचार करें। और कोई सेटअप Amazon को हमेशा विश्वसनीयता से स्क्रैप नहीं करता; लक्ष्य एक स्थायी संग्रह दर है, न कि अदृश्यता। सामान्य ई-कॉमर्स उपयोग के मामलों के लिए — मूल्य निगरानी, प्रतिस्पर्धात्मक अनुसंधान — हमारे मूल्य निगरानी और Amazon प्रॉक्सी पृष्ठ देखें।

एक स्थायी स्क्रैपिंग सेटअप

जीतने वाला दृष्टिकोण कई सामान्य खरीदारों की नकल करता है:

  • प्रॉक्सी पूल को घुमाएँ ताकि कोई एकल IP अमेज़न की सहिष्णुता से अधिक न हो। यह प्रति-IP थ्रॉटलिंग के खिलाफ प्राथमिक रक्षा है।
  • पूर्ण, वास्तविक हेडर भेजें — यूज़र-एजेंट, स्वीकार करें, स्वीकार-भाषा, और इन्हें आंतरिक रूप से सुसंगत रखें। एक नग्न अनुरोध डिफ़ॉल्ट हेडर तुरंत पहचानने योग्य है।
  • जिटर के साथ गति बनाए रखें — यादृच्छिक विलंब निश्चित अंतरालों को मात देते हैं। फटने के बजाय एक स्थिर धारा को प्राथमिकता दें।
  • एक क्षेत्र को पिन करें — एक निकासी देश और मेल खाते हुए स्वीकार-भाषा और पोस्टकोड का उपयोग करें ताकि कीमतें और उपलब्धता सुसंगत रहें; रन के मध्य में क्षेत्रों को स्विच करना आपके डेटा को उलझा देता है।
  • बॉट पृष्ठ का पता लगाएँ — CAPTCHA / रोबोट चेक मार्करों के लिए जाँच करें और उस IP से पीछे हटें बजाय कि बेकार डेटा को पार्स करें।
  • केवल आवश्यकता होने पर हेडलेस ब्राउज़र का उपयोग करें — उत्पाद पृष्ठ का अधिकांश भाग प्रारंभिक HTML में होता है; JS-रेंडर किए गए अनुभागों के लिए भारी उपकरणों को आरक्षित करें।

अमेज़न डेटा सेंटर IP को स्कोर करता है, इसलिए आक्रामक स्क्रैपिंग एक ऐसा मामला है जहाँ आवासीय प्रॉक्सी अक्सर लंबे समय तक जीवित रहते हैं। s4m बेचता है डेटा सेंटर प्रॉक्सी; एक समर्पित IP आपको कीमत-सुसंगत संग्रह के लिए एक स्थिर क्षेत्र देता है, लेकिन उच्च मात्रा में डेटा सेंटर पहचान के बारे में यथार्थवादी रहें।

एक प्रॉक्सी के माध्यम से एक उत्पाद पृष्ठ लाएँ

s4m प्रॉक्सी के माध्यम से एक पूर्ण हेडर सेट के साथ रूट करें, और अमेज़न के बॉट पृष्ठ का पता लगाएं ताकि आप त्रुटि को पार्स करने के बजाय घुमा सकें।

python
import requests

proxies = {
    "http":  "http://USER:PASS@proxy.s4m.online:3128",
    "https": "http://USER:PASS@proxy.s4m.online:3128",
}
headers = {
    "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
                  "AppleWebKit/537.36 (KHTML, like Gecko) "
                  "Chrome/122.0 Safari/537.36",
    "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
    "Accept-Language": "en-US,en;q=0.9",
}

r = requests.get("https://www.amazon.com/dp/B0EXAMPLE",
                 headers=headers, proxies=proxies, timeout=20)

if "api-services-support@amazon.com" in r.text or "Robot Check" in r.text:
    raise RuntimeError("Hit Amazon bot page - rotate IP and back off")

parse_product(r.text)   # your parser
Share this page
FAQ

प्रश्न, उत्तरित

क्या Amazon से स्क्रैपिंग की अनुमति है?

अमेज़न की उपयोग की शर्तें स्क्रैपिंग को प्रतिबंधित करती हैं, और क्षेत्राधिकार और डेटा के आधार पर कानूनी जोखिम हो सकता है। अमेज़न अनुमोदित पहुंच के लिए आधिकारिक APIs (उत्पाद विज्ञापन API, बिक्री भागीदार API) प्रदान करता है। पहले उन पर विचार करें और बड़े पैमाने पर किसी भी चीज़ के लिए कानूनी सलाह प्राप्त करें।

मेरे Amazon के मूल्य अनुरोधों के बीच क्यों बदलते रहते हैं?

Amazon क्षेत्र के अनुसार कीमतों और उपलब्धता को स्थानीयकृत करता है और A/B परीक्षण करता है। यदि आपका प्रॉक्सी पूल विभिन्न देशों से निकलता है, तो आप असंगत डेटा एकत्र करेंगे। एक निकासी क्षेत्र और मेल खाते Accept-Language और पोस्टकोड को पिन करें, और एक समर्पित IP इसे स्थिर रखने में मदद करता है।

क्या डेटा सेंटर प्रॉक्स Amazon के लिए काम करते हैं?

मध्यम, अच्छी गति से संग्रह के लिए, अक्सर हाँ। अमेज़न डेटा सेंटर रेंज को स्कोर करता है, इसलिए उच्च मात्रा में आप आवासीय IPs की तुलना में अधिक CAPTCHAs देखेंगे। s4m डेटा सेंटर प्रॉक्सी बेचता है; रोटेशन, गति और यथार्थवादी हेडर IP प्रकार के रूप में महत्वपूर्ण हैं, लेकिन कोई सेटअप ब्लॉक-प्रूफ नहीं है।

ई-कॉमर्स डेटा को साफ़ तरीके से स्क्रैप करें

प्रमाणित s4m डेटा सेंटर प्रॉक्सियों के माध्यम से उत्पाद और मूल्य स्क्रैपिंग को रूट करें, एक समर्पित IP के साथ एक क्षेत्र को पिन करें, और अपने कार्यों की गति को नियंत्रित करें। मीटर किए गए पे-एज़-यू-गो, गुमनाम खाते, क्रिप्टो स्वीकार किया जाता है।

लोगों ने इस पृष्ठ को खोजकर पाया

वास्तविक खोज वाक्यांश जिनका यह पृष्ठ उत्तर देता है — लिंक किए गए वाक्यांश उस पृष्ठ को खोलते हैं जो उन्हें गहराई से कवर करता है।