वेब स्क्रैपिंग · 2 मिनट पढ़ें

गूगल सर्च परिणामों को स्क्रैप करना बिना ब्लॉक हुए

Google आक्रामक रूप से स्वचालित खोज अनुरोधों की दर को सीमित करता है, इसलिए बड़े पैमाने पर SERP को स्क्रैप करना ज्यादातर ट्रैफ़िक को वितरित करने और ब्राउज़र की तरह व्यवहार करने का खेल है। यह गाइड व्यावहारिक रणनीतियों को कवर करती है - प्रॉक्सी रोटेशन, अनुरोध की गति, हेडर और पार्सिंग - सीमाओं और नियमों पर ईमानदार नोट्स के साथ।

गूगल स्क्रैपर्स को क्यों ब्लॉक करता है

गूगल के खोज परिणाम पृष्ठ वेब पर सबसे अधिक सुरक्षित एंडपॉइंट्स में से एक है। एक आईपी से बहुत अधिक स्वचालित अनुरोध भेजें और आप जल्दी ही एक CAPTCHA ("असामान्य ट्रैफ़िक" इंटरस्टिशियल) पर पहुँचेंगे, फिर कठिन ब्लॉक्स। पहचान कुंजी आईपी प्रति मात्रा, बहुत नियमित अनुरोध समय, गायब या रोबोटिक हेडर, और सामान्य ब्राउज़र व्यवहार की अनुपस्थिति पर आधारित होती हैं।

दो तथ्य अपेक्षाएँ निर्धारित करते हैं। पहले, गूगल के परिणामों को स्क्रैप करना इसके सेवा की शर्तें के खिलाफ है, और गूगल प्रोग्रामेटिक एक्सेस के लिए आधिकारिक एपीआई (कस्टम सर्च JSON एपीआई, और भुगतान विकल्प) प्रदान करता है - स्क्रैपिंग से पहले उन्हें तौलें। दूसरे, कोई तकनीक स्वचालित SERP संग्रह को हमेशा के लिए विश्वसनीय नहीं बनाती; सुरक्षा उपाय बदलते हैं, और कोई भी जो अदृश्य गूगल स्क्रैपिंग का वादा करता है, वह अधिक बेच रहा है। अच्छा उपकरण यह करता है कि ब्लॉक दर को पर्याप्त रूप से कम करता है ताकि डेटा को एक स्थायी गति पर एकत्र किया जा सके।

वास्तव में मदद करने वाली रणनीतियाँ

मुख्य विचार यह है कि एक थकावट रहित बॉट के बजाय कई सामान्य उपयोगकर्ताओं की तरह दिखना है:

  • IP बदलें — अनुरोधों को एक पूल में फैलाएं ताकि कोई एकल पता Google के प्रति-IP सहिष्णुता से अधिक न हो। यह सबसे बड़ा लीवर है। हमारे बदलते बनाम स्थिर सत्रों गाइड को देखें।
  • गति और यादृच्छिकता — अनुरोधों के बीच जिटर जोड़ें बजाय एक निश्चित अंतराल के; नियमित समय एक संकेत है। धीमा होना तेज और प्रतिबंधित होने से अधिक टिकाऊ है।
  • वास्तविक हेडर भेजें — एक वास्तविक User-Agent, Accept-Language और वह हेडर जो एक ब्राउज़र भेजता है। उन्हें समझदारी से घुमाएं बजाय एक स्थिर सेट का पुन: उपयोग करने के।
  • CAPTCHA को एक संकेत के रूप में संभालें — जब आप एक पर पहुंचते हैं, तो उस IP से पीछे हटें बजाय इसे तोड़ने के।
  • JS-भारी परिणाम प्रकारों के लिए एक हेडलेस ब्राउज़र को प्राथमिकता दें — कुछ SERP सुविधाएँ क्लाइंट-साइड पर रेंडर होती हैं।

IP प्रतिष्ठा महत्वपूर्ण है: Google डेटा केंद्र रेंज को स्कोर करता है, इसलिए भारी SERP स्क्रैपिंग एक सामान्य मामला है जहां आवासीय IP डेटा केंद्र से बेहतर प्रदर्शन करते हैं। s4m बेचता है डेटा केंद्र प्रॉक्सी, जो हल्की या अच्छी गति वाली संग्रहण के लिए उपयुक्त हैं; उच्च मात्रा वाले SERP कार्य के लिए अपने आप से ईमानदार रहें कि क्या डेटा केंद्र बनाए रखेगा।

Python में एक गति-नियंत्रित, प्रॉक्सी अनुरोध

एक न्यूनतम उदाहरण: एक s4m प्रॉक्सी के माध्यम से रूट करें, एक यथार्थवादी हेडर भेजें, और अनुरोधों की गति को नियंत्रित करें। उत्पादन में एक पूल के बीच प्रॉक्सी और यूजर-एजेंट को घुमाएं।

python
import time, random, requests

proxies = {
    "http":  "http://USER:PASS@proxy.s4m.online:3128",
    "https": "http://USER:PASS@proxy.s4m.online:3128",
}
headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) "
                  "AppleWebKit/537.36 (KHTML, like Gecko) "
                  "Chrome/122.0 Safari/537.36",
    "Accept-Language": "en-US,en;q=0.9",
}

for query in queries:
    r = requests.get("https://www.google.com/search",
                     params={"q": query, "num": 10},
                     headers=headers, proxies=proxies, timeout=20)
    if r.status_code == 429 or "unusual traffic" in r.text:
        # Back off this IP; rotate to the next proxy in your pool.
        time.sleep(60)
        continue
    parse_results(r.text)          # your parser (e.g. selectolax/bs4)
    time.sleep(random.uniform(3, 8))  # jitter, don't hammer
Share this page
FAQ

प्रश्न, उत्तरित

क्या Google को स्क्रैप करना कानूनी है?

सार्वजनिक खोज परिणामों को स्क्रैप करना एक विवादित क्षेत्र में है: यह Google की सेवा की शर्तों का उल्लंघन करता है, और क्षेत्राधिकार और आप जो डेटा एकत्र करते हैं उसके आधार पर कानूनी जोखिम हो सकता है। Google प्रोग्रामेटिक एक्सेस के लिए आधिकारिक APIs भी प्रदान करता है। पहले उन पर विचार करें, और बड़े पैमाने पर किसी भी चीज़ के लिए अपना कानूनी सलाह लें।

क्या मुझे Google को स्क्रैप करने के लिए आवासीय प्रॉक्सी की आवश्यकता है?

उच्च मात्रा के लिए, अक्सर हाँ — Google डेटा केंद्र रेंज को स्कोर करता है, इसलिए वे पहले कैप्चा पर पहुँचते हैं। डेटा सेंटर प्रॉक्सियाँ (जो s4m बेचता है) हल्की, अच्छी तरह से गति वाली संग्रहण के लिए काम कर सकती हैं। घूर्णन और गति IP प्रकार के रूप में महत्वपूर्ण हैं; कोई प्रॉक्सी SERP स्क्रैपिंग को ब्लॉक-प्रूफ नहीं बनाती।

'असामान्य ट्रैफ़िक' CAPTCHA से कैसे बचें?

इसे एक दर संकेत के रूप में मानें: IP को घुमाएँ, अनुरोधों के बीच यादृच्छिक देरी जोड़ें, वास्तविक ब्राउज़र हेडर भेजें, और किसी भी IP से पीछे हटें जो चुनौती दी जाती है बजाय तुरंत पुनः प्रयास करने के। आप CAPTCHAs की दर को कम करते हैं; आप उन्हें पूरी तरह से बड़े पैमाने पर समाप्त नहीं कर सकते।

अपने स्क्रैपिंग ट्रैफ़िक को वितरित करें

प्रमाणित s4m डेटा सेंटर प्रॉक्स के माध्यम से अनुरोधों को रूट करें, एक पूल को घुमाएं, और अपने कार्यों की गति को नियंत्रित करें। परीक्षण के लिए एक मुफ्त निरंतर-चेक की गई प्रॉक्सी सूची के साथ मीटर के अनुसार भुगतान करें। गुमनाम खाते, क्रिप्टो स्वीकार किया जाता है।

लोगों ने इस पृष्ठ को खोजकर पाया

वास्तविक खोज वाक्यांश जिनका यह पृष्ठ उत्तर देता है — लिंक किए गए वाक्यांश उस पृष्ठ को खोलते हैं जो उन्हें गहराई से कवर करता है।