वेब स्क्रैपिंग · 2 मिनट पढ़ें

वेब स्क्रैपिंग के लिए प्रॉक्सियों का उपयोग कैसे करें

प्रॉक्सियाँ आपके स्क्रैपर के मूल सर्वर को छिपाए रखती हैं और IPs के बीच अनुरोधों को फैलाती हैं ताकि एकल पता दर-सीमित या ब्लॉक न हो। यह गाइड प्रॉक्सियों को चुनने और उन्हें Python, Scrapy, और Playwright में वायरिंग करने को कवर करती है।

आपके स्क्रैपर को प्रॉक्सी की आवश्यकता क्यों है

दो समस्याएँ लगभग हर स्क्रैपिंग सेटअप को चलाती हैं: आपके असली IP की सुरक्षा करना, और प्रति-IP दर सीमाओं के तहत रहना।

जब एक क्रॉलर एक पते से हजारों अनुरोध भेजता है, तो लक्षित साइट एकल IP को बॉट की तरह व्यवहार करते हुए देखती है। सामान्य परिणाम धीमा होना, CAPTCHA दीवार, या पूरी तरह से ब्लॉक होना है - और इससे भी बुरा, ब्लॉक किया गया पता है आपका मूल सर्वर, वह मशीन जो आपके व्यवसाय की लॉजिक चलाती है। एक प्रॉक्सी आपके स्क्रैपर और लक्षित साइट के बीच बैठती है ताकि साइट केवल प्रॉक्सी के निकासी IP को देखे, कभी भी आपके असली को नहीं।

दो चिंताएँ लगभग हर स्क्रैपिंग सेटअप को आकार देती हैं:

  • अपने मूल की सुरक्षा करना। यदि आपके उत्पादन सर्वर का IP ब्लैकलिस्ट हो जाता है, तो नुकसान स्क्रैप से अधिक समय तक रहता है। एक प्रॉक्सी के माध्यम से रूटिंग उस पते को साफ और क्रॉल से अज्ञात रखती है।
  • लोड का वितरण। कई निकासी IPs के बीच अनुरोधों को फैलाने से उनमें से किसी एक को लक्षित साइट के प्रति-IP दर सीमा के तहत रखा जाता है, ताकि आप डेटा एकत्र कर सकें बिना दुरुपयोग की सुरक्षा को ट्रिप किए।

s4m सटीक रूप से इसके लिए प्रमाणित डेटासेंटर SOCKS5 और HTTP प्रॉक्सियों की पेशकश करता है। वे तेज और सस्ते हैं, जो उच्च मात्रा, सहिष्णु लक्ष्यों के लिए उपयुक्त हैं - लेकिन चूंकि वे डेटासेंटर IPs हैं, सख्त साइटें उन्हें आवासीय पते की तुलना में अधिक आसानी से फिंगरप्रिंट कर सकती हैं, इसलिए अपेक्षाएँ उसी के अनुसार सेट करें। त्वरित प्रयोगों के लिए आप मुफ्त सार्वजनिक प्रॉक्सी सूची से फेंकने योग्य एंडपॉइंट्स निकाल सकते हैं, तीसरे पक्ष की प्रॉक्सियाँ जो लगातार मान्य की जाती हैं लेकिन सख्ती से अपने जोखिम पर उपयोग करें। यदि आप एकल क्लाइंट के बजाय एक पूरे ऐप या सर्वर को छिपाना चाहते हैं, तो एक VPN टनल इसके सभी ट्रैफ़िक को कवर करता है। मीटर किए गए प्रॉक्सी दरों के लिए मूल्य निर्धारण देखें।

स्क्रैपिंग के लिए प्रॉक्सी का चयन करना

उपकरण को काम से मिलाएं। यहाँ बताया गया है कि s4m के विकल्प एक स्क्रैपिंग कार्यभार के लिए कैसे तुलना करते हैं।

डेटा सेंटर SOCKS5 / HTTP

proxy.s4m.online पर मीटर किए गए, पे-एज़-यू-गो प्रॉक्सी — SOCKS5 के लिए पोर्ट 1080, HTTP के लिए 3128, USER:PASS के साथ प्रमाणित। लक्ष्यों के बड़े पैमाने पर क्रॉलिंग के लिए तेज और लागत-कुशल जो आक्रामक रूप से आईपी प्रतिष्ठा को स्कोर नहीं करते। यह उत्पादन स्क्रैपिंग के लिए कार्य घोड़ा है।

मुफ्त सार्वजनिक प्रॉक्सी सूची

तीसरे पक्ष के प्रॉक्सी जो खुले स्रोतों से एकत्र किए गए हैं और लगातार पुनः मान्य किए जाते हैं, देश, प्रोटोकॉल और गुमनामी द्वारा फ़िल्टर किए जा सकते हैं। बजट के लिए प्रतिबद्ध होने से पहले स्क्रैपर का प्रोटोटाइप बनाने के लिए आदर्श - लेकिन अविश्वसनीय और अपने जोखिम पर उपयोग करें, कभी भी उत्पादन कार्यों के लिए उपयुक्त नहीं।

समर्पित व्यक्तिगत IP

एक वैकल्पिक स्थिर IP जो केवल आपका है, आपके प्रॉक्सी से बंधा हुआ और वैकल्पिक रूप से आपकी पहचान से अनलिंक किया जा सकता है। जब एक लक्ष्य एकल पते को व्हाइटलिस्ट करता है, या जब आपको एक स्थिर, चिपचिपा सत्र की आवश्यकता होती है जो कभी भी आपके नीचे से नहीं बदलता है, तो यह उपयोगी है।

अपने क्रॉल को एकीकृत और नियंत्रित करें

एक पहले प्रमाणित अनुरोध से सत्र, रोटेशन, दर सीमाएँ, और लागत नियंत्रण।

अपने क्लाइंट को प्रॉक्सी पर इंगित करें

Python अनुरोधों में, प्रॉक्सी डिक्ट को socks5://USER:PASS@proxy.s4m.online:1080 (requests[socks] स्थापित करें) या 3128 पर HTTP एंडपॉइंट सेट करें। Scrapy में, HttpProxyMiddleware सक्षम करें और प्रति अनुरोध या http_proxy पर्यावरण चर के माध्यम से प्रॉक्सी सेट करें। Playwright में, browser.launch() को proxy={"server": ...} पास करें।

सत्र बनाम रोटेशन चुनें

एक स्थायी requests.Session का उपयोग करें — या एक समर्पित व्यक्तिगत IP — जब लक्ष्य कुकीज़ और लॉगिन स्थिति को एक IP से बांधता है, क्योंकि सत्र के मध्य में स्विच करना संदिग्ध लगता है। सार्वजनिक लिस्टिंग को क्रॉल करते समय कई निकास IPs के बीच घुमाएं, ताकि प्रति-IP सीमाओं के तहत रहें। एक ही तार्किक पहचान के लिए दोनों को न मिलाएं।

लक्ष्य को थ्रॉटल करें और सम्मान करें

robots.txt का सम्मान करें, साइट की सेवा की शर्तें पढ़ें, और देरी जोड़ें: requests में time.sleep, Scrapy में DOWNLOAD_DELAY और AutoThrottle। स्थिर, मानव-स्तरीय अनुरोध दरें अक्सर बर्स्ट की तुलना में बहुत कम बार अवरुद्ध होती हैं - जिम्मेदारी से स्क्रैपिंग करना नैतिक विकल्प और प्रभावी विकल्प दोनों है।

अपने खर्च को सीमित करें

क्योंकि डेटा सेंटर प्रॉक्स मीटर किए जाते हैं, उपयोग पर नज़र रखें। s4m प्रशासकों को तीन ध्रुवों पर सीमाएँ सेट करने की अनुमति देता है - प्रति खाता प्रकार, प्रति IP, और प्रति खाता - ताकि एक runaway crawler चुपचाप आपके बजट को न जला सके। एक बड़े काम को शुरू करने से पहले प्रति-खाता सीमा सेट करें।

Python: s4m प्रॉक्सी के माध्यम से स्क्रैप करें

एक न्यूनतम, विनम्र अनुरोध स्क्रैपर जो आपके मूल सर्वर के बजाय आपके s4m डेटा सेंटर प्रॉक्सी के माध्यम से बाहर निकलता है।

python
import time
import requests

# s4m datacenter proxy endpoints:
#   SOCKS5 -> proxy.s4m.online:1080   (pip install "requests[socks]")
#   HTTP   -> proxy.s4m.online:3128
PROXY = "socks5://USER:PASS@proxy.s4m.online:1080"
# PROXY = "http://USER:PASS@proxy.s4m.online:3128"

session = requests.Session()
session.proxies.update({"http": PROXY, "https": PROXY})
session.headers.update(
    {"User-Agent": "my-scraper/1.0 (+contact@example.com)"}
)

# Confirm requests now exit through the proxy, not your real IP:
print("exit IP:", session.get("https://api.ipify.org", timeout=15).text)

for page in range(1, 6):
    r = session.get(f"https://example.com/list?page={page}", timeout=20)
    r.raise_for_status()
    # ... parse r.text here ...
    time.sleep(1.5)  # throttle: stay within the target's rate limits
FAQ

प्रश्न, उत्तरित

क्या s4m प्रॉक्सियाँ आवासीय हैं?

नहीं। s4m प्रमाणित डाटासेंटर SOCKS5 और HTTP प्रॉक्सियों की पेशकश करता है। ये तेज और लागत-कुशल हैं, लेकिन चूंकि ये डाटासेंटर IP हैं, IP प्रतिष्ठा को स्कोर करने वाली साइटें इन्हें आवासीय पते की तुलना में अधिक आसानी से पहचान सकती हैं। हम आवासीय प्रॉक्सियों को नहीं बेचते या दावा नहीं करते।

क्या मैं IP को स्वचालित रूप से घुमा सकता हूँ?

आप अपनी ओर से अनुरोधों या सत्रों के माध्यम से रोटेशन चलाते हैं। एक निश्चित, गैर-घूर्णन निकास के लिए, एक समर्पित व्यक्तिगत आईपी जोड़ें और इसे अपने प्रॉक्सी से बाइंड करें। किसी भी दृष्टिकोण को s4m के प्रति-आईपी और प्रति-खाता उपयोग सीमाओं के साथ जोड़ें ताकि व्यवहार और लागत दोनों को पूर्वानुमानित रखा जा सके।

SOCKS5 या HTTP — मुझे स्क्रैपिंग के लिए कौन सा उपयोग करना चाहिए?

दोनों काम करते हैं। SOCKS5 (पोर्ट 1080) प्रोटोकॉल-निष्पक्ष है और किसी भी TCP ट्रैफ़िक को संभालता है, जो ब्राउज़र स्वचालन जैसे Playwright के लिए सुविधाजनक है। HTTP (पोर्ट 3128) साधारण अनुरोध-आधारित स्क्रिप्ट के लिए सबसे सरल फिट है। चुनें कि आपका क्लाइंट किसे सबसे अच्छा समर्थन करता है।

क्या मैं उत्पादन स्क्रैपिंग के लिए मुफ्त प्रॉक्सी सूची का उपयोग कर सकता हूँ?

इसे परीक्षण के लिए रखें। मुफ्त सूची खुले स्रोतों से तीसरे पक्ष की प्रॉक्सी को एकत्रित करती है; इन्हें लगातार मान्य किया जाता है लेकिन ये किसी भी क्षण गायब या धीमी हो सकती हैं, और आप इन्हें अपने जोखिम पर उपयोग करते हैं। विश्वसनीय कार्यों के लिए, s4m के प्रमाणित डाटासेंटर प्रॉक्सी का उपयोग करें।

क्या प्रॉक्सी के माध्यम से वेब स्क्रैपिंग कानूनी है?

एक प्रॉक्सी यह बदलती है कि एक साइट कौन सा IP देखती है; यह अनुमति नहीं देती। हमेशा लक्ष्य की सेवा की शर्तों और robots.txt की जांच करें, व्यक्तिगत या कॉपीराइटेड डेटा से बचें जिसे आप इकट्ठा करने की अनुमति नहीं रखते, और अनुरोध दरों को उचित रखें। एक प्रॉक्सी कानूनी और नैतिक रूप से स्क्रैपिंग का विकल्प नहीं है।

अपने मूल को उजागर किए बिना स्क्रैपिंग शुरू करें

प्रमाणित डेटा सेंटर SOCKS5 और HTTP प्रॉक्सी चालू करें, या पहले मुफ्त सार्वजनिक सूची के साथ प्रोटोटाइप करें। गुमनाम खाते, डिज़ाइन द्वारा कोई लॉग नहीं, और आप केवल उस डेटा के लिए भुगतान करते हैं जिसे आप मीटर करते हैं।

लोगों ने इस पृष्ठ को खोजकर पाया

वास्तविक खोज वाक्यांश जिनका यह पृष्ठ उत्तर देता है — लिंक किए गए वाक्यांश उस पृष्ठ को खोलते हैं जो उन्हें गहराई से कवर करता है।