Jak używać proxy do skrobania stron internetowych
Proxy ukrywają serwer źródłowy Twojego skanera i rozkładają żądania na różne adresy IP, aby pojedynczy adres nie został ograniczony lub zablokowany. Ten przewodnik dotyczy wyboru proxy i ich podłączenia do Pythona, Scrapy i Playwright.
Dlaczego twój skrypt potrzebuje proxy
Dwa problemy napędzają prawie każdą konfigurację skrobania: ochrona Twojego prawdziwego adresu IP i pozostawanie poniżej limitów stawki na adres IP.
Kiedy crawler wysyła tysiące żądań z jednego adresu, docelowa strona widzi pojedynczy adres IP zachowujący się jak bot. Zwykle skutkuje to spowolnieniem, ścianą CAPTCHA lub całkowitym zablokowaniem — a co gorsza, zablokowany adres to twój serwer źródłowy, maszyna, która obsługuje logikę twojego biznesu. Proxy znajduje się pomiędzy twoim scraperem a celem, więc strona widzi tylko adres IP wyjściowy proxy, nigdy twój prawdziwy.
Dwa zagadnienia kształtują prawie każdą konfigurację scrapowania:
- Ochrona twojego źródła. Jeśli adres IP twojego serwera produkcyjnego zostanie umieszczony na czarnej liście, szkody przetrwają scrapowanie. Przekierowanie przez proxy utrzymuje ten adres czysty i niepowiązany z crawl.
- Rozkład obciążenia. Rozprzestrzenienie żądań na kilka adresów IP wyjściowych utrzymuje każdy z nich poniżej limitu stawki na IP, dzięki czemu zbierasz dane bez uruchamiania obron przed nadużyciami.
s4m zapewnia uwierzytelnione proxy SOCKS5 i HTTP dokładnie do tego celu. Są szybkie i niedrogie, co pasuje do celów o dużym wolumenie, tolerancyjnych — ale ponieważ są to adresy IP z centrum danych, surowe strony mogą je łatwiej zidentyfikować niż adresy mieszkalne, więc dostosuj oczekiwania odpowiednio. Do szybkich eksperymentów możesz pobrać jednorazowe punkty końcowe z darmowej publicznej listy proxy, proxy stron trzecich weryfikowane ciągle, ale używaj ich na własne ryzyko. Jeśli chcesz również ukryć całą aplikację lub serwer, a nie tylko pojedynczego klienta, tunel VPN obejmuje cały jego ruch. Zobacz cennik dla stawek proxy z metrowaniem.
Wybór proxy do skrobania
Dopasuj narzędzie do zadania. Oto jak opcje s4m porównują się do obciążenia związanego z scrapingiem.
Centrum danych SOCKS5 / HTTP
Mierzone, płatne za użycie proxy na proxy.s4m.online — port 1080 dla SOCKS5, 3128 dla HTTP, uwierzytelnione za pomocą USER:PASS. Szybkie i opłacalne dla masowego skanowania celów, które nie agresywnie oceniają reputację IP. To jest koń roboczy dla produkcyjnego skrobania.
Darmowa publiczna lista proxy
Proxy osób trzecich pozyskiwane z otwartych źródeł i ciągle weryfikowane, filtrowalne według kraju, protokołu i anonimowości. Idealne do prototypowania skrobaka przed zainwestowaniem budżetu — ale niepewne i używaj na własne ryzyko, nigdy nie nadaje się do pracy produkcyjnej.
Dedykowany osobisty IP
Opcjonalne statyczne IP, które jest tylko twoje, powiązane z twoim proxy i opcjonalnie niezwiązane z twoją tożsamością. Przydatne, gdy cel dopuszcza tylko jeden adres, lub gdy potrzebujesz stabilnej, trwałej sesji, która nigdy nie zmienia się pod tobą.
Zintegruj i kontroluj swoje skanowanie
Od pierwszego uwierzytelnionego żądania do sesji, rotacji, limitów prędkości i kontroli kosztów.
Wskaź klienta na proxy
W Pythonie requests, ustaw słownik proxies na socks5://USER:PASS@proxy.s4m.online:1080 (zainstaluj requests[socks]) lub punkt końcowy HTTP na 3128. W Scrapy, włącz HttpProxyMiddleware i ustaw proxy na żądanie lub za pomocą zmiennej środowiskowej http_proxy. W Playwright, przekaż proxy={"server": ...} do browser.launch().
Wybierz sesje vs rotację
Użyj jednej trwałej requests.Session — lub dedykowanego osobistego adresu IP — gdy cel wiąże ciasteczka i stan logowania z adresem IP, ponieważ zmiana w trakcie sesji wygląda podejrzanie. Rotuj przez wiele adresów IP wyjściowych podczas przeszukiwania publicznych list, aby pozostać poniżej limitów na adres IP. Nie mieszaj obu dla tej samej logicznej tożsamości.
Ogranicz i szanuj cel
Szanuj robots.txt, przeczytaj warunki usługi strony i dodaj opóźnienia: time.sleep w requests, DOWNLOAD_DELAY i AutoThrottle w Scrapy. Stabilne, ludzkie tempo żądań jest blokowane znacznie rzadziej niż nagłe skoki — odpowiedzialne skrobanie to zarówno etyczny, jak i skuteczny wybór.
Ogranicz swoje wydatki
Ponieważ proxy z centrów danych są mierzone, obserwuj użycie. s4m pozwala administratorom ustawić limity na trzech osiach — na typ konta, na adres IP i na konto — aby niekontrolowany crawler nie mógł cicho spalić Twojego budżetu. Ustaw sufit na konto przed uruchomieniem dużego zadania.
Python: skrob przez proxy s4m
Minimalny, grzeczny skrypt do zbierania żądań, który wychodzi przez Twój proxy w centrum danych s4m zamiast przez serwer źródłowy.
import time
import requests
# s4m datacenter proxy endpoints:
# SOCKS5 -> proxy.s4m.online:1080 (pip install "requests[socks]")
# HTTP -> proxy.s4m.online:3128
PROXY = "socks5://USER:PASS@proxy.s4m.online:1080"
# PROXY = "http://USER:PASS@proxy.s4m.online:3128"
session = requests.Session()
session.proxies.update({"http": PROXY, "https": PROXY})
session.headers.update(
{"User-Agent": "my-scraper/1.0 (+contact@example.com)"}
)
# Confirm requests now exit through the proxy, not your real IP:
print("exit IP:", session.get("https://api.ipify.org", timeout=15).text)
for page in range(1, 6):
r = session.get(f"https://example.com/list?page={page}", timeout=20)
r.raise_for_status()
# ... parse r.text here ...
time.sleep(1.5) # throttle: stay within the target's rate limits
Pytania, odpowiedzi
Czy proxy s4m są mieszkalne?
Nie. s4m oferuje uwierzytelnione proxy SOCKS5 i HTTP z centrum danych. Są szybkie i opłacalne, ale ponieważ są to adresy IP z centrum danych, strony, które oceniają reputację IP, mogą je wykrywać łatwiej niż adresy mieszkalne. Nie sprzedajemy ani nie twierdzimy, że oferujemy proxy mieszkalne.
Czy mogę automatycznie zmieniać IP?
Rotację prowadzisz z własnej strony, przechodząc przez żądania lub sesje. Aby uzyskać stałe, niezmienne wyjście, dodaj dedykowany osobisty adres IP i powiąż go ze swoim proxy. Połącz dowolne podejście z limitami użytkowania s4m na adres IP i konto, aby zachować przewidywalność zarówno zachowania, jak i kosztów.
SOCKS5 czy HTTP — co powinienem użyć do skrobania?
Oba działają. SOCKS5 (port 1080) jest niezależny od protokołu i obsługuje każdy ruch TCP, co jest wygodne dla automatyzacji przeglądarki, takiej jak Playwright. HTTP (port 3128) jest najprostszym dopasowaniem dla skryptów opartych na prostych żądaniach. Wybierz ten, który najlepiej wspiera twój klient.
Czy mogę używać darmowej listy proxy do produkcyjnego skrobania?
Zachowaj to do testów. Darmowa lista agreguje proxy zewnętrzne z otwartych źródeł; są one ciągle weryfikowane, ale mogą zniknąć lub zwolnić w każdej chwili, a korzystasz z nich na własne ryzyko. Do niezawodnych zadań użyj uwierzytelnionych proxy z centrum danych s4m.
Czy web scraping przez proxy jest legalny?
Proxy zmienia, jaki adres IP widzi strona; nie przyznaje jednak pozwolenia. Zawsze sprawdzaj warunki korzystania z usługi i robots.txt docelowego serwisu, unikaj danych osobowych lub objętych prawem autorskim, których nie masz prawa zbierać, i utrzymuj rozsądne tempo żądań. Proxy nie jest substytutem legalnego i etycznego skrobania.
Rozpocznij skanowanie bez ujawniania swojego pochodzenia
Uruchom uwierzytelnione proxy SOCKS5 i HTTP w centrum danych lub najpierw prototypuj z darmową publiczną listą. Konta anonimowe, brak logów z założenia, a płacisz tylko za dane, które mierzysz.
Ludzie znaleźli tę stronę, szukając
- jak używać proxy do skrobania stron internetowych
- podział tunelowania
- adres IP za skrobanie
- adres IP
- wyłącznik kill VPN za skrobanie
- proxy do skrobania
- lista darmowych proxy
- konfiguracja proxy
- podwójne VPN / multi-hop
- jak używać proxy z wget
Rzeczywiste frazy wyszukiwania, na które ta strona odpowiada — powiązane otwierają stronę, która je szczegółowo omawia.