Jak unikać banów IP podczas scrapingu
Bany IP zazwyczaj wynikają z zachowania, a nie pecha — zbyt wiele żądań, niechlujne nagłówki i odcisk palca, który krzyczy "bot". Oto jak skrobać w ramach zasad i utrzymać swoje żądania w ruchu.
Dlaczego strony blokują IP (i co naprawić jako pierwsze)
Większość blokad jest wywoływana przez sposób, w jaki żądasz, a nie przez to, kim jesteś.
Trzy sygnały wykonują ciężką pracę za większością zakazów:
- Wskaźnik & objętości — zbyt wiele żądań na sekundę z jednego adresu IP lub idealnie równomierny rytm, którego żaden człowiek nie byłby w stanie wyprodukować.
- Odcisk palca — TLS/JA3, kolejność ramek HTTP/2 oraz kolejność nagłówków, które nie pasują do przeglądarki, którą twierdzisz, że jesteś.
- Nagłówki — brak lub domyślny
User-Agent, brakAccept-Language, przestarzały lub nieobecnyReferer.
Zanim zoptymalizujesz cokolwiek z tego, przeczytaj plik robots.txt i Warunki korzystania z usługi. Zbieranie publicznych danych jest często w porządku; uderzanie w punkt końcowy, ignorowanie opublikowanych limitów szybkości lub zbieranie danych osobowych może naruszać ToS i, w niektórych jurysdykcjach, prawo. Szanuj crawl-delay, pamiętaj, co pobierasz, i nie próbuj ponownie odwiedzać strony do upadku.
Gdy już zbierasz dane odpowiedzialnie, twoim głównym narzędziem jest sposób przypisywania adresów IP:
| Podejście | Najlepsze dla | Kompromis |
|---|---|---|
| Rotacja (nowy IP na żądanie/wsad) | Strony publiczne o dużym wolumenie, przeszukiwania w stylu wyszukiwania | Rozkłada obciążenie, ale łamie sesje, koszyki i logowania |
| Sticky / sesja (ten sam IP przez jakiś czas) | Przepływy zalogowane, nawigacja wieloetapowa, paginacja | Wygląda jak człowiek, ale koncentruje obciążenie na jednym wyjściu |
s4m uruchamia proxy w centrum danych — uwierzytelnione SOCKS5 + HTTP, nie mieszkalne. Są szybkie i tanie za GB, ale niektóre strony konsumenckie łatwiej oznaczają zakresy centrów danych, więc łącz je z czystymi nagłówkami i uczciwymi limitami szybkości. Potrzebujesz jednego stabilnego wyjścia do logowania? Dodaj dedykowany IP. Wolisz pełny tunel? Zobacz /vpn/, porównaj opcje w /compare/ lub przeczytaj więcej przewodników.
Dźwignie, które utrzymują cię bez bana
Połącz te elementy — żaden pojedynczy trik nie pokona dobrego systemu anty-botowego.
Limitowanie szybkości i jitter
Ogranicz równoczesność, dodaj losowe opóźnienia między żądaniami i przestrzegaj crawl-delay oraz wszelkich 429 / Retry-After, które wysyła serwer.
Rotuj lub pozostań przywiązany
Rotuj IP dla stateless, wysokowolumenowych skanów; zachowaj stałe wyjście dla zalogowanych, wieloetapowych procesów. Wiele zadań łączy oba podejścia.
Czysty odcisk palca
Wysyłaj realistyczne nagłówki przeglądarki z spójnym Accept-Language i Referer zamiast domyślnych ustawień biblioteki, które oznaczają Cię jako bota.
Wycofaj się w przypadku niepowodzenia
Użyj wykładniczego opóźnienia z jitterem w odpowiedziach 429 i 5xx, a całkowicie zatrzymaj się, gdy strona wyraźnie sygnalizuje zatrzymanie.
Kontrola użycia na IP
Limity s4m są dostosowywane przez administratora na podstawie IP, konta i typu konta, więc jedno niekontrolowane zadanie nie może zniszczyć wspólnego wyjścia ani twojego budżetu.
Bez logów, RAM-przede wszystkim
Uwierzytelnione proxy przez TLS, bez logów z założenia. Twoja lista celów i ruch pozostają Twoje, na karcie lub kryptowalucie.
Konfiguracja odporna na blokady do skrobania
Sześć kroków od pierwszego żądania do trwałego robota.
Sprawdź robots.txt i ToS
Potwierdź, że punkt końcowy umożliwia automatyczny dostęp, zanotuj wszelkie opóźnienia w indeksowaniu i pomiń dane osobiste lub wyraźnie niedostępne.
Ustaw budżet żądania
Wybierz limit współbieżności i docelową liczbę żądań na sekundę znacznie poniżej tego, co mogłoby wyglądać na nadużycie, a następnie dodaj losowe opóźnienie.
Wyślij realistyczne nagłówki
Ustaw prawdziwego User-Agent, Accept i Accept-Language, i utrzymuj je w spójności przez cały czas trwania sesji.
Wybierz rotacyjne vs stałe
Rotuj wyjścia dla stateless pages; używaj jednego stałego wyjścia na sesję zalogowaną, aby stan nie został przerwany w trakcie.
Dodaj wykładnicze opóźnienie
W przypadku 429 / 503, poczekaj Retry-After (lub 2^n) plus jitter i spróbuj ponownie kilka razy, a następnie poddaj się z godnością.
Limit użycia na IP
Użyj limitów per-IP w s4m, aby pojedyncze skrypty nie mogły wyczerpać wyjścia, i monitoruj zużycie z ograniczeniami w miarę skalowania.
Python: grzeczny crawler przez proxy s4m
Sticky session, realistyczne nagłówki, spowolnienie z jitterem. Zamień USER:PASS na swoje dane uwierzytelniające — nigdy nie koduj na stałe prawdziwego IP.
import random
import time
import requests
# s4m datacenter proxies (authenticated). Placeholder host only.
USER, PASS = "USER", "PASS"
HTTP = f"http://{USER}:{PASS}@proxy.s4m.online:3128"
SOCKS = f"socks5://{USER}:{PASS}@proxy.s4m.online:1080" # pip install requests[socks]
PROXIES = {"http": HTTP, "https": HTTP}
HEADERS = {
"User-Agent": (
"Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 "
"(KHTML, like Gecko) Chrome/125.0 Safari/537.36"
),
"Accept": "text/html,application/xhtml+xml;q=0.9,*/*;q=0.8",
"Accept-Language": "en-US,en;q=0.9",
}
def polite_get(url, session, max_retries=5):
for attempt in range(max_retries):
r = session.get(url, headers=HEADERS, proxies=PROXIES, timeout=20)
if r.status_code == 429 or r.status_code >= 500:
wait = float(r.headers.get("Retry-After", 2 ** attempt))
time.sleep(wait + random.uniform(0, 1)) # backoff + jitter
continue
r.raise_for_status()
return r
raise RuntimeError(f"gave up after {max_retries} tries: {url}")
def crawl(urls):
# One Session = one sticky exit for this run; open a new one to rotate.
with requests.Session() as s:
for url in urls:
resp = polite_get(url, s)
yield url, resp.text
time.sleep(random.uniform(1.5, 4.0)) # rate-limit + jitter
if __name__ == "__main__":
for url, html in crawl(["https://example.com/page/1"]):
print(url, len(html))Pytania, odpowiedzi
Czy proxy z centrum danych są wystarczające, aby uniknąć banów?
Ukrywają Twój oryginalny IP i rozkładają obciążenie, co zapobiega wielu blokadom opartym na stawkach. Ale proxy s4m są z centrum danych, a nie mieszkalne, i niektóre strony konsumenckie łatwiej oznaczają zakresy z centrum danych — więc łącz je z czystymi nagłówkami, rozsądnymi limitami stawki i trwałymi sesjami tam, gdzie stan ma znaczenie.
Czy powinienem używać rotujących czy sticky proxy?
Rotuj wyjścia dla stateless, wysokowolumenowych publicznych stron, aby żaden pojedynczy adres IP nie przyciągał uwagi. Utrzymuj stabilną sesję, gdy jesteś zalogowany lub przechodzisz przez wieloetapowy proces, ponieważ zmieniający się adres IP w trakcie sesji wygląda podejrzanie i może zepsuć koszyki lub autoryzację. Wiele zadań łączy oba podejścia.
Czy web scraping jest legalny?
To zależy od twojej jurysdykcji, danych i warunków serwisu. Publiczne, nieosobowe dane są często w porządku, ale regulamin platformy może zabraniać automatycznego dostępu, nawet gdy jest to technicznie możliwe, a dane osobowe mają dodatkowe zasady. Zawsze sprawdzaj robots.txt i regulamin, i zbieraj dane ostrożnie.
Jak mogę zatrzymać jedno zadanie przed wykorzystaniem całego mojego limitu?
Proxy s4m są rozliczane na podstawie zużycia i działają w modelu pay-as-you-go, z limitami dostosowywanymi przez administratora na adres IP, na konto i na typ konta. Ogranicz równoległość w swoim crawlerze i ustaw limit zużycia na adres IP, aby niekontrolowana pętla nie wyczerpała twojego budżetu ani wspólnego wyjścia.
Czy mogę uzyskać stabilne IP do skanowania po zalogowaniu?
Tak. Dedykowany dodatek z osobnym adresem IP to statyczne wyjście, które możesz opcjonalnie odłączyć od swojej tożsamości i powiązać z proxy lub VPN — przydatne, gdy cel wiąże sesję z jednym stałym adresem.
Scrapuj mądrzej, nie ciężej
Uwierzytelnione proxy SOCKS5 + HTTP w centrach danych, płatne na zasadzie pay-as-you-go, z limitami użycia na IP i opcjonalnym dedykowanym IP. Brak logów z założenia — i uczciwe, że są to wyjścia z centrów danych, a nie mieszkalne.
Ludzie znaleźli tę stronę, szukając
- jak unikać banów IP podczas scrapingu
- czym są proxy ISP (statyczne mieszkalne)
- proxy do skrobania z płatnością kryptowalutą
- jak skonfigurować proxy w Chrome i firefoxie
- konfiguracja proxy Puppeteer z uwierzytelnianiem
- świeży lista darmowych proxy
- jak lista darmowych proxy działa
- proxy http
- wyłącznik kill VPN
- WireGuard vs OpenVPN
- proxy socks5 dla biznesu
- openvpn
- uwierzytelnianie proxy samouczek
- jak skonfigurować adres IP
- adres IP
- uwierzytelnianie proxy
Rzeczywiste frazy wyszukiwania, na które ta strona odpowiada — powiązane otwierają stronę, która je szczegółowo omawia.