Web scraping · 1 min czytania

Zbieranie wyników wyszukiwania Google bez blokady

Google agresywnie ogranicza automatyczne zapytania wyszukiwania, więc skrobanie SERP na dużą skalę to głównie gra w rozdzielanie ruchu i zachowywanie się jak przeglądarka. Ten przewodnik obejmuje praktyczne taktyki — rotację proxy, tempo zapytań, nagłówki i analizę — z uczciwymi uwagami na temat ograniczeń i zasad.

Dlaczego Google blokuje skrypty

Strona wyników wyszukiwania Google'a jest jednym z najbardziej chronionych punktów dostępu w sieci. Wysyłając zbyt wiele automatycznych zapytań z jednego adresu IP, szybko napotkasz CAPTCHA (ekran „nietypowy ruch”), a następnie twarde blokady. Wykrywanie opiera się na ilości zapytań na IP, zbyt regularnym czasie zapytań, brakujących lub robotycznych nagłówkach oraz braku normalnego zachowania przeglądarki.

Dwa fakty ustalają oczekiwania. Po pierwsze, skrobanie wyników Google'a jest sprzeczne z jego Warunkami korzystania z usługi, a Google oferuje oficjalne API (Custom Search JSON API oraz płatne opcje) do programatycznego dostępu — rozważ je przed skrobaniem. Po drugie, żadna technika nie sprawia, że automatyczne zbieranie danych z SERP jest niezawodne na zawsze; obrony się zmieniają, a każdy, kto obiecuje niewykrywalne skrobanie Google'a, przesadza. Dobre narzędzia zmniejszają wskaźnik blokad na tyle, aby zbierać dane w zrównoważonym tempie.

Taktyki, które naprawdę pomagają

Główna idea polega na tym, aby wyglądać jak wielu zwykłych użytkowników, a nie jak jeden niezmordowany bot:

  • Rotacja IP — rozkładaj żądania na pulę, aby żaden pojedynczy adres nie przekraczał tolerancji Google na IP. To jest największa dźwignia. Zobacz nasz przewodnik po rotujących i statycznych sesjach.
  • Ustal tempo i wprowadź losowość — dodaj jitter między żądaniami zamiast stałego interwału; regularne timing to wskazówka. Wolniejsze jest bardziej zrównoważone niż szybkie i zbanowane.
  • Wysyłaj realistyczne nagłówki — prawdziwy User-Agent, Accept-Language i nagłówki, które wysyła przeglądarka. Rotuj je sensownie, zamiast używać jednego statycznego zestawu.
  • Traktuj CAPTCHAs jako sygnał — gdy napotkasz jeden, wycofaj się z tego IP zamiast próbować go przełamać.
  • Preferuj przeglądarkę bez interfejsu dla typów wyników z dużą ilością JS — niektóre funkcje SERP renderują po stronie klienta.

Reputacja IP ma znaczenie: Google ocenia zakresy centrów danych, więc intensywne skanowanie SERP to powszechny przypadek, w którym IP z mieszkań przewyższają centra danych. s4m sprzedaje proxy z centrów danych, które nadają się do lżejszej lub dobrze zorganizowanej zbiórki; w przypadku pracy z dużą ilością SERP bądź szczery wobec siebie, czy centrum danych będzie w stanie nadążyć.

Paced, proxied request w Pythonie

Minimalny przykład: kieruj przez proxy s4m, wyślij realistyczny nagłówek i równomiernie rozłóż żądania. Rotuj proxy i User-Agent w puli w produkcji.

python
import time, random, requests

proxies = {
    "http":  "http://USER:PASS@proxy.s4m.online:3128",
    "https": "http://USER:PASS@proxy.s4m.online:3128",
}
headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) "
                  "AppleWebKit/537.36 (KHTML, like Gecko) "
                  "Chrome/122.0 Safari/537.36",
    "Accept-Language": "en-US,en;q=0.9",
}

for query in queries:
    r = requests.get("https://www.google.com/search",
                     params={"q": query, "num": 10},
                     headers=headers, proxies=proxies, timeout=20)
    if r.status_code == 429 or "unusual traffic" in r.text:
        # Back off this IP; rotate to the next proxy in your pool.
        time.sleep(60)
        continue
    parse_results(r.text)          # your parser (e.g. selectolax/bs4)
    time.sleep(random.uniform(3, 8))  # jitter, don't hammer
Share this page
FAQ

Pytania, odpowiedzi

Czy skrobanie Google jest legalne?

Zbieranie publicznych wyników wyszukiwania znajduje się w kontrowersyjnej strefie: narusza Warunki korzystania z usług Google, a w zależności od jurysdykcji i danych, które zbierasz, może wiązać się z ryzykiem prawnym. Google oferuje również oficjalne API do programowego dostępu. Rozważ te opcje najpierw i uzyskaj własną poradę prawną w przypadku działań na dużą skalę.

Czy potrzebuję proxy mieszkalnych, aby zeskrobać Google?

Dla dużego wolumenu, często tak — Google ocenia zakresy datacenter, więc szybciej napotykają CAPTCHAs. Proxy datacenter (to, co sprzedaje s4m) mogą działać dla lżejszego, dobrze rozłożonego zbierania. Rotacja i tempo mają znaczenie tak samo jak typ IP; żadne proxy nie czyni scraping SERP odpornym na blokady.

Jak uniknąć CAPTCHA 'nietypowy ruch'?

Traktuj to jako sygnał stawki: rotuj IP, dodawaj losowe opóźnienia między żądaniami, wysyłaj realistyczne nagłówki przeglądarki i wycofuj każde IP, które zostanie wyzwane, zamiast natychmiast próbować ponownie. Zmniejszasz częstotliwość CAPTCHA; nie możesz ich całkowicie wyeliminować na dużą skalę.

Rozdziel swój ruch zeskrobywania

Przekieruj zapytania przez uwierzytelnione proxy w centrum danych s4m, rotuj pulę i dostosuj tempo swoich zadań. Płatność metrowa w modelu pay-as-you-go z darmową, ciągle sprawdzaną listą proxy do testów. Konta anonimowe, akceptujemy kryptowaluty.

Ludzie znaleźli tę stronę, szukając

Rzeczywiste frazy wyszukiwania, na które ta strona odpowiada — powiązane otwierają stronę, która je szczegółowo omawia.