Como usar proxies para raspagem da web
Os proxies mantêm o servidor de origem do seu scraper oculto e espalham solicitações entre IPs para que um único endereço não seja limitado por taxa ou bloqueado. Este guia cobre a escolha de proxies e como integrá-los ao Python, Scrapy e Playwright.
Por que seu scraper precisa de um proxy
Dois problemas impulsionam quase toda configuração de scraping: proteger seu IP real e permanecer abaixo dos limites de taxa por IP.
Quando um crawler envia milhares de solicitações de um único endereço, o site alvo vê um único IP se comportando como um bot. O resultado usual é uma desaceleração, um muro de CAPTCHA ou um bloqueio total — e pior, o endereço bloqueado é seu servidor de origem, a máquina que executa sua lógica de negócios. Um proxy fica entre seu scraper e o alvo, de modo que o site vê apenas o IP de saída do proxy, nunca o seu real.
Duas preocupações moldam quase toda configuração de scraping:
- Proteger sua origem. Se o IP do seu servidor de produção for colocado na lista negra, o dano perdura além do scraping. Roteando através de um proxy mantém esse endereço limpo e desvinculado do crawl.
- Distribuir carga. Espalhar solicitações por vários IPs de saída mantém qualquer um deles abaixo do limite de taxa por IP do alvo, assim você coleta dados sem ativar defesas contra abuso.
s4m fornece proxies SOCKS5 e HTTP autenticados de datacenter exatamente para isso. Eles são rápidos e baratos, o que se adequa a alvos de alto volume e tolerantes — mas como são IPs de datacenter, sites rigorosos podem identificá-los mais facilmente do que endereços residenciais, então ajuste as expectativas de acordo. Para experimentos rápidos, você pode pegar endpoints descartáveis da lista pública de proxies gratuitos, proxies de terceiros validados continuamente, mas use-os por sua própria conta e risco. Se você também quiser ocultar um aplicativo ou servidor inteiro em vez de um único cliente, um túnel VPN cobre todo o seu tráfego. Veja preços para tarifas de proxy com medição.
Escolhendo proxies para scraping
Combine a ferramenta com o trabalho. Veja como as opções do s4m se comparam para uma carga de trabalho de scraping.
Datacenter SOCKS5 / HTTP
Metered, pay-as-you-go proxies on proxy.s4m.online — port 1080 for SOCKS5, 3128 for HTTP, authenticated with USER:PASS. Fast and cost-effective for bulk crawling of targets that don't aggressively score IP reputation. This is the workhorse for production scraping.
Lista de proxies públicos gratuitos
Proxies de terceiros coletados de fontes abertas e continuamente revalidados, filtráveis por país, protocolo e anonimato. Ideal para prototipar um scraper antes de comprometer o orçamento — mas não confiável e use por sua conta e risco, nunca adequado para trabalhos de produção.
IP pessoal dedicado
Um IP estático opcional que é só seu, vinculável ao seu proxy e opcionalmente desvinculado de sua identidade. Útil quando um alvo lista um único endereço, ou quando você precisa de uma sessão estável e fixa que nunca muda.
Integre e controle seu rastreamento
De um primeiro pedido autenticado a sessões, rotação, limites de taxa e controle de custos.
Aponte seu cliente para o proxy
No Python requests, defina o dicionário de proxies como socks5://USER:PASS@proxy.s4m.online:1080 (instale requests[socks]) ou o ponto final HTTP na porta 3128. No Scrapy, ative o HttpProxyMiddleware e defina o proxy por solicitação ou via a variável de ambiente http_proxy. No Playwright, passe proxy={"server": ...} para browser.launch().
Escolha sessões vs rotação
Use uma requests.Session persistente — ou um IP pessoal dedicado — quando o alvo vincula cookies e estado de login a um IP, já que mudar no meio da sessão parece suspeito. Rotacione entre muitos IPs de saída ao rastrear listagens públicas, para ficar abaixo dos limites por IP. Não misture os dois para a mesma identidade lógica.
Controle e respeite o alvo
Respeite o robots.txt, leia os termos de serviço do site e adicione atrasos: time.sleep em requests, DOWNLOAD_DELAY e AutoThrottle em Scrapy. Taxas de requisição constantes e em escala humana são bloqueadas com muito menos frequência do que picos — fazer scraping de forma responsável é tanto a escolha ética quanto a eficaz.
Limite seu gasto
Como os proxies de datacenter são medidos, fique de olho no uso. s4m permite que administradores definam limites em três eixos — por tipo de conta, por IP e por conta — para que um rastreador descontrolado não queime seu orçamento silenciosamente. Defina um teto por conta antes de lançar um grande trabalho.
Python: scrape através do proxy s4m
Um scraper de solicitações minimalista e educado que sai pelo seu proxy de datacenter s4m em vez do seu servidor de origem.
import time
import requests
# s4m datacenter proxy endpoints:
# SOCKS5 -> proxy.s4m.online:1080 (pip install "requests[socks]")
# HTTP -> proxy.s4m.online:3128
PROXY = "socks5://USER:PASS@proxy.s4m.online:1080"
# PROXY = "http://USER:PASS@proxy.s4m.online:3128"
session = requests.Session()
session.proxies.update({"http": PROXY, "https": PROXY})
session.headers.update(
{"User-Agent": "my-scraper/1.0 (+contact@example.com)"}
)
# Confirm requests now exit through the proxy, not your real IP:
print("exit IP:", session.get("https://api.ipify.org", timeout=15).text)
for page in range(1, 6):
r = session.get(f"https://example.com/list?page={page}", timeout=20)
r.raise_for_status()
# ... parse r.text here ...
time.sleep(1.5) # throttle: stay within the target's rate limits
Perguntas, respondidas
Os proxies s4m são residenciais?
Não. s4m fornece proxies SOCKS5 e HTTP de datacenter autenticados. Eles são rápidos e econômicos, mas como são IPs de datacenter, sites que avaliam a reputação do IP podem detectá-los mais facilmente do que endereços residenciais. Não vendemos nem afirmamos ter proxies residenciais.
Posso rotacionar IPs automaticamente?
Você controla a rotação do seu lado, alternando entre solicitações ou sessões. Para uma saída fixa, não rotativa, adicione um IP pessoal dedicado e vincule-o ao seu proxy. Combine qualquer uma das abordagens com os limites de uso por IP e por conta do s4m para manter tanto o comportamento quanto o custo previsíveis.
SOCKS5 ou HTTP — qual devo usar para scraping?
Ambos funcionam. SOCKS5 (porta 1080) é agnóstico em relação ao protocolo e lida com qualquer tráfego TCP, o que é conveniente para automação de navegador como Playwright. HTTP (porta 3128) é a opção mais simples para scripts baseados em solicitações. Escolha o que seu cliente suporta melhor.
Posso usar a lista de proxies gratuitos para raspagem em produção?
Mantenha isso para testes. A lista gratuita agrega proxies de terceiros de fontes abertas; eles são validados continuamente, mas podem desaparecer ou desacelerar a qualquer momento, e você os usa por sua conta e risco. Para trabalhos confiáveis, use os proxies de datacenter autenticados do s4m.
É legal fazer web scraping através de um proxy?
Um proxy muda qual IP um site vê; ele não concede permissão. Sempre verifique os termos de serviço e o robots.txt do alvo, evite dados pessoais ou protegidos por direitos autorais que você não tem permissão para coletar e mantenha as taxas de solicitação razoáveis. Um proxy não é um substituto para raspagem legal e ética.
Comece a coletar dados sem expor sua origem
Spin up authenticated datacenter SOCKS5 and HTTP proxies, or prototype with the free public list first. Anonymous accounts, no-logs by design, and you pay only for the data you meter.
As pessoas encontraram esta página pesquisando por
- como usar proxies para raspagem da web
- túnel dividido
- endereço IP para scraping
- endereço IP
- interruptor de desligamento vpn para scraping
- proxy para scraping
- lista de proxies gratuitos
- configuração de proxy
- double VPN / multi-hop
- como usar um proxy com wget
Frases de busca reais que esta página responde — os links abrem a página que as cobre em profundidade.