Cómo usar proxies para web scraping
Los proxies mantienen oculta la dirección del servidor de origen de tu scraper y distribuyen las solicitudes entre IPs para que una sola dirección no sea limitada por tasa o bloqueada. Esta guía cubre la elección de proxies y su integración en Python, Scrapy y Playwright.
Por qué su scraper necesita un proxy
Dos problemas impulsan casi toda configuración de scraping: proteger tu IP real y mantenerse por debajo de los límites de tasa por IP.
Cuando un rastreador envía miles de solicitudes desde una dirección, el sitio objetivo ve una sola IP comportándose como un bot. El resultado habitual es una desaceleración, un muro CAPTCHA o un bloqueo total; y lo peor, la dirección bloqueada es tu servidor de origen, la máquina que ejecuta la lógica de tu negocio. Un proxy se sitúa entre tu scraper y el objetivo, de modo que el sitio solo ve la IP de salida del proxy, nunca la tuya real.
Dos preocupaciones moldean casi toda configuración de scraping:
- Proteger tu origen. Si la IP de tu servidor de producción es incluida en una lista negra, el daño perdura más allá del scraping. Enrutar a través de un proxy mantiene esa dirección limpia y desvinculada del rastreo.
- Distribuir la carga. Distribuir solicitudes a través de varias IPs de salida mantiene a cualquiera de ellas por debajo del límite de tasa por IP del objetivo, así que recopilas datos sin activar las defensas contra abusos.
s4m proporciona proxies SOCKS5 y HTTP autenticados de centro de datos para exactamente esto. Son rápidos y económicos, lo que se adapta a objetivos de alto volumen y tolerantes; pero dado que son IPs de centro de datos, los sitios estrictos pueden identificarlos más fácilmente que las direcciones residenciales, así que establece expectativas en consecuencia. Para experimentos rápidos, puedes obtener puntos finales desechables de la lista pública de proxies gratuitos, proxies de terceros validados continuamente pero estrictamente bajo tu propio riesgo. Si también deseas ocultar una aplicación o servidor completo en lugar de un solo cliente, un túnel VPN cubre todo su tráfico. Consulta precios para tarifas de proxy medidas.
Eligiendo proxies para scraping
Ajusta la herramienta al trabajo. Así es como las opciones de s4m se comparan para una carga de trabajo de scraping.
Datacenter SOCKS5 / HTTP
Proxies medidos, de pago por uso en proxy.s4m.online — puerto 1080 para SOCKS5, 3128 para HTTP, autenticados con USER:PASS. Rápido y rentable para el rastreo masivo de objetivos que no puntúan agresivamente la reputación de IP. Este es el caballo de batalla para el scraping en producción.
Lista de proxies públicos gratuitos
Proxies de terceros recolectados de fuentes abiertas y continuamente revalidados, filtrables por país, protocolo y anonimato. Ideal para prototipar un scraper antes de comprometer presupuesto, pero poco confiables y bajo tu propio riesgo, nunca aptos para trabajos de producción.
IP personal dedicada
Una IP estática opcional que es solo tuya, vinculable a tu proxy y opcionalmente desvinculada de tu identidad. Útil cuando un objetivo blinda una sola dirección, o cuando necesitas una sesión estable y persistente que nunca se rota.
Integra y controla tu rastreo
Desde una primera solicitud autenticada hasta sesiones, rotación, límites de tasa y control de costos.
Apunta tu cliente al proxy
En Python requests, establece el diccionario de proxies a socks5://USER:PASS@proxy.s4m.online:1080 (instala requests[socks]) o el punto final HTTP en 3128. En Scrapy, habilita HttpProxyMiddleware y establece el proxy por solicitud o a través de la variable de entorno http_proxy. En Playwright, pasa proxy={"server": ...} a browser.launch().
Elige sesiones vs rotación
Usa una requests.Session persistente — o una IP personal dedicada — cuando el objetivo vincula cookies y estado de inicio de sesión a una IP, ya que cambiar a mitad de sesión parece sospechoso. Rota entre muchas IPs de salida al rastrear listados públicos, para mantenerte por debajo de los límites por IP. No mezcles los dos para la misma identidad lógica.
Controla y respeta el objetivo
Respeta robots.txt, lee los términos de servicio del sitio y añade retrasos: time.sleep en requests, DOWNLOAD_DELAY y AutoThrottle en Scrapy. Tasas de solicitud constantes y a escala humana son bloqueadas con mucha menos frecuencia que los picos: raspar de manera responsable es tanto la elección ética como la efectiva.
Limita tu gasto
Debido a que los proxies de centro de datos son medidos, observa el uso. s4m permite a los administradores establecer límites en tres ejes: por tipo de cuenta, por IP y por cuenta, para que un rastreador descontrolado no queme silenciosamente tu presupuesto. Establece un límite por cuenta antes de lanzar un trabajo grande.
Python: scrapea a través del proxy s4m
Un raspador de solicitudes mínimo y educado que sale a través de tu proxy de centro de datos s4m en lugar de tu servidor de origen.
import time
import requests
# s4m datacenter proxy endpoints:
# SOCKS5 -> proxy.s4m.online:1080 (pip install "requests[socks]")
# HTTP -> proxy.s4m.online:3128
PROXY = "socks5://USER:PASS@proxy.s4m.online:1080"
# PROXY = "http://USER:PASS@proxy.s4m.online:3128"
session = requests.Session()
session.proxies.update({"http": PROXY, "https": PROXY})
session.headers.update(
{"User-Agent": "my-scraper/1.0 (+contact@example.com)"}
)
# Confirm requests now exit through the proxy, not your real IP:
print("exit IP:", session.get("https://api.ipify.org", timeout=15).text)
for page in range(1, 6):
r = session.get(f"https://example.com/list?page={page}", timeout=20)
r.raise_for_status()
# ... parse r.text here ...
time.sleep(1.5) # throttle: stay within the target's rate limits
Preguntas, respondidas
¿Los proxies de s4m son residenciales?
No. s4m proporciona proxies SOCKS5 y HTTP de centro de datos autenticados. Son rápidos y rentables, pero debido a que son IPs de centro de datos, los sitios que evalúan la reputación de IP pueden detectarlos más fácilmente que las direcciones residenciales. No vendemos ni reclamamos proxies residenciales.
¿Puedo rotar IPs automáticamente?
Tú controlas la rotación desde tu lado al alternar entre solicitudes o sesiones. Para una salida fija y no rotativa, añade una IP personal dedicada y asóciala a tu proxy. Combina cualquiera de los enfoques con los límites de uso por IP y por cuenta de s4m para mantener tanto el comportamiento como el costo predecibles.
SOCKS5 o HTTP — ¿cuál debo usar para scraping?
Ambos funcionan. SOCKS5 (puerto 1080) es agnóstico al protocolo y maneja cualquier tráfico TCP, lo que es conveniente para la automatización del navegador como Playwright. HTTP (puerto 3128) es la opción más simple para scripts basados en solicitudes. Elige el que mejor soporte tu cliente.
¿Puedo usar la lista de proxies gratuita para scraping en producción?
Mantenlo para pruebas. La lista gratuita agrega proxies de terceros de fuentes abiertas; se validan continuamente pero pueden desaparecer o ralentizarse en cualquier momento, y los usas bajo tu propio riesgo. Para trabajos confiables, usa los proxies de centro de datos autenticados de s4m.
¿Es legal el web scraping a través de un proxy?
Un proxy cambia qué IP ve un sitio; no otorga permiso. Siempre verifica los términos de servicio del objetivo y robots.txt, evita datos personales o protegidos por derechos de autor que no estás autorizado a recopilar, y mantén las tasas de solicitud razonables. Un proxy no es un sustituto para raspar de manera legal y ética.
Comienza a raspar sin exponer tu origen
Inicia proxies SOCKS5 y HTTP autenticados en centros de datos, o prototipa primero con la lista pública gratuita. Cuentas anónimas, sin registros por diseño, y solo pagas por los datos que mides.
Las personas encontraron esta página buscando
- cómo usar proxies para web scraping
- túnel dividido
- dirección IP para scraping
- dirección IP
- interruptor de apagado de VPN para scraping
- proxy para scraping
- lista de proxies gratuitos
- configuración de proxy
- doble VPN / multi-hop
- cómo usar un proxy con wget
Frases de búsqueda reales que esta página responde — los enlaces abren la página que las cubre en profundidad.