Comment utiliser des proxies pour le web scraping
Les proxies cachent le serveur d'origine de votre scraper et répartissent les requêtes sur plusieurs IP afin qu'une seule adresse ne soit pas limitée en taux ou bloquée. Ce guide couvre le choix des proxies et leur intégration dans Python, Scrapy et Playwright.
Pourquoi votre scraper a besoin d'un proxy
Deux problèmes motivent presque chaque configuration de scraping : protéger votre véritable IP et rester en dessous des limites de taux par IP.
Lorsque un crawler envoie des milliers de requêtes depuis une seule adresse, le site cible voit une seule IP se comporter comme un bot. Le résultat habituel est un ralentissement, un mur CAPTCHA, ou un blocage pur et simple — et pire, l'adresse bloquée est votre serveur d'origine, la machine qui exécute votre logique métier. Un proxy se trouve entre votre scraper et la cible, de sorte que le site ne voit jamais que l'IP de sortie du proxy, jamais la vôtre.
Deux préoccupations façonnent presque chaque configuration de scraping :
- Protéger votre origine. Si l'IP de votre serveur de production est mise sur liste noire, les dommages survivent au scraping. Le routage via un proxy garde cette adresse propre et non liée au crawl.
- Distribuer la charge. Répartir les requêtes sur plusieurs IP de sortie maintient chacune d'elles sous la limite de taux par IP du cible, vous permettant de collecter des données sans déclencher les défenses contre les abus.
s4m fournit des proxies SOCKS5 et HTTP authentifiés de datacenter pour exactement cela. Ils sont rapides et peu coûteux, ce qui convient aux cibles à volume élevé et tolérantes — mais comme ce sont des IP de datacenter, les sites stricts peuvent les identifier plus facilement que les adresses résidentielles, donc ajustez vos attentes en conséquence. Pour des expériences rapides, vous pouvez tirer des points de terminaison jetables de la liste publique de proxies gratuits, des proxies tiers validés en continu mais à utiliser strictement à vos propres risques. Si vous souhaitez également cacher une application ou un serveur entier plutôt qu'un seul client, un tunnel VPN couvre tout son trafic. Consultez les tarifs pour les tarifs de proxy mesurés.
Choisir des proxies pour le scraping
Associez l'outil à la tâche. Voici comment les options de s4m se comparent pour une charge de travail de scraping.
Datacenter SOCKS5 / HTTP
Proxies facturés à l'utilisation, payez au fur et à mesure sur proxy.s4m.online — port 1080 pour SOCKS5, 3128 pour HTTP, authentifiés avec USER:PASS. Rapide et rentable pour le crawling en masse de cibles qui ne notent pas agressivement la réputation IP. C'est le cheval de bataille pour le scraping en production.
Liste de proxies publics gratuits
Proxies tiers récoltés à partir de sources ouvertes et continuellement re-validés, filtrables par pays, protocole et anonymat. Idéal pour prototyper un scraper avant de vous engager financièrement — mais peu fiable et à vos risques et périls, jamais adapté aux travaux de production.
IP personnelle dédiée
Une IP statique optionnelle qui est uniquement la vôtre, liables à votre proxy et éventuellement non liée à votre identité. Utile lorsqu'une cible met sur liste blanche une seule adresse, ou lorsque vous avez besoin d'une session stable et persistante qui ne change jamais sous vous.
Intégrer et contrôler votre exploration
D'une première demande authentifiée aux sessions, à la rotation, aux limites de taux et au contrôle des coûts.
Dirigez votre client vers le proxy
Dans les requêtes Python, définissez le dictionnaire de proxies sur socks5://USER:PASS@proxy.s4m.online:1080 (installez requests[socks]) ou le point de terminaison HTTP sur 3128. Dans Scrapy, activez HttpProxyMiddleware et définissez le proxy par requête ou via la variable d'environnement http_proxy. Dans Playwright, passez proxy={"server": ...} à browser.launch().
Choisissez sessions vs rotation
Utilisez une session de requêtes persistante requests.Session — ou une IP personnelle dédiée — lorsque la cible lie les cookies et l'état de connexion à une IP, car changer en cours de session semble suspect. Faites tourner à travers de nombreuses IP de sortie lors de l'exploration de listes publiques, pour rester sous les limites par IP. Ne mélangez pas les deux pour la même identité logique.
Ralentissez et respectez la cible
Respectez robots.txt, lisez les conditions de service du site et ajoutez des délais : time.sleep dans les requêtes, DOWNLOAD_DELAY et AutoThrottle dans Scrapy. Des taux de requêtes constants, à l'échelle humaine, sont bloqués beaucoup moins souvent que des pics — scraper de manière responsable est à la fois le choix éthique et le choix efficace.
Limitez vos dépenses
Parce que les proxys de centre de données sont mesurés, surveillez l'utilisation. s4m permet aux administrateurs de définir des limites sur trois axes — par type de compte, par IP et par compte — afin qu'un crawler incontrôlé ne puisse pas brûler discrètement votre budget. Fixez un plafond par compte avant de lancer un gros travail.
Python : scraper via le proxy s4m
Un scraper de requêtes minimal et poli qui sort par votre proxy de datacenter s4m au lieu de votre serveur d'origine.
import time
import requests
# s4m datacenter proxy endpoints:
# SOCKS5 -> proxy.s4m.online:1080 (pip install "requests[socks]")
# HTTP -> proxy.s4m.online:3128
PROXY = "socks5://USER:PASS@proxy.s4m.online:1080"
# PROXY = "http://USER:PASS@proxy.s4m.online:3128"
session = requests.Session()
session.proxies.update({"http": PROXY, "https": PROXY})
session.headers.update(
{"User-Agent": "my-scraper/1.0 (+contact@example.com)"}
)
# Confirm requests now exit through the proxy, not your real IP:
print("exit IP:", session.get("https://api.ipify.org", timeout=15).text)
for page in range(1, 6):
r = session.get(f"https://example.com/list?page={page}", timeout=20)
r.raise_for_status()
# ... parse r.text here ...
time.sleep(1.5) # throttle: stay within the target's rate limits
Questions, réponses
Les proxies s4m sont-ils résidentiels ?
Non. s4m fournit des proxies SOCKS5 et HTTP de datacenter authentifiés. Ils sont rapides et rentables, mais comme ce sont des IP de datacenter, les sites qui évaluent la réputation des IP peuvent les détecter plus facilement que les adresses résidentielles. Nous ne vendons pas et ne revendiquons pas de proxies résidentiels.
Puis-je faire tourner les IP automatiquement ?
Vous gérez la rotation de votre côté en alternant les demandes ou les sessions. Pour une sortie fixe et non rotative, ajoutez une IP personnelle dédiée et liez-la à votre proxy. Associez l'une ou l'autre approche avec les limites d'utilisation par IP et par compte de s4m pour garder le comportement et le coût prévisibles.
SOCKS5 ou HTTP — lequel devrais-je utiliser pour le scraping ?
Les deux fonctionnent. SOCKS5 (port 1080) est agnostique au protocole et gère tout le trafic TCP, ce qui est pratique pour l'automatisation de navigateur comme Playwright. HTTP (port 3128) est le meilleur ajustement pour des scripts basés sur des requêtes simples. Choisissez celui que votre client supporte le mieux.
Puis-je utiliser la liste de proxies gratuite pour le scraping en production ?
Gardez-le pour les tests. La liste gratuite agrège des proxies tiers provenant de sources ouvertes ; ils sont validés en continu mais peuvent disparaître ou ralentir à tout moment, et vous les utilisez à vos propres risques. Pour des travaux fiables, utilisez les proxies de datacenter authentifiés de s4m.
Le scraping web à travers un proxy est-il légal ?
Un proxy change l'adresse IP qu'un site voit ; il ne donne pas de permission. Vérifiez toujours les conditions d'utilisation et le robots.txt de la cible, évitez les données personnelles ou protégées par des droits d'auteur que vous n'êtes pas autorisé à collecter, et maintenez des taux de demande raisonnables. Un proxy n'est pas un substitut à un scraping légal et éthique.
Commencez à scraper sans exposer votre origine
Lancez des proxies SOCKS5 et HTTP authentifiés de datacenter, ou prototypez d'abord avec la liste publique gratuite. Comptes anonymes, sans journaux par conception, et vous ne payez que pour les données que vous mesurez.
Les gens ont trouvé cette page en recherchant
- comment utiliser des proxies pour le web scraping
- tunnelage divisé
- adresse IP pour le scraping
- adresse IP
- interrupteur d'arrêt VPN pour le scraping
- proxy pour le scraping
- liste de proxies gratuits
- configuration du proxy
- double VPN / multi-hop
- comment utiliser un proxy avec wget
Vraies phrases de recherche auxquelles cette page répond — les liens ouvrent la page qui les couvre en profondeur.