Raspando a Amazon: Proxies, Cabeçalhos e Limites de Taxa
A Amazon é um dos sites mais raspados da web e um dos mais defensivos. Coletar preços, avaliações ou dados de catálogo em grande escala significa distribuir solicitações, enviar cabeçalhos realistas e lidar com os CAPTCHAs e páginas de bot que a Amazon devolve. Aqui está um guia prático e honesto.
Como a Amazon combate scrapers
A Amazon defende seu catálogo com detecção em camadas: limites de taxa por IP, a página CAPTCHA "Verificação de Robô" / "Digite os caracteres que você vê", páginas de erro de cachorro, TLS e impressão digital de cabeçalho, e verificações comportamentais. Atacar páginas de produtos de um único endereço e você rapidamente verá CAPTCHAs, depois limitações ou bloqueios. O site também varia páginas por região e testa layouts A/B, então seu parser deve tolerar mudanças.
Duas advertências honestas antes de você começar. Os termos da Amazon proíbem scraping, e a Amazon oferece rotas oficiais — a API de Publicidade de Produtos e a API de Parceiro de Vendas — para acesso a dados aprovado; considere essas primeiro. E nenhum setup faz scraping da Amazon de forma confiável para sempre; o objetivo é uma taxa de coleta sustentável, não invisibilidade. Para os casos de uso comuns de e-commerce — monitoramento de preços, pesquisa competitiva — veja nossas páginas de monitoramento de preços e proxy da Amazon.
Uma configuração de raspagem sustentável
A abordagem vencedora imita muitos compradores comuns:
- Gire um pool de proxies para que nenhum IP exceda a tolerância da Amazon. Esta é a principal defesa contra a limitação por IP.
- Envie cabeçalhos completos e realistas — User-Agent, Accept, Accept-Language, e mantenha-os internamente consistentes. Um cabeçalho padrão de requisições é um sinal instantâneo.
- Ritmo com jitter — atrasos aleatórios superam intervalos fixos. Prefira um fluxo constante em vez de explosões.
- Fixe uma região — use um país de saída e um Accept-Language e código postal correspondentes para que os preços e a disponibilidade sejam consistentes; mudar de regiões durante a execução embaralha seus dados.
- Detecte a página do bot — verifique os marcadores de CAPTCHA / Verificação de Robô e afaste-se desse IP em vez de analisar dados ruins.
- Use um navegador sem cabeça apenas quando necessário — grande parte de uma página de produto está no HTML inicial; reserve ferramentas mais pesadas para seções renderizadas em JS.
A Amazon classifica IPs de datacenter, então a raspagem agressiva é um caso em que proxies residenciais muitas vezes sobrevivem mais tempo. s4m vende proxies de datacenter; um IP dedicado oferece uma região estável para coleta de preços consistentes em volumes modestos, mas seja realista sobre a detecção de datacenter em alto volume.
Busque uma página de produto através de um proxy
Roteie através de um proxy s4m com um conjunto completo de cabeçalhos e detecte a página de bot da Amazon para que você possa rotacionar em vez de analisar um erro.
import requests
proxies = {
"http": "http://USER:PASS@proxy.s4m.online:3128",
"https": "http://USER:PASS@proxy.s4m.online:3128",
}
headers = {
"User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
"AppleWebKit/537.36 (KHTML, like Gecko) "
"Chrome/122.0 Safari/537.36",
"Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
"Accept-Language": "en-US,en;q=0.9",
}
r = requests.get("https://www.amazon.com/dp/B0EXAMPLE",
headers=headers, proxies=proxies, timeout=20)
if "api-services-support@amazon.com" in r.text or "Robot Check" in r.text:
raise RuntimeError("Hit Amazon bot page - rotate IP and back off")
parse_product(r.text) # your parserPerguntas, respondidas
É permitido fazer scraping no Amazon?
As Condições de Uso da Amazon proíbem scraping, e pode haver risco legal dependendo da jurisdição e dos dados. A Amazon fornece APIs oficiais (API de Publicidade de Produtos, API de Parceiro de Vendas) para acesso aprovado. Considere essas primeiro e obtenha aconselhamento jurídico para qualquer coisa em grande escala.
Por que meus preços na Amazon continuam mudando entre as solicitações?
A Amazon localiza preços e disponibilidade por região e realiza testes A/B. Se seu pool de proxies sai de diferentes países, você coletará dados inconsistentes. Fixe uma região de saída e um Accept-Language e código postal correspondentes, e um IP dedicado ajuda a mantê-lo estável.
Os proxies de datacenter funcionam para a Amazon?
Para coleta modesta e bem controlada, muitas vezes sim. A Amazon classifica faixas de datacenter, então em alto volume você verá mais CAPTCHAs do que com IPs residenciais. s4m vende proxies de datacenter; rotação, ritmo e cabeçalhos realistas importam tanto quanto o tipo de IP, mas nenhuma configuração é à prova de bloqueios.
Raspar dados de e-commerce de forma limpa
Roteie a coleta de produtos e preços através de proxies de datacenter s4m autenticados, fixe uma região com um IP dedicado e distribua suas tarefas. Contas anônimas pagas conforme o uso, criptomoedas aceitas.
As pessoas encontraram esta página pesquisando por
- raspando a Amazon
- raspando a Amazon para android
- como testar vazamentos de DNS
- como configurar raspando a Amazon
- como verificar raspando a Amazon
- endereço IP
- proxies de datacenter vs residenciais vs móveis
- melhor interruptor de desligamento vpn 2026
- quanto tempo os proxies gratuitos duram
- lista de proxies gratuitos
Frases de busca reais que esta página responde — os links abrem a página que as cobre em profundidade.