Proxy para coleta de dados públicos com responsabilidade
05 de outubro de 2026 · Proxy · Para empresas
Coleta de dados públicos (web scraping) é usar um programa para ler páginas abertas e organizar a informação, como preços, catálogos ou listas de produtos. O proxy ajuda a distribuir os pedidos e a ver a página como um visitante de certo país. Mas ele não muda o que é permitido: a responsabilidade continua sendo de quem coleta.
Antes de começar: pode coletar?
Responda estas perguntas antes de escrever a primeira linha de código:
- O site oferece uma API ou um arquivo para baixar os dados? Se sim, use. É mais estável, mais leve e combinado com o dono do site.
- O que dizem os termos de uso? Alguns sites proíbem coleta automatizada. Respeite.
- O que diz o arquivo robots.txt do site? Ele indica quais áreas o dono não quer que robôs acessem.
- Os dados exigem login? Dados atrás de login não são públicos. Não use conta para coletar o que você não poderia ver de outro jeito.
- Há dados pessoais? Nome, e-mail, telefone e perfis de pessoas entram na LGPD. Veja mais abaixo.
Ritmo: o site não é seu
Um script mal feito pode derrubar um site pequeno. Coletar com responsabilidade significa:
- Limitar a quantidade de pedidos por segundo e pôr pausas entre eles.
- Evitar os horários de pico do site.
- Guardar o que já baixou e não pedir a mesma página de novo sem necessidade.
- Identificar o seu robô de forma honesta no cabeçalho da requisição, quando possível.
- Parar se o site responder com erros de limite, em vez de insistir.
O proxy não serve para esconder um ritmo abusivo. Se o site pede para ir mais devagar, vá mais devagar.
Onde o proxy ajuda de verdade
- Ver a página como um visitante de outro país, com preço, moeda e idioma locais.
- Distribuir pedidos em ritmo normal sem que todos saiam do IP do seu servidor, que às vezes é de datacenter e recebe outra versão da página.
- Separar a coleta do seu IP de trabalho.
Que tipo de proxy usar
- Datacenter: o mais barato por GB e o mais rápido. Bom para sites que aceitam bem esse tipo de IP.
- Residencial: quando o site mostra conteúdo diferente para IPs de servidor, ou quando você precisa de uma cidade específica.
- Porta 823 (IP muda a cada pedido) para páginas independentes; portas a partir de 10000 (IP fixo por alguns minutos) quando a coleta precisa seguir várias páginas em sequência.
Coleta por script costuma gastar menos GB por página que um navegador, porque baixa só o HTML. Veja quanto GB de proxy você precisa.
Dados pessoais e LGPD
Dado público não é dado livre. Se a sua coleta pega informação de pessoas, a LGPD vale: você precisa de uma finalidade clara, de uma base legal, coletar só o necessário, guardar com segurança e apagar quando não precisar mais. Na dúvida, não colete dados de pessoas. Veja proxy e LGPD.
O que não fazer
- Coletar áreas que exigem login ou que o site bloqueia.
- Copiar conteúdo protegido para republicar como se fosse seu.
- Montar listas de contatos de pessoas para mandar mensagens que elas não pediram.
- Insistir quando o site recusa ou pede para parar.
Resumo
Proxy é ferramenta de rede, não autorização. Prefira API quando existir, leia os termos, respeite o robots.txt, vá devagar, colete só o necessário e trate dados pessoais com cuidado. Os preços do proxy por GB estão ao vivo em Proxy.
Perguntas frequentes
Usar proxy torna a coleta permitida?
Não. O proxy só muda o caminho da conexão. Termos de uso, robots.txt e a LGPD continuam valendo.
Qual proxy usar para coleta?
Datacenter quando o site aceita, por ser mais barato e rápido; residencial quando o site trata IPs de servidor de outro jeito.
Posso coletar dados de pessoas?
Só com finalidade clara e base legal na LGPD, coletando o mínimo necessário. Na dúvida, não colete.
Número na hora, com reembolso automático
Recarga por PIX a partir de R$ 5. Sem mensalidade.
Ver apps e preços