← Blog

Proxy para coleta de dados públicos com responsabilidade

05 de outubro de 2026 · Proxy · Para empresas

Coleta de dados públicos (web scraping) é usar um programa para ler páginas abertas e organizar a informação, como preços, catálogos ou listas de produtos. O proxy ajuda a distribuir os pedidos e a ver a página como um visitante de certo país. Mas ele não muda o que é permitido: a responsabilidade continua sendo de quem coleta.

Antes de começar: pode coletar?

Responda estas perguntas antes de escrever a primeira linha de código:

  • O site oferece uma API ou um arquivo para baixar os dados? Se sim, use. É mais estável, mais leve e combinado com o dono do site.
  • O que dizem os termos de uso? Alguns sites proíbem coleta automatizada. Respeite.
  • O que diz o arquivo robots.txt do site? Ele indica quais áreas o dono não quer que robôs acessem.
  • Os dados exigem login? Dados atrás de login não são públicos. Não use conta para coletar o que você não poderia ver de outro jeito.
  • Há dados pessoais? Nome, e-mail, telefone e perfis de pessoas entram na LGPD. Veja mais abaixo.

Ritmo: o site não é seu

Um script mal feito pode derrubar um site pequeno. Coletar com responsabilidade significa:

  • Limitar a quantidade de pedidos por segundo e pôr pausas entre eles.
  • Evitar os horários de pico do site.
  • Guardar o que já baixou e não pedir a mesma página de novo sem necessidade.
  • Identificar o seu robô de forma honesta no cabeçalho da requisição, quando possível.
  • Parar se o site responder com erros de limite, em vez de insistir.

O proxy não serve para esconder um ritmo abusivo. Se o site pede para ir mais devagar, vá mais devagar.

Onde o proxy ajuda de verdade

  • Ver a página como um visitante de outro país, com preço, moeda e idioma locais.
  • Distribuir pedidos em ritmo normal sem que todos saiam do IP do seu servidor, que às vezes é de datacenter e recebe outra versão da página.
  • Separar a coleta do seu IP de trabalho.

Que tipo de proxy usar

  • Datacenter: o mais barato por GB e o mais rápido. Bom para sites que aceitam bem esse tipo de IP.
  • Residencial: quando o site mostra conteúdo diferente para IPs de servidor, ou quando você precisa de uma cidade específica.
  • Porta 823 (IP muda a cada pedido) para páginas independentes; portas a partir de 10000 (IP fixo por alguns minutos) quando a coleta precisa seguir várias páginas em sequência.

Coleta por script costuma gastar menos GB por página que um navegador, porque baixa só o HTML. Veja quanto GB de proxy você precisa.

Dados pessoais e LGPD

Dado público não é dado livre. Se a sua coleta pega informação de pessoas, a LGPD vale: você precisa de uma finalidade clara, de uma base legal, coletar só o necessário, guardar com segurança e apagar quando não precisar mais. Na dúvida, não colete dados de pessoas. Veja proxy e LGPD.

O que não fazer

  • Coletar áreas que exigem login ou que o site bloqueia.
  • Copiar conteúdo protegido para republicar como se fosse seu.
  • Montar listas de contatos de pessoas para mandar mensagens que elas não pediram.
  • Insistir quando o site recusa ou pede para parar.

Resumo

Proxy é ferramenta de rede, não autorização. Prefira API quando existir, leia os termos, respeite o robots.txt, vá devagar, colete só o necessário e trate dados pessoais com cuidado. Os preços do proxy por GB estão ao vivo em Proxy.

Perguntas frequentes

Usar proxy torna a coleta permitida?

Não. O proxy só muda o caminho da conexão. Termos de uso, robots.txt e a LGPD continuam valendo.

Qual proxy usar para coleta?

Datacenter quando o site aceita, por ser mais barato e rápido; residencial quando o site trata IPs de servidor de outro jeito.

Posso coletar dados de pessoas?

Só com finalidade clara e base legal na LGPD, coletando o mínimo necessário. Na dúvida, não colete.

Número na hora, com reembolso automático

Recarga por PIX a partir de R$ 5. Sem mensalidade.

Ver apps e preços
Proxy para coleta de dados públicos com responsabilidade · Sinallo