O que é web scraping
Web scraping — em português, raspagem de dados — é a extração automatizada de informações de páginas da web. Um programa acessa as páginas, lê o conteúdo e organiza os dados desejados em formato estruturado, como uma planilha ou um banco de dados, pronto para análise.
O ponto essencial: a técnica em si é neutra. O que a torna legítima ou abusiva é o que se coleta, de onde e para quê — e é essa distinção que este artigo destrincha.
Como funciona, em 3 etapas
- Requisitar — o bot acessa a página da mesma forma que um navegador faria, recebendo o código HTML;
- Interpretar — o programa lê esse código e localiza os campos de interesse: nome do produto, preço, descrição, avaliações;
- Extrair — os dados são salvos em formato estruturado, e o ciclo se repete automaticamente para centenas ou milhares de páginas.
É a automação que dá escala: o que uma pessoa levaria semanas copiando e colando, um scraper faz em horas. Quando o site oferece uma API, ela é o caminho correto para obter os mesmos dados — estruturados, autorizados e sem sobrecarregar as páginas.
Scraping ≠ crawling
Os termos andam juntos, mas não são sinônimos. Crawling é percorrer e descobrir páginas em escala — é o que o Googlebot faz para indexar a web. Scraping é extrair dados específicos dessas páginas para reutilização.
Na prática, um scraper geralmente embute um crawler: primeiro descobre as páginas-alvo, depois extrai o que interessa de cada uma. O buscador rastreia para referenciar seu conteúdo (e te mandar tráfego); o scraper malicioso rastreia para copiá-lo.
Usos legítimos
- Monitoramento de preços — e-commerces acompanham a concorrência para ajustar precificação;
- Pesquisa de mercado — coleta de avaliações e tendências públicas para análise;
- Comparadores — sites de passagens, hotéis e produtos agregam ofertas de várias fontes;
- Auditorias de SEO — ferramentas rastreiam sites para diagnosticar títulos, links quebrados e estrutura em escala;
- Agregadores — portais de vagas e notícias reúnem conteúdo de origens diversas, com atribuição.
Quando vira abuso
O mesmo mecanismo alimenta práticas que causam prejuízo real: clonagem de conteúdo (textos inteiros republicados em outros domínios, competindo com o original no Google), cópia de catálogos para lojas falsas que enganam consumidores com preços irreais, coleta de e-mails para spam e raspagem de dados pessoais sem consentimento.
Além disso, um scraping tecnicamente agressivo — milhares de requisições em poucos minutos — pode sobrecarregar servidores de menor capacidade e degradar o site para os visitantes reais, mesmo sem intenção de ataque.
O que diz a lei (e a LGPD)
Não existe uma lei que proíba "scraping" em si — a legalidade depende do objeto e do uso. Três limites principais valem no Brasil:
- Direitos autorais — copiar e republicar conteúdo protegido é violação, com ou sem automação;
- LGPD — coletar dados pessoais (nomes, e-mails, perfis) exige base legal, mesmo que os dados estejam publicamente acessíveis;
- Termos de uso — muitos sites proíbem acesso automatizado em seus termos, e violá-los pode gerar responsabilização.
"O scraping não é o vilão nem o herói da história. É uma ferramenta de escala — e escala amplifica tanto a análise legítima quanto o abuso."
O papel do robots.txt
O robots.txt é um arquivo público, na raiz do site, que indica aos robôs quais áreas podem ou não ser acessadas. Bots legítimos — como o Googlebot, documentado no Google Search Central — respeitam essas regras.
Scrapers maliciosos, por definição, as ignoram. Por isso o robots.txt deve ser entendido como sinalização, não proteção: ele organiza o acesso dos bots bem-comportados, mas não impede os demais.
Como proteger o seu site
- Limite de taxa (rate limiting) — bloquear IPs que fazem requisições em volume anormal;
- Detecção de bots — CDNs e firewalls de aplicação (WAF) identificam padrões automatizados;
- CAPTCHA — em formulários e áreas sensíveis, barra automação simples;
- Monitoramento — acompanhar picos de tráfego anômalos no analytics e nos logs do servidor.
Essas camadas fazem parte do que chamamos de site blindado — proteção pensada desde a construção, não remendada depois do problema.
Como saber se seu conteúdo foi copiado
Três verificações simples: buscar no Google trechos exatos dos seus textos entre aspas (cópias publicadas aparecem nos resultados); observar quedas bruscas de posicionamento em páginas antes estáveis, que podem indicar conteúdo duplicado competindo com o seu; e revisar o analytics e os logs em busca de padrões de acesso automatizado. Confirmada a cópia, o caminho é notificar o site infrator e, se necessário, reportar a violação ao Google para remoção dos resultados.
Perguntas frequentes
O que é web scraping?
É a extração automatizada de dados de páginas da web. Um programa acessa as páginas, lê o conteúdo e organiza as informações desejadas em formato estruturado — planilha ou banco de dados — para análise posterior.
Qual a diferença entre web scraping e web crawling?
Crawling é percorrer e descobrir páginas em escala, como faz o Googlebot para indexar a web. Scraping é extrair dados específicos dessas páginas. Um scraper geralmente usa um crawler para chegar às páginas de onde vai extrair informação.
Web scraping é legal?
Depende do que se coleta e de como se usa. Coletar dados públicos para análise pode ser legítimo; copiar conteúdo protegido por direitos autorais, violar termos de uso ou coletar dados pessoais sem base legal (LGPD) não é.
Quais são os usos legítimos do web scraping?
Monitoramento de preços da concorrência, pesquisa de mercado, comparadores de produtos e passagens, auditorias de SEO em escala, agregadores de notícias e vagas, e pesquisa acadêmica são exemplos comuns de uso legítimo.
Como o web scraping funciona na prática?
Em três etapas: o programa requisita a página (como um navegador faria), interpreta o código HTML recebido e extrai os campos de interesse — nome, preço, descrição —, salvando tudo em formato estruturado. O ciclo se repete para milhares de páginas.
O que é raspagem maliciosa?
É o uso do scraping para copiar conteúdo inteiro de sites e republicá-lo, clonar catálogos de produtos para enganar consumidores, coletar e-mails para spam ou coletar dados pessoais sem consentimento — práticas que causam prejuízo real às empresas.
Scraping pode derrubar um site?
Um scraping agressivo, com milhares de requisições em pouco tempo, pode sobrecarregar servidores de menor capacidade e degradar o site para visitantes reais. Por isso scrapers responsáveis limitam a frequência de requisições — e sites se protegem com limites de taxa.
Como proteger meu site de scraping abusivo?
Com limite de taxa de requisições, bloqueio de bots conhecidos, CAPTCHA em áreas sensíveis, monitoramento de tráfego anômalo e serviços de proteção como firewalls de aplicação (WAF) e CDNs com detecção de bots.
O que é o robots.txt e o que ele tem a ver com scraping?
É um arquivo público que indica aos robôs quais áreas do site podem ou não ser acessadas. Bots legítimos, como o Googlebot, respeitam essas regras; scrapers maliciosos costumam ignorá-las — por isso ele é uma sinalização, não uma proteção.
Como sei se meu conteúdo foi copiado por scraping?
Buscar trechos exatos dos seus textos no Google entre aspas revela cópias publicadas. Quedas bruscas de posicionamento em páginas antes estáveis e picos de tráfego de origem estranha no analytics também são sinais de alerta.