Pular para o conteúdo
Lebtaglebtag

RPA e web scraping sob medida

Existe uma categoria inteira de trabalho que só continua manual porque o sistema do outro lado não tem API: baixar arquivo de portal de governo, consultar um cadastro público, extrair dado de um fornecedor que só oferece tela.

RPA e web scraping resolvem exatamente isso — um robô faz o que uma pessoa faria no navegador, só que sem cansar, sem errar de digitação e sem esquecer que hoje é dia de rodar.

Quando faz sentido

  • Portal sem API

    Órgão público, banco, fornecedor ou marketplace que só oferece interface web e nenhuma integração.

  • Coleta repetitiva em escala

    Consultar centenas de registros por dia, um a um, para montar uma base.

  • Download recorrente de documento

    Nota fiscal, boleto, extrato ou certidão que alguém baixa manualmente toda semana.

  • Monitoramento de mudança

    Preço, disponibilidade, edital ou situação cadastral que precisa ser acompanhada de perto.

Como fazemos

  1. 01

    Verificamos o que é permitido antes de escrever código

    Termos de uso, robots.txt e limites de requisição. Robô que ignora isso derruba o serviço do outro lado, queima o IP e vira problema jurídico. Onde existe API oficial, usamos a API.

  2. 02

    Construímos o coletor tolerante a falha

    Portal cai, muda o layout e trava sem avisar. O robô precisa tentar de novo, respeitar ritmo e registrar o que conseguiu — falha vira lacuna anotada, não erro que trava tudo.

  3. 03

    Normalizamos o dado na saída

    Coletar é metade; a outra metade é entregar em formato consistente, com tipos corretos e duplicata resolvida, pronto para o seu sistema consumir.

  4. 04

    Guardamos a evidência

    Print, arquivo original e horário da coleta. Em processo que precisa de comprovação — fiscal, crédito, auditoria — o dado sem evidência não vale.

O que você recebe

  • Robô em produção com agendamento e monitoramento
  • Dados normalizados no formato que seu sistema consome
  • Evidência da coleta guardada para auditoria
  • Tratamento de falha, retentativa e alerta
  • Documentação do que o robô faz e onde ele pode quebrar

Onde já aplicamos

No Hubfiscal, o sistema baixa notas fiscais direto da Receita, com o certificado digital ficando na máquina do escritório. Na pré-análise de crédito, a coleta em sete fontes distintas — que consumia quase um dia útil de um analista — passou a rodar sozinha, com print e arquivo anexados ao laudo.

Dúvidas sobre RPA e scraping

Web scraping é legal?

Depende do que se coleta e de como. Dado público, coletado em ritmo que não prejudica o serviço e respeitando os termos de uso, é prática comum. Dado pessoal entra no escopo da LGPD e exige base legal. Contornar autenticação ou bloqueio é outra história, e não fazemos. Essa análise é a primeira etapa do projeto, antes de qualquer linha de código.

E se o site mudar o layout?

Vai mudar — é questão de quando. Por isso construímos com seletores resilientes e alerta de quebra: quando o coletor para de encontrar o que esperava, você é avisado em vez de descobrir semanas depois que a base está desatualizada. Manutenção faz parte do ciclo de vida de qualquer robô.

Vocês precisam das minhas senhas?

Quando o portal exige login, sim — e é por isso que a arquitetura importa. No Hubfiscal, o certificado digital do escritório nunca sobe para a nuvem: fica na máquina do cliente e só o resultado da operação trafega. Esse padrão pode ser aplicado em qualquer coleta autenticada.

Outros serviços