Geonode logo
Geonode Team

Geonode Team

Atualizado: 7 de outubro de 2026

Publicado: 2 de setembro de 2026

Como criar um site agregador: um guia prático

Um agregador é um site cujo valor provém do conteúdo de outras pessoas, organizado de forma mais eficaz do que elas próprias o organizaram. Empregos, imóveis, preços, notícias, eventos. Os desafios interessantes não são de natureza técnica. Obter os dados é a parte fácil; deduplicá-los, mantê-los atualizados e cumprir a lei são os aspetos que levam ao fracasso dos projetos. Este guia abrange todo o processo — fontes de dados por ordem de preferência, a vertente jurídica, a arquitetura e os modos de falha.

A nossa posição: somos a Geonode e vendemos proxies, que constituem um dos elementos de entrada de um agregador e aquele a que a maioria dos guias dá demasiada importância. Por isso, vamos ser sinceros desde já — os proxies são a última coisa que deve comprar, não a primeira. Uma grande parte dos dados agregáveis está disponível através de feeds, APIs e mapas de site que são gratuitos, estruturados, estáveis e oferecidos explicitamente para este fim. Criar um rastreador para conteúdo que alguém publica como um feed RSS é um desperdício de trabalho, e comprar largura de banda antes de teres descoberto isso é um desperdício de dinheiro. Os proxies tornam-se relevantes num momento específico — quando se está a rastrear em grande volume, a partir de várias regiões, em sites que limitam a taxa de acesso — e esse momento surge mais tarde do que a maioria das pessoas supõe. Há uma secção abaixo que explica exatamente onde está esse limite.

Que tipo de agregador: quatro modelos

Estes apresentam dinâmicas económicas e riscos legais diferentes, e confundir os uns com os outros é o primeiro erro.

Agregadores de links recolhem títulos e redirecionam para sites externos. Baixo consumo de espaço de armazenamento, baixo risco legal e baixo custo de mudança para os utilizadores. O valor reside inteiramente na curadoria e na rapidez. Os agregadores de notícias e conteúdos enquadram-se, na sua maioria, nesta categoria.

Os agregadores de listagens recolhem registos estruturados — empregos, imóveis, automóveis, eventos — e apresentam-nos como uma base de dados pesquisável. Maior valor, maior esforço e o modelo em que a deduplicação se torna o principal desafio de engenharia.

Agregadores de preços acompanham o mesmo artigo em diferentes vendedores. O modelo mais restrito e complexo: fazer a correspondência de produtos entre retalhistas que os descrevem de forma diferente é um problema genuinamente difícil, e os requisitos de atualização são rigorosos, porque um preço desatualizado é pior do que a ausência de preço.

Agregadores de críticas e classificações combinam dados de opinião. Cobertura escassa, trabalho intenso de normalização e os mais expostos a acusações de deturpação da fonte.

Escolha um deliberadamente. A arquitetura difere, a análise jurídica difere e «um agregador para tudo» é a forma como os projetos se tornam impossíveis de concluir.

Comece por obter os dados da forma mais fácil

Por ordem de preferência. Vá percorrendo esta lista e pare assim que encontrar algo que funcione.

APIs oficiais. Se a fonte publicar uma, utilize-a. É estável, estruturada, aprovada e alguém irá corrigi-la caso deixe de funcionar. Leia os termos — a maioria restringe a redistribuição, a duração do armazenamento em cache e a utilização comercial, e essas restrições moldam o seu produto.

Feeds de parceiros ou afiliados. Muitos setores publicam feeds em massa especificamente para agregadores, porque estes lhes enviam tráfego. Portais de emprego, portais imobiliários, retalhistas e operadores de viagens têm frequentemente um programa de parceria que lhe fornece o conjunto de dados completo. Esta é a fonte mais subutilizada neste domínio, e a razão é que as pessoas pesquisam «como extrair dados de X» em vez de enviar um e-mail a X para perguntar se têm um feed. Pergunte. Um número surpreendente responde que sim.

Feeds RSS e Atom. Ainda amplamente publicados, continuam a ser ideais para a agregação de links. Estão estruturados, são económicos, foram concebidos exatamente para este fim e são oferecidos de forma inequívoca para consumo.

Mapas do site. O sitemap.xml fornece-lhe uma lista completa de URLs, além de registos de data e hora lastmod, o que permite que faça o rastreio de forma eficiente, em vez de recorrer à força bruta. Mesmo quando for necessário rastrear, o mapa do site indica-lhe o que mudou, para que apenas recupere esses dados.

Dados estruturados na página. Antes de escrever analisadores HTML, verifique se existe JSON-LD num bloco <script type="application/ld+json">. A marcação Schema.org para JobPosting, Product, Event e Recipe é amplamente utilizada porque impulsiona funcionalidades de pesquisa e fornece dados estruturados e limpos a partir de uma página que iria aceder de qualquer forma. Além disso, resiste a reformulações de design muito melhor do que os seletores CSS.

Análise de HTML. Último recurso. Frágil, exige muita manutenção e é o que transforma um agregador num trabalho a tempo inteiro.

A ordem é mais importante do que qualquer item individual. As equipas que começam no fim desta lista criam um rastreador e só descobrem o feed seis meses depois.

Quando é necessário fazer o rastreamento: o robots.txt é agora uma norma O ficheiro

robots.txt deixou de ser uma convenção em 2022. A RFC 9309 normaliza o Protocolo de Exclusão de Robôs e, se estiver a desenvolver um rastreador, define o comportamento que deve implementar.

Quatro requisitos que vale a pena conhecer com precisão:

A correspondência é feita por especificidade, não por ordem. «A correspondência mais específica encontrada DEVE ser utilizada. A correspondência mais específica é aquela que tem o maior número de octetos.» Não se aplica o princípio de «a primeira correspondência vence», que é o que muitos analisadores criados manualmente assumem.

O cache não deve exceder 24 horas. «Os rastreadores NÃO DEVEM utilizar a versão em cache por mais de 24 horas, a menos que o ficheiro robots.txt esteja inacessível.» Obtê-lo uma única vez no momento da implementação não está em conformidade.

Erros de servidor significam parar. «Se o ficheiro robots.txt estiver inacessível devido a erros de servidor ou de rede...... o rastreador DEVE assumir uma proibição total.» Um código 5xx significa afastar-se completamente. Um 404, em contrapartida, significa que não há restrições — não existe ficheiro, pelo que nada é proibido.

Analise pelo menos 500 KiB. «O limite de análise DEVE ser de, pelo menos, 500 kibibytes.» Sites de grande dimensão têm ficheiros de grande dimensão.

Utilize uma biblioteca atualizada em vez de escrever o código sozinho. A regra de correspondência de especificidade, por si só, é uma fonte comum de erros, e um rastreador que interprete incorretamente um «robots.txt» é um rastreador que gera reclamações.

Para além do próprio ficheiro, as cortesias habituais: identifique-se com um agente de utilizador real que inclua um URL de contacto, respeite o Crawl-delay quando estiver presente, desista imediatamente em caso de 429 e 503, e utilize a cache para nunca ir buscar conteúdo inalterado duas vezes. Os pedidos condicionais com If-Modified-Since ou If-None-Match não custam nada à fonte nem a si. A maioria dos sites que bloqueiam agregadores fá-lo devido ao comportamento, não à existência.

A vertente jurídica: direitos de autor, exclusões do TDM e direitos sobre bases de dados

Isto não constitui aconselhamento jurídico, e a jurisdição tem uma importância enorme. No entanto, há quatro aspetos que vale a pena compreender antes de se iniciar o desenvolvimento.

Os factos, em geral, não são passíveis de direitos de autor; a expressão, sim. Um cargo, um salário, um preço e uma data são factos. A descrição redigida para promover a vaga é uma expressão. Agregar os primeiros assenta em bases muito mais sólidas do que reproduzir a segunda. Esta distinção simples determina a conceção mais sensata de um agregador: armazenar os factos estruturados e incluir um link para a fonte no que diz respeito ao texto.

O comprimento dos excertos é importante. Reproduzir um título e uma frase com um link é uma situação diferente de reproduzir um artigo. Várias jurisdições já debateram em tribunal onde se situa a linha divisória, e as respostas divergem. Quanto mais curto, mais seguro; e criar um link em vez de reproduzir o conteúdo é a opção mais segura.

A UE dispõe de uma cláusula de exclusão para a mineração de texto e dados que é, por definição, legível por máquinas. O artigo 4.º da Diretiva (UE) 2019/790 permite a mineração de texto e dados por qualquer pessoa, desde que os titulares dos direitos não tenham reservado expressamente os seus direitos «de forma adequada, por exemplo, utilizando meios legíveis por máquina». No que diz respeito a conteúdos disponibilizados publicamente em linha, a diretiva considera a reserva legível por máquina — «incluindo metadados e termos e condições de um sítio Web ou de um serviço» — como a via adequada. A exceção exige também que o material tenha sido acedido legalmente.

A implicação prática para um rastreador: as reservas expressas de forma legível por máquina devem ser respeitadas, e a UE tem vindo a trabalhar no sentido de normalizar os protocolos para as expressar. Criar um rastreador que ignore as reservas legíveis por máquina é incorporar um problema de conformidade nas suas bases.

A UE também dispõe de um direito específico relativo às bases de dados. Para além dos direitos de autor, a Diretiva relativa às bases de dados criou um direito sui generis que protege o investimento substancial na obtenção, verificação ou apresentação do conteúdo de uma base de dados — independentemente de o próprio conteúdo ser ou não passível de direitos de autor. Isto é diretamente relevante para os agregadores, porque extrair uma parte substancial da base de dados de anúncios de alguém pode envolver esse direito, mesmo quando cada anúncio individual constitui um simples facto.

Depois, há os termos de serviço, que são de natureza contratual e não legal, e que muitos sites utilizam para proibir totalmente o acesso automatizado. Se um termo o vincula mesmo que nunca tenha clicado em nada é uma questão genuinamente contestada que varia consoante a jurisdição. Leia-os na mesma: eles indicam-lhe o que o site fará a esse respeito, o que é frequentemente mais relevante no momento do que o que um tribunal diria.

O resumo pragmático: dê preferência a fontes autorizadas, guarde factos em vez de texto, crie ligações em vez de reproduzir, respeite as restrições legíveis por máquina e procure aconselhamento para qualquer assunto de importância comercial.

Arquitetura: Quatro fases e a mais difícil

Todos os agregadores passam pelas mesmas quatro fases, e apenas uma delas é difícil.

Recolha. Obter o conteúdo bruto. Questões a considerar: agendamento, limitação de taxa, novas tentativas, armazenamento em cache, pedidos condicionais. Guarde sempre a resposta bruta — quando um analisador falhar, é preferível voltar a analisar os dados históricos em vez de os voltar a recolher.

Análise. Transformar o conteúdo bruto em registos estruturados. Aspetos a ter em conta: fragilidade e deteção de alterações. Alerte quando o formato da saída de um analisador se alterar, em vez de quando este lança um erro, porque a falha mais dispendiosa é um analisador que, silenciosamente, começa a devolver menos campos.

Normalizar e deduplicar. A etapa mais difícil. Detalhada abaixo.

Servir. Pesquisar, filtrar, apresentar. Engenharia web padrão e a parte em que a maioria das equipas investe excessivamente na fase inicial, porque é a parte visível.

A deduplicação é o que determina o sucesso ou o fracasso dos agregadores. A mesma oferta de emprego é publicada em quatro portais com títulos diferentes. O mesmo imóvel aparece através de três agentes a preços diferentes. O mesmo produto tem um nome diferente em cada retalhista. Os utilizadores julgam-no quase exclusivamente com base nisto: um site de listagens que mostra a mesma coisa seis vezes parece defeituoso, independentemente de quão completo seja.

A abordagem que funciona é em camadas, começando pelo mais barato:

Identificadores exatos. ISBNs, números de peça, números de registo, IDs de origem. Sempre que existirem, utilize-os e pare por aí — resolvem o problema na totalidade.

Chaves normalizadas. Crie uma chave canónica a partir de campos em minúsculas, sem espaços em branco e sem pontuação: entidade patronal mais cargo mais localização; código postal mais número de quartos mais área útil. Abrange uma grande parte de forma económica.

Correspondência aproximada. Semelhança baseada em tokens em títulos e descrições, com um limiar que ajusta com base numa amostra rotulada manualmente. É necessário e dispendioso; restrinja-o a candidatos que já partilhem uma chave aproximada, ou tornar-se-á uma comparação entre todos os pares que não poderá suportar financeiramente.

Revisão manual para os casos ambíguos. Aceite que uma parte precisa de intervenção humana. Crie a fila antecipadamente, em vez de o fazer só depois de os utilizadores se queixarem.

Duas decisões de conceção que poupam dores de cabeça mais tarde: mantenha cada registo de origem separadamente e associe-os a uma entidade canónica, em vez de os fundir de forma destrutiva — irá cometer erros nas fusões e terá de as desfazer. E registe o motivo pelo qual dois registos foram fundidos, porque «por que é que esta listagem apresenta o preço errado?» é uma pergunta que lhe será feita e à qual não poderá responder apenas com base nos dados fundidos.

Atualidade, Programação e Custos

Os requisitos de atualidade variam enormemente e determinam toda a sua estrutura de custos.

TipoTempo máximo de desatualizaçãoImplicações
NotíciasMinutosBaseadas em feeds, envio push sempre que possível
EmpregosHoras a um diaRastreio diário adequado para a maioria das fontes
ImobiliárioHorasVerificações frequentes apenas nos anúncios ativos
PreçosMinutos a horasO mais dispendioso
EventosDiasSemanalmente é normalmente suficiente

O erro que arruína os orçamentos é rastrear tudo com a frequência exigida pelo item mais volátil. A solução é a classificação por níveis: rastrear o que muda frequentemente, com frequência; rastrear o que muda raramente, com pouca frequência; e utilizar o «lastmod» a partir de mapas do site e pedidos condicionais para ignorar completamente o conteúdo inalterado.

A deteção de remoção é o problema de atualização que ninguém prevê. Um emprego preenchido ou uma casa vendida precisam de desaparecer, e as fontes raramente o anunciam. É necessário um sinal (a página apresenta um erro 404, um campo de estado altera-se) ou uma política (os registos não vistos em três rastreamentos são marcados como inativos). Se errar nisto, o seu agregador enche-se de anúncios obsoletos, o que é a segunda razão mais comum pela qual os utilizadores deixam de confiar num agregador, a seguir às duplicatas.

O custo varia em função das consultas, não dos registos. Dez mil anúncios verificados de hora a hora equivalem a 240 000 consultas por dia; os mesmos anúncios verificados diariamente equivalem a 10 000. Os mesmos dados, mas uma diferença de vinte e quatro vezes na largura de banda e na carga que se impõe às fontes. Cada hora de desatualização aceitável custa dinheiro.

Onde os proxies são adequados e onde não são

A nossa parte final do processo, descrita com a maior precisão possível.

Não precisa de proxies quando: estiver a consumir feeds ou APIs, o seu volume for modesto, estiver a rastrear a partir de um único local em fontes que não impõem limites de taxa, ou ainda estiver a desenvolver e a testar. Isto abrange inteiramente muitos agregadores em fase inicial.

Precisa deles quando: o rastreamento é intenso ao ponto de um único endereço ser sujeito a limitação de taxa; o conteúdo varia consoante a região e precisa de aceder a várias regiões; estiver a utilizar rastreadores distribuídos e quiser que estes pareçam clientes distintos, em vez de uma única máquina com vários threads; ou precisar de precisão geográfica para preços e disponibilidade específicos de cada localidade.

Que tipo: centro de dados para a maioria dos rastreamentos, porque é significativamente mais barato e as páginas de listagens públicas normalmente não exigem nada mais. O nosso começa nos 0,14 $/GB, faturado por tráfego em vez de por IP. Opte pela opção residencial — a partir de 0,79 $/GB — apenas quando o centro de dados falhar comprovadamente ou quando precisar de geolocalização na rede de consumidores. As novas contas recebem 1 TB de tráfego residencial gratuito, o que é suficiente para determinar se realmente precisa disso. Dados retirados da nossa página de preços, verificados em setembro de 2026.

O fator de custo que ninguém prevê: navegadores sem interface gráfica. Se as suas fontes exigirem renderização em JavaScript, um navegador descarrega todas as imagens, tipos de letra e scripts, e a largura de banda aumenta numa ordem de grandeza em relação ao HTTP bruto. Bloqueie os tipos de recursos de que não necessita. Numa largura de banda medida, esta é a maior alavanca disponível, e abordámos os aspetos económicos mais amplos no nosso guia de preços de proxy.

E a verdade nua e crua: os proxies resolvem a distribuição. Não resolvem as condições de utilização, não resolvem os direitos sobre a base de dados e não fazem com que uma fonte queira que estejas lá. Se um site te disse para não o rastreares, ter mais endereços não é a resposta para isso; é apenas uma forma de ignorar essa regra de forma mais eficiente.

Por que razão a maioria dos agregadores falha

Não por razões técnicas.

Falta de valor único. Agregar o que todos os outros agregam resulta numa versão pior de um site já existente. O valor tem de residir numa cobertura que mais ninguém tem, numa organização que mais ninguém oferece ou num nicho demasiado pequeno para os operadores estabelecidos.

Duplicações. Já abordado acima, mas vale a pena repetir. Esta é a principal razão pela qual os utilizadores abandonam o site.

Dados desatualizados. Anúncios inativos destroem a confiança mais rapidamente do que anúncios em falta, porque um anúncio em falta é invisível e um inativo faz o utilizador perder tempo.

Custo de manutenção superior ao valor. Vinte analisadores HTML escritos à mão equivalem a um trabalho a tempo parcial para sempre. Cada fonte que se adiciona aumenta o custo fixo recorrente. Dê preferência a fontes com feeds; esteja disposto a abandonar fontes cuja manutenção exceda a sua contribuição.

O ovo ou a galinha. Os agregadores precisam de cobertura para atrair utilizadores e de utilizadores para justificar a cobertura. A solução é ser completo numa área restrita, em vez de parcial numa área ampla.

Problemas legais que surgem tarde. Uma ordem de cessação e desistência depois de teres construído o negócio com base numa única fonte é consideravelmente mais dispendiosa do que uma conversa com os parceiros antes de começares. Fala com as tuas maiores fontes desde cedo; algumas ficarão satisfeitas com o tráfego, e é melhor descobrir logo no primeiro dia quais são as que não ficarão.

Perguntas frequentes

É legal criar um site agregador?

Depende do que se agrega, de onde e como. Os factos, em geral, não são passíveis de direitos de autor, ao passo que a expressão sim o é; é por isso que armazenar dados estruturados e incluir ligações para a fonte constitui a abordagem mais segura. Na UE, aplicam-se a exceção relativa à mineração de texto e dados, as reservas de direitos legíveis por máquina e o direito separado sobre bases de dados. Procure aconselhamento para qualquer questão de relevância comercial.

De onde é que os agregadores obtêm os seus dados?

Por ordem de preferência: APIs oficiais, feeds de parceiros e afiliados, RSS e Atom, mapas do site, dados estruturados incorporados nas páginas e, só depois, análise de HTML. A fonte mais negligenciada é o feed de parceiros — muitos setores publicam conjuntos de dados completos para agregadores, porque estes lhes enviam tráfego. Pergunte antes de criar um rastreador.

Preciso de proxies para criar um agregador?

Inicialmente, não. Os feeds e as APIs não precisam de nenhum, e um rastreamento modesto a partir de um único local normalmente também não. Tornam-se necessários quando o volume atinge limites de taxa, quando é necessário aceder a conteúdos específicos de uma região ou quando se executam rastreadores distribuídos. A largura de banda do centro de dados é a opção padrão sensata; a residencial apenas quando for comprovadamente necessária.

Como é que os agregadores lidam com listagens duplicadas?

Correspondência em camadas, começando pelo mais barato: identificadores exatos, quando existirem; depois, chaves normalizadas construídas a partir de campos limpos; em seguida, semelhança aproximada dentro de grupos de candidatos gerais; e, por fim, revisão humana para o restante ambíguo. Mantenha os registos de origem separados e associe-os a uma entidade canónica, em vez de os fundir de forma destrutiva.

O que é que o ficheiro robots.txt me obriga a fazer?

Desde a RFC 9309 que se trata de uma norma e não de uma convenção. Faça a correspondência por especificidade em vez de por ordem, atualize o ficheiro pelo menos diariamente, trate os erros do servidor como proibição total, trate um erro 404 como ausência de restrições e analise pelo menos 500 KiB. Utilize uma biblioteca atualizada em vez de escrever o seu próprio analisador.

Com que frequência deve um agregador atualizar os seus dados?

Tão raramente quanto o seu caso de utilização permitir, porque o custo varia em função do número de requisições. As notícias requerem minutos, as ofertas de emprego requerem horas, os eventos requerem dias. Classifique as suas fontes por volatilidade, utilize o mapa do site lastmod e pedidos condicionais para ignorar conteúdo inalterado e tenha uma política explícita para detetar listagens removidas.

Posso agregar conteúdo de sites que bloqueiam scrapers?

Tecnicamente, pode ser possível; se deve fazê-lo, isso é outra questão. Um bloqueio é uma declaração de intenção, e contorná-lo não altera os termos, o direito de acesso à base de dados nem a relação. A melhor opção é solicitar um feed — muitos sites que bloqueiam rastreadores fornecem de bom grado dados aos seus parceiros.

Qual é a parte mais difícil de criar um agregador?

A deduplicação e a atualização, por uma larga margem. A recuperação e a análise são problemas resolvidos com bibliotecas. Decidir que duas listagens com formulações diferentes são a mesma coisa e perceber quando uma delas deixou de existir discretamente é onde residem tanto o esforço de engenharia como a confiança do utilizador.

Conclusão

A habilidade na criação de um agregador reside em saber quais são os problemas reais. A obtenção de conteúdo não é um deles — feeds, APIs, mapas do site e dados estruturados incorporados abrangem muito mais do que as pessoas esperam, e as equipas que se dedicam diretamente à criação de analisadores HTML estão, normalmente, a resolver um problema que já lhes tinha sido resolvido.

Os verdadeiros problemas surgem a jusante. A deduplicação determina se os utilizadores confiam nos seus dados. A deteção de remoções determina se confiam neles uma segunda vez. A carga de manutenção determina se o projeto sobrevive ao contacto com vinte fontes que alteram a sua marcação de forma independente. E a vertente jurídica — direitos de autor sobre a expressão, reservas de TDM legíveis por máquina, o direito de base de dados da UE, termos de serviço — determina se tudo isto é um negócio ou um risco.

Comece por algo restrito e completo, em vez de algo abrangente e parcial. Dê preferência a fontes autorizadas sempre que possível, incluindo contactar as fontes diretamente, uma vez que um feed de um parceiro elimina de uma só vez toda uma categoria de problemas. Adicione infraestrutura — incluindo proxies — no momento em que puder identificar o limite que atingiu, e não antes.