Nuestra postura: somos Geonode y vendemos proxies, que son uno de los elementos que alimentan un agregador y al que la mayoría de las guías le dan demasiada importancia. Así que, para ser sinceros desde el principio: los proxies son lo último que deberías comprar, no lo primero. Una gran parte de los datos que se pueden agregar está disponible a través de feeds, API y mapas de sitio que son gratuitos, están estructurados, son estables y se ofrecen explícitamente para este fin. Crear un rastreador para contenido que alguien publica como feed RSS es un trabajo inútil, y comprar ancho de banda antes de haberlo descubierto es tirar el dinero. Los proxies cobran relevancia en un momento concreto —cuando se realiza un rastreo a gran escala, desde múltiples regiones, en sitios web que limitan el número de solicitudes— y ese momento llega más tarde de lo que la mayoría de la gente supone. Más adelante hay una sección que explica exactamente dónde está ese límite.
¿Qué tipo de agregador? Cuatro modelos
Cada uno tiene una economía diferente y un riesgo legal distinto, y confundirlos es el primer error.
Los agregadores de enlaces recopilan titulares y redirigen a otras páginas. Requieren poco almacenamiento, tienen un riesgo legal bajo y el coste de cambio para los usuarios es reducido. El valor reside exclusivamente en la selección y la rapidez. La mayoría de los agregadores de noticias y contenidos se enmarcan en esta categoría.
Los agregadores de listados recopilan registros estructurados —empleos, inmuebles, coches, eventos— y los presentan como una base de datos en la que se pueden realizar búsquedas. Mayor valor, mayor esfuerzo y un modelo en el que la deduplicación se convierte en el principal reto de ingeniería.
Los agregadores de precios comparan el mismo artículo entre distintos vendedores. Es el ámbito más limitado y complicado: hacer coincidir productos entre minoristas que los describen de forma diferente es un problema realmente difícil, y los requisitos de actualidad son muy exigentes, ya que un precio desactualizado es peor que no tener ningún precio.
Los agregadores de reseñas y valoraciones combinan datos de opiniones. Cobertura escasa, gran trabajo de normalización y son los más expuestos a acusaciones de tergiversar la fuente.
Elige uno deliberadamente. La arquitectura difiere, el análisis jurídico difiere, y «un agregador para todo» es la forma en que los proyectos se convierten en imposibles de terminar.
Consigue los datos de la forma más sencilla primero
Por orden de preferencia. Ve revisando esta lista y detente en cuanto encuentres algo que funcione.
API oficiales. Si la fuente publica una, utilízala. Es estable, está estructurada, cuenta con autorización oficial y alguien la arreglará si falla. Lee las condiciones: la mayoría restringe la redistribución, la duración del almacenamiento en caché y el uso comercial, y esas restricciones determinan cómo será tu producto.
Fuentes de socios o afiliados. Muchos sectores publican fuentes masivas específicamente para agregadores, ya que estos les aportan tráfico. Las bolsas de empleo, los portales inmobiliarios, los minoristas y los operadores turísticos suelen tener un programa de socios que te proporciona el conjunto de datos completo. Esta es, con diferencia, la fuente más infrautilizada en este ámbito, y la razón es que la gente busca «cómo extraer datos de X» en lugar de enviar un correo electrónico a X para preguntar si disponen de un feed. Pregunta. Un número sorprendente de ellos dirá que sí.
Feeds RSS y Atom. Siguen publicándose ampliamente y siguen siendo ideales para la agregación de enlaces. Están estructurados, son económicos, están diseñados precisamente para esto y se ofrecen sin ambigüedades para su consumo.
Mapas de sitio. sitemap.xml te proporciona una lista completa de URL, además de marcas de tiempo lastmod, lo que te permite rastrear de forma eficiente en lugar de hacerlo por fuerza bruta. Incluso cuando tengas que rastrear, el mapa de sitio te indica qué ha cambiado para que solo recojas eso.
Datos estructurados en la página. Antes de escribir analizadores de HTML, comprueba si hay JSON-LD en un bloque <script type="application/ld+json">. El marcado de Schema.org para JobPosting, Product, Event y Recipe está muy extendido porque impulsa las funciones de búsqueda y te proporciona datos estructurados limpios de una página que ibas a recuperar de todos modos. Además, resiste los rediseños mucho mejor que los selectores CSS.
Análisis sintáctico de HTML. Último recurso. Frágil, requiere mucho mantenimiento y es lo que convierte a un agregador en un trabajo a tiempo completo.
El orden importa más que cualquier elemento individual. Los equipos que empiezan por el final de esta lista crean un rastreador y luego descubren el feed seis meses más tarde.
Cuando tienes que rastrear: robots.txt ya es un estándar
robots.txt dejó de ser una convención en 2022. El RFC 9309 estandariza el Protocolo de Exclusión de Robots y, si estás desarrollando un rastreador, define el comportamiento que debes implementar.
Cuatro requisitos que conviene conocer con precisión:
La coincidencia se determina por especificidad, no por orden. «DEBE utilizarse la coincidencia más específica encontrada. La coincidencia más específica es aquella que tiene más octetos». No se aplica el principio de «la primera coincidencia gana», que es lo que asumen muchos analizadores sintácticos creados a mano.
Almacenar en caché durante no más de 24 horas. «Los rastreadores NO DEBERÍAN utilizar la versión almacenada en caché durante más de 24 horas, a menos que no se pueda acceder al archivo robots.txt». Obtenerla una sola vez en el momento de la implementación no cumple con las normas.
Los errores del servidor implican detener la operación. «Si no se puede acceder al archivo robots.txt debido a errores del servidor o de la red...... el rastreador DEBE asumir que el acceso está totalmente prohibido». Un código 5xx significa retirarse por completo. Un 404, por el contrario, significa que no hay restricciones: no hay archivo, por lo que no se prohíbe nada.
Analizar al menos 500 KiB. «El límite de análisis DEBE ser de al menos 500 kibibytes». Los sitios web grandes tienen archivos grandes.
Utiliza una biblioteca actualizada en lugar de escribir el código tú mismo. La regla de coincidencia de especificidad por sí sola es una fuente habitual de errores, y un rastreador que interprete mal un «robots.txt» es un rastreador que genera quejas.
Más allá del propio archivo, las normas de cortesía habituales: identifícate con un agente de usuario real que incluya una URL de contacto, respeta «Crawl-delay» cuando esté presente, retírate inmediatamente ante los códigos 429 y 503, y almacena en caché para no recuperar nunca dos veces contenido que no haya cambiado. Las solicitudes condicionales con If-Modified-Since o If-None-Match no suponen ningún coste para la fuente ni para ti. La mayoría de los sitios que bloquean a los agregadores lo hacen por su comportamiento, no por su mera existencia.
El aspecto jurídico: derechos de autor, excepciones al TDM y derechos sobre bases de datos
Esto no constituye asesoramiento jurídico, y la jurisdicción tiene una importancia enorme. Sin embargo, hay cuatro aspectos que conviene comprender antes de crear una plataforma.
Por lo general, los hechos no están protegidos por derechos de autor; la expresión sí lo está. Un puesto de trabajo, un salario, un precio y una fecha son hechos. La descripción redactada para promocionar el puesto de trabajo es una expresión. Agregar los primeros se sustenta en una base mucho más sólida que reproducir los segundos. Esta simple distinción determina el diseño más sensato de cualquier agregador: almacenar los datos estructurados y enlazar a la fuente para el texto descriptivo.
La longitud del fragmento importa. Reproducir un titular y una frase con un enlace es algo distinto a reproducir un artículo. Varias jurisdicciones han litigado sobre dónde trazar la línea divisoria, y las respuestas difieren. Cuanto más breve, más seguro; y enlazar en lugar de reproducir es lo más seguro.
La UE cuenta con una cláusula de exclusión voluntaria para la minería de textos y datos que, por su diseño, es legible por máquina. El artículo 4 de la Directiva (UE) 2019/790 permite la minería de textos y datos a cualquier persona, siempre que los titulares de los derechos no se hayan reservado expresamente sus derechos «de manera adecuada, por ejemplo, mediante medios legibles por máquina». En el caso de los contenidos puestos a disposición del público en línea, la directiva considera que la reserva legible por máquina —«incluidos los metadatos y los términos y condiciones de un sitio web o un servicio»— es la vía adecuada. La excepción también exige que se haya accedido al material de forma lícita.
La implicación práctica para un rastreador: las reservas expresadas en formato legible por máquina deben respetarse, y la UE ha estado trabajando para estandarizar los protocolos para expresarlas. Crear un rastreador que ignore las reservas legibles por máquina es incorporar un problema de cumplimiento normativo desde el principio.
La UE también cuenta con un derecho sobre bases de datos independiente. Más allá de los derechos de autor, la Directiva sobre bases de datos creó un derecho sui generis que protege la inversión sustancial realizada en la obtención, verificación o presentación de los contenidos de una base de datos, independientemente de si los contenidos en sí mismos son susceptibles de protección por derechos de autor. Esto es directamente relevante para los agregadores, ya que extraer una parte sustancial de la base de datos de anuncios de alguien puede dar lugar a su aplicación, incluso cuando cada anuncio individual sea un mero hecho.
Luego están las condiciones de uso, que son de carácter contractual y no legal, y que muchos sitios web utilizan para prohibir rotundamente el acceso automatizado. Si una condición te vincula aunque nunca hayas hecho clic en nada es una cuestión realmente controvertida que varía según la jurisdicción. Léelas de todos modos: te indican cómo actuará el sitio web al respecto, lo cual suele ser más relevante de forma inmediata que lo que diría un tribunal.
El resumen práctico: da preferencia a las fuentes autorizadas, almacena datos en lugar de texto, enlaza en lugar de reproducir, respeta las restricciones legibles por máquina y busca asesoramiento para cualquier asunto de importancia comercial.
Arquitectura: cuatro fases y la más complicada
Todos los agregadores siguen las mismas cuatro fases, y solo una de ellas es complicada.
Recuperación. Obtener el contenido sin procesar. Aspectos a tener en cuenta: programación, limitación de frecuencia, reintentos, almacenamiento en caché, solicitudes condicionales. Almacena siempre la respuesta sin procesar; cuando un analizador falla, es mejor volver a analizar los datos históricos en lugar de volver a recuperarlos.
Análisis. Convertir el contenido sin procesar en registros estructurados. Aspectos a tener en cuenta: fragilidad y detección de cambios. Avisa cuando cambie el formato de la salida del analizador, en lugar de cuando se produzca un error, ya que el fallo más costoso es que un analizador empiece a devolver menos campos sin avisar.
Normalizar y deduplicar. La etapa difícil. Se detalla a continuación.
Servir. Buscar, filtrar, mostrar. Ingeniería web estándar, y la parte en la que la mayoría de los equipos invierten en exceso al principio porque es la parte visible.
La deduplicación es lo que determina el éxito o el fracaso de los agregadores. La misma oferta de trabajo se publica en cuatro portales con títulos diferentes. La misma propiedad aparece a través de tres agentes a precios distintos. El mismo producto tiene un nombre diferente en cada tienda. Los usuarios te juzgan casi exclusivamente por esto: un sitio de anuncios que muestra lo mismo seis veces se percibe como defectuoso, independientemente de lo completo que esté.
El enfoque que funciona es por capas, empezando por el más barato:
Identificadores exactos. ISBN, números de referencia, números de matrícula, identificadores de origen. Cuando existan, utilízalos y ya está: resuelven el problema por completo.
Claves normalizadas. Crea una clave canónica a partir de campos en minúsculas, sin espacios en blanco y sin signos de puntuación: empresa más cargo más ubicación; código postal más número de dormitorios más superficie. Cubre una gran parte de forma económica.
Coincidencia aproximada. Similitud basada en tokens en títulos y descripciones, con un umbral que se ajusta a partir de una muestra etiquetada manualmente. Es necesario y costoso; limítalo a los candidatos que ya compartan una clave aproximada, o se convertirá en una comparación de todos los pares que no te podrás permitir.
Revisión manual para los casos ambiguos intermedios. Acepta que una parte requiere intervención humana. Crea la cola con antelación, en lugar de esperar a que los usuarios se quejen.
Dos decisiones de diseño que te ahorrarán problemas más adelante: mantén cada registro de origen por separado y vincúlalos a una entidad canónica, en lugar de fusionarlos de forma destructiva; cometerás errores en las fusiones y tendrás que deshacerlas. Y registra por qué se fusionaron dos registros, porque «¿por qué este anuncio muestra un precio incorrecto?» es una pregunta que te harán y a la que no podrás responder basándote únicamente en los datos fusionados.
Actualidad, programación y costes
Los requisitos de actualidad varían enormemente y determinan toda tu estructura de costes.
| Tipo | Plazo máximo de antigüedad | Implicaciones |
|---|---|---|
| Noticias | Minutos | Basadas en feeds, envío push siempre que sea posible |
| Ofertas de empleo | De horas a un día | Un rastreo diario es suficiente para la mayoría de las fuentes |
| Inmuebles | Horas | Comprobaciones frecuentes solo de los anuncios activos |
| Precios | De minutos a horas | La opción más cara |
| Eventos | Días | Por lo general, una vez a la semana es suficiente |
El error que arruina los presupuestos es rastrear todo con la frecuencia que requiere el elemento más volátil. La solución es la clasificación por niveles: rastrea con frecuencia lo que cambia a menudo; rastrea con poca frecuencia lo que cambia raramente; y utiliza la opción «lastmod» (no rastrear) de los mapas del sitio y las solicitudes condicionales para omitir por completo el contenido que no ha cambiado.
La detección de eliminaciones es el problema de actualidad que nadie tiene en cuenta. Una oferta de empleo cubierta o una vivienda vendida deben desaparecer, y las fuentes rara vez lo anuncian. Se necesita o bien una señal (la página devuelve un error 404, cambia un campo de estado) o bien una política (los registros que no se hayan visto en tres rastreos se marcan como inactivos). Si se comete un error en esto, el agregador se llena de anuncios obsoletos, lo cual es la segunda razón más común por la que los usuarios dejan de confiar en un agregador, después de los duplicados.
El coste varía en función de las consultas, no de los registros. Diez mil anuncios comprobados cada hora suponen 240 000 consultas al día; los mismos anuncios comprobados diariamente suponen 10 000. Son los mismos datos, pero con una diferencia de veinticuatro veces en el ancho de banda y en la carga que se ejerce sobre las fuentes. Cada hora de desactualización aceptable cuesta dinero.
Cuándo conviene usar proxies y cuándo no
Nuestro extremo del proceso, descrito con la mayor precisión posible.
No necesitas proxies cuando: consumes feeds o API, tu volumen es moderado, estás rastreando desde una única ubicación fuentes que no limitan la tasa de acceso, o aún te encuentras en fase de desarrollo y pruebas. Esto abarca por completo a muchos agregadores en sus primeras etapas.
Sí los necesitas cuando: el rastreo es tan intenso que una sola dirección se ve limitada por la tasa de acceso; el contenido varía según la región y necesitas consultar varias regiones; estás ejecutando rastreadores distribuidos y quieres que parezcan clientes distintos en lugar de una sola máquina con varios subprocesos; o necesitas precisión geográfica para precios y disponibilidad específicos de cada zona.
¿Qué tipo? El de centro de datos para la mayoría de los rastreos, ya que es mucho más económico y las páginas de anuncios públicos no suelen requerir nada más. El nuestro cuesta a partir de 0,14 $/GB, facturado por tráfico en lugar de por IP. Pasa a la opción residencial —a partir de 0,79 $/GB— solo cuando el centro de datos falle de forma demostrable o cuando necesites geolocalización de redes de consumidores. Las cuentas nuevas obtienen 1 TB de tráfico residencial gratis, lo cual es suficiente para determinar si realmente lo necesitas. Cifras extraídas de nuestra página de precios, consultada en septiembre de 2026.
El factor de coste que nadie tiene en cuenta: los navegadores sin interfaz gráfica. Si tus fuentes requieren la ejecución de JavaScript, el navegador descarga todas las imágenes, fuentes y scripts, y el ancho de banda se multiplica por diez en comparación con el HTTP sin procesar. Bloquea los tipos de recursos que no necesites. En un ancho de banda medido, esta es la medida más eficaz de la que dispones, y hemos tratado los aspectos económicos más generales en nuestra guía de precios de proxies.
Y la verdad a la vista: los proxies resuelven la distribución. No resuelven las condiciones de servicio, no resuelven los derechos de las bases de datos y no hacen que una fuente te quiera allí. Si un sitio te ha dicho que no lo rastrees, disponer de más direcciones no es la solución; es una forma de ignorarlo de manera más eficiente.
Por qué fracasan la mayoría de los agregadores
No es por razones técnicas.
Falta de valor diferenciador. Agregar lo que todos los demás agregan da como resultado una versión peor de un sitio web ya existente. El valor debe residir en una cobertura que nadie más tenga, en una organización que nadie más ofrezca o en un nicho demasiado pequeño para los operadores ya establecidos.
Duplicados. Ya se ha mencionado anteriormente, pero merece la pena repetirlo. Esta es la razón principal por la que los usuarios se marchan.
Datos obsoletos. Los anuncios inactivos destruyen la confianza más rápido que los que faltan, porque un anuncio que falta es invisible y uno inactivo hace perder el tiempo al usuario.
Carga de mantenimiento que supera el valor. Veinte analizadores HTML escritos a mano suponen un trabajo a tiempo parcial para siempre. Cada fuente que añadas aumenta el coste fijo recurrente. Da preferencia a las fuentes con feeds; estate dispuesto a descartar aquellas cuyo mantenimiento supere su aportación.
El dilema del huevo y la gallina. Los agregadores necesitan cobertura para atraer a los usuarios y necesitan usuarios para justificar esa cobertura. La solución pasa por ser exhaustivo en un ámbito concreto en lugar de parcial en uno amplio.
Problemas legales que surgen tarde. Una orden de cese y desistimiento después de haber construido el negocio sobre una sola fuente resulta considerablemente más cara que una conversación con los socios antes de empezar. Habla con tus fuentes más importantes desde el principio; algunas se alegrarán del tráfico, y es mejor descubrir desde el primer día cuáles no lo harán.
Preguntas frecuentes
¿Es legal crear una página web agregadora?
Depende de qué se agregue, de dónde y cómo. Por lo general, los hechos no están sujetos a derechos de autor, mientras que la expresión sí lo está; por eso, almacenar datos estructurados e incluir enlaces a la fuente es la opción más segura. En la UE se aplican la excepción relativa a la minería de textos y datos, las reservas de derechos legibles por máquina y el derecho sobre bases de datos independientes. Busca asesoramiento para cualquier asunto de importancia comercial.
¿De dónde obtienen los agregadores sus datos?
Por orden de preferencia: API oficiales, fuentes de socios y afiliados, RSS y Atom, mapas de sitio, datos estructurados incrustados en las páginas y, solo entonces, análisis de HTML. La fuente más pasada por alto es la fuente de los socios: muchos sectores publican conjuntos de datos completos para los agregadores porque estos les envían tráfico. Pregunta antes de crear un rastreador.
¿Necesito proxies para crear un agregador?
Al principio, no. Los feeds y las API no los necesitan, y un rastreo moderado desde una única ubicación tampoco suele requerirlos. Se vuelven necesarios cuando el volumen activa límites de velocidad, cuando necesitas ver contenido específico de una región o cuando ejecutas rastreadores distribuidos. El ancho de banda de los centros de datos es la opción predeterminada más sensata; el residencial solo cuando sea claramente necesario.
¿Cómo gestionan los agregadores los listados duplicados?
Coincidencia por capas, de menor a mayor: identificadores exactos cuando existan, luego claves normalizadas creadas a partir de campos depurados, a continuación similitud aproximada dentro de grupos de candidatos generales y, por último, revisión humana para el resto de casos ambiguos. Mantén los registros de origen separados y vincúlalos a una entidad canónica en lugar de fusionarlos de forma destructiva.
¿Qué me exige el archivo robots.txt?
Desde la RFC 9309, se trata de un estándar y no de una convención. Realiza la coincidencia por especificidad en lugar de por orden, actualiza el archivo al menos una vez al día, trata los errores del servidor como una prohibición total, trata un 404 como si no hubiera restricciones y analiza al menos 500 KiB. Utiliza una biblioteca actualizada en lugar de escribir tu propio analizador.
¿Con qué frecuencia debe un agregador actualizar sus datos?
Tan poco como permita tu caso de uso, ya que el coste varía en función del número de recuperaciones. Las noticias requieren minutos, las ofertas de empleo horas y los eventos días. Clasifica tus fuentes según su volatilidad, utiliza el mapa del sitio lastmod y solicitudes condicionales para omitir el contenido que no haya cambiado, y establece una política explícita para detectar anuncios eliminados.
¿Puedo agregar contenido de sitios que bloquean los rastreadores?
Técnicamente, es posible que puedas hacerlo; pero si deberías hacerlo es otra cuestión. Un bloqueo es una declaración de intenciones, y eludirlo no cambia los términos, el derecho de base de datos ni la relación. Lo mejor es solicitar un feed: muchos sitios que bloquean a los rastreadores proporcionan encantados datos a sus socios.
¿Cuál es la parte más difícil de crear un agregador?
La deduplicación y la actualidad, con diferencia. La obtención y el análisis sintáctico son problemas ya resueltos gracias a las bibliotecas. Determinar que dos anuncios redactados de forma diferente se refieren a lo mismo, y darse cuenta de cuándo uno de ellos ha dejado de existir sin que nadie se haya dado cuenta, es donde residen tanto el esfuerzo de ingeniería como la confianza del usuario.
Conclusión
La clave para crear un agregador está en saber qué problemas son reales. La obtención de contenido no es uno de ellos: los feeds, las API, los mapas de sitio y los datos estructurados incrustados abarcan mucho más de lo que la gente espera, y los equipos que se lanzan directamente a escribir analizadores sintácticos de HTML suelen estar resolviendo un problema que ya se había resuelto por ellos.
Los verdaderos problemas se encuentran más adelante en el proceso. La deduplicación determina si los usuarios confían en tus datos. La detección de eliminaciones determina si vuelven a confiar en ellos. La carga de mantenimiento determina si el proyecto sobrevive al contacto con veinte fuentes que modifican su marcado de forma independiente. Y el aspecto legal —los derechos de autor sobre la expresión, las reservas de TDM legibles por máquina, el derecho de la UE sobre las bases de datos, las condiciones de servicio— determina si todo el conjunto es un negocio o un riesgo.
Empieza por algo concreto y completo, en lugar de amplio y parcial. Da preferencia a las fuentes autorizadas siempre que sea posible, incluso preguntando directamente a las fuentes, ya que un feed de un socio elimina de un plumazo toda una categoría de problemas. Añade infraestructura —incluidos los proxies— en el momento en que puedas señalar el límite al que has llegado, no antes.
