Un scraper funciona a la perfección en las pruebas.
Pero cuando lo diriges a una web real, te sale:
403 Prohibido.
O un CAPTCHA.
O la página se carga en Chrome, pero devuelve algo completamente diferente a lo que espera tu script.
Cambias la dirección IP. Funciona durante unas cuantas solicitudes y vuelve a bloquearse.
Este es el tipo de problema para el que se ha diseñado DataDome en lo que respecta al tráfico automatizado.
Lo importante es comprender que DataDome no se limita a preguntar:
«¿Es sospechosa esta IP?»
La detección moderna de bots se acerca mucho más a:
«¿Tienen sentido en conjunto esta IP, la conexión de red, el navegador, el dispositivo, el patrón de solicitud y la sesión?»
Esa distinción explica por qué cambiar de proxy a veces ayuda, por qué a menudo no lo hace y por qué un rastreador que parece perfectamente normal a nivel HTTP puede seguir fallando.
Esta guía explica cómo funciona DataDome, qué señales puede utilizar, cómo es un bloqueo de DataDome, por qué los navegadores y los scripts se comportan de forma diferente, y qué papel desempeñan los proxies, la automatización de navegadores y las API de scraping en todo este contexto.
¿Qué es DataDome?
DataDome es una plataforma de protección contra bots y fraudes en línea que utilizan sitios web, aplicaciones móviles y API para distinguir a los usuarios legítimos del tráfico automatizado o malicioso.
Los propietarios de sitios web utilizan sistemas como DataDome para reducir actividades tales como:
- extracción no autorizada de datos;
- relleno de credenciales;
- intentos de apropiación de cuentas;
- creación de cuentas falsas;
- abuso del inventario;
- fraude en los pagos;
- análisis automatizado de vulnerabilidades;
- bots agresivos;
- agentes de IA no deseados.
Para alguien que recopila datos públicos de la web, DataDome se sitúa al otro lado de la ecuación.
Tu solicitud llega a un sitio web protegido, pero antes de que la aplicación decida qué contenido devolver, DataDome puede evaluar la solicitud y determinar si parece legítima, sospechosa o automatizada.
El resultado puede ser:
Permitir
La solicitud continúa con normalidad.
Comprobación del dispositivo
Se lleva a cabo una verificación adicional del navegador o del dispositivo.
CAPTCHA
El cliente recibe un desafío interactivo.
Bloquear
La solicitud es rechazada.
Por eso, dos solicitudes dirigidas exactamente a la misma URL pueden generar respuestas completamente diferentes.
La URL no ha cambiado.
El cliente sí.
Cómo funciona DataDome
Un modelo simplificado útil es el siguiente:
Cliente → sitio web protegido/DataDome → decisión de detección → sitio web
La fase de detección es donde se producen la mayoría de los problemas relacionados con los rastreadores.
DataDome puede evaluar señales procedentes de múltiples capas de una conexión, en lugar de basarse en un único indicador.
Estas capas pueden incluir:
| Capa | Ejemplos de señales |
|---|
| Red | Dirección IP, ASN, reputación de la red |
| TLS | Huella digital TLS y características de la conexión |
| HTTP | Encabezados, coherencia de los encabezados, propiedades de la solicitud |
| Navegador | Huella digital del navegador y entorno |
| Dispositivo | Sistema operativo, hardware y señales de ejecución |
| JavaScript | Resultados de comprobaciones del lado del cliente |
| Sesión | Cookies y continuidad entre solicitudes |
| Comportamiento | Tiempos y patrones de interacción |
| Reputación | Actividad previa asociada a la infraestructura |
Ninguna fila por sí sola demuestra necesariamente que una solicitud sea automatizada.
El valor reside en compararlas entre sí.
Una IP residencial con una huella digital del navegador imposible puede seguir pareciendo sospechosa.
Un User-Agent que parezca perfecto y provenga de un cliente TLS inconsistente puede seguir pareciendo sospechoso.
Un navegador real que genere cientos de solicitudes muy repetitivas puede seguir pareciendo sospechoso.
Esa es la diferencia fundamental entre los sistemas antibots modernos y los antiguos sistemas de bloqueo de IP.
Detección de DataDome: las capas principales
1. Reputación de IP
La reputación de una IP sigue siendo importante.
Una dirección IP puede tener un historial.
Por ejemplo, una infraestructura puede adquirir mala reputación cuando se origina desde ella una gran cantidad de tráfico abusivo o claramente automatizado.
DataDome puede evaluar si el tráfico procede de:
- una infraestructura de alojamiento conocida;
- rangos de centros de datos;
- proxies compartidos;
- proxies residenciales;
- redes de proxies públicos gratuitos;
- direcciones que hayan sido sospechosas anteriormente.
Pero la reputación de la IP es solo una señal.
Por eso, afirmaciones como:
«Utiliza un proxy residencial y DataDome no podrá detectarte».
son engañosas.
Una dirección residencial puede hacer que una solicitud de red se parezca más al tráfico habitual de un consumidor.
Pero no puede hacer que el resto de la solicitud sea automáticamente coherente.
2. Encabezados HTTP
Los navegadores envían un conjunto reconocible de encabezados.
Las herramientas de automatización también envían encabezados.
Lo interesante no es simplemente si una solicitud contiene un «User-Agent
».
Lo importante es si la solicitud tiene sentido en su conjunto.
Por ejemplo, imagina un cliente que afirma ser una versión reciente de Chrome mientras envía un conjunto de encabezados que normalmente no se corresponden con ese navegador.
Por separado, cada valor puede parecer razonable.
Pero, en conjunto, puede que no lo sean.
Los sistemas modernos de detección de bots pueden buscar estas inconsistencias.
Cambiar únicamente:
User-Agent: Mozilla/5.0...
no convierte una simple biblioteca HTTP en Chrome.
3. Huellas digitales TLS
Antes de que los datos HTTP se intercambien a través de HTTPS, el cliente establece una conexión TLS.
Diferentes clientes pueden generar características TLS distintas.
Un navegador, una biblioteca HTTP de Python, un cliente de línea de comandos y otro entorno de ejecución pueden establecer conexiones cifradas de forma diferente.
Esos patrones pueden resumirse en huellas digitales.
La documentación de DataDome hace referencia específica a las huellas digitales de TLS, incluida la información JA3 y JA4, como parte de los datos que pueden utilizarse al evaluar el tráfico.
Esto plantea un problema importante para las configuraciones de scraping simplistas.
Tus encabezados HTTP podrían indicar:
Chrome en Windows
mientras que la conexión de red subyacente no se parece en nada a la versión de Chrome que afirmas estar utilizando.
Cambiar un encabezado HTTP no modifica automáticamente la pila TLS subyacente.
Esta es una de las razones por las que la suplantación de identidad basada únicamente en HTTP acaba topando con un límite.
4. Huella digital del navegador
Una vez que JavaScript puede ejecutarse, la detección antibots tiene acceso a un entorno mucho más completo.
Un navegador real revela una gran cantidad de información sobre sí mismo y sobre el dispositivo en el que se ejecuta.
Entre las posibles señales se incluyen características relacionadas con:
- la versión del navegador;
- el sistema operativo;
- el hardware;
- la CPU;
- la memoria;
- el entorno gráfico;
- las API del navegador compatibles;
- el comportamiento de renderizado;
- la compatibilidad con funciones;
- los indicios de automatización.
Lo difícil para la automatización no es generar un valor verosímil.
Sino en generar cientos de valores coherentes entre sí.
Supongamos que un navegador automatizado afirma que se está ejecutando en un sistema operativo, pero otras partes de su entorno se comportan como si fuera otro.
O que las características de hardware comunicadas no se ajustan al dispositivo declarado.
O que la automatización modifica propiedades comunes de la huella digital, pero deja inalteradas las señales secundarias.
El navegador puede parecer convincente si se inspeccionan cinco propiedades evidentes.
Un sistema de detección no tiene por qué limitarse a cinco.
5. Detección de navegadores sin interfaz gráfica y automatizados
Playwright, Puppeteer y Selenium son increíblemente útiles.
Además, no son invisibles.
Al iniciar Chromium, tu rastreador dispone de un motor de navegador real, lo que resuelve muchos problemas que un cliente HTTP básico no puede resolver:
- Ejecución de JavaScript;
- representación;
- cookies;
- API del navegador;
- contenido dinámico;
- estado de navegación.
Pero «motor de navegador real» no significa «indistinguible de un usuario normal».
Los marcos de automatización pueden introducir diferencias observables.
La propia documentación de detección de DataDome incluye explícitamente categorías de detección para navegadores automatizados y sin interfaz gráfica, incluidos los controlados por Puppeteer, Selenium y Playwright.
Esto significa que esta sencilla arquitectura:
Playwright + proxy
no debe considerarse una solución universal contra los bots.
Puede funcionar perfectamente en un sitio web y fallar rápidamente en otro.
6. JavaScript y Device Check
DataDome también puede solicitar una verificación adicional al cliente.
Un mecanismo es Device Check.
En lugar de presentar inmediatamente un CAPTCHA visible, se ejecuta JavaScript en el navegador y evalúa el entorno.
Según DataDome, su «Device Check» recopila cientos de señales y realiza múltiples comprobaciones destinadas a detectar marcos de automatización, entornos falsificados y acceso programático.
Para un visitante real, esto puede ocurrir sin ninguna interrupción evidente.
Para un rastreador, esto crea una diferencia importante entre:
cliente HTTP
y:
navegador capaz de ejecutar la lógica prevista del lado del cliente
Si tu rastreador solo descarga el HTML inicial e ignora todo lo que ocurre en el navegador, es posible que nunca reproduzca la interacción completa que espera el sitio protegido.
7. Detección de comportamientos
Un navegador técnicamente convincente puede, aun así, comportarse de forma extraña.
Consideremos dos sesiones.
Sesión A
Un usuario:
- abre la página de un producto;
- dedica 14 segundos a leer;
- abre otra página;
- se desplaza por la página;
- vuelve;
- realiza una búsqueda;
- abre un resultado.
Sesión B
Un rastreador:
- solicita el producto 1;
- 300 ms después solicita el producto 2;
- 300 ms después solicita el producto 3;
- repite esto cientos de veces.
Ambas sesiones pueden utilizar Chrome.
Ambas pueden utilizar direcciones IP residenciales.
Su comportamiento es, obviamente, diferente.
La detección basada en el comportamiento permite que un sistema antibots tenga en cuenta patrones en lugar de solicitudes individuales.
Esto es especialmente importante a gran escala.
Un rastreador que tiene éxito una vez no es necesariamente un rastreador capaz de mantener 100 000 solicitudes.
8. Coherencia de la sesión
Los sitios web modernos son «con estado».
Las cookies, el estado del navegador, las direcciones IP y el historial de solicitudes forman parte de una sesión.
La automatización resulta más fácil de detectar cuando esos elementos se contradicen entre sí.
Por ejemplo:
- la IP cambia constantemente mientras que la misma cookie de sesión permanece;
- la identidad del navegador cambia a mitad de una sesión;
- la navegación salta repentinamente a recursos no relacionados;
- las cookies esperadas de un paso anterior nunca aparecen;
- cada solicitud se comporta como si fuera un visitante completamente nuevo.
Por eso, rotar ciegamente una dirección IP en cada solicitud puede, en ocasiones, hacer que un rastreador resulte menos creíble en lugar de más.
La rotación es útil.
La continuidad es útil.
La elección correcta depende de la carga de trabajo.
¿Cómo es un bloqueo de DataDome?
DataDome no tiene por qué responder de la misma forma a todas las solicitudes sospechosas.
Hay varios resultados con los que te puedes encontrar.
Respuesta 403
La señal más clara es una respuesta HTTP «403 Forbidden».
Pero no des por sentado que todos los códigos 403 que aparecen en Internet provienen de DataDome.
Comprueba siempre la respuesta real.
Página de CAPTCHA
En lugar de la página de destino, la respuesta puede contener un desafío de DataDome.
Comprobación del dispositivo
El navegador puede realizar una verificación invisible antes de permitir el acceso.
Esto resulta especialmente confuso durante la depuración, ya que la página puede acabar funcionando en tu navegador habitual sin que llegues a ver nunca un CAPTCHA.
Página de bloqueo
El tráfico que se considere lo suficientemente sospechoso puede recibir una respuesta de bloqueo directo.
Comportamiento diferente en Chrome y en tu rastreador
Esta es una de las pistas más claras de que el problema no radica en la propia URL.
Si:
Chrome → contenido
pero:
solicitudes/cURL/script personalizado → desafío
es probable que la diferencia se encuentre en algún lugar del cliente, la identidad de red, la ejecución del navegador o la sesión.
Por qué no basta con cambiar la dirección IP
Un proxy modifica una parte importante de la solicitud:
el lugar desde donde parece proceder el tráfico.
Eso es valioso.
Pero no cambia automáticamente:
- tu implementación de HTTP;
- la huella digital de TLS;
- el entorno del navegador;
- la ejecución de JavaScript;
- la huella digital del navegador;
- las cookies;
- la sincronización de la solicitud;
- el comportamiento de navegación;
- la lógica de sesión.
Piensa en la pila completa:
**IP
- TLS
- HTTP
- navegador
- dispositivo
- sesión
- comportamiento**
Un proxy modifica principalmente la primera capa.
Eso puede ser suficiente cuando la reputación de la IP es la razón por la que falla una solicitud.
No es suficiente cuando varias capas no coinciden.
Proxies de centro de datos frente a proxies residenciales con DataDome
No existe un «proxy DataDome» universal.
Los diferentes tipos de proxy resuelven distintos problemas de red.
Proxies de centro de datos
Las direcciones IP de centro de datos son rápidas, económicas y extremadamente útiles para muchas tareas de automatización.
Su desventaja en sitios web para consumidores con alta protección es que el origen de su red es más fácil de clasificar como infraestructura de alojamiento.
Esto no significa que se bloquee todas las solicitudes procedentes de centros de datos.
Significa que la propia IP puede aportar menos indicios de que el cliente se asemeja a un consumidor habitual.
Proxies residenciales
Los proxies residenciales enrutan las solicitudes a través de direcciones IP asociadas a conexiones a Internet de consumidores.
Esto puede proporcionar un perfil de red más adecuado para cargas de trabajo relacionadas con sitios web públicos dirigidos a consumidores.
Pero una IP residencial no equivale a un usuario humano.
DataDome documenta explícitamente modelos capaces de identificar el tráfico automatizado enrutado a través de proxies residenciales.
Por lo tanto, la forma más útil de considerar los proxies residenciales es:
mejor identidad de red
y no:
elusión automática de la protección contra bots
Proxies de ISP
Los proxies de ISP pueden ofrecer sesiones estables al utilizar el espacio de IP asociado a los proveedores de servicios de Internet (ISP) de los consumidores.
Para flujos de trabajo que requieren una identidad constante a lo largo de una sesión más prolongada, esa estabilidad puede resultar valiosa.
Una vez más, el resto del cliente sigue siendo importante.
Por qué la rotación constante de proxies puede resultar contraproducente
«Rotar con más frecuencia» parece un consejo obvio.
No siempre es correcto.
Imagina una sesión en un sitio web que dura cinco minutos.
Un usuario real mantendría normalmente la misma identidad de red durante la mayor parte de esa sesión.
Si tu automatización cambia de país o de red cada tres solicitudes, al tiempo que conserva las mismas cookies y la misma sesión de cuenta, esa combinación puede resultar poco natural.
Para algunas cargas de trabajo, las sesiones rotativas son adecuadas.
Para otras, las sesiones persistentes producen un comportamiento más coherente.
Una estrategia de proxy debe ajustarse a la estructura de la aplicación a la que estás accediendo.
¿Qué ocurre con los programas de resolución de CAPTCHA?
El CAPTCHA no es necesariamente el punto de partida del proceso de decisión de DataDome.
Puede ser una respuesta posterior a que otra detección ya haya marcado la sesión como sospechosa.
Esa distinción es importante.
Resolver un CAPTCHA no soluciona automáticamente:
- una huella digital del navegador sospechosa;
- una pila TLS incoherente;
- una mala reputación de la IP;
- un comportamiento de sesión imposible.
DataDome ha hablado públicamente sobre la detección de granjas de CAPTCHA y entornos automatizados incluso después de que se haya resuelto un desafío.
Por lo tanto, considerar que resolver el CAPTCHA es el único problema es pasar por alto el sistema más amplio que lo rodea.
Por qué un scraper puede funcionar hoy y fallar mañana
Esta es otra fuente habitual de confusión.
No cambia nada en tu código.
De repente, la tasa de éxito cae.
Eso no significa necesariamente que el sitio web de destino haya cambiado su diseño.
Los sistemas de gestión de bots modifican continuamente su lógica de detección.
También cambian otras variables:
- la reputación de las direcciones IP evoluciona;
- se actualizan las versiones de los navegadores;
- cambian las políticas de los sitios web;
- aumenta el volumen de tráfico;
- cambia tu patrón de solicitudes;
- un sitio objetivo activa una protección más estricta para un punto final específico.
Por lo tanto, el scraping frente a los sistemas antibots modernos es un problema operativo, no un problema de configuración puntual.
DataDome y Playwright
Playwright resulta útil cuando un sitio web requiere una ejecución real en el navegador.
Puede cargar JavaScript, interactuar con las páginas y mantener el estado del navegador.
Esto lo hace mucho más potente que una simple biblioteca de solicitudes HTTP para sitios web modernos.
Sin embargo, Playwright no convierte automáticamente el tráfico en tráfico humano.
El sitio protegido puede seguir evaluando:
- las características del navegador;
- los indicios de automatización;
- la identidad de red;
- las sesiones;
- la frecuencia de las solicitudes;
- el comportamiento.
Por eso, un rastreador basado en Playwright puede funcionar bien en fase de desarrollo y resultar poco fiable a gran escala.
La automatización del navegador resuelve la ejecución en el navegador.
No resuelve todas las capas antibots que rodean al navegador.
DataDome y Puppeteer
El mismo principio se aplica a Puppeteer.
El uso de Chromium proporciona al rastreador un entorno de cliente mucho más rico que el HTTP sin procesar.
Esto resulta útil para:
- aplicaciones renderizadas por el cliente;
- páginas dinámicas;
- navegación mediante JavaScript;
- contenido cargado tras el HTML inicial;
- aplicaciones que requieren cookies o el estado del navegador.
Pero el navegador, la IP y el comportamiento siguen teniendo que formar una sesión coherente.
Puppeteer es un marco de automatización del navegador.
No es una capa de invisibilidad.
La pila de scraping que realmente importa
En lugar de preguntarse:
«¿Qué proxy elude DataDome?»
resulta más útil pensar en capas.
| Problema | Capa relevante |
|---|
| Mala reputación de la IP | Proxy/red |
| Ubicación incorrecta | Proxy con segmentación geográfica |
| Se requiere JavaScript | Navegador/renderización |
| Contenido dinámico | Navegador/renderización |
| Inconsistencia de TLS | Pila HTTP/navegador |
| Discrepancia en la huella digital del navegador | Entorno del navegador |
| Inestabilidad de la sesión | Gestión de cookies/sesiones |
| Patrón de solicitudes excesivo | Arquitectura de rastreo |
| CAPTCHA/desafío | Gestión de desafíos |
| Mantenimiento constante contra bots | Infraestructura de scraping gestionada |
Esto agiliza mucho la resolución de problemas.
Dejas de intentar resolver cada problema cambiando el proxy.
Tres formas de recopilar datos de un sitio protegido por DataDome
Para la recopilación legítima de datos, en la que se te permite acceder al sitio de destino, existen, a grandes rasgos, tres arquitecturas.
1. Crear tú mismo el scraper
Tú controlas todo:
- cliente HTTP;
- navegador;
- proxy;
- sesión;
- lógica de reintentos;
- análisis sintáctico;
- representación;
- supervisión.
Ventajas:
Máximo control.
Desventajas:
Máximo mantenimiento.
Esto tiene sentido cuando tu flujo de trabajo es lo suficientemente inusual como para justificar el control de toda la pila.
2. Utilizar proxies con tu propio navegador o rastreador
Arquitectura:
tu rastreador → red de proxies → destino
Esto te permite mantener el control de la aplicación al tiempo que externalizas la infraestructura de red.
Resulta útil cuando tus principales problemas tienen que ver con:
- la reputación de la IP;
- segmentación geográfica;
- concurrencia;
- rotación de redes;
- sesiones estables.
Los proxies residenciales de Geonode, por ejemplo, admiten la segmentación geográfica y configuraciones de sesiones tanto rotativas como persistentes.
Sin embargo, tu aplicación sigue siendo responsable de todo lo que se encuentra por encima de la capa de proxy.
3. Utilizar una API de scraping
Arquitectura:
tu aplicación → API de scraping → destino
En lugar de encargarte tú mismo de los navegadores, la selección de proxies y la infraestructura de extracción, envías la URL a un servicio diseñado para la recopilación de datos web.
Esto suele ser más adecuado cuando el requisito real es:
«Dame el contenido de la página».
en lugar de:
«Quiero mantener un equipo encargado de la infraestructura anti-bot y de navegadores».
Scraper API de , por ejemplo, puede devolver el contenido renderizado de la página en formato HTML o Markdown y ofrece renderización en JavaScript, infraestructura de proxies gestionada, segmentación geográfica, procesamiento por lotes y rastreo.
La distinción importante es quién asume la responsabilidad de la complejidad.
Con los proxies:
tú controlas la pila.
Con una API de scraping:
la plataforma de scraping gestiona una mayor parte de la pila.
Ninguno de los dos modelos es mejor en todos los casos.
Resuelven problemas de ingeniería diferentes.
Proxy, navegador y API de extracción de datos
| Solución | Cambia la IP | Ejecuta JS | Gestiona el navegador | Se encarga de la extracción | Tu mantenimiento |
|---|
| Solo proxy | Sí | No | No | No | Alto |
| Playwright + proxy | Sí | Sí | Tú | Tú | Alto |
| Puppeteer + proxy | Sí | Sí | Tú | Tú | Alto |
| API de scraping | Gestionado | Sí, si es compatible | Gestionado | Gestionado | Menor |
Por eso, decirle a alguien que «simplemente utilice proxies residenciales» es un consejo incompleto.
A veces, eso es exactamente lo que necesitan.
Otras veces, el proxy es solo una parte de un problema mucho mayor.
Cómo solucionar problemas con los bloqueos de DataDome
Cuando las solicitudes empiecen a fallar, no cambies diez cosas a la vez.
Diagnostica la capa.
Problema: Funciona en el navegador, falla en el script
Posibles áreas que investigar:
- Ejecución de JavaScript;
- Diferencias entre clientes HTTP/TLS;
- Huella digital del navegador;
- Cookies;
- Estado de la sesión.
Cambiar la IP puede no surtir efecto si el fallo se origina en el cliente.
Problema: Funciona al principio, pero luego se bloquea
Fíjate en:
- la frecuencia de las solicitudes;
- los patrones de navegación repetitivos;
- la rotación de IP/sesiones;
- los problemas crecientes de reputación de la IP;
- la consistencia de la sesión.
La primera solicitud y la milésima solicitud no son equivalentes.
Problema: la IP del centro de datos falla, pero la residencial funciona
Es probable que la reputación de la red sea un factor importante en la decisión.
Eso, sin embargo, no demuestra que se estén ignorando otras señales.
Problema: el proxy residencial también falla
No concluyas inmediatamente que el proxy residencial es defectuoso.
Investiga:
- la huella digital del navegador o cliente;
- las características de TLS;
- los requisitos de JavaScript;
- las cookies;
- los patrones de solicitud;
- el diseño de la sesión.
Problema: el CAPTCHA aparece repetidamente
Un bucle de CAPTCHA puede indicar que la sesión en su conjunto sigue pareciendo sospechosa.
Considera el desafío como un síntoma, no necesariamente como la causa principal.
Problema: Los diferentes países producen resultados distintos
Comprueba si:
- el propio sitio web se comporta de forma diferente según la ubicación geográfica;
- cambia la disponibilidad del contenido;
- el estado de las cookies se mantiene constante;
- la geolocalización de la IP coincide con la sesión prevista.
¿Detecta DataDome los proxies residenciales?
Sí, puede hacerlo.
Esto se refleja explícitamente en la documentación sobre detección de DataDome.
Eso no significa que se bloquee todas las solicitudes procedentes de proxies residenciales.
Si fuera así, los usuarios legítimos que se conectan a través de redes compartidas de consumo generarían enormes problemas de falsos positivos.
La afirmación más precisa es:
Una IP residencial es un indicio, no una prueba de que se trate de un visitante humano.
La detección moderna la combina con otras pruebas.
¿Detecta DataDome Playwright?
DataDome documenta modelos de detección que abarcan navegadores controlados a través de marcos de automatización, incluidos Playwright, Puppeteer y Selenium.
Eso no significa que todas las sesiones de Playwright se bloqueen automáticamente.
Significa que la suposición:
«Playwright utiliza un navegador real, por lo que no puede detectarse»
es incorrecta.
¿Utiliza DataDome las huellas digitales de navegadores?
Sí.
Las huellas digitales de navegadores y dispositivos forman parte de la arquitectura de detección de DataDome.
Esto permite al sistema comparar la información expuesta por el navegador y el entorno de ejecución, en lugar de basarse únicamente en identificadores simples como el encabezado User-Agent.
¿Utiliza DataDome la identificación de huellas de TLS?
La documentación de DataDome hace referencia a las huellas de TLS y recomienda las huellas JA3 y JA4 como señales disponibles para sus integraciones de la API de protección.
Esto es importante porque la conexión TLS se establece antes de que la lógica habitual de la aplicación web detecte la solicitud.
Por lo tanto, un rastreador puede tener encabezados HTTP perfectamente modificados y, aun así, seguir exponiendo una huella de red diferente de nivel inferior.
¿Utiliza DataDome el aprendizaje automático?
DataDome describe sus modelos de detección de amenazas como basados en el aprendizaje automático y actualizados continuamente.
El aprendizaje automático no es magia.
Su valor práctico en este contexto radica en la capacidad de combinar numerosas señales y patrones, en lugar de basarse en una única regla estática como, por ejemplo:
bloquear la IP tras 100 solicitudes.
¿Puede DataDome bloquear agentes de IA?
Sí.
El mercado de la gestión de bots se está expandiendo cada vez más, más allá de los rastreadores tradicionales, hacia los agentes de IA y los rastreadores LLM.
DataDome ahora admite explícitamente la identificación y autenticación de bots comerciales y agentes de IA, mientras que el tráfico automatizado no autenticado puede estar sujeto a sus políticas de detección de amenazas.
Es probable que esto cobre cada vez más importancia a medida que más sistemas de IA naveguen e interactúen directamente con los sitios web.
¿Se puede eludir DataDome?
Esta suele ser una pregunta de ingeniería errónea.
No existe ningún encabezado, tipo de proxy o indicador del navegador permanente que haga desaparecer un sistema de detección moderno.
Una configuración que funcione para un punto final con un determinado volumen de tráfico puede fallar:
- en otro punto final;
- a mayor escala;
- con otra versión del navegador;
- tras un cambio en los modelos de detección.
Para cargas de trabajo legítimas de datos web, la pregunta más sensata es:
¿Qué parte de mi pila de scraping está provocando que la solicitud se clasifique como automatizada, y quiero mantener esa capa yo mismo?
A veces, la respuesta es la infraestructura de red.
Utiliza una configuración de proxy adecuada.
A veces, la respuesta está en la representación.
Utiliza un navegador.
A veces, la respuesta es toda la pila operativa.
Utiliza una API de scraping gestionada.
Y, a veces, la respuesta correcta es utilizar una API oficial u otra fuente de datos autorizada en su lugar.
DataDome frente a Cloudflare
DataDome y Cloudflare se solapan en algunos segmentos del mercado de la gestión de bots, pero no deben considerarse productos idénticos.
Cloudflare ofrece una amplia plataforma de infraestructura que incluye CDN, DNS, WAF, mitigación de ataques DDoS y capacidades de gestión de bots.
DataDome se centra más específicamente en la detección de bots y del fraude en línea en sitios web, aplicaciones móviles y API.
Sin embargo, desde la perspectiva de un desarrollador de scrapers, la lección es similar:
la protección antibots moderna opera en múltiples capas.
Una estrategia eficaz no puede basarse únicamente en cambiar un encabezado HTTP.
DataDome frente a CAPTCHA
DataDome no es un servicio CAPTCHA.
El CAPTCHA es una posible respuesta tras la detección.
El sistema real que decide si un cliente es sospechoso se sitúa antes de eso.
Esta distinción es importante porque los desarrolladores suelen dedicar un enorme esfuerzo a intentar «resolver el CAPTCHA», mientras ignoran las señales que provocaron la aparición del desafío.
La pregunta más acertada es:
¿Por qué se cuestionó esta sesión en primer lugar?
Cuándo conviene utilizar proxies residenciales
Los proxies residenciales resultan útiles cuando la capa de red es importante.
Algunos ejemplos son las cargas de trabajo legítimas relacionadas con:
- contenido público específico por zona geográfica;
- resultados de búsqueda localizados;
- precios regionales;
- disponibilidad de productos;
- estudios de mercado;
- recopilación web distribuida.
Resultan especialmente útiles cuando se desea mantener el control total sobre el propio rastreador.
Los proxies residenciales de Geonode proporcionan enrutamiento a través de direcciones IP residenciales con segmentación geográfica y comportamiento de sesión configurable.
Pero un proxy debe seguir siendo lo que realmente es:
infraestructura de red.
No es un navegador.
No es un sistema CAPTCHA.
No es un motor de scraping.
Y no repara automáticamente una huella digital dañada.
Cuándo tiene más sentido un «Scraper API»
Un «Scraper API» resulta atractivo cuando el mantenimiento anti-bot empieza a dominar el desarrollo.
Deberías, como mínimo, plantearte utilizar una API gestionada cuando tu equipo dedique más tiempo a:
- actualizaciones del navegador;
- lógica de reintentos;
- orquestación de proxies;
- renderización;
- extracción;
- gestión de sesiones;
- solicitudes fallidas;
que al uso de los propios datos.
Con Geonode Scraper API, una aplicación puede enviar URL y recibir HTML o Markdown extraídos, mientras que el servicio gestiona la representación y la infraestructura de proxy detrás de la solicitud.
La disyuntiva es clara:
Desarrollarlo tú mismo te da más control.
Utilizar una API elimina el trabajo de infraestructura.
Elige en función de lo que tu producto realmente necesite.
Preguntas frecuentes
¿Qué es DataDome?
DataDome es una plataforma de protección contra bots y fraudes en línea diseñada para identificar el tráfico automatizado y malicioso en sitios web, aplicaciones móviles y API.
¿Cómo detecta DataDome los bots?
Combina múltiples señales, entre las que se incluyen la reputación de la IP, las huellas de HTTP y del navegador, las características de TLS, la información del dispositivo, los patrones de comportamiento y los modelos de detección basados en aprendizaje automático.
¿Por qué bloquea DataDome mi scraper?
Rara vez hay una única razón universal. La dirección IP, el cliente HTTP/TLS, el entorno del navegador, la compatibilidad con JavaScript, la coherencia de la sesión o el comportamiento de las solicitudes pueden influir.
¿Utiliza DataDome CAPTCHA?
Sí, el CAPTCHA puede ser una respuesta ante el tráfico sospechoso. DataDome también puede realizar una comprobación de dispositivo invisible o bloquear directamente las solicitudes.
¿Qué es la comprobación de dispositivos de DataDome?
La comprobación de dispositivos es un mecanismo de verificación adicional que realiza comprobaciones del lado del cliente sin requerir necesariamente una interacción visible por parte del usuario. Evalúa las señales del dispositivo y de ejecución, y puede permitir, solicitar una verificación o bloquear al cliente en función del resultado.
¿Si cambio mi User-Agent, eludo DataDome?
Cambiar el User-Agent solo modifica un valor HTTP. No cambia automáticamente la conexión TLS, el entorno del navegador, la huella digital del dispositivo, las cookies ni el comportamiento.
¿Puede DataDome detectar Chrome sin interfaz gráfica?
DataDome documenta específicamente categorías de detección para navegadores sin interfaz gráfica y automatizados, incluidos los navegadores instrumentados a través de Puppeteer, Selenium y Playwright.
¿Puede DataDome detectar Playwright?
Puede identificar características asociadas a la automatización de navegadores, incluidos los entornos controlados por Playwright. El uso de Playwright no implica automáticamente que se bloquee una sesión, pero no debe considerarse intrínsecamente invisible.
¿Puede DataDome detectar Puppeteer?
Sí, DataDome cuenta con modelos de detección que abarcan la automatización basada en Puppeteer y Puppeteer Extra Stealth.
¿Puede DataDome detectar proxies residenciales?
DataDome cuenta con modelos de detección relacionados con el tráfico enrutado a través de proxies residenciales. Una IP residencial puede seguir siendo útil porque cambia la identidad de la red, pero no convierte automáticamente el tráfico automatizado en legítimo.
¿Son los proxies residenciales mejores que los de centro de datos para los sitios protegidos por DataDome?
Los proxies residenciales pueden proporcionar una identidad de red más cercana al tráfico habitual de los consumidores, lo que puede resultar útil en sitios dirigidos al público general. La elección correcta sigue dependiendo del objetivo, la carga de trabajo y otras capas de detección.
¿Necesito un navegador para extraer datos de un sitio protegido por DataDome?
No todas las páginas protegidas requieren un navegador. Sin embargo, los sitios web que se basan en la representación del lado del cliente o en Device Check pueden requerir la ejecución de JavaScript auténtico y un estado del navegador que un cliente HTTP básico no puede proporcionar.
¿Por qué recibo errores 403 de DataDome?
Un error 403 puede indicar que la solicitud se ha clasificado como sospechosa o automatizada. Comprueba que la respuesta provenga realmente de DataDome antes de dar por hecho que el sistema antibots es el responsable.
¿Por qué la página funciona manualmente pero no en Python?
Tu navegador habitual y la biblioteca HTTP de Python generan entornos de red, TLS, HTTP, JavaScript y de navegador muy diferentes. Un sistema antibots puede detectar algunas de esas diferencias.
¿Por qué mi rastreador funciona durante unas cuantas solicitudes y luego se detiene?
Entre las posibles causas se incluyen la detección de comportamientos, los patrones de frecuencia, los cambios en la reputación de la IP o las sesiones inconsistentes. Los sistemas antibots pueden evaluar la actividad a lo largo de varias solicitudes, en lugar de juzgar cada solicitud de forma aislada.
¿La rotación de proxies resuelve el problema de DataDome?
No por sí sola.
La rotación cambia la identidad de red. No cambia automáticamente la huella digital del navegador, el cliente TLS, el entorno de JavaScript ni el comportamiento de las solicitudes.
¿Es una API de scraping mejor que los proxies?
Resuelven problemas diferentes.
Utiliza proxies cuando quieras controlar tu scraper y necesites principalmente infraestructura de red.
Utiliza una API de scraping cuando quieras que se gestione por ti una mayor parte de la infraestructura del navegador, el proxy, la representación y la extracción.
En resumen
Lo más importante que hay que entender sobre DataDome es que no existe una única «señal de bot».
La detección moderna de bots analiza todas las capas.
Una solicitud no es solo una dirección IP.
Es:
una IP
que establece una conexión TLS
que envía encabezados HTTP
desde un navegador o una aplicación
dentro de una sesión
con un historial
y un patrón de comportamiento.
Cuanto más coincidan entre sí esos elementos, más coherente parecerá el cliente.
Por eso, cambiar de IP puede solucionar un problema y dejar otros cinco sin resolver.
Es por eso por lo que Playwright resuelve la ejecución de JavaScript sin resolver todos los problemas de detección.
Y es por eso por lo que existen, en primer lugar, las API de scraping gestionadas.
Si necesitas un control total, crea tú mismo la pila y utiliza proxies como infraestructura de red.
Si lo que necesitas principalmente es contenido web fiable sin tener que ocuparte del mantenimiento de navegadores ni de la gestión de proxies, utiliza una API de scraping.
Lo importante es saber qué capa estás intentando solucionar realmente.