Geonode logo
Geonode Team

Geonode Team

Actualizado: 7 de septiembre de 2026

Publicado: 2 de septiembre de 2026

Conjuntos de datos para entrenar LLMs: qué son y cómo usarlos

Los conjuntos públicos para entrenar LLMs son grandes, están bien documentados y en su mayoría tienen licencias permisivas. También son más heterogéneos de lo que sugiere «un montón de texto web», y las diferencias entre ellos importan más que sus tamaños. Esta guía cubre los corpora principales con cifras verificadas, las cuestiones de licencia y procedencia que determinan si puedes usarlos, y lo que implica realmente construir el tuyo. Incluyendo la observación honesta de que la mayoría de quienes se hacen esta pregunta no necesitan preentrenar nada.

Nuestro interés, declarado: somos Geonode y vendemos proxies, que es la infraestructura que usarías para recoger datos web por tu cuenta. La posición honesta es que casi nadie debería. Los corpora públicos de abajo representan cantidades enormes de filtrado, deduplicación y cuidado legal, son gratuitos, y reproducir siquiera una fracción de ese trabajo es un programa de investigación, no un proyecto. Donde la recogida sí se justifica — un dominio estrecho que nadie ha publicado, o datos frescos posteriores al corte de un corpus — es un trabajo pequeño y puntual, no un crawl a escala web. Esa sección está al final y es corta, a propósito.

La capa de debajo: Common Crawl

Casi todo corpus abierto de la web deriva de la misma fuente.

Common Crawl es un archivo web gratuito con miles de millones de páginas, publicado como instantáneas periódicas de crawl en AWS S3 en us-east-1 y disponible por HTTP en data.commoncrawl.org. El acceso anónimo funciona con la AWS CLI usando --no-sign-request, o con herramientas habituales como wget y curl.

Publica tres formatos, y saber cuál quieres ahorra un ancho de banda considerable:

WARC — "the raw data from the crawl, providing a direct mapping to the crawl process", incluidas respuestas HTTP, peticiones y metadatos. Completo y muy grande.

WAT — archivos "Web Archive Transformation" con metadatos calculados en JSON, incluidos encabezados HTTP y enlaces de la página. La elección correcta para trabajo de grafo de enlaces.

WET — archivos "WARC Encapsulated Text" solo con texto plano extraído. La elección correcta para modelado de lenguaje, y dramáticamente más pequeños que WARC.

Lo importante es que Common Crawl es un ingrediente crudo, no un conjunto de datos. Contiene boilerplate, navegación, spam, duplicados, traducción automática y todo el resto de artefactos de la web abierta. El valor de los corpora derivados de abajo está casi entero en el filtrado, y ese filtrado es donde está la investigación.

FineWeb

El corpus web de Hugging Face, y el punto de referencia actual para datos abiertos de la web a escala.

FineWeb deriva de Common Crawl y contiene 25.900 millones de filas, cubriendo crawls de CC-MAIN-2013-20 a CC-MAIN-2025-26 — más o menos de mediados de 2013 a mediados de 2025. Se publica bajo ODC-BY, la licencia Open Data Commons Attribution.

Cada registro lleva señales de calidad, incluida una puntuación de idioma y un recuento de tokens, que importan más de lo que suenan: permiten filtrar el corpus más adelante para tus propósitos sin rehacer el pipeline. Querer solo inglés de alta confianza por encima de un umbral de longitud es una expresión de filtro, no un trabajo de preprocesado.

FineWeb merece empezar por él porque las decisiones de filtrado están documentadas y ablacionadas, no solo afirmadas. Cuando un corpus te dice qué elecciones de filtrado mejoraron el rendimiento en benchmarks posteriores y en cuánto, puedes discrepar de ellas a propósito.

Dolma

El corpus de Allen AI, y el más transparente sobre su composición.

Dolma se describe como "a dataset of 3 trillion tokens from a diverse mix of web content, academic publications, code, books, and encyclopedic materials", con 2.532 millones de documentos. La versión 1.7, con 1,715 billones de tokens, se usó para entrenar OLMo 7B-v1.7.

Las fuentes se nombran de forma individual: páginas web de Common Crawl, código de StarCoder y The Stack, artículos académicos de S2ORC y arXiv, Reddit, libros de Project Gutenberg y Wikipedia.

Se publica bajo ODC-BY, con un aviso importante dicho con claridad: los usuarios "are also bound by the original licenses of constituent sources". Esa es la frase para leer dos veces. Una licencia permisiva de la compilación no anula las licencias de lo que entró en ella, y esto es cierto de todo corpus derivado, diga o no tan claro.

Dos puntos más hacen que Dolma merezca atención más allá de su contenido. Allen AI publicó el kit de curación como código abierto, así que el conjunto es reproducible, no solo descargable: puedes cambiar una decisión de filtrado y reconstruir. Y hay un mecanismo de retirada: un formulario para notificar a los mantenedores documentos que contengan información personal de un usuario concreto.

Esa combinación — fuentes nombradas, herramientas abiertas, una vía de retirada — es lo que parece una publicación responsable de conjuntos, y es un estándar razonable para exigir a los demás.

The Stack v2

El corpus de código, y el más cuidadoso de los grandes conjuntos respecto a las licencias.

The Stack v2 del BigCode Project es "a collection of source code in over 600 programming languages", con 3.280 millones de archivos únicos que suman 67,53 TB sin comprimir, abarcando 658 lenguajes. Las variantes de entrenamiento se filtran a 17 o a más de 600 lenguajes según la versión.

Su procedencia es inusual y merece nota: los datos derivan del archivo Software Heritage, descrito como "the largest public archive of software source code", combinado con metadatos de GitHub Archive hasta septiembre de 2023.

Dos mecanismos lo distinguen.

Filtrado de licencia. El conjunto "contains only permissively licensed code". Los creadores "propagate the detected licenses to all files" dentro de los repositorios y mantienen una lista curada de identificadores SPDX aceptables basada en las aprobaciones del Blue Oak Council. Es un enfoque bastante más rigoroso que filtrar por el campo de licencia declarado del repositorio.

Exclusión del desarrollador. Hay una herramienta "Am I In The Stack?" para comprobar inclusión, un proceso de retirada documentado, y el conjunto se "regularly updated to enact validated data removal requests".

Se piense lo que se piense de entrenar con código público, esta es la implementación más defendible disponible hoy, y el mecanismo de exclusión es de verdad, no un gesto.

Licencias y procedencia

La parte que determina si realmente puedes usar cualquiera de esto, y tiene más capas de las que sugiere un solo campo de licencia.

La licencia de la compilación no es la licencia del contenido. ODC-BY en FineWeb o Dolma rige la colección. Los documentos subyacentes llevan su propio derecho de autor, y Dolma lo dice de forma explícita. Una licencia permisiva del conjunto significa que los compiladores no te restringen más; no significa que el contenido fuera suyo para relicenciar.

La atribución es un requisito, no una cortesía. ODC-BY es una licencia de atribución. Si usas estos conjuntos, atribúyelos.

Las exclusiones se están volviendo estándar y conviene honrarlas. El proceso de retirada de The Stack y el formulario de información personal de Dolma existen porque publicar a esta escala crea obligaciones. Usar un conjunto significa heredar la versión que descargaste: volver a bajar periódicamente es cómo las retiradas entran de hecho en tu copia.

Los datos personales tienen su propio régimen. Los corpora a escala web contienen información personal, y en jurisdicciones con ley de protección de datos eso crea obligaciones para ti como encargado, con independencia de cualquier licencia del conjunto. «Estaba en un conjunto público» no es una base lícita.

Y el entorno legal está abierto. Si entrenar con material protegido por derecho de autor está permitido, y bajo qué condiciones, se litiga de forma activa en varias jurisdicciones. En la UE, el marco de minería de textos y datos contempla reservas de derechos legibles por máquina, y los mecanismos para expresarlas aún se están asentando. Quien construya un producto sobre esto debería vigilarlo, no asumir que la posición de hoy es definitiva.

Cómo evaluar un conjunto antes de usarlo

Un corpus no es una caja negra, y media hora de inspección antes de comprometer almacenamiento y cómputo te dirá más que cualquier resumen de model card.

Muestrea y lee. Baja unos cientos de documentos al azar y léelos de verdad. Suena poco serio y es lo más informativo que puedes hacer. En minutos averiguarás si la retirada de boilerplate funcionó, cuánto texto traducido por máquina hay y si la mezcla de dominios encaja con lo que afirma la descripción.

Comprueba la distribución de idiomas frente a tu necesidad. Un corpus descrito como multilingüe puede ser 90 % inglés con una cola larga, lo cual está bien si quieres inglés e inútil si quieres portugués. Donde se ofrecen señales de calidad como una puntuación de idioma — FineWeb incluye una — úsalas en vez de fiarte del titular.

Mide la duplicación tú mismo. Incluso los corpora deduplicados contienen cuasi-duplicados, y la tasa varía por fuente. Haz hash de una muestra y cuenta colisiones; si la tasa es alta, estás entrenando el mismo contenido una y otra vez y el conjunto efectivo es más pequeño de lo que sugiere el recuento de tokens.

Comprueba la fecha de corte. Todo corpus tiene una, y determina lo que el modelo resultante no puede saber. Los crawls de FineWeb llegan a mediados de 2025; todo lo más reciente está ausente. Para un dominio que se mueve rápido, esto puede descalificar con independencia del resto.

Busca contaminación frente a tu conjunto de evaluación. Si las preguntas y respuestas de tu benchmark aparecen en el corpus de entrenamiento, la evaluación está midiendo memorización. Es habitual, es fácil de comprobar con búsqueda de subcadenas en una muestra, e invalida resultados de un modo embarazoso de descubrir después de publicar.

Y comprueba el coste de almacenamiento y ancho de banda antes de descargar. The Stack v2 son 67,53 TB sin comprimir. Las descargas de varios terabytes tienen costes reales de transferencia, almacenamiento y tiempo, y transmitir un subconjunto directo desde object storage suele ser un plan mejor que bajarlo todo para descubrir que querías una décima parte.

¿De verdad necesitas un conjunto de entrenamiento?

La pregunta que conviene hacerse antes de todo lo anterior.

Para preentrenar un modelo desde cero, sí — y es una empresa a escala de investigación. Cómputo en cientos de miles de horas de GPU, un equipo que ya lo ha hecho y un motivo por el que un modelo open-weight existente no sirve. Muy pocas organizaciones están en esa posición, y las que lo están ya lo saben.

Para fine-tuning necesitas algo enteramente distinto: un conjunto modesto, de alta calidad, específico de la tarea. Miles de ejemplos en vez de billones de tokens, y el trabajo está en la curación, no en la escala. Ninguno de los corpora de arriba es la entrada correcta.

Para recuperación necesitas tus propios documentos indexados, no un corpus de entrenamiento. Este es el caso en que acaba revelándose una parte enorme de las consultas «necesitamos datos de entrenamiento», y se responde con un índice vectorial sobre contenido que ya tienes.

Para evaluación necesitas un conjunto reservado representativo de tu tarea real, hecho a mano y pequeño.

El modo de fallo que esta sección existe para evitar es descargar un corpus de varios terabytes para un problema que necesitaba doscientos ejemplos curados. Pasa, y el esfuerzo desperdiciado es considerable.

Construir el tuyo, con honestidad

Si has establecido que necesitas datos de dominio que nadie ha publicado, esto es lo que implica de verdad — y dónde encaja nuestro producto.

La recogida es la parte fácil y la más pequeña. Traer páginas es un problema resuelto. Siempre que sea posible, prefiere rutas sancionadas: APIs, exportaciones masivas, feeds de socios, archivos existentes. El crawling es el último recurso, no el primer paso, y viene con obligaciones — robots.txt, términos de servicio, derecho de autor, derechos de base de datos y ley de protección de datos donde hay datos personales.

La limpieza es la mayor parte del trabajo. Retirada de boilerplate, identificación de idioma, filtrado de calidad, detección de cuasi-duplicados a escala, detección y retirada de información personal. Los corpora publicados representan un esfuerzo enorme aquí, y el kit abierto de Dolma merece estudiarse antes de escribir el tuyo: reutilizar un pipeline documentado es mucho mejor que reinventar uno mal.

La deduplicación merece atención particular. Los cuasi-duplicados degradan el entrenamiento e inflan el volumen aparente de datos. Hacerlo bien a escala exige MinHash o una técnica similar, y es el paso más propenso a saltarse y el más propenso a importar.

La documentación no es opcional. Registra por qué existe el conjunto, qué contiene, cómo y cuándo se recogió, qué falta y para qué no debe usarse. Esa es la diferencia entre un activo y un pasivo, y es casi imposible de reconstruir después.

Dónde entran los proxies: recogida a volumen desde muchas fuentes, o donde el contenido difiere por región. El ancho de banda de datacenter es el valor por defecto sensato — el nuestro empieza en 0,14 $/GB — con residencial desde 0,79 $/GB solo donde se demuestre necesario, de nuestra página de precios, comprobada en septiembre de 2026.

Y dónde no: si los datos que necesitas están en un corpus publicado, comprar ancho de banda para recrearlos es un desperdicio directo. Comprueba primero. Los corpora de arriba cubren un terreno enorme, y el trabajo de filtrado embebido en ellos vale más que el texto crudo.

Preguntas frecuentes

¿Qué conjuntos se usan para entrenar LLMs?

La mayoría de los modelos abiertos entrenan en corpora web derivados de Common Crawl — FineWeb y Dolma son los puntos de referencia actuales — mezclados con código de The Stack, artículos académicos, libros y contenido enciclopédico. Dolma nombra sus fuentes de forma individual, lo cual es inusual y útil.

¿Common Crawl es gratuito de usar?

Los datos son de acceso libre en AWS S3 y por HTTP, con acceso anónimo admitido. Publica formatos WARC, WAT y WET, y aplican sus términos de uso. Ten en cuenta que el acceso gratuito a un archivo web no resuelve el estatuto de derecho de autor de las páginas que contiene.

¿Bajo qué licencia están los principales conjuntos de LLMs?

FineWeb y Dolma son ODC-BY, la licencia Open Data Commons Attribution. Dolma afirma de forma explícita que los usuarios también están vinculados a las licencias originales de las fuentes constituyentes: la licencia de la compilación no anula el derecho de autor de los documentos subyacentes.

¿Puedo retirar mis datos de un conjunto de entrenamiento?

A veces. The Stack v2 ofrece una herramienta "Am I In The Stack?" y un proceso de retirada documentado, y se actualiza para aplicar solicitudes de retirada validadas. Dolma ofrece un formulario para informar de documentos con información personal. Los mecanismos varían por conjunto y no son universales.

¿De qué tamaño son los conjuntos de entrenamiento de LLMs?

Dolma tiene 3 billones de tokens en 2.532 millones de documentos. FineWeb contiene 25.900 millones de filas cubriendo Common Crawl de 2013 a 2025. The Stack v2 tiene 3.280 millones de archivos que suman 67,53 TB sin comprimir en 658 lenguajes de programación.

¿Necesito un conjunto de entrenamiento para hacer fine-tuning de un modelo?

No: necesitas un conjunto pequeño, de alta calidad, específico de la tarea, normalmente miles de ejemplos en vez de billones de tokens. Los grandes corpora de preentrenamiento son la entrada equivocada por completo, y el trabajo en el fine-tuning es curación, no escala.

¿Debo construir mi propio conjunto de entrenamiento?

Solo para datos de dominio que nadie ha publicado. Los corpora públicos encarnan un esfuerzo enorme de filtrado y deduplicación difícil de reproducir, y la mayoría de los requisitos etiquetados como «datos de entrenamiento» resultan ser problemas de recuperación o de fine-tuning que necesitan mucho menos. Comprueba primero los corpora existentes.

¿Cuál es la parte más difícil de construir un conjunto?

La limpieza y la deduplicación, no la recogida. La retirada de boilerplate, la identificación de idioma, el filtrado de calidad, la detección de cuasi-duplicados a escala y el tratamiento de información personal concentran casi todo el esfuerzo. El kit abierto Dolma de Allen AI merece estudiarse antes de escribir tu propio pipeline.

Conclusión

Los conjuntos públicos de LLMs son un recurso notable: billones de tokens, filtrado documentado, licencias de compilación permisivas y, en los mejores casos, herramientas abiertas y mecanismos de exclusión que funcionan. FineWeb para texto web, Dolma para una mezcla documentada, The Stack v2 para código, todos construidos sobre Common Crawl o Software Heritage debajo.

Dos cosas conviene llevarse sobre usarlos. La licencia de la compilación no es la licencia del contenido — Dolma lo dice de forma directa y es cierto de todos — así que una licencia permisiva del conjunto es el comienzo de tu análisis jurídico, no el final. Y los mecanismos de exclusión solo funcionan si vuelves a bajar, porque tu copia descargada queda congelada en el momento en que la tomaste.

La conclusión más útil es sobre el alcance. La mayoría de los requisitos descritos como necesidad de datos de entrenamiento resultan ser problemas de recuperación, resueltos indexando documentos que ya tienes, o de fine-tuning, resueltos con unos miles de ejemplos elegidos con cuidado. Ambos son mucho más pequeños y mucho más tratables que cualquier cosa de esta página.

Y si de verdad necesitas recoger datos que nadie ha publicado, la recogida es la parte fácil. El filtrado, la deduplicación y la documentación son el trabajo: exactamente por eso los corpora publicados valen tanto más que el texto crudo que contienen.