Notre intérêt, déclaré : nous sommes Geonode et nous vendons des proxies, c'est-à-dire l'infrastructure que vous utiliseriez pour collecter des données web vous-même. La position honnête est que presque personne ne devrait. Les corpus publics ci-dessous représentent d'énormes volumes de filtrage, de déduplication et de soin juridique, ils sont gratuits, et reproduire ne serait-ce qu'une fraction de ce travail est un programme de recherche, pas un projet. Là où la collecte se justifie vraiment — un domaine étroit que personne n'a publié, ou des données fraîches après la date de coupure d'un corpus — c'est un travail petit et ciblé, pas un crawl à l'échelle du web. Cette section est à la fin et elle est courte, exprès.
La couche en dessous : Common Crawl
Presque tous les corpus web ouverts dérivent de la même source.
Common Crawl est une archive web gratuite contenant des milliards de pages, publiée sous forme d'instantanés de crawl périodiques sur AWS S3 dans us-east-1 et disponible en HTTP à data.commoncrawl.org. L'accès anonyme fonctionne avec l'AWS CLI via --no-sign-request, ou avec des outils ordinaires comme wget et curl.
Il publie trois formats, et savoir lequel vous voulez économise une bande passante considérable :
WARC — "the raw data from the crawl, providing a direct mapping to the crawl process", y compris réponses HTTP, requêtes et métadonnées. Complet et très volumineux.
WAT — fichiers "Web Archive Transformation" contenant des métadonnées calculées en JSON, y compris en-têtes HTTP et liens de page. Le bon choix pour le travail de graphe de liens.
WET — fichiers "WARC Encapsulated Text" avec le texte brut extrait seulement. Le bon choix pour la modélisation de langage, et dramatiquement plus petits que WARC.
Le point important est que Common Crawl est un ingrédient brut, pas un jeu de données. Il contient du boilerplate, de la navigation, du spam, des doublons, de la traduction automatique et tous les autres artefacts du web ouvert. La valeur des corpus dérivés ci-dessous est presque entièrement dans le filtrage, et c'est là que se trouve la recherche.
FineWeb
Le corpus web de Hugging Face, et le point de référence actuel pour les données web ouvertes à l'échelle.
FineWeb dérive de Common Crawl et contient 25,9 milliards de lignes, couvrant les crawls de CC-MAIN-2013-20 à CC-MAIN-2025-26 — grosso modo mi-2013 à mi-2025. Il est publié sous ODC-BY, la licence Open Data Commons Attribution.
Chaque enregistrement porte des signaux de qualité, dont un score de langue et un nombre de tokens, qui comptent plus qu'il n'y paraît : ils permettent de filtrer le corpus plus loin pour vos propres besoins sans refaire le pipeline. Vouloir uniquement de l'anglais à haute confiance au-dessus d'un seuil de longueur est une expression de filtre, pas un travail de prétraitement.
FineWeb mérite d'être un point de départ parce que les décisions de filtrage sont documentées et ablatées, pas seulement affirmées. Quand un corpus vous dit quelles choix de filtrage ont amélioré les performances de benchmark en aval et de combien, vous pouvez être en désaccord avec eux délibérément.
Dolma
Le corpus d'Allen AI, et le plus transparent sur sa composition.
Dolma est décrit comme "a dataset of 3 trillion tokens from a diverse mix of web content, academic publications, code, books, and encyclopedic materials", comprenant 2,532 milliards de documents. La version 1.7, contenant 1,715 trillion de tokens, a servi à entraîner OLMo 7B-v1.7.
Ses sources sont nommées individuellement : pages web Common Crawl, code de StarCoder et The Stack, articles académiques de S2ORC et arXiv, Reddit, livres Project Gutenberg, et Wikipedia.
Il est publié sous ODC-BY, avec une réserve importante dite clairement : les utilisateurs "are also bound by the original licenses of constituent sources". C'est la phrase à lire deux fois. Une licence permissive sur la compilation n'annule pas les licences de ce qui y est entré, et c'est vrai de tout corpus dérivé, qu'il le dise aussi clairement ou non.
Deux autres points rendent Dolma digne d'attention au-delà de son contenu. Allen AI a publié le kit de curation en open source, donc le jeu est reproductible plutôt que seulement téléchargeable — vous pouvez changer une décision de filtrage et reconstruire. Et il y a un mécanisme de retrait : un formulaire pour notifier les mainteneurs de documents contenant des informations personnelles d'un utilisateur précis.
Cette combinaison — sources nommées, outillage ouvert, un chemin de retrait — est ce à quoi ressemble une publication responsable de jeux de données, et c'est un standard raisonnable à exiger des autres.
The Stack v2
Le corpus de code, et le plus soigneux des grands jeux sur le plan des licences.
The Stack v2 du BigCode Project est "a collection of source code in over 600 programming languages", contenant 3,28 milliards de fichiers uniques totalisant 67,53 To non compressés, couvrant 658 langages. Les variantes d'entraînement sont filtrées vers 17 ou plus de 600 langages selon la version.
Sa provenance est inhabituelle et mérite d'être notée : les données dérivent de l'archive Software Heritage, décrite comme "the largest public archive of software source code", combinée aux métadonnées GitHub Archive jusqu'en septembre 2023.
Deux mécanismes le distinguent.
Filtrage des licences. Le jeu "contains only permissively licensed code". Les créateurs "propagate the detected licenses to all files" au sein des dépôts et tiennent une liste curatée d'identifiants SPDX acceptables fondée sur les approbations du Blue Oak Council. C'est une approche nettement plus rigoureuse que de filtrer sur le champ de licence déclaré d'un dépôt.
Opt-out développeur. Il existe un outil "Am I In The Stack?" pour vérifier l'inclusion, un processus de retrait documenté, et le jeu est "regularly updated to enact validated data removal requests".
Quoi que l'on pense de l'entraînement sur du code public, c'est l'implémentation la plus défendable actuellement disponible, et le mécanisme d'opt-out est réel plutôt qu'un geste.
Licences et provenance
La partie qui détermine si vous pouvez réellement utiliser quoi que ce soit de tout cela, et elle a plus de couches qu'un seul champ de licence ne le suggère.
La licence de compilation n'est pas la licence du contenu. ODC-BY sur FineWeb ou Dolma régit la collection. Les documents sous-jacents portent leur propre droit d'auteur, et Dolma le dit explicitement. Une licence de jeu permissive signifie que les compilateurs ne vous restreignent pas davantage ; cela ne signifie pas que le contenu était à eux à relicencier.
L'attribution est une exigence, pas une courtoisie. ODC-BY est une licence d'attribution. Si vous utilisez ces jeux, attribuez-les.
Les opt-out deviennent la norme et méritent d'être honorés. Le processus de retrait de The Stack et le formulaire d'informations personnelles de Dolma existent parce que publier à cette échelle crée des obligations. Utiliser un jeu, c'est hériter de la version que vous avez téléchargée — donc re-télécharger périodiquement est la façon dont les retraits prennent réellement effet dans votre copie.
Les données personnelles ont leur propre régime. Les corpus à l'échelle du web contiennent des informations personnelles, et dans les juridictions avec une loi de protection des données cela crée des obligations pour vous en tant que responsable de traitement, indépendamment de toute licence de jeu. « C'était dans un jeu public » n'est pas une base légale.
Et l'environnement juridique est instable. Si l'entraînement sur du matériel protégé par le droit d'auteur est permis, et sous quelles conditions, est activement plaidé dans plusieurs juridictions. Dans l'UE, le cadre de fouille de textes et de données envisage des réserves de droits lisibles par machine, et les mécanismes pour les exprimer sont encore en train de se fixer. Quiconque construit un produit là-dessus devrait le surveiller plutôt que d'assumer que la position d'aujourd'hui est définitive.
Évaluer un jeu avant de l'utiliser
Un corpus n'est pas une boîte noire, et une demi-heure d'inspection avant d'engager stockage et calcul vous dira plus que n'importe quel résumé de model card.
Échantillonnez et lisez. Tirez quelques centaines de documents au hasard et lisez-les vraiment. Cela sonne peu sérieux et c'est la chose isolément la plus informative que vous puissiez faire. En quelques minutes vous saurez si le retrait de boilerplate a marché, combien de texte traduit automatiquement est présent, et si le mélange de domaines correspond à ce que la description affirme.
Vérifiez la distribution des langues par rapport à vos besoins. Un corpus décrit comme multilingue peut être à 90 % de l'anglais avec une longue traîne, ce qui convient si vous voulez de l'anglais et est inutile si vous voulez du portugais. Là où des signaux de qualité comme un score de langue sont fournis — FineWeb en inclut un — utilisez-les plutôt que de faire confiance au titre.
Mesurez la duplication vous-même. Même les corpus dédupliqués contiennent des quasi-doublons, et le taux varie selon la source. Hachez un échantillon et comptez les collisions ; si le taux est élevé, vous entraînez sur le même contenu de façon répétée et votre jeu effectif est plus petit que le nombre de tokens ne le suggère.
Vérifiez la date de coupure. Chaque corpus en a une, et elle détermine ce que le modèle résultant ne peut pas savoir. Les crawls de FineWeb vont jusqu'à mi-2025 ; tout ce qui est plus récent est absent. Pour un domaine qui bouge vite, cela peut disqualifier indépendamment de tout le reste.
Cherchez une contamination contre votre jeu d'évaluation. Si les questions et réponses de votre benchmark apparaissent dans le corpus d'entraînement, votre évaluation mesure de la mémorisation. C'est courant, facile à vérifier par recherche de sous-chaîne sur un échantillon, et cela invalide les résultats d'une façon embarrassante à découvrir après publication.
Et vérifiez le coût de stockage et de bande passante avant de télécharger. The Stack v2 fait 67,53 To non compressés. Les téléchargements de plusieurs téraoctets ont des coûts réels de transfert, de stockage et de temps, et streamer un sous-ensemble directement depuis le stockage objet est souvent un meilleur plan que de tout tirer pour découvrir que vous en vouliez un dixième.
Avez-vous vraiment besoin d'un jeu d'entraînement ?
La question qui mérite d'être posée avant tout ce qui précède.
Pour pré-entraîner un modèle from scratch, oui — et c'est une entreprise à l'échelle de la recherche. Du calcul dans les centaines de milliers d'heures GPU, une équipe qui l'a déjà fait, et une raison pour laquelle un modèle open-weight existant ne suffira pas. Très peu d'organisations sont dans cette position, et celles qui le sont le savent déjà.
Pour le fine-tuning, vous avez besoin de quelque chose d'entièrement différent : un jeu modeste, de haute qualité, spécifique à la tâche. Des milliers d'exemples plutôt que des trillions de tokens, et le travail est dans la curation plutôt que dans l'échelle. Aucun des corpus ci-dessus n'est la bonne entrée.
Pour la recherche, vous avez besoin de vos propres documents indexés, pas d'un corpus d'entraînement du tout. C'est le cas auquel une part énorme des demandes « nous avons besoin de données d'entraînement » se révèle être, et cela se résout par un index vectoriel sur du contenu que vous avez déjà.
Pour l'évaluation, vous avez besoin d'un jeu réservé représentatif de votre tâche réelle, construit à la main et petit.
Le mode d'échec que cette section existe pour empêcher est de télécharger un corpus de plusieurs téraoctets pour un problème qui avait besoin de deux cents exemples curatés. Cela arrive, et l'effort gaspillé est considérable.
Construire le vôtre, honnêtement
Si vous avez établi que vous avez besoin de données de domaine que personne n'a publiées, voici ce que cela implique vraiment — et où notre produit s'insère.
La collecte est la partie facile et la plus petite. Récupérer des pages est un problème résolu. Chaque fois que possible, préférez des voies sanctionnées : API, exports en masse, flux partenaires, archives existantes. Le crawling est le dernier recours, pas la première étape, et il s'accompagne d'obligations — robots.txt, conditions d'utilisation, droit d'auteur, droits de base de données, et droit de la protection des données dès que des données personnelles sont concernées.
Le nettoyage est l'essentiel du travail. Retrait de boilerplate, identification de langue, filtrage de qualité, détection de quasi-doublons à l'échelle, détection et retrait d'informations personnelles. Les corpus publiés représentent un effort énorme ici, et le kit ouvert de Dolma mérite d'être étudié avant d'écrire le vôtre — réutiliser un pipeline documenté est bien mieux que d'en réinventer un mal.
La déduplication mérite une attention particulière. Les quasi-doublons dégradent l'entraînement et gonflent le volume apparent de données. Le faire correctement à l'échelle exige MinHash ou une technique similaire, et c'est l'étape la plus susceptible d'être sautée et la plus susceptible de compter.
La documentation n'est pas optionnelle. Notez pourquoi le jeu existe, ce qu'il contient, comment et quand il a été collecté, ce qui manque, et à quoi il ne devrait pas servir. C'est la différence entre un actif et un passif, et c'est presque impossible à reconstruire plus tard.
Où les proxies interviennent : collecte en volume depuis de nombreuses sources, ou là où le contenu diffère selon la région. La bande passante datacenter est le défaut raisonnable — la nôtre commence à 0,14 $/Go — avec du résidentiel à partir de 0,79 $/Go seulement là où c'est démontrablement nécessaire, depuis notre page tarifs, vérifiée en septembre 2026.
Et où ils n'interviennent pas : si les données dont vous avez besoin sont dans un corpus publié, acheter de la bande passante pour les recréer est tout simplement du gaspillage. Vérifiez d'abord. Les corpus ci-dessus couvrent un terrain énorme, et le travail de filtrage qui y est intégré vaut plus que le texte brut.
Questions fréquentes
Quels jeux sont utilisés pour entraîner les LLM ?
La plupart des modèles ouverts s'entraînent sur des corpus web dérivés de Common Crawl — FineWeb et Dolma sont les points de référence actuels — mélangés avec du code de The Stack, des articles académiques, des livres et du contenu encyclopédique. Dolma nomme ses sources individuellement, ce qui est inhabituel et utile.
Common Crawl est-il gratuit à utiliser ?
Les données sont librement accessibles sur AWS S3 et en HTTP, avec un accès anonyme pris en charge. Il publie les formats WARC, WAT et WET, et ses conditions d'utilisation s'appliquent. Notez que l'accès gratuit à une archive web ne résout pas le statut de droit d'auteur des pages qu'elle contient.
Sous quelle licence sont les principaux jeux LLM ?
FineWeb et Dolma sont ODC-BY, la licence Open Data Commons Attribution. Dolma affirme explicitement que les utilisateurs sont aussi liés par les licences originales des sources constituantes — la licence de compilation n'annule pas le droit d'auteur des documents sous-jacents.
Puis-je retirer mes données d'un jeu d'entraînement ?
Parfois. The Stack v2 fournit un outil "Am I In The Stack?" et un processus de retrait documenté, et est mis à jour pour appliquer les demandes de retrait validées. Dolma offre un formulaire pour signaler des documents contenant des informations personnelles. Les mécanismes varient selon le jeu et ne sont pas universels.
Quelle est la taille des jeux d'entraînement LLM ?
Dolma fait 3 trillions de tokens sur 2,532 milliards de documents. FineWeb contient 25,9 milliards de lignes couvrant Common Crawl de 2013 à 2025. The Stack v2 a 3,28 milliards de fichiers totalisant 67,53 To non compressés sur 658 langages de programmation.
Ai-je besoin d'un jeu d'entraînement pour fine-tuner un modèle ?
Non — vous avez besoin d'un petit jeu de haute qualité, spécifique à la tâche, typiquement des milliers d'exemples plutôt que des trillions de tokens. Les grands corpus de pré-entraînement sont la mauvaise entrée entièrement, et le travail du fine-tuning est la curation plutôt que l'échelle.
Devrais-je construire mon propre jeu d'entraînement ?
Seulement pour des données de domaine que personne n'a publiées. Les corpus publics incarnent un énorme effort de filtrage et de déduplication difficile à reproduire, et la plupart des besoins étiquetés « données d'entraînement » se révèlent être des problèmes de recherche ou de fine-tuning nécessitant bien moins. Vérifiez d'abord les corpus existants.
Quelle est la partie la plus dure de la construction d'un jeu ?
Le nettoyage et la déduplication, pas la collecte. Le retrait de boilerplate, l'identification de langue, le filtrage de qualité, la détection de quasi-doublons à l'échelle et le traitement des informations personnelles représentent presque tout l'effort. Le kit ouvert Dolma d'Allen AI mérite d'être étudié avant d'écrire votre propre pipeline.
Conclusion
Les jeux LLM publics sont une ressource remarquable : des trillions de tokens, un filtrage documenté, des licences de compilation permissives, et dans les meilleurs cas un outillage ouvert et des mécanismes d'opt-out qui fonctionnent. FineWeb pour le texte web, Dolma pour un mélange documenté, The Stack v2 pour le code, tous construits sur Common Crawl ou Software Heritage en dessous.
Deux choses valent d'être emportées sur leur utilisation. La licence de compilation n'est pas la licence du contenu — Dolma le dit directement et c'est vrai de tous — donc une licence de jeu permissive est le début de votre analyse juridique plutôt que la fin. Et les mécanismes d'opt-out ne fonctionnent que si vous re-téléchargez, puisque votre copie téléchargée est figée au moment où vous l'avez prise.
La conclusion plus utile porte sur le périmètre. La plupart des besoins décrits comme nécessitant des données d'entraînement se révèlent être des problèmes de recherche, résolus en indexant des documents que vous avez déjà, ou de fine-tuning, résolus par quelques milliers d'exemples soigneusement choisis. Les deux sont bien plus petits et bien plus traitables que tout ce qui est sur cette page.
Et si vous avez vraiment besoin de collecter des données que personne n'a publiées, la collecte est la partie facile. Le filtrage, la déduplication et la documentation sont le travail — ce qui est exactement pourquoi les corpus publiés valent tellement plus que le texte brut qu'ils contiennent.
