Unser Interesse, offengelegt: wir sind Geonode und verkaufen Proxys, also die Infrastruktur, mit der Sie Webdaten selbst sammeln würden. Die ehrliche Position ist, dass das fast niemand tun sollte. Die öffentlichen Corpora unten stehen für enorme Mengen an Filterung, Deduplizierung und rechtlicher Sorgfalt, sie sind kostenlos, und selbst einen Bruchteil dieser Arbeit zu reproduzieren ist ein Forschungsprogramm, kein Projekt. Wo Sammlung wirklich gerechtfertigt ist — eine enge Domäne, die niemand veröffentlicht hat, oder frische Daten nach einem Corpus-Stichtag — ist es ein kleiner, gezielter Job, kein Crawl im Web-Maßstab. Dieser Abschnitt steht am Ende und ist absichtlich kurz.
Die Schicht darunter: Common Crawl
Fast jeder offene Web-Corpus stammt aus derselben Quelle.
Common Crawl ist ein kostenloses Webarchiv mit Milliarden Seiten, als periodische Crawl-Snapshots auf AWS S3 in us-east-1 veröffentlicht und per HTTP unter data.commoncrawl.org verfügbar. Anonymer Zugriff funktioniert mit der AWS CLI über --no-sign-request oder mit gewöhnlichen Werkzeugen wie wget und curl.
Es veröffentlicht drei Formate, und zu wissen, welches Sie wollen, spart erhebliche Bandbreite:
WARC — "the raw data from the crawl, providing a direct mapping to the crawl process", einschließlich HTTP-Antworten, Anfragen und Metadaten. Vollständig und sehr groß.
WAT — "Web Archive Transformation"-Dateien mit berechneten Metadaten als JSON, einschließlich HTTP-Headern und Seitenlinks. Die richtige Wahl für Link-Graph-Arbeit.
WET — "WARC Encapsulated Text"-Dateien nur mit extrahiertem Klartext. Die richtige Wahl für Sprachmodellierung und dramatisch kleiner als WARC.
Wichtig zu verstehen: Common Crawl ist ein Rohstoff, kein Datensatz. Es enthält Boilerplate, Navigation, Spam, Duplikate, maschinelle Übersetzung und jedes andere Artefakt des offenen Webs. Der Wert der abgeleiteten Corpora unten liegt fast vollständig in der Filterung, und dort liegt die Forschung.
FineWeb
Der Web-Corpus von Hugging Face und der aktuelle Referenzpunkt für offene Webdaten im Maßstab.
FineWeb stammt von Common Crawl und enthält 25,9 Milliarden Zeilen, Crawls von CC-MAIN-2013-20 bis CC-MAIN-2025-26 — grob Mitte 2013 bis Mitte 2025. Veröffentlicht unter ODC-BY, der Open Data Commons Attribution-Lizenz.
Jeder Datensatz trägt Qualitätssignale, darunter einen Sprachscore und eine Tokenzahl, die mehr zählen, als sie klingen: Sie erlauben, den Corpus für eigene Zwecke weiterzufiltern, ohne die Pipeline neu zu bauen. Nur hochkonfidentes Englisch über einer Längenschwelle zu wollen ist ein Filterausdruck, kein Vorverarbeitungjob.
FineWeb lohnt als Startpunkt, weil die Filterentscheidungen dokumentiert und abliert sind, nicht nur behauptet. Wenn ein Corpus sagt, welche Filterwahlen die nachgelagerte Benchmark-Leistung um wie viel verbessert haben, können Sie bewusst widersprechen.
Dolma
Der Corpus von Allen AI und der transparenteste über seine Zusammensetzung.
Dolma wird beschrieben als "a dataset of 3 trillion tokens from a diverse mix of web content, academic publications, code, books, and encyclopedic materials", mit 2,532 Milliarden Dokumenten. Version 1.7 mit 1,715 Billionen Tokens wurde zum Trainieren von OLMo 7B-v1.7 genutzt.
Die Quellen sind einzeln benannt: Common-Crawl-Webseiten, Code von StarCoder und The Stack, wissenschaftliche Papiere von S2ORC und arXiv, Reddit, Project-Gutenberg-Bücher und Wikipedia.
Veröffentlicht unter ODC-BY, mit einem klaren Vorbehalt: Nutzer "are also bound by the original licenses of constituent sources". Das ist der Satz, den man zweimal liest. Eine permissive Lizenz der Zusammenstellung hebt die Lizenzen dessen, was hineinging, nicht auf, und das gilt für jeden abgeleiteten Corpus, egal ob er es so klar sagt.
Zwei weitere Punkte machen Dolma über den Inhalt hinaus beachtenswert. Allen AI hat das Curation-Toolkit als Open Source veröffentlicht, der Datensatz ist also reproduzierbar, nicht nur herunterladbar — Sie können eine Filterentscheidung ändern und neu bauen. Und es gibt einen Entfernungsmechanismus: ein Formular, um die Betreiber über Dokumente mit personenbezogenen Daten eines bestimmten Nutzers zu informieren.
Diese Kombination — benannte Quellen, offene Werkzeuge, ein Entfernungspfad — ist verantwortliche Datensatzpublikation, und ein vernünftiger Maßstab, den man an andere anlegen kann.
The Stack v2
Der Code-Corpus und der sorgfältigste der großen Datensätze bei der Lizenzierung.
The Stack v2 vom BigCode Project ist "a collection of source code in over 600 programming languages", mit 3,28 Milliarden eindeutigen Dateien, insgesamt 67,53 TB unkomprimiert, über 658 Sprachen. Trainingsvarianten sind je nach Version auf 17 oder über 600 Sprachen gefiltert.
Die Provenienz ist ungewöhnlich und erwähnenswert: Die Daten stammen aus dem Software-Heritage-Archiv, beschrieben als "the largest public archive of software source code", kombiniert mit GitHub-Archive-Metadaten bis September 2023.
Zwei Mechanismen unterscheiden ihn.
Lizenzfilterung. Der Datensatz "contains only permissively licensed code". Die Ersteller "propagate the detected licenses to all files" innerhalb von Repositories und führen eine kuratierte Liste akzeptabler SPDX-Identifikatoren auf Basis der Blue-Oak-Council-Freigaben. Das ist deutlich strenger als nach dem deklarierten Lizenzfeld eines Repositories zu filtern.
Opt-out für Entwickler. Es gibt ein "Am I In The Stack?"-Werkzeug zur Prüfung der Aufnahme, einen dokumentierten Entfernungsprozess, und der Datensatz wird "regularly updated to enact validated data removal requests".
Was man auch vom Training auf öffentlichem Code hält: Das ist derzeit die verteidigungsfähigste Umsetzung, und der Opt-out-Mechanismus ist ein echter, kein Gestus.
Lizenzen und Provenienz
Der Teil, der bestimmt, ob Sie irgendetwas davon wirklich nutzen dürfen, und er hat mehr Schichten, als ein einzelnes Lizenzfeld nahelegt.
Die Lizenz der Zusammenstellung ist nicht die Lizenz des Inhalts. ODC-BY auf FineWeb oder Dolma gilt für die Sammlung. Die zugrunde liegenden Dokumente tragen ihr eigenes Urheberrecht, und Dolma sagt das ausdrücklich. Eine permissive Datensatzlizenz heißt, die Zusammensteller schränken Sie nicht weiter ein; sie heißt nicht, der Inhalt war ihrer zum Neulizenzieren.
Namensnennung ist Pflicht, kein Entgegenkommen. ODC-BY ist eine Namensnennungslizenz. Wenn Sie diese Datensätze nutzen, nennen Sie sie.
Opt-outs werden Standard und verdienen Einhaltung. Der Entfernungsprozess von The Stack und Dolmas Formular für personenbezogene Daten existieren, weil Publizieren in diesem Maßstab Pflichten erzeugt. Einen Datensatz zu nutzen heißt, die heruntergeladene Version zu erben — periodisches erneutes Holen ist, wie Entfernungen in Ihrer Kopie tatsächlich wirksam werden.
Personenbezogene Daten haben ein eigenes Regime. Web-Maßstab-Corpora enthalten personenbezogene Informationen, und in Rechtsordnungen mit Datenschutzrecht entstehen daraus Pflichten für Sie als Verarbeiter, unabhängig von jeder Datensatzlizenz. „Es stand in einem öffentlichen Datensatz“ ist keine Rechtsgrundlage.
Und die Rechtslage ist ungefestigt. Ob Training auf urheberrechtlich geschütztem Material erlaubt ist und unter welchen Bedingungen, wird in mehreren Rechtsordnungen aktiv verhandelt. In der EU sieht der Rahmen für Text- und Data-Mining maschinenlesbare Rechtevorbehalte vor, und die Mechanismen, sie auszudrücken, setzen sich noch. Wer ein Produkt darauf baut, sollte das beobachten statt anzunehmen, die heutige Lage sei endgültig.
Einen Datensatz vor der Nutzung bewerten
Ein Corpus ist keine Blackbox, und eine halbe Stunde Inspektion vor Speicher- und Rechenaufwand sagt mehr als jede Model-Card-Zusammenfassung.
Stichproben ziehen und lesen. Holen Sie ein paar hundert Dokumente zufällig und lesen Sie sie wirklich. Das klingt unseriös und ist das Einzelinformativste, das Sie tun können. Innerhalb von Minuten wissen Sie, ob die Boilerplate-Entfernung funktionierte, wie viel maschinell übersetzter Text da ist und ob die Domänenmischung zur Beschreibung passt.
Prüfen Sie die Sprachverteilung gegen Ihren Bedarf. Ein als mehrsprachig beschriebener Corpus kann 90 % Englisch mit einem langen Schwanz sein, was in Ordnung ist, wenn Sie Englisch wollen, und nutzlos, wenn Sie Portugiesisch wollen. Wo Qualitätssignale wie ein Sprachscore geliefert werden — FineWeb hat einen — nutzen Sie sie statt der Überschrift zu vertrauen.
Messen Sie Duplikate selbst. Selbst deduplizierte Corpora enthalten Near-Duplicates, und die Rate variiert nach Quelle. Hashen Sie eine Stichprobe und zählen Sie Kollisionen; ist die Rate hoch, trainieren Sie wiederholt auf demselben Inhalt und der effektive Datensatz ist kleiner, als die Tokenzahl nahelegt.
Prüfen Sie das Stichtagsdatum. Jeder Corpus hat eines, und es bestimmt, was das resultierende Modell nicht wissen kann. FineWebs Crawls laufen bis Mitte 2025; alles Neuere fehlt. Für eine schnell bewegte Domäne kann das unabhängig vom Rest disqualifizieren.
Suchen Sie nach Kontamination gegen Ihren Evaluationssatz. Stehen Ihre Benchmark-Fragen und -Antworten im Trainingscorpus, misst die Evaluation Auswendiglernen. Das ist häufig, mit Substringsuche auf einer Stichprobe leicht zu prüfen, und macht Ergebnisse auf eine Weise ungültig, die nach der Veröffentlichung peinlich zu entdecken ist.
Und prüfen Sie Speicher- und Bandbreitenkosten vor dem Download. The Stack v2 ist 67,53 TB unkomprimiert. Multi-Terabyte-Downloads haben echte Kosten in Transfer, Speicher und Zeit, und einen Teil direkt aus Object Storage zu streamen ist oft der bessere Plan, als das Ganze zu holen und festzustellen, dass Sie ein Zehntel wollten.
Brauchen Sie überhaupt einen Trainingsdatensatz?
Die Frage, die vor allem Obigen lohnt.
Zum Vortrainieren eines Modells von Grund auf, ja — und das ist ein Unterfangen im Forschungsmaßstab. Rechenaufwand in Hunderttausenden GPU-Stunden, ein Team, das das schon gemacht hat, und ein Grund, warum ein bestehendes Open-Weight-Modell nicht reicht. Sehr wenige Organisationen sind in dieser Lage, und die, die es sind, wissen es bereits.
Zum Fine-Tuning brauchen Sie etwas ganz anderes: einen bescheidenen, hochwertigen, aufgabenspezifischen Datensatz. Tausende Beispiele statt Billionen Tokens, und die Arbeit liegt in der Kuratierung, nicht im Maßstab. Keiner der Corpora oben ist die richtige Eingabe.
Zur Suche brauchen Sie Ihre eigenen indexierten Dokumente, überhaupt keinen Trainingscorpus. Das ist der Fall, als der sich ein enormer Anteil der Anfragen „wir brauchen Trainingsdaten“ entpuppt, und die Antwort ist ein Vektorindex über Inhalt, den Sie schon haben.
Zur Evaluation brauchen Sie einen zurückgehaltenen Satz, der Ihre tatsächliche Aufgabe repräsentiert, von Hand gebaut und klein.
Der Fehlermodus, den dieser Abschnitt verhindern soll, ist, einen Multi-Terabyte-Corpus für ein Problem herunterzuladen, das zweihundert kuratierte Beispiele brauchte. Das passiert, und der verschwendete Aufwand ist erheblich.
Den eigenen ehrlich aufbauen
Wenn feststeht, dass Sie Domänendaten brauchen, die niemand veröffentlicht hat, hier, was das tatsächlich bedeutet — und wo unser Produkt hineinpasst.
Sammlung ist der leichte und kleinste Teil. Seiten zu holen ist ein gelöstes Problem. Wo immer möglich, bevorzugen Sie sanktionierte Wege: APIs, Massenexporte, Partner-Feeds, bestehende Archive. Crawling ist der letzte Ausweg, nicht der erste Schritt, und kommt mit Pflichten — robots.txt, Nutzungsbedingungen, Urheberrecht, Datenbankrechte und Datenschutzrecht, wo personenbezogene Daten betroffen sind.
Reinigung ist der Großteil der Arbeit. Boilerplate-Entfernung, Spracherkennung, Qualitätsfilterung, Near-Duplicate-Erkennung im Maßstab, Erkennung und Entfernung personenbezogener Daten. Die veröffentlichten Corpora stehen hier für enormen Aufwand, und Dolmas offenes Toolkit lohnt Studium, bevor Sie Ihr eigenes schreiben — eine dokumentierte Pipeline wiederzuverwenden ist weit besser, als eine schlecht neu zu erfinden.
Deduplizierung verdient besondere Aufmerksamkeit. Near-Duplicates verschlechtern das Training und blähen das scheinbare Datenvolumen auf. Das im Maßstab richtig zu machen braucht MinHash oder eine ähnliche Technik, und es ist der Schritt, der am ehesten übersprungen wird und am ehesten zählt.
Dokumentation ist nicht optional. Halten Sie fest, warum der Datensatz existiert, was er enthält, wie und wann er gesammelt wurde, was fehlt und wofür er nicht genutzt werden sollte. Das ist der Unterschied zwischen einem Asset und einer Haftung, und später fast unmöglich zu rekonstruieren.
Wo Proxys hineinkommen: Sammlung im Volumen aus vielen Quellen, oder wo Inhalt sich nach Region unterscheidet. Rechenzentrumsbandbreite ist die vernünftige Voreinstellung — unsere beginnt bei 0,14 $/GB — mit Residential ab 0,79 $/GB nur, wo nachweislich nötig, von unserer Preisseite, geprüft im September 2026.
Und wo nicht: Wenn die benötigten Daten in einem veröffentlichten Corpus liegen, Bandbreite zu kaufen, um sie nachzubauen, ist schlicht verschwenderisch. Erst prüfen. Die Corpora oben decken enorm viel ab, und die eingebettete Filterarbeit ist mehr wert als der Rohtext.
Häufige Fragen
Welche Datensätze werden zum Trainieren von LLMs genutzt?
Die meisten offenen Modelle trainieren auf Web-Corpora aus Common Crawl — FineWeb und Dolma sind die aktuellen Referenzpunkte — gemischt mit Code aus The Stack, wissenschaftlichen Papieren, Büchern und enzyklopädischem Inhalt. Dolma nennt seine Quellen einzeln, was ungewöhnlich und nützlich ist.
Ist Common Crawl kostenlos nutzbar?
Die Daten sind auf AWS S3 und per HTTP frei zugänglich, anonymer Zugriff wird unterstützt. Es veröffentlicht WARC-, WAT- und WET-Formate, und die Nutzungsbedingungen gelten. Freier Zugang zu einem Webarchiv löst den urheberrechtlichen Status der Seiten darin nicht.
Unter welcher Lizenz stehen die großen LLM-Datensätze?
FineWeb und Dolma sind ODC-BY, die Open Data Commons Attribution-Lizenz. Dolma sagt ausdrücklich, dass Nutzer auch an die ursprünglichen Lizenzen der Bestandteile gebunden sind — die Lizenz der Zusammenstellung hebt das Urheberrecht der zugrunde liegenden Dokumente nicht auf.
Kann ich meine Daten aus einem Trainingsdatensatz entfernen lassen?
Manchmal. The Stack v2 bietet ein "Am I In The Stack?"-Werkzeug und einen dokumentierten Entfernungsprozess und wird aktualisiert, um validierte Entfernungsanfragen umzusetzen. Dolma bietet ein Formular zum Melden von Dokumenten mit personenbezogenen Daten. Mechanismen variieren je Datensatz und sind nicht universell.
Wie groß sind LLM-Trainingsdatensätze?
Dolma umfasst 3 Billionen Tokens in 2,532 Milliarden Dokumenten. FineWeb enthält 25,9 Milliarden Zeilen, Common Crawl von 2013 bis 2025. The Stack v2 hat 3,28 Milliarden Dateien, insgesamt 67,53 TB unkomprimiert, in 658 Programmiersprachen.
Brauche ich einen Trainingsdatensatz zum Fine-Tuning eines Modells?
Nein — Sie brauchen einen kleinen, hochwertigen, aufgabenspezifischen Datensatz, typischerweise Tausende Beispiele statt Billionen Tokens. Die großen Vortrainingscorpora sind die völlig falsche Eingabe, und die Arbeit beim Fine-Tuning ist Kuratierung, nicht Maßstab.
Soll ich meinen eigenen Trainingsdatensatz bauen?
Nur für Domänendaten, die niemand veröffentlicht hat. Die öffentlichen Corpora verkörpern enormen Filter- und Deduplizierungsaufwand, der schwer zu reproduzieren ist, und die meisten als „Trainingsdaten“ bezeichneten Anforderungen entpuppen sich als Retrieval- oder Fine-Tuning-Probleme, die weit weniger brauchen. Erst die bestehenden Corpora prüfen.
Was ist der härteste Teil beim Aufbau eines Datensatzes?
Reinigung und Deduplizierung, nicht Sammlung. Boilerplate-Entfernung, Spracherkennung, Qualitätsfilterung, Near-Duplicate-Erkennung im Maßstab und Umgang mit personenbezogenen Daten machen fast den gesamten Aufwand aus. Das offene Dolma-Toolkit von Allen AI lohnt Studium, bevor Sie Ihre eigene Pipeline schreiben.
Fazit
Die öffentlichen LLM-Datensätze sind eine bemerkenswerte Ressource: Billionen Tokens, dokumentierte Filterung, permissive Zusammenstellungslizenzen und in den besseren Fällen offene Werkzeuge und funktionierende Opt-out-Mechanismen. FineWeb für Webtext, Dolma für eine dokumentierte Mischung, The Stack v2 für Code, alle auf Common Crawl oder Software Heritage darunter gebaut.
Zwei Dinge sollte man zum Nutzen mitnehmen. Die Lizenz der Zusammenstellung ist nicht die Lizenz des Inhalts — Dolma sagt das direkt, und es gilt für alle — eine permissive Datensatzlizenz ist also der Anfang Ihrer rechtlichen Analyse, nicht das Ende. Und Opt-out-Mechanismen greifen nur, wenn Sie erneut holen, weil Ihre heruntergeladene Kopie im Moment des Holens eingefroren ist.
Die nützlichere Schlussfolgerung betrifft den Umfang. Die meisten als Trainingsdatenbedarf beschriebenen Anforderungen entpuppen sich als Retrieval-Probleme, beantwortet durch Indexieren von Dokumenten, die Sie schon haben, oder Fine-Tuning-Probleme, beantwortet durch ein paar Tausend sorgfältig gewählte Beispiele. Beides ist weit kleiner und weit handhabbarer als alles auf dieser Seite.
Und wenn Sie wirklich Daten sammeln müssen, die niemand veröffentlicht hat, ist die Sammlung der leichte Teil. Filterung, Deduplizierung und Dokumentation sind die Arbeit — genau deshalb sind die veröffentlichten Corpora so viel mehr wert als der Rohtext, den sie enthalten.
