Kepentingan kami, dinyatakan: kami adalah Geonode dan kami menjual proksi, yaitu infrastruktur yang akan Anda pakai untuk mengumpulkan data web sendiri. Posisi yang jujur adalah hampir tidak ada yang seharusnya. Korpus publik di bawah merepresentasikan jumlah penyaringan, deduplikasi, dan kehati-hatian hukum yang sangat besar, semuanya gratis, dan mereproduksi bahkan sebagian dari pekerjaan itu adalah program riset, bukan proyek. Di mana pengumpulan memang beralasan — domain sempit yang belum dipublikasikan siapa pun, atau data baru setelah batas potong korpus — itu pekerjaan kecil dan terarah, bukan crawl skala web. Bagian itu ada di akhir dan sengaja pendek.
Lapisan di bawah: Common Crawl
Hampir setiap korpus web terbuka berasal dari sumber yang sama.
Common Crawl adalah arsip web gratis yang berisi miliaran halaman, dirilis sebagai snapshot crawl berkala di AWS S3 di us-east-1 dan tersedia lewat HTTP di data.commoncrawl.org. Akses anonim bekerja dengan AWS CLI memakai --no-sign-request, atau dengan alat biasa seperti wget dan curl.
Ia menerbitkan tiga format, dan mengetahui mana yang Anda butuhkan menghemat bandwidth yang cukup besar:
WARC — "the raw data from the crawl, providing a direct mapping to the crawl process", termasuk respons HTTP, permintaan, dan metadata. Lengkap dan sangat besar.
WAT — berkas "Web Archive Transformation" berisi metadata terhitung sebagai JSON, termasuk header HTTP dan tautan halaman. Pilihan tepat untuk kerja graf tautan.
WET — berkas "WARC Encapsulated Text" hanya dengan teks biasa yang diekstrak. Pilihan tepat untuk pemodelan bahasa, dan jauh lebih kecil daripada WARC.
Hal penting untuk dipahami adalah Common Crawl adalah bahan mentah, bukan dataset. Ia berisi boilerplate, navigasi, spam, duplikat, terjemahan mesin, dan setiap artefak lain dari web terbuka. Nilai korpus turunan di bawah hampir seluruhnya ada pada penyaringan, dan di situlah risetnya.
FineWeb
Korpus web Hugging Face, dan titik rujukan saat ini untuk data web terbuka pada skala.
FineWeb berasal dari Common Crawl dan berisi 25,9 miliar baris, mencakup crawl dari CC-MAIN-2013-20 hingga CC-MAIN-2025-26 — kira-kira pertengahan 2013 hingga pertengahan 2025. Dirilis di bawah ODC-BY, lisensi Open Data Commons Attribution.
Setiap rekaman membawa sinyal kualitas termasuk skor bahasa dan jumlah token, yang lebih penting daripada kedengarannya: memungkinkan Anda menyaring korpus lebih lanjut untuk tujuan sendiri tanpa mengulang pipeline. Menginginkan hanya bahasa Inggris berkeyakinan tinggi di atas ambang panjang adalah ekspresi filter, bukan pekerjaan prapemrosesan.
Alasan FineWeb layak dijadikan awal adalah keputusan penyaringannya didokumentasikan dan diablasi, bukan hanya dinyatakan. Ketika korpus memberi tahu pilihan penyaringan mana yang meningkatkan kinerja benchmark hilir dan seberapa besar, Anda bisa tidak setuju dengan sengaja.
Dolma
Korpus Allen AI, dan yang paling transparan tentang komposisinya.
Dolma dijelaskan sebagai "a dataset of 3 trillion tokens from a diverse mix of web content, academic publications, code, books, and encyclopedic materials", terdiri dari 2,532 miliar dokumen. Versi 1.7, berisi 1,715 triliun token, dipakai untuk melatih OLMo 7B-v1.7.
Sumbernya dinamai satu per satu: halaman web Common Crawl, kode dari StarCoder dan The Stack, makalah akademik dari S2ORC dan arXiv, Reddit, buku Project Gutenberg, dan Wikipedia.
Dirilis di bawah ODC-BY, dengan catatan penting yang dikatakan dengan jelas: pengguna "are also bound by the original licenses of constituent sources". Itu kalimat yang harus dibaca dua kali. Lisensi permisif pada kompilasi tidak menimpa lisensi apa yang masuk ke dalamnya, dan ini benar untuk setiap korpus turunan terlepas dari apakah dikatakan sejelas itu.
Dua poin lagi membuat Dolma layak diperhatikan di luar isinya. Allen AI menerbitkan perangkat kurasi sebagai sumber terbuka, jadi dataset dapat direproduksi, bukan hanya diunduh — Anda bisa mengubah keputusan penyaringan dan membangun ulang. Dan ada mekanisme penghapusan: formulir untuk memberi tahu pengelola tentang dokumen yang berisi informasi pribadi pengguna tertentu.
Kombinasi itu — sumber bernama, perangkat terbuka, jalur penghapusan — adalah wujud publikasi dataset yang bertanggung jawab, dan standar yang wajar untuk dituntut dari yang lain.
The Stack v2
Korpus kode, dan yang paling hati-hati di antara dataset utama soal lisensi.
The Stack v2 dari BigCode Project adalah "a collection of source code in over 600 programming languages", berisi 3,28 miliar berkas unik total 67,53 TB tanpa kompresi, mencakup 658 bahasa. Varian pelatihan disaring ke 17 atau lebih dari 600 bahasa tergantung versi.
Provenansnya tidak biasa dan patut dicatat: data berasal dari arsip Software Heritage, dijelaskan sebagai "the largest public archive of software source code", digabung dengan metadata GitHub Archive hingga September 2023.
Dua mekanisme membedakannya.
Penyaringan lisensi. Dataset "contains only permissively licensed code". Pembuatnya "propagate the detected licenses to all files" di dalam repositori dan memelihara daftar terkurasi pengenal SPDX yang diterima berdasarkan persetujuan Blue Oak Council. Itu pendekatan yang jauh lebih ketat daripada menyaring pada kolom lisensi yang dinyatakan repositori.
Opt-out pengembang. Ada alat "Am I In The Stack?" untuk memeriksa inklusi, proses penghapusan yang didokumentasikan, dan dataset "regularly updated to enact validated data removal requests".
Apa pun pendapat tentang pelatihan pada kode publik, ini implementasi yang paling dapat dibela yang tersedia saat ini, dan mekanisme opt-out-nya sungguhan, bukan gestur.
Lisensi dan provenans
Bagian yang menentukan apakah Anda benar-benar boleh memakai salah satu dari ini, dan punya lebih banyak lapisan daripada yang disiratkan satu kolom lisensi.
Lisensi kompilasi bukan lisensi konten. ODC-BY pada FineWeb atau Dolma mengatur koleksi. Dokumen di bawahnya membawa hak cipta sendiri, dan Dolma mengatakannya secara eksplisit. Lisensi dataset yang permisif berarti penyusun tidak membatasi Anda lebih jauh; bukan berarti isinya milik mereka untuk dilisensikan ulang.
Atribusi adalah syarat, bukan kesopanan. ODC-BY adalah lisensi atribusi. Jika Anda memakai dataset ini, berikan atribusi.
Opt-out menjadi standar dan patut dihormati. Proses penghapusan The Stack dan formulir informasi pribadi Dolma ada karena memublikasikan pada skala ini menciptakan kewajiban. Memakai dataset berarti mewarisi versi yang Anda unduh — jadi menarik ulang secara berkala adalah cara penghapusan benar-benar berlaku pada salinan Anda.
Data pribadi punya rezim sendiri. Korpus skala web berisi informasi pribadi, dan di yurisdiksi dengan hukum perlindungan data itu menciptakan kewajiban bagi Anda sebagai pemroses, terlepas dari lisensi dataset mana pun. "Ada di dataset publik" bukan dasar yang sah.
Dan lingkungan hukum belum mapan. Apakah pelatihan pada materi berhak cipta diizinkan, dan dalam kondisi apa, sedang dilitigasi secara aktif di beberapa yurisdiksi. Di UE, kerangka penambangan teks dan data mempertimbangkan reservasi hak yang dapat dibaca mesin, dan mekanisme untuk mengekspresikannya masih menata diri. Siapa pun yang membangun produk di atas ini seharusnya mengawasinya, bukan mengasumsikan posisi hari ini bersifat final.
Mengevaluasi dataset sebelum dipakai
Korpus bukan kotak hitam, dan setengah jam inspeksi sebelum mengikat penyimpanan dan komputasi akan memberi tahu lebih banyak daripada ringkasan model card mana pun.
Ambil sampel dan baca. Tarik beberapa ratus dokumen secara acak dan benar-benar bacalah. Kedengarannya tidak serius dan itu hal paling informatif yang bisa Anda lakukan. Dalam hitungan menit Anda akan tahu apakah penghapusan boilerplate berhasil, berapa banyak teks terjemahan mesin, dan apakah campuran domain sesuai klaim deskripsi.
Cek distribusi bahasa terhadap kebutuhan Anda. Korpus yang digambarkan multibahasa bisa 90% bahasa Inggris dengan ekor panjang, yang baik jika Anda ingin bahasa Inggris dan sia-sia jika ingin bahasa Portugis. Di mana sinyal kualitas seperti skor bahasa disediakan — FineWeb menyertakannya — pakailah, jangan percaya judulnya.
Ukur duplikasi sendiri. Bahkan korpus yang sudah dideduplikasi berisi hampir-duplikat, dan rasio bervariasi per sumber. Hash sampel dan hitung tabrakan; jika rasio tinggi, Anda melatih konten yang sama berulang-ulang dan dataset efektif lebih kecil daripada yang disiratkan jumlah token.
Cek tanggal potong. Setiap korpus punya satu, dan itu menentukan apa yang tidak bisa diketahui model hasilnya. Crawl FineWeb berjalan hingga pertengahan 2025; apa pun yang lebih baru absen. Untuk domain yang bergerak cepat, ini bisa mendiskualifikasi terlepas dari yang lain.
Cari kontaminasi terhadap set evaluasi Anda. Jika pertanyaan dan jawaban benchmark Anda muncul di korpus pelatihan, evaluasi mengukur hafalan. Ini umum, mudah dicek dengan pencarian substring pada sampel, dan membatalkan hasil dengan cara yang memalukan jika ditemukan setelah publikasi.
Dan cek biaya penyimpanan serta bandwidth sebelum mengunduh. The Stack v2 67,53 TB tanpa kompresi. Unduhan multi-terabita punya biaya nyata dalam transfer, penyimpanan, dan waktu, dan mengalirkan subset langsung dari object storage sering rencana yang lebih baik daripada menarik semuanya hanya untuk mengetahui Anda ingin sepersepuluhnya.
Apakah Anda benar-benar butuh dataset pelatihan?
Pertanyaan yang patut diajukan sebelum apa pun di atas.
Untuk pra-pelatihan model dari nol, ya — dan ini usaha skala riset. Komputasi ratusan ribu jam GPU, tim yang sudah pernah melakukannya, dan alasan mengapa model open-weight yang ada tidak cukup. Sangat sedikit organisasi yang berada di posisi ini, dan yang berada di situ sudah mengetahuinya.
Untuk fine-tuning, Anda butuh sesuatu yang sama sekali berbeda: dataset sederhana, berkualitas tinggi, spesifik tugas. Ribuan contoh, bukan triliunan token, dan pekerjaannya pada kurasi, bukan skala. Tidak satu pun korpus di atas adalah masukan yang tepat.
Untuk retrieval, Anda butuh dokumen sendiri yang diindeks, bukan korpus pelatihan sama sekali. Ini kasus yang ternyata menjadi bagian sangat besar dari pertanyaan "kami butuh data pelatihan", dan dijawab dengan indeks vektor atas konten yang sudah Anda miliki.
Untuk evaluasi, Anda butuh set tertahan yang merepresentasikan tugas aktual, dibuat tangan dan kecil.
Mode kegagalan yang dicegah bagian ini adalah mengunduh korpus multi-terabita untuk masalah yang butuh dua ratus contoh terkurasi. Itu terjadi, dan tenaga yang terbuang cukup besar.
Membangun milik Anda, dengan jujur
Jika Anda sudah menetapkan bahwa Anda butuh data domain yang belum dipublikasikan siapa pun, inilah yang sebenarnya terlibat — dan di mana produk kami masuk.
Pengumpulan adalah bagian yang mudah dan yang terkecil. Mengambil halaman adalah masalah yang sudah selesai. Sedapat mungkin, utamakan rute yang disetujui: API, ekspor massal, umpan mitra, arsip yang ada. Crawl adalah pilihan terakhir, bukan langkah pertama, dan datang dengan kewajiban — robots.txt, syarat layanan, hak cipta, hak basis data, dan hukum perlindungan data di mana data pribadi terlibat.
Pembersihan adalah sebagian besar pekerjaan. Penghapusan boilerplate, identifikasi bahasa, penyaringan kualitas, deteksi hampir-duplikat pada skala, deteksi dan penghapusan informasi pribadi. Korpus yang dipublikasikan merepresentasikan usaha besar di sini, dan perangkat terbuka Dolma patut dipelajari sebelum menulis milik Anda — memakai ulang pipeline terdokumentasi jauh lebih baik daripada menemukan ulang yang buruk.
Deduplikasi pantas mendapat perhatian khusus. Hampir-duplikat merusak pelatihan dan menggembungkan volume data semu. Melakukannya dengan benar pada skala membutuhkan MinHash atau teknik serupa, dan itu langkah yang paling mungkin dilewati dan paling mungkin penting.
Dokumentasi tidak opsional. Catat mengapa dataset ada, apa isinya, bagaimana dan kapan dikumpulkan, apa yang hilang, dan untuk apa tidak boleh dipakai. Itu perbedaan antara aset dan liabilitas, dan hampir mustahil direkonstruksi kemudian.
Di mana proksi masuk: pengumpulan volume dari banyak sumber, atau di mana konten berbeda menurut wilayah. Bandwidth pusat data adalah default yang masuk akal — milik kami mulai dari $0,14/GB — dengan residensial dari $0,79/GB hanya di mana terbukti perlu, dari halaman harga kami, dicek September 2026.
Dan di mana tidak: jika data yang Anda butuhkan ada di korpus yang dipublikasikan, membeli bandwidth untuk membuatnya ulang adalah pemborosan langsung. Cek dulu. Korpus di atas mencakup wilayah yang sangat luas, dan pekerjaan penyaringan yang tertanam di dalamnya lebih berharga daripada teks mentah.
Pertanyaan yang sering diajukan
Dataset apa yang dipakai untuk melatih LLM?
Sebagian besar model terbuka dilatih pada korpus web yang berasal dari Common Crawl — FineWeb dan Dolma adalah titik rujukan saat ini — dicampur dengan kode dari The Stack, makalah akademik, buku, dan konten ensiklopedis. Dolma menamai sumbernya satu per satu, yang tidak biasa dan berguna.
Apakah Common Crawl gratis dipakai?
Datanya dapat diakses bebas di AWS S3 dan lewat HTTP, dengan akses anonim didukung. Ia menerbitkan format WARC, WAT, dan WET, dan syarat penggunaannya berlaku. Catat bahwa akses gratis ke arsip web tidak menyelesaikan status hak cipta halaman di dalamnya.
Lisensi apa yang dipakai dataset LLM utama?
FineWeb dan Dolma adalah ODC-BY, lisensi Open Data Commons Attribution. Dolma menyatakan secara eksplisit bahwa pengguna juga terikat lisensi asli sumber penyusun — lisensi kompilasi tidak menimpa hak cipta dokumen di bawahnya.
Bisakah saya menghapus data saya dari dataset pelatihan?
Kadang-kadang. The Stack v2 menyediakan alat "Am I In The Stack?" dan proses penghapusan terdokumentasi, dan diperbarui untuk menjalankan permintaan penghapusan yang divalidasi. Dolma menawarkan formulir untuk melaporkan dokumen yang berisi informasi pribadi. Mekanisme bervariasi per dataset dan tidak universal.
Seberapa besar dataset pelatihan LLM?
Dolma 3 triliun token pada 2,532 miliar dokumen. FineWeb berisi 25,9 miliar baris yang mencakup Common Crawl dari 2013 hingga 2025. The Stack v2 punya 3,28 miliar berkas total 67,53 TB tanpa kompresi pada 658 bahasa pemrograman.
Apakah saya butuh dataset pelatihan untuk fine-tune model?
Tidak — Anda butuh dataset kecil, berkualitas tinggi, spesifik tugas, biasanya ribuan contoh bukan triliunan token. Korpus pra-pelatihan yang besar adalah masukan yang salah sepenuhnya, dan pekerjaan fine-tuning ada pada kurasi, bukan skala.
Haruskah saya membangun dataset pelatihan sendiri?
Hanya untuk data domain yang belum dipublikasikan siapa pun. Korpus publik mewujudkan usaha penyaringan dan deduplikasi yang sangat besar dan sulit direproduksi, dan sebagian besar kebutuhan yang dilabeli "data pelatihan" ternyata masalah retrieval atau fine-tuning yang butuh jauh lebih sedikit. Cek korpus yang ada dulu.
Apa bagian tersulit membangun dataset?
Pembersihan dan deduplikasi, bukan pengumpulan. Penghapusan boilerplate, identifikasi bahasa, penyaringan kualitas, deteksi hampir-duplikat pada skala, dan penanganan informasi pribadi mencakup hampir seluruh usaha. Perangkat terbuka Dolma dari Allen AI patut dipelajari sebelum menulis pipeline sendiri.
Penutup
Dataset LLM publik adalah sumber daya yang luar biasa: triliunan token, penyaringan terdokumentasi, lisensi kompilasi permisif, dan pada kasus yang lebih baik perangkat terbuka serta mekanisme opt-out yang berfungsi. FineWeb untuk teks web, Dolma untuk campuran terdokumentasi, The Stack v2 untuk kode, semuanya dibangun di atas Common Crawl atau Software Heritage di bawahnya.
Dua hal patut dibawa tentang pemakaiannya. Lisensi kompilasi bukan lisensi konten — Dolma mengatakannya secara langsung dan itu benar untuk semuanya — jadi lisensi dataset yang permisif adalah awal analisis hukum Anda, bukan akhir. Dan mekanisme opt-out hanya bekerja jika Anda menarik ulang, karena salinan yang diunduh membeku pada saat Anda mengambilnya.
Kesimpulan yang lebih berguna adalah tentang cakupan. Sebagian besar kebutuhan yang digambarkan sebagai butuh data pelatihan ternyata masalah retrieval, dijawab dengan mengindeks dokumen yang sudah Anda miliki, atau masalah fine-tuning, dijawab dengan beberapa ribu contoh yang dipilih dengan hati-hati. Keduanya jauh lebih kecil dan jauh lebih tertangani daripada apa pun di halaman ini.
Dan jika Anda memang perlu mengumpulkan data yang belum dipublikasikan siapa pun, pengumpulan adalah bagian yang mudah. Penyaringan, deduplikasi, dan dokumentasi adalah pekerjaannya — tepatnya mengapa korpus yang dipublikasikan jauh lebih berharga daripada teks mentah yang dikandungnya.
