Geonode logo
Geonode Team

Geonode Team

Dikemas kini: 7 September 2026

Diterbitkan: 2 September 2026

Set data latihan LLM: apa itu dan cara menggunakannya

Set data awam untuk latihan LLM besar, terdokumentasi dengan baik dan kebanyakannya dilesenkan secara permisif. Ia juga lebih heterogen daripada yang disarankan "timbunan teks web", dan perbezaan antara mereka lebih penting daripada saiznya. Panduan ini merangkumi korpus utama dengan angka disahkan, soalan lesen dan provenans yang menentukan sama ada anda boleh menggunakannya, dan apa yang terlibat sebenarnya jika membina milik anda sendiri. Termasuk pemerhatian jujur bahawa kebanyakan orang yang menanyakan soalan ini tidak perlu pra-latih apa-apa.

Kepentingan kami, dinyatakan: kami ialah Geonode dan kami menjual proksi, iaitu infrastruktur yang akan anda gunakan untuk mengumpul data web sendiri. Kedudukan yang jujur ialah hampir tiada siapa yang patut. Korpus awam di bawah mewakili jumlah penapisan, deduplikasi dan penjagaan undang-undang yang besar, ia percuma, dan menghasilkan semula walaupun sebahagian daripada kerja itu ialah program penyelidikan, bukan projek. Di mana pengumpulan benar-benar wajar — domain sempit yang tiada siapa terbitkan, atau data baharu selepas tarikh potong korpus — ia kerja kecil dan tersasar, bukan crawl skala web. Bahagian itu di hujung dan sengaja pendek.

Lapisan di bawah: Common Crawl

Hampir setiap korpus web terbuka berasal daripada sumber yang sama.

Common Crawl ialah arkib web percuma yang mengandungi berbilion halaman, dikeluarkan sebagai snapshot crawl berkala di AWS S3 di us-east-1 dan tersedia melalui HTTP di data.commoncrawl.org. Akses tanpa nama berfungsi dengan AWS CLI menggunakan --no-sign-request, atau dengan alat biasa seperti wget dan curl.

Ia menerbitkan tiga format, dan mengetahui yang mana anda mahu menjimatkan jalur lebar yang ketara:

WARC — "the raw data from the crawl, providing a direct mapping to the crawl process", termasuk respons HTTP, permintaan dan metadata. Lengkap dan sangat besar.

WAT — fail "Web Archive Transformation" yang mengandungi metadata dikira sebagai JSON, termasuk pengepala HTTP dan pautan halaman. Pilihan yang betul untuk kerja graf pautan.

WET — fail "WARC Encapsulated Text" dengan teks biasa diekstrak sahaja. Pilihan yang betul untuk pemodelan bahasa, dan jauh lebih kecil daripada WARC.

Perkara penting untuk difahami ialah Common Crawl ialah bahan mentah, bukan set data. Ia mengandungi boilerplate, navigasi, spam, pendua, terjemahan mesin dan setiap artifak lain web terbuka. Nilai korpus terbitan di bawah hampir seluruhnya dalam penapisan, dan di situlah penyelidikannya.

FineWeb

Korpus web Hugging Face, dan titik rujukan semasa untuk data web terbuka pada skala.

FineWeb berasal daripada Common Crawl dan mengandungi 25.9 bilion baris, merangkumi crawl dari CC-MAIN-2013-20 hingga CC-MAIN-2025-26 — kira-kira pertengahan 2013 hingga pertengahan 2025. Dikeluarkan di bawah ODC-BY, lesen Open Data Commons Attribution.

Setiap rekod membawa isyarat kualiti termasuk skor bahasa dan kiraan token, yang lebih penting daripada bunyinya: ia membolehkan anda menapis korpus selanjutnya untuk tujuan sendiri tanpa mengulangi saluran paip. Mahukan hanya bahasa Inggeris keyakinan tinggi di atas ambang panjang ialah ungkapan penapis, bukan kerja prapemprosesan.

Sebab FineWeb berbaloi dimulakan ialah keputusan penapisan didokumentasikan dan diablasi, bukan hanya dinyatakan. Apabila korpus memberitahu pilihan penapisan mana yang meningkatkan prestasi penanda aras hiliran dan berapa banyak, anda boleh tidak setuju dengan sengaja.

Dolma

Korpus Allen AI, dan yang paling telus tentang komposisinya.

Dolma digambarkan sebagai "a dataset of 3 trillion tokens from a diverse mix of web content, academic publications, code, books, and encyclopedic materials", merangkumi 2.532 bilion dokumen. Versi 1.7, mengandungi 1.715 trilion token, digunakan untuk melatih OLMo 7B-v1.7.

Sumbernya dinamakan secara individu: halaman web Common Crawl, kod dari StarCoder dan The Stack, kertas akademik dari S2ORC dan arXiv, Reddit, buku Project Gutenberg, dan Wikipedia.

Dikeluarkan di bawah ODC-BY, dengan kaveat penting yang dinyatakan dengan jelas: pengguna "are also bound by the original licenses of constituent sources". Itu ayat yang perlu dibaca dua kali. Lesen permisif pada kompilasi tidak mengetepikan lesen apa yang masuk ke dalamnya, dan ini benar bagi setiap korpus terbitan sama ada ia mengatakannya sejelas itu atau tidak.

Dua perkara lagi menjadikan Dolma berbaloi diberi perhatian di luar kandungannya. Allen AI menerbitkan kit kurasi sebagai sumber terbuka, jadi set data boleh dihasilkan semula, bukan sekadar dimuat turun — anda boleh menukar keputusan penapisan dan membina semula. Dan terdapat mekanisme penyingkiran: borang untuk memaklumkan penyelenggara tentang dokumen yang mengandungi maklumat peribadi pengguna tertentu.

Gabungan itu — sumber bernama, perkakas terbuka, laluan penyingkiran — ialah rupa penerbitan set data yang bertanggungjawab, dan piawaian yang munasabah untuk diminta daripada orang lain.

The Stack v2

Korpus kod, dan yang paling berhati-hati daripada set data utama tentang pelesenan.

The Stack v2 daripada BigCode Project ialah "a collection of source code in over 600 programming languages", mengandungi 3.28 bilion fail unik berjumlah 67.53 TB tidak termampat, merangkumi 658 bahasa. Varian latihan ditapis kepada 17 atau lebih 600 bahasa bergantung pada versi.

Provenansnya luar biasa dan patut dicatat: data berasal daripada arkib Software Heritage, digambarkan sebagai "the largest public archive of software source code", digabungkan dengan metadata GitHub Archive hingga September 2023.

Dua mekanisme membezakannya.

Penapisan lesen. Set data "contains only permissively licensed code". Pencipta "propagate the detected licenses to all files" dalam repositori dan mengekalkan senarai terkurasi pengecam SPDX yang diterima berdasarkan kelulusan Blue Oak Council. Itu pendekatan yang jauh lebih ketat daripada menapis pada medan lesen yang diisytiharkan repositori.

Opt keluar pembangun. Terdapat alat "Am I In The Stack?" untuk memeriksa kemasukan, proses penyingkiran yang didokumentasikan, dan set data "regularly updated to enact validated data removal requests".

Apa pun pandangan tentang latihan pada kod awam, ini pelaksanaan paling boleh dipertahankan yang tersedia sekarang, dan mekanisme opt keluar ialah yang sebenar, bukan gerak isyarat.

Lesen dan provenans

Bahagian yang menentukan sama ada anda benar-benar boleh menggunakan mana-mana ini, dan ia mempunyai lebih banyak lapisan daripada yang disarankan satu medan lesen.

Lesen kompilasi bukan lesen kandungan. ODC-BY pada FineWeb atau Dolma mentadbir koleksi. Dokumen asas membawa hak cipta mereka sendiri, dan Dolma mengatakannya secara eksplisit. Lesen set data yang permisif bermaksud penyusun tidak menyekat anda lebih jauh; ia tidak bermaksud kandungannya milik mereka untuk dilesenkan semula.

Atribusi ialah keperluan, bukan budi bahasa. ODC-BY ialah lesen atribusi. Jika anda menggunakan set data ini, atributkannya.

Opt keluar menjadi piawaian dan patut dihormati. Proses penyingkiran The Stack dan borang maklumat peribadi Dolma wujud kerana penerbitan pada skala ini mencipta kewajipan. Menggunakan set data bermaksud mewarisi versi yang anda muat turun — jadi menarik semula secara berkala ialah cara penyingkiran benar-benar berkuat kuasa dalam salinan anda.

Data peribadi mempunyai rejim sendiri. Korpus skala web mengandungi maklumat peribadi, dan dalam bidang kuasa dengan undang-undang perlindungan data itu mencipta kewajipan untuk anda sebagai pemproses, bebas daripada sebarang lesen set data. "Ia ada dalam set data awam" bukan asas yang sah.

Dan persekitaran undang-undang belum tetap. Sama ada latihan pada bahan berhak cipta dibenarkan, dan dalam syarat apa, sedang dilitigasi secara aktif di beberapa bidang kuasa. Di EU, rangka kerja perlombongan teks dan data merenungkan penempahan hak yang boleh dibaca mesin, dan mekanisme untuk mengungkapkannya masih menata diri. Sesiapa yang membina produk di atas ini patut memerhatikannya, bukan mengandaikan kedudukan hari ini muktamad.

Menilai set data sebelum menggunakannya

Korpus bukan kotak hitam, dan setengah jam pemeriksaan sebelum mengikat storan dan pengiraan akan memberitahu lebih daripada mana-mana ringkasan model card.

Sampel dan baca. Tarik beberapa ratus dokumen secara rawak dan benar-benar bacanya. Bunyinya tidak serius dan ia perkara paling bermaklumat yang boleh anda lakukan. Dalam beberapa minit anda akan tahu sama ada penyingkiran boilerplate berjaya, berapa banyak teks terjemahan mesin, dan sama ada campuran domain sepadan dengan apa yang didakwa perihalan.

Semak taburan bahasa berbanding keperluan anda. Korpus yang digambarkan sebagai berbilang bahasa mungkin 90% bahasa Inggeris dengan ekor panjang, yang baik jika anda mahukan bahasa Inggeris dan tidak berguna jika anda mahukan bahasa Portugis. Di mana isyarat kualiti seperti skor bahasa disediakan — FineWeb menyertakan satu — gunakannya dan jangan percayakan tajuk.

Ukur penduaan sendiri. Malah korpus yang dideduplikasi mengandungi hampir-pendua, dan kadar berbeza mengikut sumber. Cincang sampel dan kira perlanggaran; jika kadar tinggi, anda berlatih pada kandungan yang sama berulang kali dan set data berkesan lebih kecil daripada yang disarankan kiraan token.

Semak tarikh potong. Setiap korpus mempunyai satu, dan ia menentukan apa yang model hasil tidak boleh tahu. Crawl FineWeb berjalan hingga pertengahan 2025; apa-apa yang lebih baharu tiada. Bagi domain yang bergerak pantas, ini mungkin menyingkirkan tanpa mengira yang lain.

Cari pencemaran terhadap set penilaian anda. Jika soalan dan jawapan penanda aras anda muncul dalam korpus latihan, penilaian anda mengukur hafalan. Ini biasa, mudah disemak dengan carian substring pada sampel, dan membatalkan keputusan dengan cara yang memalukan untuk ditemui selepas penerbitan.

Dan semak kos storan serta jalur lebar sebelum memuat turun. The Stack v2 ialah 67.53 TB tidak termampat. Muat turun berbilang terabait mempunyai kos sebenar dalam pemindahan, storan dan masa, dan menstrim subset terus dari storan objek kerap menjadi rancangan yang lebih baik daripada menarik seluruhnya untuk mengetahui anda mahukan sepersepuluhnya.

Adakah anda benar-benar perlukan set data latihan?

Soalan yang patut ditanya sebelum mana-mana di atas.

Untuk pra-latih model dari awal, ya — dan ini usaha skala penyelidikan. Pengiraan dalam ratusan ribu jam GPU, pasukan yang pernah melakukannya, dan sebab mengapa model open-weight sedia ada tidak mencukupi. Sangat sedikit organisasi berada dalam kedudukan ini, dan yang berada di situ sudah mengetahuinya.

Untuk penalaan halus, anda perlukan sesuatu yang sama sekali berbeza: set data sederhana, berkualiti tinggi, khusus tugas. Ribuan contoh dan bukannya trilion token, dan kerja ada dalam kurasi, bukan skala. Tiada satu pun korpus di atas ialah input yang betul.

Untuk pengambilan, anda perlukan dokumen anda sendiri diindeks, bukan korpus latihan langsung. Ini kes yang ternyata menjadi bahagian besar pertanyaan "kami perlukan data latihan", dan dijawab oleh indeks vektor ke atas kandungan yang sudah anda miliki.

Untuk penilaian, anda perlukan set tertahan yang mewakili tugas sebenar anda, dibina tangan dan kecil.

Mod kegagalan yang wujud bahagian ini untuk cegah ialah memuat turun korpus berbilang terabait untuk masalah yang memerlukan dua ratus contoh terkurasi. Ia berlaku, dan usaha yang dibazirkan ketara.

Membina milik anda, dengan jujur

Jika anda telah menetapkan bahawa anda memerlukan data domain yang tiada siapa terbitkan, inilah yang terlibat sebenarnya — dan di mana produk kami masuk.

Pengumpulan ialah bahagian mudah dan bahagian terkecil. Mengambil halaman ialah masalah yang sudah diselesaikan. Di mana mungkin, utamakan laluan yang disahkan: API, eksport pukal, suapan rakan kongsi, arkib sedia ada. Crawl ialah pilihan terakhir, bukan langkah pertama, dan datang dengan kewajipan — robots.txt, terma perkhidmatan, hak cipta, hak pangkalan data, dan undang-undang perlindungan data di mana data peribadi terlibat.

Pembersihan ialah sebahagian besar kerja. Penyingkiran boilerplate, pengenalan bahasa, penapisan kualiti, pengesanan hampir-pendua pada skala, pengesanan dan penyingkiran maklumat peribadi. Korpus yang diterbitkan mewakili usaha besar di sini, dan kit terbuka Dolma patut dikaji sebelum menulis milik anda — menggunakan semula saluran paip terdokumentasi jauh lebih baik daripada mencipta semula yang buruk.

Deduplikasi patut diberi perhatian khusus. Hampir-pendua merendahkan latihan dan menggembungkan isipadu data nampak. Melakukannya dengan betul pada skala memerlukan MinHash atau teknik serupa, dan ia langkah yang paling mungkin dilangkau dan paling mungkin penting.

Dokumentasi tidak pilihan. Catat mengapa set data wujud, apa yang dikandunginya, bagaimana dan bila ia dikumpul, apa yang tiada, dan untuk apa ia tidak patut digunakan. Itu perbezaan antara aset dan liabiliti, dan hampir mustahil dibina semula kemudian.

Di mana proksi masuk: pengumpulan isipadu dari banyak sumber, atau di mana kandungan berbeza mengikut wilayah. Jalur lebar pusat data ialah lalai yang munasabah — milik kami bermula pada $0.14/GB — dengan residensial dari $0.79/GB hanya di mana terbukti diperlukan, dari halaman harga kami, disemak September 2026.

Dan di mana tidak: jika data yang anda perlukan ada dalam korpus yang diterbitkan, membeli jalur lebar untuk menciptanya semula ialah pembaziran secara terus. Semak dahulu. Korpus di atas merangkumi tanah yang sangat luas, dan kerja penapisan yang tertanam di dalamnya lebih bernilai daripada teks mentah.

Soalan lazim

Set data apa yang digunakan untuk melatih LLM?

Kebanyakan model terbuka berlatih pada korpus web yang berasal daripada Common Crawl — FineWeb dan Dolma ialah titik rujukan semasa — dicampur dengan kod dari The Stack, kertas akademik, buku dan kandungan ensiklopedia. Dolma menamakan sumbernya secara individu, yang luar biasa dan berguna.

Adakah Common Crawl percuma untuk digunakan?

Data boleh diakses secara bebas di AWS S3 dan melalui HTTP, dengan akses tanpa nama disokong. Ia menerbitkan format WARC, WAT dan WET, dan terma penggunaannya terpakai. Ambil perhatian bahawa akses percuma kepada arkib web tidak menyelesaikan status hak cipta halaman di dalamnya.

Lesen apa yang digunakan set data LLM utama?

FineWeb dan Dolma ialah ODC-BY, lesen Open Data Commons Attribution. Dolma menyatakan secara eksplisit bahawa pengguna juga terikat oleh lesen asal sumber konstituen — lesen kompilasi tidak mengetepikan hak cipta dokumen asas.

Bolehkah saya menyingkirkan data saya daripada set data latihan?

Kadang-kadang. The Stack v2 menyediakan alat "Am I In The Stack?" dan proses penyingkiran terdokumentasi, dan dikemas kini untuk melaksanakan permintaan penyingkiran yang disahkan. Dolma menawarkan borang untuk melaporkan dokumen yang mengandungi maklumat peribadi. Mekanisme berbeza mengikut set data dan tidak universal.

Seberapa besar set data latihan LLM?

Dolma ialah 3 trilion token merentas 2.532 bilion dokumen. FineWeb mengandungi 25.9 bilion baris merangkumi Common Crawl dari 2013 hingga 2025. The Stack v2 mempunyai 3.28 bilion fail berjumlah 67.53 TB tidak termampat merentas 658 bahasa pengaturcaraan.

Perlukah saya set data latihan untuk menala halus model?

Tidak — anda perlukan set data kecil, berkualiti tinggi, khusus tugas, biasanya ribuan contoh dan bukannya trilion token. Korpus pra-latihan yang besar ialah input yang salah sepenuhnya, dan kerja dalam penalaan halus ialah kurasi, bukan skala.

Patutkah saya membina set data latihan sendiri?

Hanya untuk data domain yang tiada siapa terbitkan. Korpus awam merangkumi usaha penapisan dan deduplikasi yang besar yang sukar dihasilkan semula, dan kebanyakan keperluan dilabelkan "data latihan" ternyata masalah pengambilan atau penalaan halus yang memerlukan jauh lebih sedikit. Semak korpus sedia ada dahulu.

Apakah bahagian paling sukar membina set data?

Pembersihan dan deduplikasi, bukan pengumpulan. Penyingkiran boilerplate, pengenalan bahasa, penapisan kualiti, pengesanan hampir-pendua pada skala dan pengendalian maklumat peribadi menyumbang hampir semua usaha. Kit terbuka Dolma Allen AI patut dikaji sebelum menulis saluran paip sendiri.

Penutup

Set data LLM awam ialah sumber yang luar biasa: trilion token, penapisan terdokumentasi, lesen kompilasi permisif, dan dalam kes yang lebih baik perkakas terbuka serta mekanisme opt keluar yang berfungsi. FineWeb untuk teks web, Dolma untuk campuran terdokumentasi, The Stack v2 untuk kod, semuanya dibina di atas Common Crawl atau Software Heritage di bawahnya.

Dua perkara patut dibawa tentang menggunakannya. Lesen kompilasi bukan lesen kandungan — Dolma mengatakannya secara langsung dan ia benar bagi semuanya — jadi lesen set data yang permisif ialah permulaan analisis undang-undang anda, bukan penghujung. Dan mekanisme opt keluar hanya berfungsi jika anda tarik semula, kerana salinan yang dimuat turun beku pada saat anda mengambilnya.

Kesimpulan yang lebih berguna ialah tentang skop. Kebanyakan keperluan yang digambarkan sebagai memerlukan data latihan ternyata masalah pengambilan, dijawab dengan mengindeks dokumen yang sudah anda miliki, atau masalah penalaan halus, dijawab dengan beberapa ribu contoh yang dipilih dengan teliti. Kedua-duanya jauh lebih kecil dan jauh lebih tertangani daripada apa-apa di halaman ini.

Dan jika anda benar-benar perlu mengumpul data yang tiada siapa terbitkan, pengumpulan ialah bahagian mudah. Penapisan, deduplikasi dan dokumentasi ialah kerja — itulah tepatnya mengapa korpus yang diterbitkan jauh lebih bernilai daripada teks mentah yang dikandunginya.