Geonode logo
Geonode Team

Geonode Team

Güncellenme: 7 Eylül 2026

Yayınlanma: 2 Eylül 2026

LLM eğitim veri kümeleri: nedirler ve nasıl kullanılırlar

Kamuya açık LLM eğitim veri kümeleri büyüktür, iyi belgelenmiştir ve çoğu izin verici lisanslıdır. Ayrıca "büyük bir yığın web metni"nin ima ettiğinden daha heterojendirler ve aralarındaki farklar boyutlarından daha önemlidir. Bu rehber, doğrulanmış rakamlarla başlıca korpusları, bunları kullanıp kullanamayacağınızı belirleyen lisans ve köken sorularını ve kendi kümenizi kurmanın gerçekte ne içerdiğini kapsar. Bu soruyu soran çoğu kişinin hiçbir şeyi önceden eğitmesi gerekmediği dürüst gözlemi dahil.

Çıkarımız, açıkça: biz Geonode ve vekil satıyoruz; bu da web verisini kendiniz toplamak için kullanacağınız altyapıdır. Dürüst konum neredeyse kimsenin bunu yapmaması gerektiğidir. Aşağıdaki kamuya açık korpuslar muazzam miktarda filtreleme, tekilleştirme ve hukuki özeni temsil eder, ücretsizdir ve bu işin bir kesrini bile yeniden üretmek bir proje değil bir araştırma programıdır. Toplamanın gerçekten haklı olduğu yer — kimsenin yayımlamadığı dar bir alan veya bir korpus kesiminden sonraki taze veri — küçük, hedefli bir iştir, web ölçeğinde bir tarama değil. O bölüm sonda ve kasten kısadır.

Alttaki katman: Common Crawl

Neredeyse her açık web korpusu aynı kaynaktan tüner.

Common Crawl milyarlarca sayfa içeren ücretsiz bir web arşividir, us-east-1 içindeki AWS S3'te periyodik tarama anlık görüntüleri olarak yayımlanır ve data.commoncrawl.org adresinde HTTP üzerinden kullanılabilir. Anonim erişim AWS CLI ile --no-sign-request kullanarak veya wget ve curl gibi sıradan araçlarla çalışır.

Üç biçim yayımlar ve hangisini istediğinizi bilmek önemli bant genişliği tasarruf eder:

WARC — "the raw data from the crawl, providing a direct mapping to the crawl process", HTTP yanıtları, istekler ve meta veriler dahil. Tam ve çok büyük.

WAT — HTTP üstbilgileri ve sayfa bağlantıları dahil, hesaplanmış meta verileri JSON olarak içeren "Web Archive Transformation" dosyaları. Bağlantı grafiği işi için doğru seçim.

WET — yalnızca çıkarılmış düz metin içeren "WARC Encapsulated Text" dosyaları. Dil modelleme için doğru seçim ve WARC'tan dramatik biçimde daha küçük.

Anlaşılması gereken önemli nokta Common Crawl'ın ham bir malzeme, bir veri kümesi olmadığıdır. Şablon, gezinme, spam, kopyalar, makine çevirisi ve açık web'in diğer her artefaktını içerir. Aşağıdaki türetilmiş korpusların değeri neredeyse tamamen filtrelemededir ve araştırma oradadır.

FineWeb

Hugging Face'in web korpusu ve ölçekte açık web verisi için mevcut referans noktası.

FineWeb Common Crawl'dan türetilir ve 25,9 milyar satır içerir, CC-MAIN-2013-20'den CC-MAIN-2025-26'ya taramaları kapsar — kabaca 2013 ortasından 2025 ortasına. ODC-BY, Open Data Commons Attribution lisansı altında yayımlanır.

Her kayıt bir dil skoru ve bir token sayısı dahil kalite sinyalleri taşır; kulağa geldiğinden daha önemlidir: boru hattını yeniden yapmadan kendi amaçlarınız için korpusu daha fazla filtrelemenize izin verir. Uzunluk eşiğinin üzerinde yalnızca yüksek güvenilir İngilizce istemek bir ön işleme işi değil bir filtre ifadesidir.

FineWeb ile başlamaya değer olmasının nedeni, filtreleme kararlarının yalnızca iddia edilmeyip belgelenmesi ve ablasyonudur. Bir korpus hangi filtreleme seçimlerinin sonraki kıyaslama performansını ne kadar iyileştirdiğini söylediğinde, onlarla kasten anlaşmazlığa düşebilirsiniz.

Dolma

Allen AI'nin korpusu ve bileşimi hakkında en şeffaf olanı.

Dolma "a dataset of 3 trillion tokens from a diverse mix of web content, academic publications, code, books, and encyclopedic materials" olarak tanımlanır, 2,532 milyar belgeden oluşur. 1,715 trilyon token içeren 1.7 sürümü OLMo 7B-v1.7'yi eğitmek için kullanıldı.

Kaynakları tek tek adlandırılır: Common Crawl web sayfaları, StarCoder ve The Stack'ten kod, S2ORC ve arXiv'den akademik makaleler, Reddit, Project Gutenberg kitapları ve Wikipedia.

ODC-BY altında yayımlanır, açıkça söylenen önemli bir uyarıyla: kullanıcılar "are also bound by the original licenses of constituent sources". İki kez okunacak cümle budur. Derlemenin izin verici lisansı, içine girenin lisanslarını geçersiz kılmaz ve bu, bunu o kadar açık söyleyip söylememesine bakılmaksızın her türetilmiş korpus için geçerlidir.

İki nokta daha Dolma'yı içeriğinin ötesinde dikkate değer kılar. Allen AI kürasyon araç setini açık kaynak olarak yayımladı, bu yüzden veri kümesi yalnızca indirilebilir değil yeniden üretilebilir — bir filtreleme kararını değiştirip yeniden inşa edebilirsiniz. Ve bir kaldırma mekanizması vardır: belirli bir kullanıcı hakkında kişisel bilgi içeren belgeleri bakımcılara bildirmek için bir form.

Bu birleşim — adlandırılmış kaynaklar, açık araçlar, bir kaldırma yolu — sorumlu veri kümesi yayımlamasının görüntüsüdür ve başkalarından beklenmesi makul bir standarttır.

The Stack v2

Kod korpusu ve başlıca veri kümeleri arasında lisanslama konusunda en dikkatli olanı.

BigCode Project'ten The Stack v2 "a collection of source code in over 600 programming languages"dır, 3,28 milyar benzersiz dosya içerir, sıkıştırılmamış 67,53 TB toplam, 658 dil kapsar. Eğitim varyantları sürüme göre 17 veya 600'den fazla dile süzülür.

Kökeni alışılmadıktır ve not etmeye değer: veri, "the largest public archive of software source code" olarak tanımlanan Software Heritage arşivinden tüner, Eylül 2023'e kadar GitHub Archive meta verisiyle birleştirilir.

İki mekanizma onu ayırır.

Lisans filtreleme. Veri kümesi "contains only permissively licensed code". Oluşturucular depolar içinde "propagate the detected licenses to all files" ve Blue Oak Council onaylarına dayalı kabul edilebilir SPDX tanımlayıcılarının küratörlü bir listesini tutar. Bu, bir deponun beyan edilen lisans alanına göre filtrelemekten oldukça daha titiz bir yaklaşımdır.

Geliştirici çıkışı. Dahil edilmeyi kontrol etmek için bir "Am I In The Stack?" aracı, belgelenmiş bir kaldırma süreci vardır ve veri kümesi "regularly updated to enact validated data removal requests".

Kamuya açık kod üzerinde eğitim hakkında ne düşünülürse düşünülsün, bu şu anda mevcut en savunulabilir uygulamadır ve çıkış mekanizması bir jest değil gerçektir.

Lisanslar ve köken

Bunlardan herhangi birini gerçekten kullanıp kullanamayacağınızı belirleyen kısım ve tek bir lisans alanının ima ettiğinden daha fazla katmanı vardır.

Derleme lisansı içerik lisansı değildir. FineWeb veya Dolma üzerindeki ODC-BY koleksiyonu yönetir. Altta yatan belgeler kendi telif haklarını taşır ve Dolma bunu açıkça söyler. İzin verici bir veri kümesi lisansı, derleyicilerin sizi daha fazla kısıtlamadığı anlamına gelir; içeriğin yeniden lisanslamak üzere onların olduğu anlamına gelmez.

Atıf bir nezaket değil bir gerekliliktir. ODC-BY bir atıf lisansıdır. Bu veri kümelerini kullanırsanız atıf yapın.

Çıkışlar standart haline geliyor ve onurlandırılmaya değer. The Stack'in kaldırma süreci ve Dolma'nın kişisel bilgi formu, bu ölçekte yayımlamanın yükümlülükler yaratması yüzünden vardır. Bir veri kümesini kullanmak indirdiğiniz sürümü miras almak demektir — bu yüzden periyodik yeniden çekmek, kaldırmaların kopyanızda gerçekten yürürlüğe girmesidir.

Kişisel verinin kendi rejimi vardır. Web ölçeğinde korpuslar kişisel bilgi içerir ve veri koruma yasası olan yargı bölgelerinde bu, herhangi bir veri kümesi lisansından bağımsız olarak sizin için işleyen sıfatıyla yükümlülükler yaratır. "Kamuya açık bir veri kümesindeydi" hukuka uygun bir dayanak değildir.

Ve hukuki ortam oturmamıştır. Telifli malzeme üzerinde eğitimin izinli olup olmadığı ve hangi koşullarda olduğu birkaç yargı bölgesinde aktif olarak davalaştırılmaktadır. AB'de metin ve veri madenciliği çerçevesi makinece okunabilir hak çekincelerini öngörür ve bunları ifade etme mekanizmaları hâlâ oturmaktadır. Bunun üzerine ürün kuran herkes, bugünün konumunun nihai olduğunu varsaymak yerine bunu izlemelidir.

Kullanmadan önce bir veri kümesini değerlendirmek

Bir korpus kara kutu değildir ve depolama ile hesaplamayı taahhüt etmeden önce yarım saatlik inceleme, herhangi bir model card özetinden daha fazlasını söyler.

Örnekleyin ve okuyun. Rastgele birkaç yüz belge çekin ve gerçekten okuyun. Ciddiyetsiz duyulur ve yapabileceğiniz tek en bilgilendirici şey budur. Dakikalar içinde şablon kaldırmanın işe yarayıp yaramadığını, ne kadar makine çevirisi metin olduğunu ve alan karışımının açıklamanın iddiasıyla örtüşüp örtüşmediğini öğrenirsiniz.

Dil dağılımını ihtiyaçlarınıza göre kontrol edin. Çok dilli diye tanımlanan bir korpus uzun bir kuyrukla %90 İngilizce olabilir; İngilizce istiyorsanız sorun yoktur, Portekizce istiyorsanız işe yaramaz. Dil skoru gibi kalite sinyalleri sağlandığında — FineWeb bir tane içerir — başlığa güvenmek yerine onları kullanın.

Tekrarı kendiniz ölçün. Tekilleştirilmiş korpuslar bile yakın kopyalar içerir ve oran kaynağa göre değişir. Bir örneği karmalayın ve çarpışmaları sayın; oran yüksekse aynı içeriği tekrar tekrar eğitiyorsunuzdur ve etkin veri kümeniz token sayısının ima ettiğinden küçüktür.

Kesim tarihini kontrol edin. Her korpusun bir tane vardır ve sonuç modelin bilemeyeceğini belirler. FineWeb taramaları 2025 ortasına kadar gider; daha yenisi yoktur. Hızlı hareket eden bir alan için bu, gerisinin hepsinden bağımsız olarak eleyici olabilir.

Değerlendirme kümenize karşı bulaşma arayın. Kıyaslama soru ve yanıtlarınız eğitim korpusunda görünüyorsa değerlendirmeniz ezberlemeyi ölçüyordur. Bu yaygındır, bir örnekte alt dize aramasıyla kontrolü kolaydır ve yayımlamadan sonra keşfetmenin utanç verici olduğu bir şekilde sonuçları geçersiz kılar.

Ve indirmeden önce depolama ve bant genişliği maliyetini kontrol edin. The Stack v2 sıkıştırılmamış 67,53 TB'dır. Çok terabaytlık indirmelerin aktarım, depolama ve zamanda gerçek maliyetleri vardır ve nesne depolamadan bir alt kümeyi doğrudan akıtmak, tümünü çekip onda birini istediğinizi öğrenmekten sıklıkla daha iyi bir plandır.

Gerçekten bir eğitim veri kümesine ihtiyacınız var mı?

Yukarıdakilerden herhangi birinden önce sorulmaya değer soru.

Sıfırdan bir modeli önceden eğitmek için, evet — ve bu araştırma ölçeğinde bir girişimdir. Yüz binlerce GPU-saat hesaplama, bunu daha önce yapmış bir ekip ve mevcut bir açık ağırlıklı modelin yetmeyeceği bir neden. Çok az kuruluş bu konumdadır ve olanlar zaten bilir.

İnce ayar için tamamen farklı bir şeye ihtiyacınız vardır: mütevazı, yüksek kaliteli, göreve özgü bir veri kümesi. Trilyonlarca token değil binlerce örnek ve iş ölçekte değil kürasyondadır. Yukarıdaki korpusların hiçbiri doğru girdi değildir.

Getirme için kendi belgeleriniz dizine eklenmiş olmalıdır, bir eğitim korpusu hiç değil. Bu, "eğitim verisine ihtiyacımız var" sorularının muazzam bir payının çıktığı durumdur ve zaten sahip olduğunuz içerik üzerinde bir vektör diziniyle yanıtlanır.

Değerlendirme için gerçek görevinizi temsil eden, elde yapılmış ve küçük bir ayrılmış kümeye ihtiyacınız vardır.

Bu bölümün önlemek için var olduğu başarısızlık kipi, iki yüz küratörlü örneğe ihtiyaç duyan bir sorun için çok terabaytlık bir korpus indirmektir. Olur ve boşa giden çaba önemlidir.

Kendi kümenizi dürüstçe kurmak

Kimsenin yayımlamadığı alan verisine ihtiyacınız olduğunu saptadıysanız, gerçekte ne içerdiği — ve ürünümüzün nereye girdiği — budur.

Toplama kolay kısımdır ve en küçük kısımdır. Sayfa çekmek çözülmüş bir sorundur. Mümkün olduğunca onaylı yolları tercih edin: API'ler, toplu dışa aktarımlar, ortak akışları, mevcut arşivler. Tarama son çaredir, ilk adım değil ve yükümlülüklerle gelir — robots.txt, hizmet şartları, telif, veri tabanı hakları ve kişisel verinin söz konusu olduğu yerde veri koruma yasası.

Temizlik işin çoğudur. Şablon kaldırma, dil tanıma, kalite filtreleme, ölçekte yakın kopya tespiti, kişisel bilgi tespiti ve kaldırma. Yayımlanmış korpuslar burada muazzam çabayı temsil eder ve kendi kümenizi yazmadan önce Dolma'nın açık araç setini incelemek değerlidir — belgelenmiş bir boru hattını yeniden kullanmak, kötü birini yeniden icat etmekten çok daha iyidir.

Tekilleştirme özel dikkat hak eder. Yakın kopyalar eğitimi bozar ve görünen veri hacmini şişirir. Ölçekte doğru yapmak MinHash veya benzer bir teknik gerektirir ve atlanması en olası, önem taşıması en olası adımdır.

Belgeleme isteğe bağlı değildir. Veri kümesinin neden var olduğunu, ne içerdiğini, nasıl ve ne zaman toplandığını, neyin eksik olduğunu ve ne için kullanılmaması gerektiğini kaydedin. Bu bir varlık ile bir yükümlülük arasındaki farktır ve sonradan yeniden inşa etmek neredeyse imkânsızdır.

Vekillerin girdiği yer: birçok kaynaktan hacimde toplama veya içeriğin bölgeye göre farklılaştığı yer. Veri merkezi bant genişliği makul varsayılandır — bizimki 0,14 $/GB'dan başlar — konut 0,79 $/GB'dan yalnızca kanıtlanabilir biçimde gerektiğinde, fiyat sayfamızdan, Eylül 2026'da kontrol edildi.

Ve girmediği yer: ihtiyacınız olan veri yayımlanmış bir korpustaysa, onu yeniden oluşturmak için bant genişliği satın almak düpedüz israftır. Önce kontrol edin. Yukarıdaki korpuslar muazzam bir alanı kapsar ve içlerindeki gömülü filtreleme işi ham metinden daha değerlidir.

Sık sorulan sorular

LLM'leri eğitmek için hangi veri kümeleri kullanılır?

Çoğu açık model Common Crawl'dan türetilmiş web korpuslarında eğitilir — FineWeb ve Dolma mevcut referans noktalarıdır — The Stack'ten kod, akademik makaleler, kitaplar ve ansiklopedik içerikle karıştırılır. Dolma kaynaklarını tek tek adlandırır; bu alışılmadık ve yararlıdır.

Common Crawl kullanımı ücretsiz midir?

Veri AWS S3 ve HTTP üzerinden serbestçe erişilebilir, anonim erişim desteklenir. WARC, WAT ve WET biçimlerini yayımlar ve kullanım şartları geçerlidir. Bir web arşivine ücretsiz erişimin içindeki sayfaların telif durumunu çözmediğine dikkat edin.

Başlıca LLM veri kümeleri hangi lisans altındadır?

FineWeb ve Dolma ODC-BY'dir, Open Data Commons Attribution lisansı. Dolma, kullanıcıların ayrıca kurucu kaynakların orijinal lisanslarına da bağlı olduğunu açıkça belirtir — derleme lisansı alttaki belgelerinin telifini geçersiz kılmaz.

Verilerimi bir eğitim veri kümesinden kaldırabilir miyim?

Bazen. The Stack v2 bir "Am I In The Stack?" aracı ve belgelenmiş bir kaldırma süreci sağlar ve doğrulanmış kaldırma isteklerini uygulamak üzere güncellenir. Dolma kişisel bilgi içeren belgeleri bildirmek için bir form sunar. Mekanizmalar veri kümesine göre değişir ve evrensel değildir.

LLM eğitim veri kümeleri ne kadar büyüktür?

Dolma 2,532 milyar belgede 3 trilyon tokendir. FineWeb 2013'ten 2025'e Common Crawl'ı kapsayan 25,9 milyar satır içerir. The Stack v2 658 programlama dilinde sıkıştırılmamış toplam 67,53 TB olan 3,28 milyar dosyaya sahiptir.

Bir modeli ince ayarlamak için eğitim veri kümesine ihtiyacım var mı?

Hayır — küçük, yüksek kaliteli, göreve özgü bir veri kümesine ihtiyacınız vardır, tipik olarak trilyonlarca token değil binlerce örnek. Büyük ön eğitim korpusları tamamen yanlış girdidir ve ince ayardaki iş ölçek değil kürasyondur.

Kendi eğitim veri kümemi kurmalı mıyım?

Yalnızca kimsenin yayımlamadığı alan verisi için. Kamuya açık korpuslar yeniden üretilmesi zor muazzam filtreleme ve tekilleştirme çabasını cisimleştirir ve "eğitim verisi" diye etiketlenmiş gereksinimlerin çoğu çok daha azına ihtiyaç duyan getirme veya ince ayar sorunları çıkar. Önce mevcut korpusları kontrol edin.

Bir veri kümesi kurmanın en zor kısmı nedir?

Toplama değil, temizlik ve tekilleştirme. Şablon kaldırma, dil tanıma, kalite filtreleme, ölçekte yakın kopya tespiti ve kişisel bilgi işleme neredeyse tüm çabayı oluşturur. Kendi boru hattınızı yazmadan önce Allen AI'nin açık Dolma araç setini incelemek değerlidir.

Sonuç

Kamuya açık LLM veri kümeleri dikkat çekici bir kaynaktır: trilyonlarca token, belgelenmiş filtreleme, izin verici derleme lisansları ve daha iyi durumlarda açık araçlar ile işleyen çıkış mekanizmaları. Web metni için FineWeb, belgelenmiş bir karışım için Dolma, kod için The Stack v2, hepsi altında Common Crawl veya Software Heritage üzerine kuruludur.

Kullanmak hakkında götürülmesi gereken iki şey vardır. Derleme lisansı içerik lisansı değildir — Dolma bunu doğrudan söyler ve hepsi için doğrudur — bu yüzden izin verici bir veri kümesi lisansı hukuki analizinizin sonu değil başlangıcıdır. Ve çıkış mekanizmaları yalnızca yeniden çekerseniz işler, çünkü indirilmiş kopyanız aldığınız anda donmuştur.

Daha yararlı sonuç kapsam hakkındadır. Eğitim verisine ihtiyaç duyulduğu söylenen gereksinimlerin çoğu, zaten sahip olduğunuz belgeleri dizinleyerek yanıtlanan getirme sorunları veya özenle seçilmiş birkaç bin örnekle yanıtlanan ince ayar sorunları çıkar. İkisi de bu sayfadaki her şeyden çok daha küçük ve çok daha yönetilebilir.

Ve gerçekten kimsenin yayımlamadığı veriyi toplamanız gerekiyorsa, toplama kolay kısımdır. Filtreleme, tekilleştirme ve belgeleme iştir — yayımlanmış korpusların içerdikleri ham metinden bu kadar daha değerli olmasının tam nedeni budur.