利害を先に宣言します。私たちは Geonode であり、プロキシを売っています。これはウェブデータを自分で集めるときに使うインフラです。正直な立場は、ほぼ誰もそうすべきではない、ということです。 以下の公開コーパスは膨大なフィルタリング、重複排除、法的配慮を体現しており、無料です。その作業の一部でも再現するのはプロジェクトではなく研究プログラムです。収集が本当に正当化されるのは——誰も公開していない狭い領域、またはコーパスのカットオフ以降の新しいデータ——小さく狙いを定めた仕事であり、ウェブ規模のクロールではありません。その節は末尾にあり、意図的に短いです。
下層:Common Crawl
ほぼすべてのオープンなウェブコーパスは同じ源から来ます。
Common Crawl は数十億ページを含む無料のウェブアーカイブで、us-east-1 の AWS S3 に周期的なクロールスナップショットとして公開され、data.commoncrawl.org で HTTP でも利用できます。匿名アクセスは AWS CLI の --no-sign-request、または wget や curl のような普通のツールでできます。
3つの形式を公開しており、どれが必要かを知ると帯域をかなり節約できます。
WARC — "the raw data from the crawl, providing a direct mapping to the crawl process"。HTTP 応答、リクエスト、メタデータを含みます。完全で非常に大きいです。
WAT — 計算済みメタデータを JSON で含む "Web Archive Transformation" ファイル。HTTP ヘッダとページリンクを含みます。リンクグラフ作業に適します。
WET — 抽出済み平文だけの "WARC Encapsulated Text" ファイル。言語モデリングに適し、WARC より劇的に小さいです。
理解すべき重要な点は、Common Crawl は生の材料であり、データセットではないということです。定型文、ナビ、スパム、重複、機械翻訳、オープンウェブのその他すべての人工物を含みます。以下の派生コーパスの価値はほぼすべてフィルタリングにあり、研究があるのもそこです。
FineWeb
Hugging Face のウェブコーパスであり、規模のあるオープンウェブデータの現在の参照点です。
FineWeb は Common Crawl 由来で 259 億行を含み、CC-MAIN-2013-20 から CC-MAIN-2025-26 までのクロール——おおむね 2013年半ばから 2025年半ば——をカバーします。ODC-BY(Open Data Commons Attribution)で公開されています。
各レコードは言語スコアとトークン数を含む品質信号を持ち、聞こえ以上に重要です。パイプラインをやり直さずに自分の目的でさらにフィルタできます。長さ閾値以上の高信頼英語だけ欲しいなら、前処理仕事ではなくフィルタ式です。
FineWeb から始める価値があるのは、フィルタ判断が主張ではなく文書化され、アブレーションされているからです。どのフィルタ選択が下流ベンチマークをどれだけ改善したかをコーパスが教えてくれるなら、意図的に反対できます。
Dolma
Allen AI のコーパスであり、構成について最も透明です。
Dolma は "a dataset of 3 trillion tokens from a diverse mix of web content, academic publications, code, books, and encyclopedic materials" と説明され、25.32 億文書からなります。1.715 兆トークンを含むバージョン 1.7 は OLMo 7B-v1.7 の学習に使われました。
出典は個別に名付けられています。Common Crawl のウェブページ、StarCoder と The Stack のコード、S2ORC と arXiv の学術論文、Reddit、Project Gutenberg の本、Wikipedia。
ODC-BY で公開され、重要な留保がはっきり述べられています。利用者は "are also bound by the original licenses of constituent sources"。二度読むべき文です。編纂の寛容なライセンスは、中に入ったもののライセンスを上書きせず、これは派生コーパスすべてに当てはまり、そこまで明確に言うかどうかに依りません。
内容以外でも Dolma が注目に値する点が二つあります。Allen AI はキュレーションツールキットをオープンソースで公開したので、データセットはダウンロード可能であるだけでなく再現可能です。フィルタ判断を変えて再構築できます。そして削除メカニズムがあります。特定利用者の個人情報を含む文書をメンテナに知らせるフォームです。
名付けられた出典、オープンなツール、削除経路——この組み合わせが責任あるデータセット公開の姿であり、他者に求める合理的な基準です。
The Stack v2
コードコーパスであり、主要データセットの中でライセンスについて最も慎重です。
BigCode Project の The Stack v2 は "a collection of source code in over 600 programming languages" で、32.8 億の一意ファイル、非圧縮合計 67.53 TB、658 言語にわたります。学習用変種はバージョンにより 17 言語または 600 超にフィルタされます。
出自は珍しく、記す価値があります。データは "the largest public archive of software source code" とされる Software Heritage アーカイブに由来し、2023年9月までの GitHub Archive メタデータと組み合わされています。
二つの仕組みが区別します。
ライセンスフィルタ。 データセットは "contains only permissively licensed code"。作成者はリポジトリ内で "propagate the detected licenses to all files" し、Blue Oak Council の承認に基づく受け入れ可能な SPDX 識別子のキュレーション済みリストを維持します。リポジトリの宣言ライセンス欄でフィルタするよりかなり厳密です。
開発者オプトアウト。 収録確認用の "Am I In The Stack?" ツール、文書化された削除手続きがあり、データセットは "regularly updated to enact validated data removal requests" です。
公開コードでの学習をどう考えるにせよ、これは現在最も擁護可能な実装であり、オプトアウトはジェスチャーではなく本物です。
ライセンスと出自
このうち何かを実際に使えるかを決める部分であり、単一のライセンス欄が示唆するより層が多いです。
編纂ライセンスは内容ライセンスではない。 FineWeb や Dolma の ODC-BY はコレクションを規律します。下層文書は独自の著作権を持ち、Dolma はそれを明示します。寛容なデータセットライセンスは、編纂者がこれ以上制限しないという意味であり、内容が再ライセンスできる彼らのものだったという意味ではありません。
帰属は要件であり、礼儀ではない。 ODC-BY は帰属ライセンスです。これらのデータセットを使うなら帰属してください。
オプトアウトは標準になりつつあり、尊重する価値があります。 The Stack の削除手続きと Dolma の個人情報フォームは、この規模での公開が義務を生むからです。データセットを使うことは、ダウンロードした版を継承することです。定期的に再取得するのが、削除が自分のコピーで実際に効く方法です。
個人データには独自の制度があります。 ウェブ規模コーパスは個人情報を含み、データ保護法のある法域では、データセットライセンスとは独立に処理者としての義務が生じます。「公開データセットにあった」は適法根拠ではありません。
そして法環境は未確定です。 著作物での学習が許されるか、どんな条件かは、複数の法域で活発に争われています。EU ではテキスト・データマイニングの枠組みが機械可読の権利留保を想定し、それを表現する仕組みはまだ落ち着いていません。この上に製品を作る人は、今日の立場が最終だと仮定せず、注視すべきです。
使う前にデータセットを評価する
コーパスはブラックボックスではありません。ストレージと計算を投じる前の30分の点検は、どんな model card 要約より多くを教えてくれます。
標本を取り、読む。 数百件を無作為に引き、実際に読んでください。不真面目に聞こえますが、単体で最も情報量の多い行為です。定型除去が効いたか、機械翻訳がどれだけあるか、領域構成が説明と一致するかは数分で分かります。
言語分布を自分の必要と照合する。 多言語と説明されたコーパスが英語 90% に長い尾を持つことがあり、英語が欲しいなら問題なく、ポルトガル語が欲しいなら無用です。言語スコアのような品質信号があるなら——FineWeb にはある——見出しを信じずそれを使ってください。
重複を自分で測る。 重複排除済みコーパスでも近似重複は残り、率は出典で変わります。標本をハッシュし衝突を数えてください。率が高ければ同じ内容を繰り返し学習しており、実効データセットはトークン数が示唆するより小さいです。
カットオフ日を確認する。 どのコーパスにもあり、結果モデルが知り得ないものを決めます。FineWeb のクロールは 2025年半ばまで。それ以降は欠けます。動きの速い領域では、他がどうであれ失格になり得ます。
評価セットとの汚染を探す。 ベンチマークの問答が学習コーパスに出ていれば、評価は暗記を測っています。よくあることであり、標本の部分文字列検索で簡単に確認でき、公開後に気づくと気まずい形で結果を無効にします。
ダウンロード前にストレージと帯域コストを確認する。 The Stack v2 は非圧縮 67.53 TB です。数テラバイトのダウンロードは転送・保管・時間に実コストがあり、オブジェクトストレージからサブセットを直接ストリーミングする方が、全部取って十分の一しか要らなかったと知るより多くの場合良い計画です。
本当に学習データセットが必要か
上記のどれより先に問う価値がある質問です。
ゼロからモデルを事前学習するなら、はい——そしてこれは研究規模の事業です。数十万 GPU 時間の計算、それを以前やったチーム、既存のオープンウェイトモデルでは足りない理由。この立場にある組織はごく少なく、あるところはすでに知っています。
ファインチューニングには全く別のものが必要です。控えめで高品質な、タスク固有のデータセット。兆トークンではなく数千例、仕事は規模ではなくキュレーションです。上のコーパスのどれも正しい入力ではありません。
検索には自分の文書を索引づける必要があり、学習コーパスは不要です。「学習データが必要」という問い合わせのかなりの割合がこれに該当し、すでに持っている内容のベクトル索引で答えます。
評価には実際のタスクを代表する、手作業で作った小さなホールドアウトが必要です。
この節が防ぐ失敗は、二百のキュレーション済み例で足りる問題に数テラバイトのコーパスをダウンロードすることです。起きており、無駄な労力は相当です。
正直に自前で作る
誰も公開していない領域データが必要だと確立したなら、実際に何が伴うか——そして当社製品がどこに入るか——です。
収集は簡単な部分であり、最も小さい部分です。 ページ取得は解決済みの問題です。可能な限り認可された経路を優先してください。API、一括エクスポート、パートナーフィード、既存アーカイブ。クロールは最後の手段であり最初の一歩ではなく、義務が伴います。robots.txt、利用規約、著作権、データベース権、個人データが関わる場合のデータ保護法。
洗浄が作業の大半です。 定型除去、言語識別、品質フィルタ、規模での近似重複検出、個人情報の検出と除去。公開コーパスはここで膨大な労力を体現しており、自分で書く前に Dolma のオープンツールキットを学ぶ価値があります。文書化されたパイプラインの再利用は、下手に再発明するよりはるかに良いです。
重複排除は特に注意が必要です。 近似重複は学習を劣化させ、見かけのデータ量を膨らませます。規模で正しく行うには MinHash か類似手法が必要で、最も飛ばされやすく、最も効きやすいステップです。
文書化は任意ではありません。 データセットがなぜ存在するか、何を含むか、いつどのように集めたか、何が欠けているか、何に使うべきでないかを記録してください。資産と負債の違いであり、後から再構築するのはほぼ不可能です。
プロキシが入る場所: 多くの源からの大量収集、または内容が地域で異なる場合。データセンター帯域が妥当な既定です。当社は $0.14/GB から。住宅は $0.79/GB から、明らかに必要な場合のみ。料金ページより、2026年9月確認。
入らない場所: 必要なデータが公開コーパスにあるなら、帯域を買って再現するのは端的に無駄です。先に確認してください。上のコーパスは広大な範囲をカバーし、埋め込まれたフィルタ作業は生テキストより価値があります。
よくある質問
LLM の学習にはどのデータセットが使われますか?
ほとんどのオープンモデルは Common Crawl 由来のウェブコーパス——現在の参照点は FineWeb と Dolma——に、The Stack のコード、学術論文、本、百科的内容を混ぜて学習します。Dolma は出典を個別に名付ける点で珍しく有用です。
Common Crawl は無料で使えますか?
データは AWS S3 と HTTP で自由にアクセスでき、匿名アクセスもサポートされます。WARC、WAT、WET 形式を公開し、利用条件が適用されます。ウェブアーカイブへの無料アクセスは、中のページの著作権状態を解決しない点に注意してください。
主要な LLM データセットのライセンスは?
FineWeb と Dolma は ODC-BY、Open Data Commons Attribution です。Dolma は、利用者は構成源の元ライセンスにも拘束されると明示します。編纂ライセンスは下層文書の著作権を上書きしません。
学習データセットから自分のデータを削除できますか?
場合によります。The Stack v2 は "Am I In The Stack?" ツールと文書化された削除手続きを提供し、検証済み削除要求を反映するよう更新されます。Dolma は個人情報を含む文書を報告するフォームがあります。仕組みはデータセットごとに異なり、普遍ではありません。
LLM 学習データセットはどのくらい大きいですか?
Dolma は 25.32 億文書で 3 兆トークンです。FineWeb は 2013年から2025年の Common Crawl をカバーする 259 億行です。The Stack v2 は 32.8 億ファイル、非圧縮 67.53 TB、658 のプログラミング言語です。
モデルのファインチューニングに学習データセットは必要ですか?
いいえ。小さく高品質なタスク固有データセットが必要で、典型的には兆トークンではなく数千例です。大規模事前学習コーパスは完全に誤った入力であり、ファインチューニングの仕事は規模ではなくキュレーションです。
自分で学習データセットを作るべきですか?
誰も公開していない領域データに限ってです。公開コーパスは再現困難な膨大なフィルタと重複排除を体現しており、「学習データ」とラベルされた要件の大半は、はるかに少なくて済む検索やファインチューニングの問題です。まず既存コーパスを確認してください。
データセット構築で最も難しい部分は?
収集ではなく、洗浄と重複排除です。定型除去、言語識別、品質フィルタ、規模での近似重複検出、個人情報の扱いがほぼすべての労力です。自分のパイプラインを書く前に、Allen AI のオープンな Dolma ツールキットを学ぶ価値があります。
まとめ
公開 LLM データセットは注目すべき資源です。兆トークン、文書化されたフィルタ、寛容な編纂ライセンス、良い場合にはオープンなツールと機能するオプトアウト。ウェブテキストは FineWeb、文書化された混合は Dolma、コードは The Stack v2。下層は Common Crawl または Software Heritage です。
使い方について持ち帰るべきことが二つあります。編纂ライセンスは内容ライセンスではない——Dolma は直接そう言い、すべてに当てはまる——ので、寛容なデータセットライセンスは法的分析の終わりではなく始まりです。オプトアウトは再取得して初めて効きます。ダウンロードしたコピーは取った瞬間で凍結しているからです。
より有用な結論は範囲についてです。学習データが必要と説明される要件の大半は、すでに持っている文書の索引で答える検索問題か、慎重に選んだ数千例で答えるファインチューニング問題です。どちらもこのページの何よりはるかに小さく、扱いやすいです。
本当に誰も公開していないデータを集める必要があるなら、収集は簡単な部分です。フィルタ、重複排除、文書化が仕事です。公開コーパスが、含む生テキストよりはるかに価値がある理由はまさにそれです。
