Geonode logo
Geonode Team

Geonode Team

Atualizado: 7 de setembro de 2026

Publicado: 2 de setembro de 2026

Conjuntos de dados para treinar LLMs: o que são e como usá-los

Os conjuntos públicos para treinar LLMs são grandes, bem documentados e em geral licenciados de forma permissiva. Também são mais heterogêneos do que "um monte de texto da web" sugere, e as diferenças entre eles importam mais do que os tamanhos. Este guia cobre os principais corpora com números verificados, as questões de licenciamento e proveniência que determinam se você pode usá-los, e o que construir o seu realmente envolve. Incluindo a observação honesta de que a maior parte das pessoas que faz essa pergunta não precisa pré-treinar nada.

Nosso interesse, declarado: somos a Geonode e vendemos proxies, que é a infraestrutura que você usaria para coletar dados da web por conta própria. A posição honesta é que quase ninguém deveria. Os corpora públicos abaixo representam quantidades enormes de filtragem, deduplicação e cuidado jurídico, são gratuitos, e reproduzir mesmo uma fração desse trabalho é um programa de pesquisa, não um projeto. Onde a coleta de fato se justifica — um domínio estreito que ninguém publicou, ou dados novos depois do corte de um corpus — é um trabalho pequeno e pontual, não um crawl na escala da web. Essa seção está no fim e é curta, de propósito.

A camada de baixo: Common Crawl

Quase todo corpus aberto da web deriva da mesma fonte.

O Common Crawl é um arquivo web gratuito com bilhões de páginas, publicado como instantâneos periódicos de crawl no AWS S3 em us-east-1 e disponível via HTTP em data.commoncrawl.org. O acesso anônimo funciona com a AWS CLI usando --no-sign-request, ou com ferramentas comuns como wget e curl.

Ele publica três formatos, e saber qual você quer economiza banda considerável:

WARC — "the raw data from the crawl, providing a direct mapping to the crawl process", incluindo respostas HTTP, requisições e metadados. Completo e muito grande.

WAT — arquivos "Web Archive Transformation" com metadados computados em JSON, incluindo cabeçalhos HTTP e links da página. A escolha certa para trabalho de grafo de links.

WET — arquivos "WARC Encapsulated Text" só com texto puro extraído. A escolha certa para modelagem de linguagem, e dramaticamente menores que WARC.

O ponto importante é que o Common Crawl é um ingrediente cru, não um conjunto de dados. Contém boilerplate, navegação, spam, duplicatas, tradução automática e todo o restante artefato da web aberta. O valor dos corpora derivados abaixo está quase inteiro na filtragem, e é nessa filtragem que está a pesquisa.

FineWeb

O corpus web da Hugging Face, e o ponto de referência atual para dados abertos da web em escala.

O FineWeb deriva do Common Crawl e contém 25,9 bilhões de linhas, cobrindo crawls de CC-MAIN-2013-20 até CC-MAIN-2025-26 — mais ou menos de meados de 2013 a meados de 2025. É publicado sob ODC-BY, a licença Open Data Commons Attribution.

Cada registro carrega sinais de qualidade, incluindo uma pontuação de idioma e uma contagem de tokens, que importam mais do que parecem: permitem filtrar o corpus adiante para os seus propósitos sem refazer o pipeline. Querer só inglês de alta confiança acima de um limiar de comprimento é uma expressão de filtro, não um trabalho de pré-processamento.

O FineWeb vale começar por ele porque as decisões de filtragem são documentadas e ablacionadas, não apenas afirmadas. Quando um corpus diz quais escolhas de filtragem melhoraram o desempenho em benchmarks posteriores e em quanto, você pode discordar delas de propósito.

Dolma

O corpus da Allen AI, e o mais transparente sobre a composição.

O Dolma é descrito como "a dataset of 3 trillion tokens from a diverse mix of web content, academic publications, code, books, and encyclopedic materials", com 2,532 bilhões de documentos. A versão 1.7, com 1,715 trilhão de tokens, foi usada para treinar o OLMo 7B-v1.7.

As fontes são nomeadas individualmente: páginas web do Common Crawl, código do StarCoder e do The Stack, artigos acadêmicos do S2ORC e do arXiv, Reddit, livros do Project Gutenberg e Wikipedia.

É publicado sob ODC-BY, com um aviso importante dito de forma clara: os usuários "are also bound by the original licenses of constituent sources". Essa é a frase para ler duas vezes. Uma licença permissiva da compilação não prevalece sobre as licenças do que entrou nela, e isso vale para todo corpus derivado, diga ou não com a mesma clareza.

Dois pontos a mais fazem o Dolma merecer atenção além do conteúdo. A Allen AI publicou o kit de curadoria como código aberto, então o conjunto é reproduzível, não só baixável — você pode mudar uma decisão de filtragem e reconstruir. E há um mecanismo de remoção: um formulário para notificar os mantenedores de documentos que contenham informações pessoais de um usuário específico.

Essa combinação — fontes nomeadas, ferramentas abertas, um caminho de remoção — é o que a publicação responsável de conjuntos parece, e é um padrão razoável para cobrar dos outros.

The Stack v2

O corpus de código, e o mais cuidadoso dos grandes conjuntos quanto a licenciamento.

O The Stack v2 do BigCode Project é "a collection of source code in over 600 programming languages", com 3,28 bilhões de arquivos únicos totalizando 67,53 TB sem compressão, abrangendo 658 linguagens. As variantes de treino são filtradas para 17 ou mais de 600 linguagens, conforme a versão.

A proveniência é incomum e vale notar: os dados derivam do arquivo Software Heritage, descrito como "the largest public archive of software source code", combinado com metadados do GitHub Archive até setembro de 2023.

Dois mecanismos o distinguem.

Filtragem de licença. O conjunto "contains only permissively licensed code". Os criadores "propagate the detected licenses to all files" dentro dos repositórios e mantêm uma lista curada de identificadores SPDX aceitáveis com base nas aprovações do Blue Oak Council. Isso é bem mais rigoroso do que filtrar pelo campo de licença declarado do repositório.

Exclusão do desenvolvedor. Há uma ferramenta "Am I In The Stack?" para checar inclusão, um processo de remoção documentado, e o conjunto é "regularly updated to enact validated data removal requests".

Independentemente do que se pense sobre treinar em código público, esta é a implementação mais defensável disponível hoje, e o mecanismo de exclusão é de verdade, não um gesto.

Licenças e proveniência

A parte que determina se você realmente pode usar qualquer disso, e tem mais camadas do que um único campo de licença sugere.

A licença da compilação não é a licença do conteúdo. ODC-BY no FineWeb ou no Dolma rege a coleção. Os documentos subjacentes carregam o próprio direito autoral, e o Dolma diz isso de forma explícita. Uma licença permissiva do conjunto significa que os compiladores não estão restringindo você além disso; não significa que o conteúdo era deles para relicenciar.

Atribuição é requisito, não cortesia. ODC-BY é uma licença de atribuição. Se você usa esses conjuntos, atribua-os.

Exclusões estão se tornando padrão e vale honrá-las. O processo de remoção do The Stack e o formulário de informações pessoais do Dolma existem porque publicar nessa escala cria obrigações. Usar um conjunto significa herdar a versão que você baixou — então puxar de novo periodicamente é como as remoções de fato entram na sua cópia.

Dados pessoais têm regime próprio. Corpora na escala da web contêm informações pessoais, e em jurisdições com lei de proteção de dados isso cria obrigações para você como operador, independentemente de qualquer licença do conjunto. "Estava num conjunto público" não é base legal.

E o ambiente jurídico está em aberto. Se treinar em material protegido por direito autoral é permitido, e sob quais condições, está em litígio ativo em várias jurisdições. Na UE, o quadro de mineração de texto e dados contempla reservas de direitos legíveis por máquina, e os mecanismos para expressá-las ainda estão se acomodando. Quem constrói um produto nisso deveria acompanhar, em vez de assumir que a posição de hoje é definitiva.

Como avaliar um conjunto antes de usá-lo

Um corpus não é uma caixa-preta, e meia hora de inspeção antes de comprometer armazenamento e computação diz mais do que qualquer resumo de model card.

Amostre e leia. Puxe algumas centenas de documentos ao acaso e de fato leia. Parece pouco sério e é a coisa isolada mais informativa que você pode fazer. Em minutos você descobre se a remoção de boilerplate funcionou, quanto texto traduzido por máquina há, e se a mistura de domínios bate com o que a descrição afirma.

Confira a distribuição de idiomas contra a sua necessidade. Um corpus descrito como multilíngue pode ser 90% inglês com uma cauda longa, o que serve se você quer inglês e é inútil se você quer português. Onde sinais de qualidade como pontuação de idioma são fornecidos — o FineWeb inclui um — use-os em vez de confiar no título.

Meça duplicação você mesmo. Até corpora deduplicados contêm quase-duplicatas, e a taxa varia por fonte. Faça hash de uma amostra e conte colisões; se a taxa for alta, você está treinando no mesmo conteúdo repetidamente e o conjunto efetivo é menor do que a contagem de tokens sugere.

Confira a data de corte. Todo corpus tem uma, e ela determina o que o modelo resultante não pode saber. Os crawls do FineWeb vão até meados de 2025; qualquer coisa mais recente está ausente. Para um domínio que se move rápido, isso pode desqualificar independentemente de todo o resto.

Procure contaminação contra o seu conjunto de avaliação. Se as perguntas e respostas do seu benchmark aparecem no corpus de treino, a avaliação está medindo memorização. Isso é comum, é fácil de checar com busca de substring numa amostra, e invalida resultados de um jeito constrangedor de descobrir depois da publicação.

E confira o custo de armazenamento e banda antes de baixar. O The Stack v2 tem 67,53 TB sem compressão. Downloads de vários terabytes têm custos reais de transferência, armazenamento e tempo, e transmitir um subconjunto direto do object storage costuma ser um plano melhor do que puxar o volume inteiro para descobrir que você queria um décimo.

Você realmente precisa de um conjunto de treino?

A pergunta que vale fazer antes de qualquer coisa acima.

Para pré-treinar um modelo do zero, sim — e isso é um empreendimento em escala de pesquisa. Computação na casa de centenas de milhares de horas de GPU, um time que já fez isso antes, e um motivo pelo qual um modelo open-weight existente não serve. Pouquíssimas organizações estão nessa posição, e as que estão já sabem.

Para fine-tuning, você precisa de algo inteiramente diferente: um conjunto modesto, de alta qualidade, específico da tarefa. Milhares de exemplos em vez de trilhões de tokens, e o trabalho está na curadoria, não na escala. Nenhum dos corpora acima é a entrada certa.

Para recuperação, você precisa dos seus próprios documentos indexados, não de um corpus de treino. Este é o caso em que uma fatia enorme das consultas "precisamos de dados de treino" acaba se revelando, e a resposta é um índice vetorial sobre conteúdo que você já tem.

Para avaliação, você precisa de um conjunto reservado representativo da sua tarefa real, feito à mão e pequeno.

O modo de falha que esta seção existe para evitar é baixar um corpus de vários terabytes para um problema que precisava de duzentos exemplos curados. Acontece, e o esforço desperdiçado é considerável.

Construir o seu, com honestidade

Se você estabeleceu que precisa de dados de domínio que ninguém publicou, eis o que isso realmente envolve — e onde o nosso produto entra.

A coleta é a parte fácil e a menor parte. Buscar páginas é um problema resolvido. Sempre que possível, prefira rotas sancionadas: APIs, exportações em lote, feeds de parceiros, arquivos existentes. Crawl é o último recurso, não o primeiro passo, e vem com obrigações — robots.txt, termos de serviço, direito autoral, direitos de banco de dados e lei de proteção de dados onde houver dados pessoais.

A limpeza é a maior parte do trabalho. Remoção de boilerplate, identificação de idioma, filtragem de qualidade, detecção de quase-duplicatas em escala, detecção e remoção de informações pessoais. Os corpora publicados representam um esforço enorme aqui, e o kit aberto do Dolma vale estudar antes de escrever o seu — reutilizar um pipeline documentado é bem melhor do que reinventar um malfeito.

A deduplicação merece atenção particular. Quase-duplicatas degradam o treino e inflacionam o volume aparente de dados. Fazer direito em escala exige MinHash ou técnica semelhante, e é o passo mais propenso a ser pulado e o mais propenso a importar.

Documentação não é opcional. Registre por que o conjunto existe, o que contém, como e quando foi coletado, o que falta, e para o que não deve ser usado. Essa é a diferença entre um ativo e um passivo, e é quase impossível reconstruir depois.

Onde entram os proxies: coleta em volume a partir de muitas fontes, ou onde o conteúdo difere por região. Banda de datacenter é o padrão sensato — a nossa começa em US$ 0,14/GB — com residencial a partir de US$ 0,79/GB só onde for demonstravelmente necessário, da nossa página de preços, conferida em setembro de 2026.

E onde não entram: se os dados de que você precisa estão num corpus publicado, comprar banda para recriá-los é desperdício direto. Confira primeiro. Os corpora acima cobrem um terreno enorme, e o trabalho de filtragem embutido neles vale mais do que o texto cru.

Perguntas frequentes

Quais conjuntos são usados para treinar LLMs?

A maior parte dos modelos abertos treina em corpora web derivados do Common Crawl — FineWeb e Dolma são os pontos de referência atuais — misturados com código do The Stack, artigos acadêmicos, livros e conteúdo enciclopédico. O Dolma nomeia as fontes individualmente, o que é incomum e útil.

O Common Crawl é gratuito para usar?

Os dados são de acesso livre no AWS S3 e via HTTP, com acesso anônimo suportado. Publica os formatos WARC, WAT e WET, e os termos de uso se aplicam. Note que o acesso gratuito a um arquivo web não resolve o status de direito autoral das páginas dentro dele.

Sob que licença estão os principais conjuntos de LLMs?

FineWeb e Dolma são ODC-BY, a licença Open Data Commons Attribution. O Dolma afirma de forma explícita que os usuários também estão vinculados às licenças originais das fontes constituintes — a licença da compilação não prevalece sobre o direito autoral dos documentos subjacentes.

Posso remover meus dados de um conjunto de treino?

Às vezes. O The Stack v2 oferece a ferramenta "Am I In The Stack?" e um processo de remoção documentado, e é atualizado para efetivar pedidos de remoção validados. O Dolma oferece um formulário para reportar documentos com informações pessoais. Os mecanismos variam por conjunto e não são universais.

Qual o tamanho dos conjuntos de treino de LLMs?

O Dolma tem 3 trilhões de tokens em 2,532 bilhões de documentos. O FineWeb contém 25,9 bilhões de linhas cobrindo o Common Crawl de 2013 a 2025. O The Stack v2 tem 3,28 bilhões de arquivos totalizando 67,53 TB sem compressão em 658 linguagens de programação.

Preciso de um conjunto de treino para fazer fine-tuning de um modelo?

Não — você precisa de um conjunto pequeno, de alta qualidade, específico da tarefa, em geral milhares de exemplos em vez de trilhões de tokens. Os grandes corpora de pré-treino são a entrada errada por completo, e o trabalho no fine-tuning é curadoria, não escala.

Devo construir meu próprio conjunto de treino?

Só para dados de domínio que ninguém publicou. Os corpora públicos embutem um esforço enorme de filtragem e deduplicação, difícil de reproduzir, e a maior parte dos requisitos rotulados como "dados de treino" acaba sendo problema de recuperação ou de fine-tuning, precisando de bem menos. Confira os corpora existentes primeiro.

Qual é a parte mais difícil de construir um conjunto?

Limpeza e deduplicação, não coleta. Remoção de boilerplate, identificação de idioma, filtragem de qualidade, detecção de quase-duplicatas em escala e tratamento de informações pessoais respondem por quase todo o esforço. O kit aberto Dolma da Allen AI vale estudar antes de escrever o seu próprio pipeline.

Conclusão

Os conjuntos públicos de LLMs são um recurso notável: trilhões de tokens, filtragem documentada, licenças de compilação permissivas e, nos melhores casos, ferramentas abertas e mecanismos de exclusão que funcionam. FineWeb para texto da web, Dolma para uma mistura documentada, The Stack v2 para código, todos construídos sobre Common Crawl ou Software Heritage por baixo.

Duas coisas valem levar sobre o uso. A licença da compilação não é a licença do conteúdo — o Dolma diz isso diretamente e vale para todos — então uma licença permissiva do conjunto é o começo da sua análise jurídica, não o fim. E mecanismos de exclusão só funcionam se você puxar de novo, porque a cópia baixada fica congelada no momento em que você a tirou.

A conclusão mais útil é sobre escopo. A maior parte dos requisitos descritos como necessidade de dados de treino acaba sendo problema de recuperação, resolvido indexando documentos que você já tem, ou de fine-tuning, resolvido com alguns milhares de exemplos escolhidos com cuidado. Ambos são bem menores e bem mais tratáveis do que qualquer coisa nesta página.

E se você de fato precisa coletar dados que ninguém publicou, a coleta é a parte fácil. A filtragem, a deduplicação e a documentação são o trabalho — que é exatamente por que os corpora publicados valem tanto mais do que o texto cru que contêm.