Geonode logo
Geonode Team

Geonode Team

Atualizado: 7 de outubro de 2026

Publicado: 2 de setembro de 2026

Os melhores LLMs locais em 2026: o que executar e em que hardware

Executar um modelo de linguagem eficaz no seu próprio hardware deixou de ser uma novidade há já algum tempo. A questão agora é qual escolher, em que hardware e se vale a pena o esforço. A resposta sincera depende muito mais da sua VRAM e dos seus requisitos de licença do que de qualquer tabela de benchmarks. A seguir: os modelos que vale a pena executar, as licenças que determinam se pode comercializá-los e os casos em que um modelo local é a escolha errada.

O que não é habitual neste blogue, não temos praticamente nada para vos vender aqui. Somos a Geonode, vendemos proxies, e executar um modelo de linguagem no vosso próprio computador não requer absolutamente nada disso. Sem proxies, sem largura de banda, sem conta. A ligação é indireta: os modelos locais são frequentemente implementados com recuperação a partir dos seus próprios dados e, se esses dados provêm da Web pública, alguém tem de os recolher. Essa é a nossa parte do processo e está genuinamente separada do modelo. Por isso, leia isto como um guia escrito por pessoas que não têm qualquer interesse no modelo que escolher, o que é uma posição mais rara nesta categoria do que deveria ser.

O que o «Local» lhe oferece e quanto custa

Vale a pena ser concreto, porque ambos os aspetos desta questão são frequentemente exagerados.

O que ganha. Os dados nunca saem do seu equipamento, o que, no caso de trabalhos sujeitos a regulamentação, não é uma preferência, mas sim um requisito. Não há custo por token, pelo que a utilização intensiva ou experimental é gratuita após o investimento em hardware. Não há limites de taxa nem dependência do tempo de atividade de terceiros. Estabilidade total da versão — o modelo não muda enquanto o utiliza, o que é extremamente importante se tiver ajustado os prompts de acordo com o seu comportamento. E a capacidade de fazer um ajuste fino com base nos seus próprios dados, sem os enviar para lado nenhum.

O que paga. Capacidade, principalmente. Os melhores modelos locais em 2026 são genuinamente bons, mas ainda ficam aquém dos modelos hospedados de ponta no que diz respeito ao raciocínio complexo. Hardware, que representa um custo de capital real. Velocidade, a menos que tenha adquirido hardware de alta performance. O seu próprio tempo na configuração, nas escolhas de quantização e na integração. E a eletricidade, que não é pouca coisa para uma máquina sob carga contínua.

O que induz as pessoas em erro é encarar isto como uma comparação de custos. Se enviar algumas centenas de milhares de tokens por mês para uma API hospedada, os modelos locais não lhe vão poupar dinheiro — o hardware custa mais do que anos dessa utilização. Os modelos locais ganham em privacidade, controlo e estabilidade, ou em volumes muito elevados. Se nenhuma destas situações se aplicar a si, a economia também não se aplica.

A questão do hardware determina tudo o resto

Antes de analisar qualquer modelo, determine a sua VRAM. Tudo o resto decorre disso.

Memória disponívelO que funciona bemExpectativa realista
8 GBModelos de 4B–8B, quantizadosAdequado para resumo, extração e conversas simples
12–16 GBModelos de 12B–14B quantizados, MoE com conjuntos ativos pequenosAssistente geral fiável, ajuda decente na programação
24 GBMoE da classe dos 30 mil milhões, quantização densa de 32 mil milhõesVerdadeiramente capaz na maioria das tarefas do dia a dia
48 GB70B quantizadoPróximo da qualidade de um serviço hospedado de nível médio
80 GBMoE da classe 120B com quantização nativaO máximo que uma única placa consegue fazer

Há duas coisas que alteram esta equação a seu favor.

Arquiteturas de mistura de especialistas (Mixture-of-experts). Estas têm um grande número total de parâmetros, mas ativam apenas uma fração por token. O modelo «gpt-oss-120b» tem 117 mil milhões de parâmetros no total e 5,1 mil milhões ativos; A ficha técnica do modelo da OpenAI indica que este cabe «numa única GPU de 80 GB (como a NVIDIA H100 ou a AMD MI300X)» utilizando quantização MXFP4 dos pesos dos especialistas. O gpt-oss-20b tem um total de 21 mil milhões, dos quais 3,6 mil milhões estão ativos, e funciona «com 16 GB de memória». O utilizador obtém os benefícios de qualidade de um modelo maior com o custo de memória e velocidade de um modelo muito mais pequeno.

Memória unificada do Apple Silicon. Num Mac, a memória do sistema é a memória da GPU. Um computador com 64 GB de memória unificada executa modelos que exigiriam uma placa que a maioria das pessoas não possui. O rendimento é inferior ao de uma GPU discreta de capacidade equivalente, mas o limite máximo de capacidade é muito superior pelo mesmo preço.

Tenha também em conta o contexto no orçamento. Os pesos dos modelos não são a única variável — a cache KV cresce com o comprimento do contexto e pode consumir vários gigabytes em entradas longas. Um modelo que cabe num contexto de 4K pode não caber num de 128K.

Os modelos que vale a pena utilizar em 2026

O Qwen3 é a família mais útil para implementação local, principalmente porque abrange toda a gama de tamanhos com um comportamento consistente. A coleção da Hugging Face inclui modelos densos de 0,6 mil milhões, 1,7 mil milhões, 4 mil milhões, 8 mil milhões, 14 mil milhões e 32 mil milhões, além das variantes de mistura de especialistas 30 mil milhões-A3B e 235 mil milhões-A22B, com versões quantizadas nos formatos FP8, GGUF, AWQ, GPTQ e MLX.

A ficha do modelo Qwen3-8B documenta as características mais relevantes: licença Apache 2.0, 32 768 tokens de contexto nativo, que se estendem até 131 072 com o escalonamento YaRN, e «suporte a mais de 100 línguas e dialetos». A sua característica distintiva é a possibilidade de alternar, num único modelo, entre o modo de raciocínio — para tarefas que exigem muito raciocínio — e o modo sem raciocínio — para um diálogo eficiente.

Um pormenor prático dessa ficha que muitas pessoas ignoram: as definições de amostragem são importantes, e os valores recomendados variam consoante o modo — temperatura 0,6, top-p 0,95, top-k 20 para o modo de raciocínio; temperatura 0,7, top-p 0,8, top-k 20 nos restantes casos. A descodificação «greedy» é explicitamente desaconselhada no modo de raciocínio. Se um modelo estiver a ter um desempenho pior do que o esperado, verifique os seus parâmetros de amostragem antes de culpar o modelo.

O Gemma 4 da Google é o lançamento mais notável para quem anteriormente se sentia desmotivado pela licença do Gemma, uma vez que agora segue a licença Apache 2.0. A ficha do modelo enumera cinco tamanhos — E2B, E4B, 12B, 26B, A4B e 31B — com «uma janela de contexto de 128K, enquanto os modelos médios suportam 256K», suporte multilingue em «mais de 140 idiomas» e entrada de texto e imagem com áudio suportada nos modelos E2B, E4B e 12B. A entrada de áudio nativa num modelo pequeno de peso aberto é invulgar e vale a pena conhecer, se esse for o seu caso de utilização.

O gpt-oss da OpenAI abrange os dois extremos. O 20B cabe numa máquina de 16 GB; o 120B cabe num único cartão de 80 GB. Ambos estão sob a licença Apache 2.0, descrita nas fichas dos modelos como uma «licença Apache 2.0 permissiva: compile livremente sem restrições de copyleft nem risco de patentes». O modelo de 20 mil milhões está posicionado para «menor latência e casos de utilização locais ou especializados», com trabalho agênico, chamada de funções e execução de código entre as aplicações indicadas.

O DeepSeek-R1 continua a ser a referência para modelos de raciocínio aberto e está licenciado sob a licença MIT, que, segundo a ficha do modelo, «apoia a utilização comercial, permite quaisquer modificações e trabalhos derivados». Para utilização local, as versões destiladas são mais importantes do que o modelo completo: As versões destiladas baseadas no Qwen têm 1,5 mil milhões, 7 mil milhões, 14 mil milhões e 32 mil milhões, e as baseadas no Llama têm 8 mil milhões e 70 mil milhões, todas ajustadas com base em «800 mil amostras selecionadas com o DeepSeek-R1». As versões destiladas de 14 mil milhões e 32 mil milhões são as escolhas mais práticas para hardware de consumo.

Llama continua a ser a família mais descarregada por uma larga margem — a biblioteca da Ollama apresenta llama3.1 com 119,1 milhões de descargas e llama3.2 com 82,1 milhões, à frente de deepseek-r1 com 92,2 milhões e gemma3 com 40 milhões. A popularidade significa as melhores ferramentas, o maior número de ajustes da comunidade e mais material de resolução de problemas, o que constitui uma vantagem genuína, independente da capacidade bruta.

E não se esqueça dos modelos incorporados. O «nomic-embed-text» ocupa o terceiro lugar na biblioteca da Ollama, com 84,2 milhões de consultas, o que demonstra que grande parte da utilização local de LLM consiste, na verdade, na pesquisa de documentos privados, em vez de conversas.

As licenças são mais importantes do que os benchmarks

Esta é a secção que evita que as pessoas cometam um erro dispendioso e que é habitualmente omitida nas comparações de modelos.

«Peso aberto» não é uma coisa única. Os modelos acima dividem-se em três grupos:

Apache 2.0 — Qwen3, Gemma 4, gpt-oss, as versões do DeepSeek baseadas no Qwen. Permissivas, utilizáveis comercialmente, sem restrições quanto ao âmbito de utilização, incluindo a concessão de patentes. Se estiver a comercializar um produto, é isto que precisa.

MIT — o próprio DeepSeek-R1. Igualmente permissivo, suportando explicitamente a utilização comercial, a modificação e obras derivadas.

Licenças personalizadas da comunidade — a família Llama e, por herança, as versões do DeepSeek baseadas no Llama, que seguem as licenças Llama 3.1 e Llama 3.3, respetivamente. Estas permitem muitas coisas, mas não são Apache nem MIT: incluem políticas de utilização aceitável, requisitos de atribuição e condições que se aplicam quando o número de utilizadores é elevado. Normalmente, não há problema. Mas não é automaticamente assim, e vale a pena ler antes de desenvolver um produto com base numa delas.

A mudança do Gemma 4 para a Apache 2.0 é significativa precisamente porque o Gemma utilizava anteriormente uma licença personalizada. Se já avaliou a família anteriormente e a descartou por motivos de licenciamento, esse motivo já não se aplica.

Dois pontos práticos. Primeiro, verifique a licença do modelo específico que está a utilizar, não da família — os «distills» do DeepSeek são o exemplo mais claro, em que diferentes «distills» da mesma versão têm licenças diferentes, dependendo do seu modelo base. Segundo, se estiver a fazer ajustes, leia o que a licença diz sobre obras derivadas e sobre a denominação, porque algumas exigem que a obra derivada mantenha o nome original.

As ferramentas: Ollama, llama.cpp, LM Studio, vLLM

FerramentaIdeal paraInterfaceVantagens e desvantagens
OllamaPrimeiros passos, desenvolvimento localCLI + API HTTPMenos controlo sobre os detalhes da inferência
llama.cppControlo máximo, hardware não convencionalCLI + servidorÉ o utilizador que configura tudo
LM StudioUtilizadores sem conhecimentos técnicos, experimentaçãoGUIMenos adequado para automatização
vLLMAtendimento a vários utilizadoresAPI HTTPRequer hardware de GPU adequado

O Ollama é a escolha padrão certa para a maioria das pessoas. Um comando para obter um modelo, um ponto de extremidade HTTP compatível com a OpenAI, predefinições de quantização sensatas. A limitação é que, quando quiser ajustar os parâmetros de inferência com precisão, acabará por ultrapassar essa limitação.

O llama.cpp é a base sobre a qual o Ollama foi construído, e a sua utilização direta dá-lhe controlo total sobre a quantização, o tratamento do contexto, o descarregamento da camada da GPU e o multithreading da CPU. É também a opção com melhor suporte para hardware menos comum — placas mais antigas, apenas CPU, Apple Silicon.

O LM Studio é uma aplicação para computador com funcionalidades de descoberta de modelos e uma interface de chat. Se a pessoa que utiliza o modelo não for um programador, esta é a solução ideal.

O vLLM é um sistema de serviço, em vez de uma ferramenta local, concebido para um elevado débito com processamento em lotes contínuo. Se estiver a executar um modelo para uma equipa, em vez de para si próprio, este é o nível para o qual deve passar, e requer hardware de GPU real.

Um padrão útil: desenvolva com base no endpoint compatível com a OpenAI da Ollama e, se mais tarde precisar de fornecer o serviço corretamente, mude para o vLLM através da mesma interface. O código da sua aplicação não muda.

Quantização sem aproximações

A quantização reduz a precisão numérica dos pesos, pelo que o modelo necessita de menos memória. É assim que um modelo que, em teoria, necessita de 60 GB funciona numa placa de 24 GB.

FormatoTamanho vs. FP16QualidadeUtilizar quando
FP16/BF16100%ReferênciaTem memória de sobra
Q8~50%Quase indistinguívelTem espaço e pretende a máxima qualidade
Q5_K_M~35%Muito boaUm equilíbrio sensato
Q4_K_M~28%Boa, ligeira degradaçãoA predefinição comum
Q3 e inferiores~20%Degradação percetívelApenas quando nada mais cabe

A regra que se verifica na prática: um modelo maior com quantização mais pesada geralmente supera um modelo menor com quantização mais leve. Um modelo de 32B em Q4 terá, normalmente, um desempenho superior ao de um modelo de 14B em Q8 com o mesmo orçamento de memória. A exceção ocorre no extremo — abaixo de Q3, a degradação torna-se suficientemente grave para que a relação se inverta.

Note-se também que o MXFP4, utilizado nos pesos de especialista do gpt-oss, é um caso em que a quantização faz parte da conceção do modelo, em vez de ser algo aplicado posteriormente. É por isso que os valores de memória nessas fichas de modelo são tão baixos.

Teste a sua própria carga de trabalho em vez de confiar numa tabela, incluindo esta. A quantização degrada diferentes capacidades de forma desigual, e um nível que é imperceptível para a síntese pode ser óbvio para a geração de código.

Expectativas realistas versus a fronteira

Definir estas expectativas corretamente evita a maior parte das desilusões.

Onde os modelos locais são genuinamente competitivos: resumo, extração, classificação, tradução, autocompletar código simples, elaboração de rascunhos e resposta a perguntas reforçada por recuperação de informação nos seus próprios documentos. Para todas estas tarefas, um modelo de 14B–32B bem escolhido é suficiente, e a diferença em relação a um modelo de ponta alojado é tão pequena que seria difícil notá-la.

Onde a diferença ainda é real: raciocínio longo em várias etapas, trabalho complexo de agência, grandes bases de código que exigem compreensão genuína, tarefas que requerem conhecimento amplo e atualizado do mundo. A diferença diminuiu consideravelmente. Mas ainda não desapareceu.

Onde os modelos locais vencem de forma incontestável: qualquer situação em que os dados não possam sair da sua infraestrutura e qualquer situação com um volume suficientemente elevado para que o preço por token seja o fator dominante. Estes não são argumentos relacionados com a capacidade, mas são frequentemente os decisivos.

Mais uma expectativa a ter em conta: a velocidade. Em hardware de consumo, um modelo de 32 mil milhões de parâmetros produz tokens a uma velocidade que é adequada para uma interface de chat, mas lenta para qualquer processamento em lote. Se estiver a processar dez mil documentos, avalie o rendimento antes de se comprometer com uma arquitetura.

Quando deve simplesmente utilizar uma API

A secção que contesta a premissa.

Quando o seu volume é baixo. Algumas centenas de milhares de tokens por mês custam muito pouco numa API alojada e nunca justificarão a compra de uma GPU. Comprar hardware para evitar uma conta baixa é uma má decisão, a menos que o hardware tenha outras utilizações.

Quando precisa de capacidades de ponta. Se a tarefa exigir genuinamente o raciocínio mais avançado disponível, os modelos locais ainda não estão à altura e fingir o contrário faz com que se percam semanas.

Quando não dispõe do hardware. Executar um modelo de 7 mil milhões num cartão de 8 GB só porque é isso que tem e, depois, concluir que os modelos locais não são bons, é uma desilusão comum e evitável. O modelo que consegue executar não é o modelo sobre o qual leu.

Quando a manutenção é um custo que não pode suportar. Os modelos atualizam-se, as ferramentas mudam, os formatos de quantização evoluem. Uma API alojada é um problema operacional de outra entidade.

Quando está a criar protótipos. Desenvolva com base numa API, confirme que o produto funciona e, só depois, avalie se vale a pena migrar para um ambiente local. A ordem inversa significa resolver problemas de hardware antes de saber se a ideia é boa.

E o caso em que não há ambiguidade: se a sua restrição é que os dados não podem sair das suas instalações, nada do que foi referido acima se aplica. A execução local não é uma preferência nessa situação, e a questão é apenas qual o modelo que se adapta ao seu hardware.

Perguntas frequentes

Qual é o melhor LLM local em 2026?

Não existe uma resposta única, mas o Qwen3 é a família mais útil para implementação local, uma vez que abrange valores entre 0,6 mil milhões e 235 mil milhões, com um comportamento consistente e uma licença Apache 2.0. Adapte o tamanho à sua VRAM: 8 mil milhões para 8–16 GB, o modelo «mixture-of-experts» de 30 mil milhões-A3 mil milhões para 24 GB e o gpt-oss-120b se tiver uma placa de 80 GB.

De quanto de VRAM preciso para executar um LLM local?

8 GB permitem executar modelos quantizados úteis de 4B a 8B. 16 GB cobrem confortavelmente modelos de 12B a 14B, ou o gpt-oss-20b, que, segundo a documentação, funciona com 16 GB. 24 GB permite utilizar modelos da classe dos 30 mil milhões. As arquiteturas de mistura de especialistas tornam isto mais vantajoso para si, porque apenas uma fração dos parâmetros é ativada por token.

Os LLMs locais são tão bons quanto o ChatGPT ou o Claude?

Não nas tarefas de raciocínio mais complexas, não. Para resumo, extração, classificação, tradução e recuperação nos seus próprios documentos, um bom modelo local de 14B–32B é suficientemente próximo para que a diferença raramente seja relevante. A diferença está a diminuir, mas ainda não se fechou.

Que LLMs locais posso utilizar comercialmente?

O Qwen3, o Gemma 4 e o gpt-oss estão sob a licença Apache 2.0. O DeepSeek-R1 está sob a licença MIT. Todos permitem a utilização comercial sem restrições quanto ao âmbito de utilização. A família Llama utiliza licenças comunitárias personalizadas que permitem muitas coisas, mas incluem condições que vale a pena ler. Verifique o modelo específico em vez da família — as versões destiladas do DeepSeek baseadas no Qwen seguem a licença Apache 2.0, enquanto as baseadas no Llama seguem as licenças do Llama.

Qual é a forma mais fácil de executar um LLM localmente?

O Ollama para programadores — um comando para descarregar um modelo e um ponto de extremidade HTTP compatível com a OpenAI. O LM Studio, se preferir uma interface gráfica e não quiser utilizar a linha de comandos. Ambos tratam da quantização e da deteção de hardware por si.

A quantização prejudica a qualidade?

De certa forma, e de maneira desigual. O Q8 é praticamente indistinguível da precisão total. O Q4_K_M é o padrão comum, com uma ligeira degradação que a maioria das pessoas não nota. Abaixo do Q3, a degradação torna-se óbvia. Regra geral, um modelo maior com Q4 supera um modelo mais pequeno com Q8, com o mesmo orçamento de memória.

Posso executar um LLM local num Mac?

Sim, e muitas vezes melhor do que num PC de preço comparável, porque a memória unificada do Apple Silicon está disponível para a GPU. Um Mac de 64 GB executa modelos que exigiriam uma placa que a maioria das pessoas não possui. O rendimento é inferior ao de uma GPU discreta, mas o limite máximo de capacidade é muito mais elevado por libra.

Preciso de proxies ou de uma configuração de rede especial para LLMs locais?

Não. O modelo é executado na sua máquina e não faz pedidos de rede. A rede só entra em cena se estiver a recolher dados da Web para recuperar, o que é uma parte totalmente separada do pipeline.

Conclusão

Escolha primeiro com base na memória, depois na licença e, por último, nos resultados dos testes de desempenho. Essa ordem é o oposto da forma como a maioria das comparações é elaborada e é a que resulta num sistema funcional.

A sua VRAM determina quais os modelos que sequer são candidatos, e as arquiteturas de «mistura de especialistas» tornaram essa restrição consideravelmente menos limitativa — 117 mil milhões de parâmetros numa única placa de 80 GB, ou 21 mil milhões numa de 16 GB, não eram propostas realistas há muito tempo. A licença determina se pode distribuir o que cria, e a mudança do Gemma 4 para a Apache 2.0 significa que o nível permissivo abrange agora a maioria das opções mais sólidas. Os benchmarks vêm em último lugar porque, dentro de uma mesma classe de tamanho, as diferenças são pequenas e a sua carga de trabalho específica irá, de qualquer forma, divergir da tabela de classificação.

O resumo honesto da situação atual: para trabalhos com restrições de privacidade, para volumes elevados e para qualquer situação em que seja necessário que o modelo deixe de mudar enquanto o utiliza, a execução local é agora uma opção claramente boa, em vez de um compromisso. Para utilização ocasional com capacidades de ponta, ainda não é o caso, e uma API alojada continua a ser a resposta sensata.