Ungewöhnlich für diesen Blog: Wir haben Ihnen hier so gut wie nichts zu verkaufen. Wir sind Geonode, wir verkaufen Proxys, und um ein Sprachmodell auf Ihrem eigenen Rechner auszuführen, benötigen Sie davon genau gar nichts. Keine Proxys, keine Bandbreite, kein Konto. Der Zusammenhang ist nur einen Schritt entfernt: Lokale Modelle werden häufig so eingesetzt, dass sie auf Ihre eigenen Daten zugreifen, und wenn diese Daten aus dem öffentlichen Web stammen, muss sie jemand sammeln. Das ist unser Teil der Pipeline und steht wirklich in keinem Zusammenhang mit dem Modell. Betrachten Sie diesen Leitfaden also als einen Ratgeber, der von Personen verfasst wurde, die kein Interesse daran haben, für welches Modell Sie sich entscheiden – eine Position, die in dieser Kategorie seltener ist, als sie sein sollte.
Was Ihnen „lokal“ bringt und was es kostet
Es lohnt sich, konkret zu werden, da beide Seiten dieser Medaille regelmäßig überbewertet werden.
Was Sie gewinnen. Die Daten verlassen niemals Ihren Rechner, was bei regulierten Aufgaben keine Vorzugsoption, sondern eine zwingende Voraussetzung ist. Es fallen keine Kosten pro Token an, sodass intensive oder experimentelle Nutzung nach Anschaffung der Hardware kostenlos ist. Keine Ratenbeschränkungen und keine Abhängigkeit von der Verfügbarkeit fremder Dienste. Vollständige Versionsstabilität – das Modell ändert sich nicht, während Sie es nutzen, was enorm wichtig ist, wenn Sie Prompts speziell auf dessen Verhalten abgestimmt haben. Und die Möglichkeit, das Modell anhand Ihrer eigenen Daten zu feinstimmen, ohne diese irgendwohin zu übertragen.
Was Sie bezahlen. Vor allem Leistungsfähigkeit. Die besten lokalen Modelle im Jahr 2026 sind zwar wirklich gut, liegen aber bei komplexen Schlussfolgerungen immer noch hinter den führenden gehosteten Modellen zurück. Hardware, was echte Investitionskosten darstellt. Geschwindigkeit – es sei denn, Sie haben leistungsstarke Hardware angeschafft. Ihre eigene Zeit für die Einrichtung, Quantisierungsentscheidungen und die Integration. Und Strom, was bei einer Maschine unter Dauerlast nicht zu vernachlässigen ist.
Was die Leute in die Irre führt, ist, dies als Kostenvergleich zu betrachten. Wenn Sie monatlich einige hunderttausend Token an eine gehostete API senden, sparen Sie mit lokalen Modellen kein Geld – die Hardware kostet mehr als diese Nutzung über Jahre hinweg. Lokale Modelle punkten bei Datenschutz, Kontrolle und Stabilität oder bei sehr hohem Datenaufkommen. Wenn keiner dieser Punkte auf Sie zutrifft, tut dies auch die Wirtschaftlichkeit nicht.
Die Hardware-Frage entscheidet über alles andere
Bevor Sie sich mit einem Modell beschäftigen, sollten Sie Ihren VRAM ermitteln. Alles andere ergibt sich daraus.
| Verfügbarer Speicher | Was läuft flüssig? | Realistische Erwartungen |
|---|---|---|
| 8 GB | 4B–8B-Modelle, quantisiert | Gut geeignet für Zusammenfassungen, Extraktion und einfache Chats |
| 12–16 GB | 12B–14B quantisierte MoE-Modelle mit kleinen aktiven Sätzen | Solider allgemeiner Assistent, ordentliche Hilfe beim Programmieren |
| 24 GB | MoE der 30B-Klasse, 32B dicht quantisiert | Wirklich leistungsfähig bei den meisten alltäglichen Aufgaben |
| 48 GB | 70B quantisiert | Nahe an der Qualität gehosteter Modelle der mittleren Leistungsklasse |
| 80 GB | MoE der 120B-Klasse bei nativer Quantisierung | Das Maximum dessen, was eine einzelne Grafikkarte leisten kann |
Zwei Dinge verändern diese Rechnung zu Ihren Gunsten.
„Mixture-of-Experts“-Architekturen. Diese verfügen über eine große Gesamtanzahl an Parametern, aktivieren jedoch pro Token nur einen Bruchteil davon. „gpt-oss-120b“ hat insgesamt 117 Milliarden Parameter und 5,1 Milliarden aktive; In der Modellbeschreibung von OpenAI heißt es, dass das Modell „auf eine einzelne 80-GB-GPU (wie NVIDIA H100 oder AMD MI300X) passt“, wobei die Expertengewichte mit MXFP4-Quantisierung verarbeitet werden. gpt-oss-20b hat insgesamt 21 Milliarden Parameter, davon 3,6 Milliarden aktiv, und läuft „mit maximal 16 GB Speicher“. Man erhält die Qualitätsvorteile eines größeren Modells bei den Speicher- und Geschwindigkeitskosten eines viel kleineren Modells.
Apple Silicon Unified Memory. Auf einem Mac ist der Systemspeicher gleichzeitig der GPU-Speicher. Ein Rechner mit 64 GB Unified Memory kann Modelle ausführen, für die man sonst eine Grafikkarte benötigen würde, die die meisten Menschen nicht besitzen. Der Durchsatz ist zwar geringer als bei einer diskreten GPU mit gleicher Kapazität, aber die Kapazitätsgrenze liegt im Verhältnis zum Preis weit höher.
Berücksichtigen Sie auch den Kontext. Die Modellgewichte sind nicht alles – der KV-Cache wächst mit der Kontextlänge und kann bei langen Eingaben mehrere Gigabyte beanspruchen. Ein Modell, das bei einem 4K-Kontext passt, passt möglicherweise nicht bei 128K.
Die Modelle, die es sich 2026 lohnt einzusetzen
Qwen3 ist die nützlichste Modellfamilie für den lokalen Einsatz, vor allem weil sie den gesamten Größenbereich mit konsistentem Verhalten abdeckt. Die Hugging-Face-Sammlung listet dichte Modelle mit 0,6 Mrd., 1,7 Mrd., 4 Mrd., 8B, 14B und 32B sowie die „Mixture-of-Experts“-Varianten 30B-A3B und 235B-A22B auf, mit quantisierten Builds in den Formaten FP8, GGUF, AWQ, GPTQ und MLX.
Die Qwen3-8B-Modellkarte dokumentiert die wesentlichen Merkmale: Apache-2.0-Lizenz, 32.768 Token nativer Kontext, der sich mit YaRN-Skalierung auf 131.072 erweitert, sowie „Unterstützung von über 100 Sprachen und Dialekten“. Das Besondere daran ist die Umschaltmöglichkeit innerhalb eines Modells zwischen dem „Thinking-Modus“ für aufschlussreiche Aufgaben und dem „Non-Thinking-Modus“ für effiziente Dialoge.
Ein praktisches Detail aus dieser Karte, das oft übersehen wird: Die Sampling-Einstellungen sind wichtig, und die empfohlenen Werte unterscheiden sich je nach Modus – Temperatur 0,6, Top-p 0,95, Top-k 20 im Denkmodus; Temperatur 0,7, Top-p 0,8, Top-k 20 in allen anderen Fällen. Vom „Greedy Decoding“ wird im Denkmodus ausdrücklich abgeraten. Wenn ein Modell schlechter abschneidet als erwartet, überprüfen Sie Ihre Sampling-Parameter, bevor Sie dem Modell die Schuld geben.
Gemma 4 von Google ist die bemerkenswerte Veröffentlichung für alle, die bisher von Gemmas Lizenzierung abgeschreckt wurden, da sie nun unter der Apache 2.0-Lizenz steht. Die Modellkarte listet fünf Größen auf – E2B, E4B, 12B, 26B, A4B und 31B – mit „einem Kontextfenster von 128K, während die mittleren Modelle 256K unterstützen“, mehrsprachige Unterstützung in „über 140 Sprachen“ sowie Text- und Bildeingabe mit Audio, die bei den Modellen E2B, E4B und 12B unterstützt wird. Native Audioeingabe in einem kleinen Open-Weight-Modell ist ungewöhnlich und sollte beachtet werden, falls dies Ihrem Anwendungsfall entspricht.
gpt-oss von OpenAI deckt beide Extreme ab. Das 20B-Modell passt auf einen Rechner mit 16 GB; das 120B-Modell passt auf eine einzelne 80-GB-Karte. Beide unterliegen der Apache-2.0-Lizenz, die auf den Modellkarten als „freizügige Apache-2.0-Lizenz: Freie Erstellung ohne Copyleft-Einschränkungen oder Patentrisiko“ beschrieben wird. Das 20B-Modell ist auf „geringere Latenz sowie lokale oder spezialisierte Anwendungsfälle“ ausgerichtet, wobei agentische Aufgaben, Funktionsaufrufe und Codeausführung zu den genannten Anwendungsbereichen gehören.
DeepSeek-R1 bleibt der Maßstab für offene Schlussfolgerungsmodelle und steht unter der MIT-Lizenz, die laut Modellkarte „die kommerzielle Nutzung unterstützt und beliebige Modifikationen sowie abgeleitete Werke erlaubt“. Für den lokalen Einsatz sind die destillierten Versionen wichtiger als das Vollmodell: Qwen-basierte Destillate mit 1,5B, 7B, 14B und 32B sowie Llama-basierte mit 8B und 70B, die alle anhand von „800.000 mit DeepSeek-R1 kuratierten Samples“ feinabgestimmt wurden. Die 14B- und 32B-Distills sind die praktische Wahl für Verbraucherhardware.
Llama bleibt mit großem Abstand die am häufigsten heruntergeladene Modellfamilie – Ollamas Bibliothek weist für „llama3.1“ 119,1 Millionen Downloads und für „llama3.2“ 82,1 Millionen aus, gefolgt von „deepseek-r1“ mit 92,2 Millionen und „gemma3“ mit 40 Millionen. Beliebtheit bedeutet die besten Tools, die meisten Community-Optimierungen und das umfangreichste Material zur Fehlerbehebung – ein echter Vorteil, der unabhängig von der reinen Leistungsfähigkeit ist.
Und vergessen Sie nicht die eingebetteten Modelle. „nomic-embed-text“ belegt mit 84,2 Mio. Abrufen den dritten Platz in der Ollama-Bibliothek, was verdeutlicht, wie stark die lokale Nutzung von LLMs tatsächlich auf dem Abruf privater Dokumente und weniger auf Chats beruht.
Lizenzen sind wichtiger als Benchmarks
Dieser Abschnitt bewahrt die Leser vor einem kostspieligen Fehler, wird jedoch bei Modellvergleichen regelmäßig ausgelassen.
„Open Weights“ ist kein einheitlicher Begriff. Die oben genannten Modelle lassen sich in drei Gruppen einteilen:
Apache 2.0 – Qwen3, Gemma 4, gpt-oss, die auf Qwen basierenden DeepSeek-Derivate. Freizügig, kommerziell nutzbar, keine Einschränkungen hinsichtlich des Anwendungsbereichs, inklusive Patentgewährung. Wenn Sie ein Produkt auf den Markt bringen, ist dies genau das Richtige für Sie.
MIT — DeepSeek-R1 selbst. Ebenso freizügig, unterstützt ausdrücklich die kommerzielle Nutzung, Modifikationen und abgeleitete Werke.
Benutzerdefinierte Community-Lizenzen – die Llama-Familie und damit auch die auf Llama basierenden DeepSeek-Derivate, die jeweils unter den Lizenzen Llama 3.1 und Llama 3.3 stehen. Diese erlauben zwar viel, sind aber weder Apache noch MIT: Sie enthalten Richtlinien zur akzeptablen Nutzung, Namensnennungsanforderungen und Bedingungen, die bei einer hohen Nutzerzahl greifen. In der Regel ist das in Ordnung. Es ist jedoch nicht automatisch in Ordnung, und es lohnt sich, die Lizenzen zu lesen, bevor Sie ein Produkt auf dieser Grundlage entwickeln.
Der Wechsel von Gemma 4 zu Apache 2.0 ist gerade deshalb bedeutsam, weil Gemma zuvor eine benutzerdefinierte Lizenz verwendete. Wenn Sie die Familie zuvor geprüft und aus lizenzrechtlichen Gründen ausgeschlossen haben, trifft dieser Grund nun nicht mehr zu.
Zwei praktische Hinweise: Erstens sollten Sie die Lizenz des konkreten Modells prüfen, das Sie herunterladen, nicht die der Modellfamilie – die DeepSeek-Distills sind das deutlichste Beispiel dafür, da verschiedene Distills derselben Version je nach ihrem Basismodell unterschiedliche Lizenzen haben. Zweitens: Wenn Sie Feinabstimmungen vornehmen, lesen Sie nach, was die Lizenz über abgeleitete Werke und die Namensgebung sagt, da manche Lizenzen vorschreiben, dass das abgeleitete Werk den ursprünglichen Namen tragen muss.
Die Tools: Ollama, llama.cpp, LM Studio, vLLM
| Tool | Am besten geeignet für | Benutzeroberfläche | Vor- und Nachteile |
|---|---|---|---|
| Ollama | Erste Schritte, lokale Entwicklung | CLI + HTTP-API | Weniger Kontrolle über die Details der Inferenz |
| llama.cpp | Maximale Kontrolle, ungewöhnliche Hardware | CLI + Server | Man konfiguriert alles selbst |
| LM Studio | Nicht-technische Nutzer, Experimentieren | GUI | Weniger für Automatisierung geeignet |
| vLLM | Bedienung mehrerer Nutzer | HTTP-API | Benötigt geeignete GPU-Hardware |
Ollama ist für die meisten Nutzer die richtige Standardwahl. Ein Befehl zum Abrufen eines Modells, ein OpenAI-kompatibler HTTP-Endpunkt, sinnvolle Standardwerte für die Quantisierung. Die Grenze liegt darin, dass man irgendwann an diese Grenze stößt, wenn man die Inferenzparameter präzise anpassen möchte.
llama.cpp ist die Grundlage von Ollama, und wenn man es direkt nutzt, erhält man volle Kontrolle über Quantisierung, Kontextbehandlung, GPU-Layer-Offloading und CPU-Threading. Es ist zudem die am besten unterstützte Lösung für ungewöhnliche Hardware – ältere Grafikkarten, reine CPU-Nutzung, Apple Silicon.
LM Studio ist eine Desktop-Anwendung mit Modellsuche und einer Chat-Oberfläche. Wenn der Nutzer des Modells kein Entwickler ist, ist dies die richtige Wahl.
vLLM ist eher ein Servingsystem als ein lokales Tool und wurde für hohen Durchsatz mit kontinuierlichem Batching entwickelt. Wenn du ein Modell für ein Team und nicht für dich selbst betreibst, ist dies die Ebene, auf die du umsteigst – sie setzt echte GPU-Hardware voraus.
Ein nützliches Vorgehen: Entwickeln Sie auf Basis des OpenAI-kompatiblen Endpunkts von Ollama, und wenn Sie später eine ordnungsgemäße Bereitstellung benötigen, wechseln Sie hinter derselben Schnittstelle zu vLLM. Ihr Anwendungscode bleibt dabei unverändert.
Quantisierung ohne vage Erklärungen
Durch die Quantisierung wird die numerische Genauigkeit der Gewichte verringert, sodass das Modell weniger Speicher benötigt. Auf diese Weise kann ein Modell, das nominell 60 GB benötigt, auf einer 24-GB-Karte ausgeführt werden.
| Format | Größe im Vergleich zu FP16 | Qualität | Verwendungszweck |
|---|---|---|---|
| FP16/BF16 | 100 % | Referenz | Sie haben Speicherplatz zur Verfügung |
| Q8 | ~50 % | Nahezu nicht zu unterscheiden | Sie haben Speicherplatz und möchten maximale Qualität |
| Q5_K_M | ~35 % | Sehr gut | Ein vernünftiger Kompromiss |
| Q4_K_M | ~28 % | Gut, leichte Einbußen | Die übliche Standardeinstellung |
| Q3 und darunter | ~20 % | Spürbare Einbußen | Nur, wenn nichts anderes passt |
Die Regel, die sich in der Praxis bewährt: Ein größeres Modell mit stärkerer Quantisierung ist in der Regel einem kleineren Modell mit schwächerer Quantisierung überlegen. Ein 32B-Modell bei Q4 übertrifft bei gleichem Speicherbedarf in der Regel ein 14B-Modell bei Q8. Die Ausnahme liegt am äußersten Ende – unterhalb von Q3 wird der Leistungsverlust so stark, dass sich das Verhältnis umkehrt.
Beachten Sie außerdem, dass MXFP4, das für die „gpt-oss“-Expertengewichte verwendet wird, ein Fall ist, bei dem die Quantisierung Teil des Modelldesigns ist und nicht erst nachträglich angewendet wird. Deshalb sind die Speicherwerte auf diesen Modellkarten so niedrig.
Testen Sie lieber mit Ihrer eigenen Workload, anstatt sich auf eine Tabelle zu verlassen – auch nicht auf diese hier. Die Quantisierung beeinträchtigt verschiedene Funktionen ungleichmäßig, und ein Grad, der bei der Zusammenfassung nicht auffällt, kann bei der Codegenerierung deutlich spürbar sein.
Realistische Erwartungen im Vergleich zur „Frontier“
Wenn man diese richtig festlegt, lassen sich die meisten Enttäuschungen vermeiden.
Wo lokale Modelle wirklich konkurrenzfähig sind: Zusammenfassung, Extraktion, Klassifizierung, Übersetzung, einfache Code-Vervollständigung, Entwurferstellung, retrieval-augmented Question Answering in Ihren eigenen Dokumenten. Für all diese Aufgaben reicht ein gut ausgewähltes 14B–32B-Modell aus, und der Unterschied zu einem auf der „Frontier“ gehosteten Modell ist so gering, dass man ihn kaum bemerken würde.
Wo die Lücke noch besteht: langes, mehrstufiges Schlussfolgern, komplexe agentenbasierte Aufgaben, große Codebasen, die echtes Verständnis erfordern, sowie Aufgaben, die umfassendes und aktuelles Weltwissen erfordern. Die Lücke hat sich zwar erheblich verringert, ist aber noch nicht geschlossen.
Wo lokale Modelle eindeutig gewinnen: alles, bei dem die Daten Ihre Infrastruktur nicht verlassen dürfen, und alles bei ausreichend hohem Volumen, sodass die Abrechnung pro Token ausschlaggebend ist. Dies sind keine Argumente zur Leistungsfähigkeit, und doch sind sie häufig die entscheidenden.
Eine weitere Erwartung, die es zu kalibrieren gilt: Geschwindigkeit. Auf handelsüblicher Hardware erzeugt ein 32-Milliarden-Modell Token mit einer Geschwindigkeit, die für eine Chat-Oberfläche ausreichend, für Batch-Verarbeitungen jedoch zu langsam ist. Wenn Sie zehntausend Dokumente verarbeiten, sollten Sie den Durchsatz messen, bevor Sie sich für eine Architektur entscheiden.
Wann Sie einfach eine API nutzen sollten
Der Abschnitt, der gegen diese Prämisse argumentiert.
Wenn Ihr Volumen gering ist. Ein paar hunderttausend Token pro Monat kosten bei einer gehosteten API nur sehr wenig und rechtfertigen keinesfalls die Anschaffung einer GPU. Der Kauf von Hardware, um eine geringe Rechnung zu vermeiden, ist ein schlechtes Geschäft – es sei denn, die Hardware lässt sich anderweitig nutzen.
Wenn Sie Spitzenleistung benötigen. Wenn die Aufgabe tatsächlich die stärkste verfügbare Schlussfolgerungsleistung erfordert, sind lokale Modelle noch nicht so weit, und so zu tun, als wäre es anders, kostet Wochen an Zeit.
Wenn Sie nicht über die erforderliche Hardware verfügen. Ein 7-Milliarden-Modell auf einer 8-GB-Karte auszuführen, nur weil Sie diese zur Verfügung haben, und dann zu dem Schluss zu kommen, dass lokale Modelle nicht gut sind, ist eine häufige und vermeidbare Enttäuschung. Das Modell, das Sie ausführen können, ist nicht das Modell, über das Sie gelesen haben.
Wenn Wartungskosten für Sie untragbar sind. Modelle werden aktualisiert, Tools ändern sich, Quantisierungsformate entwickeln sich weiter. Eine gehostete API ist das Betriebsproblem eines anderen.
Wenn Sie prototypisieren. Entwickeln Sie auf Basis einer API, stellen Sie sicher, dass das Produkt funktioniert, und prüfen Sie dann, ob sich der Umstieg auf lokale Modelle lohnt. Die umgekehrte Reihenfolge bedeutet, Hardwareprobleme zu lösen, bevor du weißt, ob die Idee überhaupt gut ist.
Und der Fall, bei dem es keine Unklarheiten gibt: Wenn deine Vorgabe lautet, dass Daten dein Haus nicht verlassen dürfen, trifft nichts von alledem zu. In dieser Situation ist „lokal“ keine Präferenz, und die Frage ist lediglich, welches Modell zu deiner Hardware passt.
Häufig gestellte Fragen
Was ist das beste lokale LLM im Jahr 2026?
Es gibt keine allgemeingültige Antwort, aber Qwen3 ist die nützlichste Modellfamilie für den lokalen Einsatz, da sie einen Bereich von 0,6 Mrd. bis 235 Mrd. abdeckt, ein konsistentes Verhalten aufweist und unter der Apache-2.0-Lizenz steht. Passen Sie die Größe an Ihren VRAM an: 8B für 8–16 GB, das 30B-A3B-Mixture-of-Experts-Modell für 24 GB und gpt-oss-120b, wenn Sie eine 80-GB-Karte haben.
Wie viel VRAM benötige ich, um ein lokales LLM auszuführen?
Mit 8 GB lassen sich nützliche quantisierte Modelle der Größenordnung 4B–8B ausführen. 16 GB decken problemlos Modelle der Größenordnung 12B–14B ab oder gpt-oss-20b, das laut Dokumentation mit 16 GB läuft. 24 GB eröffnen den Einsatz von Modellen der 30B-Klasse. „Mixture-of-Experts“-Architekturen wirken sich hier zu Ihrem Vorteil aus, da pro Token nur ein Bruchteil der Parameter aktiviert wird.
Sind lokale LLMs genauso gut wie ChatGPT oder Claude?
Bei den anspruchsvollsten Denkaufgaben nicht. Für Zusammenfassungen, Extraktion, Klassifizierung, Übersetzung und das Abrufen von Informationen aus Ihren eigenen Dokumenten ist ein gutes lokales Modell der 14B–32B-Klasse so gut, dass der Unterschied kaum ins Gewicht fällt. Die Lücke wird zwar kleiner, ist aber noch nicht geschlossen.
Welche lokalen LLMs kann ich kommerziell nutzen?
Qwen3, Gemma 4 und gpt-oss unterliegen der Apache-2.0-Lizenz. DeepSeek-R1 unterliegt der MIT-Lizenz. Alle erlauben die kommerzielle Nutzung ohne Einschränkungen hinsichtlich des Anwendungsbereichs. Die Llama-Familie verwendet benutzerdefinierte Community-Lizenzen, die zwar viel zulassen, aber Bedingungen enthalten, die es wert sind, gelesen zu werden. Prüfen Sie das jeweilige Modell und nicht die Modellfamilie – die auf Qwen basierenden DeepSeek-Derivate unterliegen der Apache-2.0-Lizenz, während die auf Llama basierenden Derivate unter Llama-Lizenzen stehen.
Was ist der einfachste Weg, ein LLM lokal auszuführen?
Ollama für Entwickler – ein Befehl zum Abrufen eines Modells und ein OpenAI-kompatibler HTTP-Endpunkt. LM Studio, wenn Sie eine grafische Benutzeroberfläche und keine Befehlszeile wünschen. Beide übernehmen die Quantisierung und die Hardwareerkennung für Sie.
Beeinträchtigt die Quantisierung die Qualität?
Ein wenig, und zwar ungleichmäßig. Q8 ist von der vollen Präzision kaum zu unterscheiden. Q4_K_M ist die gängige Standardeinstellung mit einer leichten Verschlechterung, die die meisten Menschen nicht bemerken. Unterhalb von Q3 wird der Unterschied deutlich. In der Regel schneidet ein größeres Modell bei Q4 besser ab als ein kleineres Modell bei Q8 bei gleichem Speicherbedarf.
Kann ich ein lokales LLM auf einem Mac ausführen?
Ja, und oft sogar besser als auf einem PC derselben Preisklasse, da der einheitliche Speicher von Apple Silicon der GPU zur Verfügung steht. Ein Mac mit 64 GB kann Modelle ausführen, für die eine Grafikkarte erforderlich wäre, die die meisten Nutzer nicht besitzen. Der Durchsatz ist geringer als bei einer diskreten GPU, aber die Kapazitätsgrenze pro Pfund ist deutlich höher.
Benötige ich Proxys oder spezielle Netzwerkkonfigurationen für lokale LLMs?
Nein. Das Modell läuft auf Ihrem Rechner und stellt keine Netzwerkanfragen. Das Netzwerk kommt nur dann ins Spiel, wenn Sie Webdaten sammeln, um diese abzurufen – was ein völlig separater Teil der Pipeline ist.
Fazit
Entscheiden Sie sich zuerst nach dem Speicher, dann nach der Lizenz und erst an dritter Stelle nach dem Benchmark. Diese Reihenfolge ist das Gegenteil dessen, wie die meisten Vergleiche verfasst werden, und genau sie führt zu einem funktionierenden System.
Ihr VRAM bestimmt, welche Modelle überhaupt in Frage kommen, und „Mixture-of-Experts“-Architekturen haben diese Einschränkung erheblich gelockert – 117 Milliarden Parameter auf einer einzigen 80-GB-Karte oder 21 Milliarden auf einer 16-GB-Karte waren vor nicht allzu langer Zeit noch unrealistische Vorstellungen. Die Lizenz entscheidet darüber, ob Sie das, was Sie entwickeln, auch ausliefern können, und die Umstellung von Gemma 4 auf Apache 2.0 bedeutet, dass die freizügige Lizenzstufe nun die meisten der leistungsstarken Optionen abdeckt. Benchmarks kommen an letzter Stelle, da die Unterschiede innerhalb einer Größenklasse gering sind und Ihre spezifische Arbeitslast ohnehin nicht mit den Ergebnissen der Rangliste übereinstimmen wird.
Die ehrliche Zusammenfassung der aktuellen Lage: Für datenschutzrelevante Aufgaben, für hohe Datenmengen und für alles, bei dem das Modell sich nicht ständig unter Ihren Füßen verändern darf, ist die lokale Ausführung mittlerweile eine eindeutig gute Option und kein Kompromiss mehr. Für den gelegentlichen Einsatz mit Spitzenleistung ist dies jedoch nach wie vor nicht der Fall, und eine gehostete API bleibt die sinnvolle Lösung.
