Wer 2026 ein Sprachmodell auf dem eigenen Rechner betreiben will, landet fast immer bei einer von drei Familien: Llama aus dem Hause Meta, Mistral aus Frankreich und Qwen vom chinesischen Anbieter Alibaba. Alle drei sind frei herunterladbar, laufen offline und decken inzwischen ein breites Spektrum von winzigen 1-Milliarde-Parameter-Modellen bis zu großen Mixture-of-Experts-Architekturen ab. Doch sie unterscheiden sich in Lizenz, Sprachstärke, verfügbaren Größen und Charakter deutlich. Dieser Vergleich hilft dir, die richtige Familie für deinen Anwendungsfall zu wählen, ohne erst ein Dutzend Modelle durchzuprobieren.
Worin sich offene Modelle überhaupt unterscheiden
Bevor wir die drei Familien gegenüberstellen, lohnt ein Blick auf die Achsen, an denen man ein lokales Modell beurteilt. Erstens die Parameterzahl: Sie reicht von etwa 1B bis über 100B und bestimmt direkt den Speicherbedarf. Zweitens die Lizenz: Manche Modelle stehen unter echten Open-Source-Lizenzen wie Apache 2.0, andere unter Community-Lizenzen mit Einschränkungen. Drittens die Trainingssprache: Nicht jedes Modell beherrscht Deutsch gleich gut. Viertens die Architektur: Klassische dichte Modelle aktivieren alle Parameter pro Token, Mixture-of-Experts-Modelle (MoE) nur einen Teil und sind dadurch schneller bei gleicher Qualität.
Diese vier Achsen ziehen sich durch den gesamten Vergleich. Wenn du den konkreten Speicherbedarf eines Modells abschätzen willst, hilft dir unser GPU-VRAM-Bedarf-Rechner, der aus Parameterzahl und Quantisierung den nötigen Grafikspeicher berechnet.
Llama: der Allrounder mit dem größten Ökosystem
Metas Llama-Reihe ist die meistgenutzte offene Modellfamilie überhaupt. Ihr größter Vorteil ist nicht unbedingt die Spitzenleistung, sondern das riesige Ökosystem: Fast jede Anleitung, jedes Feintuning-Skript und jedes Tool im lokalen-KI-Bereich unterstützt Llama von Haus aus. Die Modelle gibt es in vielen Größen, von kompakten Varianten für Notebooks bis zu großen Versionen für Workstations.
Der Haken liegt in der Lizenz. Llama steht nicht unter einer klassischen Open-Source-Lizenz, sondern unter Metas eigener Community-Lizenz. Für die meisten privaten und kleinen kommerziellen Anwendungen ist sie unproblematisch, doch sehr große Anbieter unterliegen Sonderregeln und es gibt Nutzungsbedingungen, die man als Unternehmen lesen sollte. Sprachlich ist Llama solide im Deutschen, aber traditionell stärker im Englischen. Für deutsche Texte reicht es im Alltag, bei feinen stilistischen Aufgaben merkt man gelegentlich den englischen Schwerpunkt.
Mistral: schlank, schnell und europäisch
Mistral aus Paris hat sich einen Ruf für besonders effiziente Modelle erarbeitet. Die kleineren Mistral- und Mixtral-Modelle liefern für ihre Größe eine erstaunlich gute Qualität und laufen flott auch auf bescheidener Hardware. Viele Mistral-Modelle stehen unter der echten Apache-2.0-Lizenz, was sie kommerziell besonders unkompliziert macht: Du darfst sie ohne nennenswerte Einschränkungen einsetzen, anpassen und in Produkte einbauen.
Für deutschsprachige Nutzer ist Mistral interessant, weil das Unternehmen europäisch verwurzelt ist und europäische Sprachen von Anfang an mitgedacht hat. Im Deutschen liefert Mistral runde, idiomatische Texte. Wer Wert auf eine saubere Lizenz und gute europäische Sprachabdeckung legt und gleichzeitig sparsam mit Hardware umgehen muss, fährt mit Mistral oft am besten. Die MoE-Varianten (Mixtral) bieten dabei einen guten Kompromiss aus Geschwindigkeit und Qualität.
Qwen: der starke Allesbeherrscher mit breiter Größenpalette
Qwen von Alibaba ist in den letzten Generationen massiv aufgeholt und gehört bei vielen Benchmarks zu den stärksten offenen Modellen. Die Familie bietet die wohl breiteste Größenpalette überhaupt, von sehr kleinen Modellen für Edge-Geräte bis zu großen Versionen, und punktet zusätzlich mit spezialisierten Varianten für Programmierung und mathematisches Denken. Viele Qwen-Modelle stehen unter Apache 2.0.
Sprachlich ist Qwen stark mehrsprachig und beherrscht Deutsch erstaunlich gut, auch wenn der Trainingsschwerpunkt auf Chinesisch und Englisch liegt. Ein Punkt, den manche Anwender beachten: Da es sich um ein Modell eines chinesischen Anbieters handelt, kann es bei politisch sensiblen Themen Zurückhaltung oder Ausweichen geben. Für technische, kreative und alltägliche Aufgaben spielt das keine Rolle. Wer maximale Qualität pro Parameter und eine riesige Auswahl an Größen sucht, sollte Qwen unbedingt testen.
Direkter Vergleich nach Anwendungsfall
- Schwache Hardware, wenig VRAM: kleine Mistral- oder Qwen-Modelle. Beide liefern pro Gigabyte Speicher mehr Qualität als vergleichbar große Llama-Versionen.
- Maximale Tool- und Anleitungs-Kompatibilität: Llama. Praktisch jedes Projekt unterstützt es.
- Kommerzieller Einsatz mit sauberer Lizenz: Mistral oder Qwen unter Apache 2.0.
- Programmieren und Mathematik: die spezialisierten Qwen-Coder-Varianten.
- Deutsche Texte und europäischer Datenschutz-Fokus: Mistral.
- Höchste Allround-Qualität bei mittlerer Hardware: ein mittelgroßes Qwen-Modell.
Wichtig: Diese Empfehlungen sind Momentaufnahmen. Die Modelllandschaft ändert sich im Quartalstakt, und jede neue Generation kann die Reihenfolge umwerfen. Die übergeordneten Eigenschaften der Familien – Llamas Ökosystem, Mistrals Effizienz und Lizenz, Qwens Größenpalette – bleiben aber relativ stabil.
So testest du sie selbst in einer Stunde
- Installiere einen lokalen Runner wie Ollama oder LM Studio.
- Lade von jeder Familie ein Modell ähnlicher Größe, etwa im 7B- bis 8B-Bereich, jeweils quantisiert (z. B. Q4_K_M).
- Gib allen dieselben fünf bis zehn Prompts: ein deutscher Erklärtext, eine Code-Aufgabe, eine Zusammenfassung, eine kreative Aufgabe und eine Wissensfrage.
- Bewerte nach Korrektheit, Sprachqualität im Deutschen und Antwortgeschwindigkeit.
- Miss die Geschwindigkeit mit unserem Tokens-pro-Sekunde-Rechner, um Hardware und Modell fair zu vergleichen.
Nach diesem kleinen Vergleich weißt du in der Regel sofort, welche Familie zu deinem Schreibstil und deiner Hardware passt. Weitere praxisnahe Anleitungen rund um lokale KI findest du in unseren News, und passende Rechner sammeln wir in den Webtools.
Häufige Fragen
Welches Modell ist das beste für Deutsch?
In der Praxis liefern Mistral und die neueren Qwen-Modelle besonders runde deutsche Texte. Llama ist ebenfalls brauchbar, zeigt bei feinen stilistischen Nuancen aber gelegentlich seinen englischen Schwerpunkt. Am sichersten ist ein direkter Vergleich mit deinen eigenen Prompts, weil viel vom konkreten Modell und der Größe abhängt.
Darf ich diese Modelle kommerziell nutzen?
Mistral- und Qwen-Modelle unter Apache 2.0 sind kommerziell weitgehend frei nutzbar. Llama steht unter einer Community-Lizenz mit Sonderregeln vor allem für sehr große Anbieter. Prüfe vor einem kommerziellen Einsatz immer die konkrete Lizenz des einzelnen Modells, da innerhalb einer Familie verschiedene Versionen unterschiedliche Bedingungen haben können.
Muss ich die größte Version nehmen?
Nein. Für die meisten Alltagsaufgaben reichen Modelle im 7B- bis 14B-Bereich vollkommen aus und laufen auf bezahlbarer Hardware. Größere Modelle lohnen sich erst, wenn du komplexe Logik, anspruchsvolle Programmierung oder besonders lange Kontexte brauchst und die nötige Grafikkarte besitzt.
Wie aktuell sind die Modelle?
Lokale Modelle haben einen festen Wissensstand zum Trainingszeitpunkt und kennen keine tagesaktuellen Ereignisse. Wer aktuelle Informationen oder eigene Dokumente einbinden will, kombiniert das Modell mit einer Suche oder einem lokalen RAG-System. Das Modell selbst bleibt offline und auf seinem Trainingsstand.