LLM-Quantisierung erklärt: GGUF, 4-Bit und Modelle, die passen

Wer beginnt, Sprachmodelle lokal auszuführen, stößt schnell auf kryptische Bezeichnungen wie Q4_K_M, GGUF oder 8-Bit-Quantisierung. Dahinter steckt eine der wichtigsten Techniken, die es überhaupt möglich macht, riesige KI-Modelle auf einem normalen Laptop laufen zu lassen: die Quantisierung. Dieser Artikel erklärt verständlich, was dahintersteckt, welche Varianten es gibt und wie du die richtige für deine Hardware wählst.

Das Grundproblem: Modelle sind riesig

Ein Sprachmodell besteht aus Milliarden von Parametern – Zahlenwerten, die das im Training erlernte Wissen kodieren. Ursprünglich werden diese Werte mit hoher Präzision gespeichert, typischerweise als 16-Bit-Fließkommazahlen. Jeder Parameter belegt damit 2 Byte.

Bei einem Modell mit 7 Milliarden Parametern bedeutet das: 7 Milliarden mal 2 Byte ergeben rund 14 Gigabyte allein für die Gewichte. Ein 70-Milliarden-Modell käme so auf etwa 140 GB – weit mehr, als jeder Heimrechner an Speicher bietet. Ohne einen Trick wären lokale Sprachmodelle für die meisten Menschen unerreichbar.

Die Idee der Quantisierung

Quantisierung bedeutet, die Parameter mit weniger Bits zu speichern. Statt jeden Wert mit 16 Bit darzustellen, nutzt man 8, 5 oder sogar nur 4 Bit. Das Prinzip ähnelt der Komprimierung eines Fotos: Man reduziert die Informationstiefe und nimmt einen kleinen Qualitätsverlust in Kauf, gewinnt dafür aber massiv an Platz.

Konkret werden die ursprünglich feinstufigen Zahlenwerte auf ein gröberes Raster abgebildet. Ein Wert, der vorher als 0,4837192 gespeichert war, landet nach der Quantisierung auf dem nächstgelegenen Punkt eines kleineren Wertebereichs. Erstaunlicherweise verträgt ein großes neuronales Netz diese Vergröberung überraschend gut – die schiere Menge an Parametern gleicht kleine Ungenauigkeiten weitgehend aus.

Das Ergebnis: Aus 14 GB werden bei 4-Bit-Quantisierung rund 4 GB. Plötzlich passt ein 7B-Modell bequem in den Arbeitsspeicher eines durchschnittlichen Notebooks.

Die Bit-Tiefen im Überblick

Verschiedene Quantisierungsstufen bieten unterschiedliche Kompromisse zwischen Größe und Qualität:

Die Faustregel lautet: Je niedriger die Bit-Zahl, desto kleiner das Modell und desto höher das Risiko von Qualitätseinbußen. Q4 bis Q5 gilt für die meisten Nutzer als der beste Punkt auf dieser Kurve.

Was bedeuten die Zusätze wie K_M und K_S?

Bezeichnungen wie Q4_K_M oder Q4_K_S verwirren anfangs. Sie verweisen auf modernere, „k-quant"-Verfahren, die nicht alle Teile des Modells gleich stark komprimieren. Besonders empfindliche Schichten behalten mehr Präzision, weniger wichtige werden stärker reduziert. Die Buchstaben stehen grob für die Größe der Variante:

Für den Einstieg ist Q4_K_M eine bewährte Standardempfehlung: gute Qualität bei moderatem Speicherbedarf.

GGUF: das Dateiformat hinter lokalen Modellen

GGUF (GPT-Generated Unified Format) ist das heute verbreitetste Dateiformat für quantisierte Sprachmodelle. Es bündelt die quantisierten Gewichte zusammen mit allen nötigen Metadaten – etwa der Modellarchitektur und dem Tokenizer – in einer einzigen Datei. Das macht die Verteilung und das Laden einfach und portabel.

GGUF wurde im Umfeld der Bibliothek llama.cpp entwickelt, die hocheffizient Modelle auf CPU und GPU ausführt. Werkzeuge wie Ollama bauen darauf auf, sodass du dich um das Format meist gar nicht direkt kümmern musst – du lädst einfach ein Modell, und im Hintergrund liegt eine GGUF-Datei in passender Quantisierung.

Den Speicherbedarf richtig einschätzen

Eine praktische Überschlagsrechnung hilft bei der Modellwahl. Multipliziere die Parameterzahl in Milliarden grob mit dem Faktor der gewählten Bit-Tiefe:

Ein 7B-Modell in Q4 belegt also etwa 4 GB, ein 13B-Modell rund 7–8 GB. Hinzu kommt etwas Speicher für den sogenannten Kontext-Cache, der mit der Länge der Unterhaltung wächst. Plane daher immer einen Puffer ein. Für schnelle Umrechnungen von Gigabyte, Bit und Byte hilft dir ein passender Rechner aus dem Webtools-Bereich.

Welche Quantisierung für welche Hardware?

Die richtige Wahl ergibt sich aus deinem verfügbaren Speicher:

Die Grundregel: Wähle das größte Modell, das mit einer brauchbaren Quantisierung in deinen Speicher passt. Ein größeres Modell in Q4 liefert meist bessere Ergebnisse als ein kleineres Modell in Q8 bei vergleichbarem Speicherbedarf.

Quantisierung vs. Modellgröße: was zählt mehr?

Eine häufige Frage: Lieber ein großes Modell stark quantisiert oder ein kleines Modell in hoher Präzision? In der Praxis gewinnt fast immer das größere Modell – selbst stark komprimiert. Die zusätzliche „Welterfahrung" eines Modells mit mehr Parametern wiegt den Präzisionsverlust durch Quantisierung in den meisten Fällen auf. Erst bei sehr aggressiver Kompression (2–3 Bit) kippt dieser Vorteil.

Fazit

Quantisierung ist die Schlüsseltechnik, die lokale KI für jedermann zugänglich macht. Sie schrumpft riesige Modelle auf einen Bruchteil ihrer Größe, ohne dass die Qualität merklich leidet – vorausgesetzt, du wählst eine sinnvolle Stufe. Für die meisten Nutzer ist eine Q4- oder Q5-Variante im GGUF-Format der ideale Kompromiss. Mit dem Wissen aus diesem Artikel kannst du kryptische Modellbezeichnungen entschlüsseln und gezielt das Modell wählen, das optimal auf deine Hardware passt.

Häufige Fragen

Verliert ein quantisiertes Modell viel an Qualität?

Bei moderaten Stufen wie Q4 bis Q8 ist der Qualitätsverlust gering und im Alltag meist kaum spürbar. Erst bei sehr niedrigen Bit-Tiefen unter 3 Bit werden Einbußen deutlich. Für die meisten Aufgaben ist Q4_K_M ein ausgezeichneter Kompromiss.

Muss ich Modelle selbst quantisieren?

In der Regel nicht. Für nahezu jedes populäre Modell gibt es fertige quantisierte GGUF-Versionen in verschiedenen Stufen zum Download. Werkzeuge wie Ollama wählen automatisch eine sinnvolle Variante, sodass du dich darum nicht kümmern musst.

Was ist der Unterschied zwischen GGUF und anderen Formaten?

GGUF ist auf effiziente lokale Ausführung über CPU und GPU optimiert und besonders im Heimanwender-Bereich verbreitet. Andere Formate richten sich eher an reine GPU-Server oder Trainingsumgebungen. Für lokale Nutzung auf normaler Hardware ist GGUF heute der Standard.

Beeinflusst die Quantisierung auch die Geschwindigkeit?

Ja, meist positiv. Kleinere Modelle passen besser in den schnellen Speicher und benötigen weniger Rechenoperationen, was die Generierung beschleunigen kann – besonders auf Hardware ohne leistungsstarke GPU.

Kann ich verschiedene Quantisierungen desselben Modells testen?

Auf jeden Fall. Es lohnt sich, etwa eine Q4- und eine Q5-Variante zu vergleichen, um den besten Kompromiss aus Geschwindigkeit, Speicherbedarf und Antwortqualität für deine Hardware und deinen Anwendungsfall zu finden.