Kontextfenster bei LLMs erklärt: Wie viel Text passt wirklich rein?

Das Kontextfenster ist eine der wichtigsten und zugleich am häufigsten missverstandenen Eigenschaften eines Sprachmodells. Es bestimmt, wie viel Text ein Modell gleichzeitig "sehen" kann: System-Anweisung, deine Eingabe, hochgeladene Dokumente und die erzeugte Antwort müssen alle zusammen hineinpassen. Wer dieses Budget falsch einschätzt, wundert sich über abgeschnittene Antworten, vergessene Anweisungen oder unerwartete Fehler. Dieser Beitrag erklärt, was hinter dem Begriff steckt und wie du den Platz realistisch planst.

Was das Kontextfenster genau ist

Ein LLM verarbeitet keinen unbegrenzten Text, sondern eine feste Höchstzahl an Token pro Anfrage. Diese Obergrenze nennt man Kontextfenster oder Context Window. Token sind dabei kleine Textbausteine, oft Wortteile. Als grobe Faustregel entspricht ein Token im Englischen rund vier Zeichen, im Deutschen wegen Umlauten und langen Komposita eher drei bis dreieinhalb. Ein Kontextfenster von 200.000 Token fasst also überschlägig mehrere hundert Normseiten Text.

Entscheidend ist: Dieses Budget teilen sich Eingabe und Ausgabe. Wenn du ein langes Dokument einliest und gleichzeitig eine ausführliche Antwort erwartest, konkurrieren beide um denselben Platz. Reservierst du nichts für die Antwort, kann sie mitten im Satz enden.

Vier Posten teilen sich den Platz

Bevor das Modell auch nur ein Wort liest, ist ein Teil des Fensters bereits belegt. Sinnvoll ist, das Budget in vier Posten zu zerlegen:

Wer diese vier Posten überschlägt, vermeidet die häufigste Enttäuschung: ein riesiges Fenster auf dem Papier, das in der Praxis bereits zu drei Vierteln vom Verlauf belegt ist. Mit dem Kontextfenster-Auslastungs-Rechner lässt sich durchspielen, wie viel Reserve bei einer bestimmten Dokumentgröße noch für die Antwort bleibt.

Warum große Fenster trügerisch sind

Modelle mit Kontextfenstern von über einer Million Token klingen, als könnte man ihnen ein ganzes Archiv vorlegen. Technisch stimmt das, praktisch gibt es zwei Haken. Erstens steigen die Kosten linear mit der Eingabelänge: Wer jedes Mal eine Million Token einliest, zahlt jedes Mal dafür. Zweitens nutzt das Modell den Inhalt nicht überall gleich gut. Informationen am Anfang und Ende werden zuverlässiger aufgegriffen als solche in der Mitte. Dieser Effekt, oft "Lost in the Middle" genannt, bedeutet: Ein randvoll gefülltes Fenster liefert nicht automatisch bessere Antworten.

Die bessere Strategie als "alles reinkippen"

Statt das Fenster maximal zu füllen, lohnt sich gezieltes Vorfiltern. Bei großen Wissensbeständen ist ein Retrieval-System meist sinnvoller, das nur die wirklich relevanten Abschnitte heraussucht und ins Fenster legt. Das spart Geld, reduziert Ablenkung durch irrelevanten Text und stellt die wichtigen Passagen an gut sichtbare Stellen. Wer ohnehin mit Wissensdatenbanken arbeitet, kombiniert Retrieval mit einem moderaten Kontextfenster oft erfolgreicher als ein gigantisches Fenster ohne Vorauswahl.

Praktische Tipps für den Aufbau:

  1. Wichtige Anweisungen an den Anfang oder direkt vor die Frage stellen.
  2. Lange Dokumente in benannte Abschnitte gliedern, damit das Modell sich orientieren kann.
  3. Im Chat alte, irrelevante Nachrichten zusammenfassen statt vollständig mitzuschicken.
  4. Für die Antwort immer ausreichend Token reservieren.

Token zählen statt schätzen

Da das Fenster in Token gemessen wird, hilft ein Gefühl dafür, wie viele Token dein Text verbraucht. Deutsche Texte liegen meist höher als die englische Faustregel vermuten lässt. Wer es genauer wissen will, kann seine Texte mit dem Token-Schätzer für Text überschlagen und so abschätzen, ob ein Dokument noch komfortabel ins gewählte Fenster passt. Weitere Grundlagen zu LLMs sammeln wir laufend in den News, passende Rechner liegen in den Webtools.

Kontextfenster im Chat: das Gedächtnisproblem

Besonders deutlich werden die Grenzen des Kontextfensters in langen Chats. Jede neue Nachricht wird in der Regel zusammen mit dem bisherigen Verlauf an das Modell geschickt, damit es den Gesprächsfaden behält. Mit jeder Runde wächst dieser Verlauf, bis er einen großen Teil des Fensters belegt. Erreicht das Gespräch die Grenze, werden die ältesten Nachrichten verworfen, und das Modell "vergisst", was am Anfang besprochen wurde. Wer sich gewundert hat, warum ein KI-Chatbot nach langem Hin und Her plötzlich frühere Festlegungen ignoriert, kennt diesen Effekt.

Abhilfe schaffen mehrere Techniken: ältere Gesprächsteile zu einer kurzen Zusammenfassung verdichten und nur diese mitschicken, das Gespräch bei einem Themenwechsel bewusst neu beginnen oder wichtige Festlegungen in den System-Prompt heben, der immer mitläuft. Für Anwendungen, die viele Runden brauchen, ist ein durchdachtes Verlaufs-Management oft wichtiger als ein besonders großes Fenster.

Kosten steigen mit dem Fenster

Ein Aspekt, der bei der Begeisterung über große Fenster gern untergeht: Jedes Token im Fenster wird bezahlt, bei jeder Anfrage. Wer routinemäßig riesige Kontexte einliest, zahlt routinemäßig dafür. Das gilt besonders im Chat, wo der wachsende Verlauf bei jeder Runde erneut abgerechnet wird. Eine lange Unterhaltung kann deshalb am Ende ein Vielfaches der ersten Nachricht kosten, ohne dass das offensichtlich wäre. Hier hilft es, das Mengengerüst realistisch zu kalkulieren und den teuersten Posten, die immer wieder mitgeschickten Eingabe-Token, gezielt klein zu halten.

Häufige Fragen

Was passiert, wenn ich das Kontextfenster überschreite?

Die API lehnt die Anfrage in der Regel mit einer Fehlermeldung ab oder das Modell kürzt am Anfang ab. In Chat-Oberflächen werden oft die ältesten Nachrichten still verworfen, sodass das Modell frühere Aussagen "vergisst".

Ist ein größeres Kontextfenster immer besser?

Nicht automatisch. Es erlaubt mehr Eingabe, kostet aber mehr und garantiert keine bessere Nutzung der Inhalte in der Mitte. Für viele Aufgaben ist gezieltes Vorfiltern wirksamer als ein maximal großes Fenster.

Zählt die Antwort des Modells zum Kontextfenster?

Ja. Eingabe und erzeugte Ausgabe teilen sich dasselbe Budget. Deshalb sollte man immer Platz für die erwartete Antwortlänge einplanen.

Wie viele Seiten sind 100.000 Token?

Sehr grob entspricht das im Deutschen mehreren hundert Normseiten, je nach Textart. Genaue Werte hängen stark vom Inhalt ab; Code und Tabellen verbrauchen pro Zeichen oft mehr Token als Fließtext.