Das Context Window ist die Menge an Information, die ein KI-Modell auf einmal verarbeiten kann. Frage, Anweisungen, bisheriger Verlauf, hochgeladene Dateien, Wissens-Auszüge: alles teilt sich denselben Speicherplatz. Wenn das Window voll ist, kann das Modell nicht mehr alles gleichzeitig im Blick behalten.

In klassischen KI-Chats ist das oft ein Engpass: Mit jedem weiteren Beitrag wächst der Verbrauch, und irgendwann musst du einen neuen Chat starten. Im KI-Workplace ist das deutlich entschärft, weil die Architektur anders aufgebaut ist.

Wie der KI-Workplace damit umgeht

Im KI-Workplace redest du nicht mit einem einzelnen Modell, sondern mit einem **Team aus **Agenten****. Ein Supervisor-Agent koordiniert deine Anfrage und holt sich Spezialisten dazu, zum Beispiel den Deep Researcher für eine Web-Recherche, den Knowledge Assistenten für eine Frage zur Knowledge Base oder den Schreib-Assistenten für einen längeren Text.

Entscheidend ist dabei: Jeder Agent hat sein eigenes Context Window. Die Spezialisten arbeiten an ihrer Teilaufgabe und geben dem Supervisor am Ende nur das Ergebnis zurück, nicht den ganzen Verarbeitungsverlauf. Dadurch bleibt das Context Window des Supervisors viel länger frei. Komplexe Aufgaben, die in einem klassischen Chat schnell die Grenze sprengen würden, lassen sich hier verteilt erledigen.

Praktisch heißt das: Du musst dir um ein volles Context Window nur noch sehr selten Gedanken machen. Du kannst längere Gespräche führen, größere Dokumente hochladen und ausführliche Recherchen anstoßen, ohne ständig den Verbrauch im Blick zu haben.

Token-Limits pro Modell

Trotz Multi-Agenten-Verteilung hat jedes einzelne Modell ein technisches Limit, ausgedrückt in Tokens. Ein Token entspricht ungefähr einer halben Silbe oder einem kurzen Wort.

Im Chat-Header siehst du immer das aktuell verwendete Modell, zum Beispiel „Mistral 3 24B“. 128k Tokens entsprechen ungefähr 200 DIN-A4-Seiten Text.

Live-Verbrauch unter dem Eingabefeld: Eine schmale Statusleiste unter dem Eingabefeld zeigt, wie viele Tokens der aktuelle Chat bereits beim aktiven Modell verbraucht, im Format „12,3k / 128k Tokens” (Verbrauch / Gesamt). Sie färbt sich ab 75 % gelb und ab 90 % rot. Ist das Context-Window voll, wird das Senden blockiert und es öffnet sich automatisch der Dialog „Chat verkürzen” mit drei Optionen: einen neuen Chat starten, ältere Nachrichten ausblenden oder den bisherigen Verlauf zusammenfassen lassen.

Welche Modelle es gibt und wie sich die Limits unterscheiden, steht im Modell-Guide.

Wann du trotzdem aufpassen solltest

Auch wenn die Multi-Agenten-Logik vieles abfängt, gibt es Situationen, in denen ein bisschen Achtsamkeit hilft:

  • Sehr große Datei-Uploads: Wenn du ein Dokument mit hunderten Seiten in den Chat lädst und gleichzeitig danach fragst, ist das viel Kontext für ein einziges Modell. Es hilft, gezielt nach Abschnitten zu fragen, statt nach „dem ganzen Inhalt“.
  • Lange Recherche-Threads: Bei sehr ausführlichen Multi-Step-Recherchen lohnt es sich, Zwischenergebnisse in eine Collection oder eine Datei zu sichern, statt alles in einem einzigen Chat-Verlauf zu halten.
  • Mehrere Dokumente gleichzeitig: Wenn du fünf PDFs auf einmal vergleichen lassen willst, ist das eine andere Größenordnung als ein einzelnes PDF. Bei großen Mengen lieber Stück für Stück arbeiten oder die Inhalte in eine Collection legen und über die Knowledge Base ansprechen.
  • Große Tool-Ergebnisse: Wenn ein Agent ein umfangreiches Werkzeug-Ergebnis erzeugt (zum Beispiel eine lange Web-Recherche oder einen großen Datenauszug), wird dieses Ergebnis fester Teil des Verlaufs und bei jeder weiteren Nachricht erneut mitgesendet. Bei einem sehr großen Ergebnis pausiert der Agent und zeigt im Thinking-Block eine Entscheidungs-Karte mit drei Optionen: das Ergebnis vollständig behalten, einmalig zusammenfassen lassen oder für dieses Werkzeug immer zusammenfassen. So bleibt der Chat schnell und das Kontextfenster geschont.

Tipps

  • Vertrau dem Auto-Routing. Der Workplace verteilt deine Anfrage selbst auf passende Spezialisten und schont damit den Kontext.
  • Knowledge Base statt langer Dateianhänge. Wenn du immer wieder mit denselben Dokumenten arbeitest, leg sie in einer Collection ab. Die KI greift dann nur auf die relevanten Stellen zu, statt alles in jeden Chat zu schleppen.
  • Längere Chats sind okay. Du musst keinen neuen Chat anfangen, nur weil der Verlauf länger wird. Erst bei sehr großen Mengen oder ungewöhnlich langer Arbeit an einer einzelnen Aufgabe lohnt sich ein Reset.
  • Bei Bedarf neu starten. Mit /new öffnest du eine frische Konversation, mit /clear leerst du den aktuellen Chat. So hast du jederzeit die volle Kontrolle.