Technik, Coding & KI

ChatGPT weiß nicht, was als Nächstes kommt – es wettet auf Wörter

Ein erfundenes Kartenspiel macht sichtbar, was im Chatfenster verschwindet: Aus vielen möglichen nächsten Tokens wird eines gewählt, angehängt und sofort zur Voraussetzung der nächsten Runde.

Eine Person steht im Dunkeln zwischen einer eingefrorenen Kurve aus blanken Farbkarten und geordneten Gewichten.KI-generiertes Symbolbild
KI-generiertes Symbolbild; keine dokumentarische Aufnahme. Absichtlich ohne Marken, Logos oder erkennbare Figuren.

Stell dir einen Freitagabend vor. Vier Leute, ein leerer Tisch, farbige Karten und der angefangene Satz: „Gandalf betritt nach einem langen Marsch die Bar und bestellt …“ Jeder legt verdeckt eine Fortsetzung hin. Bier? Tee? Wasser? Einen Platz am Kamin? Das Spiel ist erfunden und seine Kartenstapel sind keine ausgelesenen Werte aus ChatGPT. Aber es zeigt erstaunlich gut, warum eine KI-Antwort zugleich verblüffend passend und komplett daneben sein kann. Ein großes Sprachmodell schreibt nicht erst heimlich den fertigen Absatz und liest ihn anschließend vor. Es berechnet aus dem bisherigen Kontext eine Verteilung für die nächste interne Einheit, wählt eine aus, hängt sie an – und beginnt mit verändertem Kontext von vorn. Der elegante Monolog entsteht aus sehr vielen lokalen Entscheidungen. „Wetten“ ist dafür eine Metapher. Der Einsatz besteht nicht aus Geld, sondern aus Wahrscheinlichkeit.

Auf den Karten stehen nicht unbedingt Wörter

Unsere Runde schreibt ganze Wörter auf Karten, weil Menschen so bequem spielen. Ein echtes Sprachmodell arbeitet dagegen mit Tokens. Google erklärt in seinem aktuellen Einführungskurs, dass ein Token ein Wort, ein Wortteil oder sogar ein einzelnes Zeichen sein kann. [1] Der sichtbare Satz wird also zunächst in Einheiten zerlegt, denen das Modell IDs zuordnet.

Wie diese Zerlegung aussieht, hängt vom Tokenizer ab. SentencePiece ist ein reales Verfahren, das Subword-Einheiten direkt aus Rohsätzen lernen kann. [2] Ein häufiger deutscher Wortbaustein kann eine Einheit sein, ein seltener Fantasyname mehrere. „Gandalf“ muss in einem konkreten Vokabular keineswegs auf einer einzigen Karte stehen. Dasselbe gilt für Emojis, Code, Bindestriche und ungewöhnliche Schreibweisen.

Das ist keine pedantische Nebensache. Tokenisierung bestimmt, wie viel Platz ein Text im Kontext belegt und an welchen internen Kanten das Modell eine Fortsetzung ansetzen kann. Wer im Chatfenster 500 Wörter sieht, kennt deshalb noch nicht automatisch die Zahl der Rechenschritte. Für unser Spiel merken wir uns nur: Die Karten sind kleiner und seltsamer geschnitten, als die gedruckten Wörter vermuten lassen.

Darth Vader verändert den ganzen Kartentisch

Jetzt tauschen wir im angefangenen Satz Gandalf gegen Darth Vader. Sofort wirken andere Fortsetzungen passend. Nicht weil unsere Runde eine Datenbank mit der einzig korrekten Getränkebestellung beider Figuren konsultiert hätte, sondern weil die Namen ein anderes Geflecht gelernter Zusammenhänge aktivieren. Beide Figuren sind reale kulturelle Referenzen; die Barbestellung bleibt ausdrücklich unsere Erfindung und ist kein Kanon.

Beim Modell steckt der Kontext nicht als hübsche Wortwolke im Speicher. Token- und Positionsinformationen werden in Zahlenvektoren übersetzt und durch viele Schichten verändert. Der 2017 veröffentlichte Transformer verband dafür unter anderem Attention, Positionsinformation und Feed-Forward-Blöcke. [3] Attention gewichtet rechnerische Beziehungen zwischen Positionen. Sie ist kein winziger Bibliothekar, der bewusst die richtige Karte heraussucht.

Deshalb kann derselbe Ausdruck in zwei Sätzen sehr verschieden wirken. „Bank“ neben Kredit, Park oder Fluss verschiebt die relevanten Beziehungen. Auch Ton, Rollenbeschreibung, vorherige Beispiele und bereits erzeugter Text gehören zum Kontext. Ein Prompt ist somit weniger ein Zauberspruch als eine Umgestaltung des ganzen Kartentischs.

Das Modell baut keinen Satzplan hinter dem Vorhang

An jeder Runde entsteht für sehr viele mögliche nächste Tokens ein Rohwert. Nach einer mathematischen Umformung lässt sich daraus eine Wahrscheinlichkeitsverteilung bilden. Die beste Karte kann deutlich vorn liegen oder nur knapp vor mehreren plausiblen Rivalen. Googles Forschung zur Mechanik der Next-Token-Prediction zeigt, dass Transformer dabei durchaus strukturierte Informationen über mehrere mögliche Fortsetzungen repräsentieren können. [4]

Das macht den Mechanismus nicht banal. Aus der Aufgabe, immer wieder sinnvoll fortzusetzen, können Grammatik, Stil, Faktenmuster, Codekonventionen und lange Abhängigkeiten entstehen. Ein Modell kann einen Witz vorbereiten, eine Funktion vervollständigen oder ein Argument über mehrere Absätze halten, obwohl die Ausgabe schrittweise wächst. Lokale Vorhersage und beeindruckende globale Form schließen einander nicht aus.

Trotzdem bleibt ein wichtiger Unterschied: Die Verteilung beantwortet zunächst „Was passt hier als Nächstes?“, nicht „Welche Aussage wurde soeben unabhängig überprüft?“ Häufig fallen Passung und Wahrheit zusammen. Manchmal gewinnt aber die Formulierung, die in den gelernten Mustern besonders glatt anschließt.

Temperatur dreht nicht einfach Kreativität auf

In unserem Spiel liegen auf manchen Karten viele neutrale Steine, auf anderen wenige. Wir haben diese Gewichte nur zur Illustration gesetzt; sie sind keine Messdaten. Zieht die Spielleitung immer die schwerste Karte, entsteht ein vorhersehbarer Pfad. Zieht sie proportional zu den Gewichten, kann eine weniger wahrscheinliche Fortsetzung gewinnen. Nach dieser Wahl liegen neue Wörter auf dem Tisch – und die Gewichte der nächsten Runde sehen anders aus.

Beim Decoding beeinflusst die Temperatur, wie spitz oder flach die Auswahlverteilung wird. Niedrige Temperatur bevorzugt starke Kandidaten stärker. Höhere Temperatur gibt schwächeren Kandidaten mehr Raum. Sie macht einen Satz aber weder automatisch origineller noch wahrer. Ein selbstsicherer Irrtum kann bei jeder Einstellung oben liegen.

Top-p, auch Nucleus Sampling genannt, verfolgt eine andere Idee: Es beschränkt die Ziehung dynamisch auf eine ausreichend wahrscheinliche Kopfmenge, statt immer eine feste Zahl Kandidaten zuzulassen. Die zugrunde liegende Arbeit zielte auf mehr Vielfalt, ohne den unzuverlässigen langen Verteilungsschwanz vollständig mitzunehmen. [5] Das ist Decodertechnik, kein Wahrheitsfilter.

Ein einziges schräges Token kann die ganze Nacht umlenken

Nehmen wir an, im Gandalf-Satz gewinnt unerwartet die Karte „Espresso“. Das ist nicht bloß ein lustiges Wort in einem bereits fertigen Absatz. Ab jetzt enthält der Kontext Espresso. Die nächsten Runden können Richtung Siebträgermaschine, Schlaflosigkeit, Italien oder absurder Fantasykomödie kippen. Jede Auswahl verändert die Bedingungen der folgenden Auswahl.

So wächst eine Antwort autoregressiv. Der erste Satz beeinflusst den zweiten, eine erfundene Jahreszahl kann später zur Voraussetzung weiterer Erklärungen werden, und ein gut gesetztes Detail kann über viele Absätze konsistent fortgeführt werden. Genau deshalb wirkt Text oft geplant, obwohl er schrittweise entsteht. Konsistenz beweist dabei nur, dass spätere Tokens an frühere anschließen können; sie beweist nicht, dass der Ausgangspunkt korrekt war.

Der Mechanismus erklärt auch, warum zwei Läufe auf denselben Prompt auseinanderlaufen können und warum ein scheinbar winziger Zusatz die Antwort stark verändert. Reproduzierbarkeit hängt nicht nur am Prompt, sondern auch an Modellversion, Systemvorgaben, Werkzeugzustand und Decoding. Der Kartentisch ist größer als das Eingabefeld.

ChatGPT, Claude und Gemini sitzen nicht nackt am Tisch

Wer ChatGPT von OpenAI, Claude von Anthropic oder Google Gemini öffnet, begegnet keinem rohen Basismodell. Das sind Produkte: mit Dialogregeln, Sicherheitsvorgaben und je nach Funktion zusätzlichen Systemkomponenten. Dieser Beitrag behauptet nicht, die aktuellen proprietären Stacks seien identisch oder vollständig öffentlich. Er benutzt die drei Namen, weil genau diese Oberflächen die nächste-Token-Rechnung im Alltag wie ein Gespräch aussehen lassen.

OpenAI dokumentierte für das GPT-4-Basismodell zunächst Training auf die nächste Wortvorhersage und danach Steuerung mit menschlichem Feedback. [6] Die InstructGPT-Arbeit beschreibt einen konkreten historischen Pfad aus Demonstrationen, einem aus Rangfolgen gelernten Präferenzmodell und Reinforcement Learning. [7] Post-Training kann also Ton, Hilfsbereitschaft, Format und Ablehnungen stark verändern, ohne den Ursprung des Basismodells in ein Nachschlagewerk zu verwandeln.

Anthropic formuliert es in einer aktuellen Forschungsarbeit ähnlich: Sprachmodelle werden zunächst als Next-Token-Prädiktoren vortrainiert und anschließend zum Assistenten – dort Claude – post-trainiert. Zugleich untersucht die Arbeit deutlich komplexere interne Repräsentationen als eine bloße Liste möglicher Wörter. [8] „Es rät nur das nächste Wort“ ist deshalb genauso irreführend wie „es weiß, wovon es spricht“. Starkes Musterrechnen ist weder bloßes Würfeln noch menschliches Wissen.

Flüssigkeit ist eine Leistung, aber kein Beleg

Ein gutes Modell hat unvorstellbar viele Formen überzeugender Sprache gesehen. Quellenangaben, juristische Einschränkungen, medizinische Erklärungen und wissenschaftlicher Ton besitzen erkennbare Muster. Das Modell kann diese Formen produzieren, auch wenn ihm für den konkreten Satz eine tragende Quelle fehlt. Ein erfundener Buchtitel kann deshalb typografisch genauso sauber aussehen wie ein echter.

TruthfulQA wurde mit Fragen konstruiert, bei denen menschliche Texte verbreitete Fehlannahmen enthalten. In der Studie garantierte die bloße Skalierung der getesteten Modelle keine höhere Wahrhaftigkeit. [9] NIST nennt selbstbewusst falsche, widersprüchliche oder vom Input abweichende Inhalte Konfabulation und beschreibt sie als Risiko statistisch plausibler Erzeugung. [10]

Das heißt nicht, dass jede KI-Antwort falsch ist. Es heißt: Sprachliche Sicherheit ist keine Herkunftsangabe. Für eine Partyidee, zehn Namen für eine Metalband oder eine erste Codehypothese darf die Latte anders liegen als für Medikamentendosis, Vertragsfrist oder Sicherheitskonfiguration. Cool ist nicht, der Maschine prinzipiell zu misstrauen. Cool ist, den nötigen Beleg dem möglichen Schaden anzupassen.

Eine Suche legt neue Karten hin – sie macht sie nicht automatisch richtig

Moderne Produkte können Webseiten suchen, Dokumente abrufen, rechnen, Code ausführen oder Kalender bedienen. Dann verändert sich die Lage: Ein äußeres System legt Suchtreffer oder Werkzeugergebnisse als neuen Kontext auf den Tisch. Das Modell formuliert anschließend weiter aus diesem erweiterten Material. Aktualität kommt in diesem Fall aus der Suche; die sprachliche Synthese bleibt eine eigene Stufe.

Dabei können neue Fehler entstehen. Die Suche kann die falsche Seite finden, eine Passage kann aus dem Zusammenhang gerissen sein, das Modell kann sie falsch zusammenfassen oder einen Satz hinzufügen, den die Quelle nicht trägt. Umgekehrt kann ein Rechner ein exaktes Ergebnis liefern, das Modell aber die falschen Zahlen hineinschicken. „Mit Internet“ und „mit Tools“ sind Fähigkeiten, keine pauschalen Gütesiegel.

Die praktische Kontrolle lautet deshalb nicht „Klingt das intelligent?“, sondern „Woher kommt genau diese Behauptung?“ Bei einer aktuellen Zahl braucht man eine aktuelle Primärquelle. Bei einer Rechnung braucht man Eingaben und Rechenweg. Bei einer Aktion braucht man Berechtigung, Vorschau und eine Möglichkeit, Fehler zu stoppen. Das Modell darf die Party moderieren; den Hausschlüssel bekommt es nur mit passenden Regeln.

Wofür der Wortwetter trotzdem verdammt gut ist

Gerade weil Sprachmodelle Muster so breit beherrschen, sind sie starke Transformationsmaschinen. Sie können einen sperrigen Absatz in eine klare Mail verwandeln, Gegenargumente zu einer Idee sammeln, Codevarianten skizzieren, ein Rollenspiel vorbereiten oder aus Notizen eine prüfbare Struktur machen. Wer das Ergebnis als Material behandelt, statt es mit Offenbarung zu verwechseln, bekommt enorm viel Tempo.

Auch im sozialen Leben ist das nützlich. Eine Gruppe kann Claude zehn ungewöhnliche Mottos für den Spieleabend entwerfen lassen, Gemini eine gemeinsam bereitgestellte Packliste ordnen oder ChatGPT drei Tonlagen für eine heikle Nachricht vorschlagen lassen. Die realen Produktnamen machen die Aufgaben konkret; ob eine bestimmte Funktion heute verfügbar ist, hängt jedoch von Version, Region und Zugang ab. Der belastbare Teil ist die Arbeitsweise: Varianten erzeugen, gemeinsam auswählen, Fakten separat prüfen.

Schlecht passt das Modell dort, wo die bloß plausible Fortsetzung schon als Entscheidung durchrutschen würde. Eine Kündigung, Diagnose oder Überweisung braucht keine schönere Wette, sondern überprüfbare Regeln und verantwortliche Menschen. Der Unterschied liegt weniger in „KI gut oder böse“ als in der Frage, was ein falsches nächstes Token anrichten kann.

Der beste KI-Trick passt auf einen Bierdeckel

Beim nächsten spektakulär flüssigen Absatz kannst du innerlich vier Karten auf den Tisch legen: Modellmuster, bereitgestellter Kontext, externe Quelle und ausgeführtes Werkzeug. Welche Karte trägt den konkreten Satz? Hat das System nur plausibel formuliert, wurde eine Passage tatsächlich abgerufen, hat ein Rechner etwas bestimmt oder hat ein Mensch geprüft?

Damit verschwindet ein großer Teil der falschen Mystik. ChatGPT, Claude und Gemini müssen weder allwissende Maschinengeister noch nutzlose Autocomplete-Spielzeuge sein. Sie sind Produkte um leistungsfähige generative Modelle, deren Antworten aus Wahrscheinlichkeiten wachsen und durch zusätzliche Komponenten besser oder folgenreicher werden können.

Zurück zu Gandalf an der Bar: Für eine lustige Fortsetzung dürfen wir ziehen, lachen und weiterspielen. Behauptet jemand anschließend, Tolkien habe genau diese Espressoszene geschrieben, wechselt die Aufgabe. Dann brauchen wir keine weitere Karte, sondern das Buch. Diese Trennung macht KI nicht kleiner. Sie macht ihren Einsatz erwachsen.

Primärquellen zu Tokens, Transformern, Decoding, Post-Training, Wahrheit und generativem Risiko

  1. Google for Developers – Introduction to Large Language Models (technical-primary)
  2. SentencePiece: A Simple and Language Independent Subword Tokenizer (research-primary)
  3. Attention Is All You Need (research-primary)
  4. Google Research – Mechanics of Next Token Prediction (research-primary)
  5. The Curious Case of Neural Text Degeneration (research-primary)
  6. OpenAI – GPT-4 Training Process (publisher-research-primary)
  7. Training Language Models to Follow Instructions with Human Feedback (research-primary)
  8. Anthropic – A Global Workspace in Language Models (publisher-research-primary)
  9. TruthfulQA: Measuring How Models Mimic Human Falsehoods (research-primary)
  10. NIST AI 600-1 – Generative AI Profile (standard-primary)

Recherche- und Redaktionsstand: 17. August 2026. Redaktionell verantwortlich: Benjamin Metzig.

Geschrieben & verantwortet von

Benjamin Metzig

Gründer und Autor von Tiefnerdig. Liebt konkrete Namen, klare Urteile und Quellen, die tatsächlich halten, was der Text ihnen zuschreibt.

Wer hier schreibt