Technik, Coding & KI

Der teuerste Satz in der KI-Antwort

Nicht jeder Satz braucht dieselbe Prüfung. Finde zuerst die Behauptung, deren Fehler Zeit, Geld, Ruf oder die Entscheidung anderer kosten würde.

Ein originärer transparenter Tiefseeorganismus mit vielen leuchtenden Kammern hängt an einem einzigen goldenen Faden über einem kleinen Mineralanker.KI-generiertes Symbolbild
KI-generiertes Symbolbild; keine dokumentarische Aufnahme. Absichtlich ohne Marken, Logos oder erkennbare Figuren.

Der Anwalt hatte die Fälle nicht gelesen. Keinen einzigen.

Im Juni 2023 hielt ein New Yorker Bundesgericht fest, wie nicht existente Gerichtsentscheidungen mit erfundenen Zitaten in einen Schriftsatz gelangten und nach ersten Warnungen weiter verteidigt wurden. Das Gericht verhängte 5.000 US-Dollar und verlangte Briefe an die Richter, deren Namen den falschen Entscheidungen zugeschrieben worden waren. [1]

Die spektakuläre Pointe lautet gern: ChatGPT halluziniert. Die nützlichere Pointe beginnt eine Minute später. Ein Mensch kopierte den Text, ein anderer unterschrieb ihn, und niemand öffnete die Urteile, auf denen das Argument stand. Genau dieser Übergang passiert heute viel kleiner in Mails, Präsentationen, Kaufvergleichen, Code und Gruppenentscheidungen. Die KI-Antwort klingt fertig. Ihre Folgen sind es nicht.

Man muss deshalb nicht jeden freundlichen Übergangssatz wie einen Tatort behandeln. Man muss den Satz finden, dessen Fehler jemanden Zeit, Geld, Ruf oder eine echte Entscheidung kostet. Er ist der teuerste Satz der Antwort. Erst wenn dieser Satz einen wirklichen, passenden und aktuellen Anker besitzt, darf die schöne Prosa Gewicht tragen.

Der Fehler beginnt nach dem Kopieren

Der Beschluss in Mata v. Avianca ist gerade deshalb wertvoll, weil er den technischen Zauber entzieht. Das Gericht erklärte nicht den bloßen Einsatz eines KI-Werkzeugs für unzulässig. Es erinnerte Anwälte an ihre bestehende Gatekeeper-Rolle. Einer der Beteiligten hatte keinen einzigen zitierten Fall gelesen; ein anderer konnte zentrale Entscheidungen nicht finden, legte diese Warnung aber nicht offen. Die falschen Fälle wurden erst zum beruflichen Schaden, als Menschen sie als eigene Recherche behandelten. [1]

Das Muster ist außerhalb eines Gerichtssaals weniger dramatisch, aber vertraut. Eine KI fasst einen Vertrag zusammen, nennt eine Rückgabefrist, vergleicht zwei Kameras oder behauptet, eine Studie zeige einen starken Effekt. Der Absatz enthält vielleicht fünf korrekte Sätze, zwei harmlose Vereinfachungen und eine falsche Zahl. Wenn genau diese Zahl über Kauf, Frist oder Veröffentlichung entscheidet, hilft die Durchschnittsqualität des Absatzes niemandem.

NIST nennt selbstbewusst präsentierte falsche oder widersprüchliche Inhalte Konfabulation. Entscheidend ist im Generative-AI-Profil nicht nur die Unrichtigkeit. Das Risiko entsteht, wenn Menschen aufgrund des Inhalts handeln oder ihn weiterverbreiten; bei folgenreichen Entscheidungen steigt die Bedeutung. [2] Prüfung beginnt daher nicht mit der Frage, ob der Text insgesamt seriös klingt. Sie beginnt mit der Frage: Was passiert draußen, wenn genau dieser Satz falsch ist?

Finde den Satz mit Gewicht

Nimm als ausdrückliches Gedankenexperiment eine KI-Antwort zur Planung einer kleinen öffentlichen Veranstaltung. Sie nennt einen Termin, eine angebliche Genehmigungsschwelle, drei Kostenpositionen und eine hübsche Idee für die Ankündigung. Der Wortwitz darf mittelmäßig sein. Die Genehmigungsschwelle nicht. Der teuerste Satz ist nicht der längste oder technischste, sondern der, der Geld auslöst, Menschen bindet oder einen Rückweg schließt.

Der NIST AI RMF Core macht aus dieser Alltagseinsicht eine Risikostruktur. Er verlangt, erwartete und tatsächliche Kosten von Fehlern im vorgesehenen Einsatz zu erfassen, den Anwendungsbereich zu bestimmen, menschliche Aufsicht zu definieren und Ergebnisse im konkreten Kontext zu interpretieren. [3] Das bedeutet nicht, dass jeder Einkaufszettel ein Audit braucht. Es bedeutet, dass „KI-Antwort“ keine sinnvolle Risikoklasse ist. Eine Namensidee, ein medizinischer Dosierungshinweis und eine Kündigungsfrist dürfen nicht dieselbe Prüftiefe bekommen.

Markiere deshalb zuerst alles, was eine Außenfolge trägt: Namen realer Menschen, Zitate, Zahlen, Fristen, Preise, Rechts- oder Sicherheitsregeln, Ursachenbehauptungen und Empfehlungen mit Aufwand. Wähle daraus den Satz mit dem größten möglichen Schaden oder der schlechtesten Rückholbarkeit. Diese Priorisierung spart Zeit. Sie verhindert zugleich die beliebte Sorgfaltskulisse, bei der zehn Nebensätze poliert werden und die tragende Behauptung ungeöffnet bleibt.

Eine zweite Frage schärft die Auswahl: Wer würde den Fehler bezahlen? Du selbst, ein Kunde, ein Kollege, ein Freund, eine Person ohne Einfluss auf das System? Das aktuelle britische Data and AI Ethics Framework verlangt bei riskanten oder folgenreichen Anwendungen eine menschliche Instanz, die Ergebnisse und Entscheidungen validieren und eingreifen kann. Wenn Verantwortung unklar ist, soll sie ausdrücklich übernommen werden. [10] Verantwortung ist kein Footer. Sie bestimmt, welcher Satz zuerst auf den Prüfstand kommt.

Ein Quellenname ist noch keine Quelle

Die erste Belastungsprobe ist brutal einfach: Existiert der Beleg? Öffne nicht die Zusammenfassung der KI, sondern das Original. Suche Titel, Autor oder Institution in der offiziellen Datenbank, beim Verlag, im Gerichtsregister oder auf der Seite der herausgebenden Stelle. Wenn ein DOI angegeben ist, löse ihn auf. Wenn ein Urteil genannt wird, prüfe Aktenzeichen, Gericht, Datum und tatsächlichen Text. Wenn eine Produktregel wichtig ist, öffne die aktuelle Hersteller- oder Behördenseite.

Warum diese Banalität nötig bleibt, zeigte die Studie von William H. Walters und Esther Isabelle Wilder. Sie untersuchten 636 bibliografische Angaben aus 84 im Jahr 2023 erzeugten Texten. In diesem historischen Setup waren 55 Prozent der GPT-3.5- und 18 Prozent der GPT-4-Referenzen erfunden; auch reale Referenzen enthielten oft falsche Autoren, Titel, Daten oder andere Metadaten. [4] Diese Zahlen beschreiben nicht heutige Modelle. Sie zeigen etwas Dauerhafteres: Eine bibliografisch perfekte Oberfläche kann eine nicht existente Adresse tragen.

Noch tückischer ist der echte Link. Retrieval-gestützte Systeme können tatsächlich Dokumente finden und dennoch ihre Aussage falsch wiedergeben. Magesh und Mitautoren testeten 2024 mehrere juristische Rechercheprodukte in einer vorregistrierten Untersuchung. Die Systeme reduzierten Fehler gegenüber allgemeinen Chatbots, beseitigten sie im damaligen Test aber nicht. [6] Der Link in der Seitenleiste ist deshalb nur eine Einladung zum Öffnen, kein Absolutionstempel.

Auch ein zweites Modell ersetzt diesen Schritt nicht. Wenn beide Systeme denselben populären Irrtum, dieselbe veraltete Seite oder denselben aus dem Zusammenhang gelösten Absatz verwenden, entsteht ein Chor, kein Beweis. Ein zweites Modell kann sagen: Prüfe die Ausnahme, das Datum oder die Stichprobe. Bestätigt ist die Aussage erst durch Material, das außerhalb dieser Sprachschleife existiert.

Der Beleg muss genau diesen Satz tragen

Nach der Existenz kommt die schwierigere Prüfung: Passt der Beleg? Lies den Absatz vor und nach der Fundstelle. Prüfe, über welche Gruppe, welches Land, welchen Zeitraum und welche Version gesprochen wird. Eine Studie über Studierende belegt nicht automatisch eine Aussage über alle Beschäftigten. Eine Richtlinie für eine Behörde ist keine allgemeine Rechtsregel. Eine Herstellerseite belegt, was der Hersteller dokumentiert oder verspricht, nicht zwangsläufig, was jedes Gerät in jeder Umgebung leistet.

Die juristischen Arbeiten zeigen, warum Qualitätsangaben ohne Kontext schnell zu Theater werden. Dahl und Mitautoren fanden bei ihren Tests deutliche Unterschiede nach Aufgabentyp, Gerichtsebene, Zeitraum und Prominenz eines Falls. [5] FACTOR verfolgt denselben Grundgedanken allgemeiner: Faktentreue sollte gegen einen relevanten Domänenkorpus gemessen werden; Modellrankings können je nach Messgröße auseinanderlaufen. [7] „Modell X ist gut“ beantwortet daher nicht, ob dieser eine Satz über diesen seltenen Fall stimmt.

Hilfreich ist eine kleine sprachliche Probe. Schreibe die tragende Behauptung ohne Schmuck auf. Daneben steht ein Satz: „Dieser Beleg zeigt …“ Wenn du dort nur „passt zum Thema“ oder „nennt etwas Ähnliches“ schreiben kannst, fehlt die Verbindung. Ein belastbarer Satz ist enger: „Die Leitlinie vom 28. Januar 2026 verlangt für diese Softwareklasse offizielle HMRC-Quellen, Versionskontrolle und menschliche Korrekturmöglichkeiten.“ Genau das lässt sich in der aktuellen HMRC-Leitlinie finden. [11]

Diese Enge ist keine akademische Marotte. Sie macht Widerspruch möglich. Eine Kollegin kann sagen: Die Leitlinie gilt nur für Steuersoftware, nicht für unser Reiseportal. Ein Kunde kann sehen: Der Preis stammt aus einer Seite von gestern. Ein Freund kann fragen: Gilt die Frist auch für reduzierte Tickets? Gute Prüfung verwandelt Autorität in eine konkrete, angreifbare Verbindung.

Aktuell ist eine eigene Behauptung

Ein Dokument kann echt und passend sein und trotzdem nicht mehr gelten. Das trifft volatile Themen besonders hart: Produktfunktionen, Preise, Gesetze, medizinische Leitlinien, Sicherheitswarnungen, Fahrpläne und Plattformregeln. Das Datum am Artikelkopf reicht dabei nicht immer. Wissenschaftliche Arbeiten können korrigiert oder zurückgezogen werden; Behörden aktualisieren Unterseiten; Softwaredokumentation gehört zu einer bestimmten Version.

Crossref stellt mit Crossmark eine Infrastruktur bereit, über die Korrekturen, Rücknahmen und andere Statusänderungen sichtbar werden können. Crossref sagt zugleich ausdrücklich, dass die bloße Anwesenheit von Crossmark keine Garantie ist. [8] Das ist eine wunderbar nüchterne Lektion: Ein Statuswerkzeug liefert eine weitere prüfbare Spur. Es ersetzt nicht das Urteil über den Inhalt.

Notiere beim teuersten Satz deshalb nicht nur die URL, sondern auch Stand und Geltungsbereich. Bei dynamischen Angaben gehört das Abrufdatum dazu. Bei Software die Version. Bei Recht die Jurisdiktion und der aktuelle Status. Bei Forschung die konkrete Ausgabe sowie Hinweise auf Korrektur oder Rücknahme. Die HMRC-Leitlinie von 2026 verlangt für generative Steuersoftware nicht zufällig Versionskontrolle und zeitnahe Aktualisierung von Code und relevanten Datenquellen, wenn sich Gesetzgebung, Rechtsprechung oder Behördenhinweise ändern. [11]

Damit wird auch eine verbreitete Formulierung verdächtig: „Laut Quelle gilt …“ Welche Quelle? Welche Fassung? Seit wann, wo und für wen? Aktualität ist keine Eigenschaft, die ein Link für immer besitzt. Sie ist eine neue Behauptung und braucht eine eigene Prüfung.

Zahlen, Code und Bilder wollen andere Beweise

Texte verführen zu einer einheitlichen Prüfmethode. Doch verschiedene Ergebnisse scheitern verschieden. Eine Zahl wird nachgerechnet. Ein Codeausschnitt wird in einer sicheren, passenden Umgebung ausgeführt und mit Gegenfällen getestet. Eine Zusammenfassung wird gegen das Original gelesen. Ein Zitat wird wortgenau und im Kontext geprüft. Eine Bildbehauptung braucht Herkunft, Bearbeitungsgeschichte und eine inhaltliche Einordnung.

C2PA Content Credentials sind dafür ein gutes reales Gegenmittel gegen begriffliche Schlamperei. Der aktuelle Explainer der Spezifikation 2.4 beschreibt kryptografisch gebundene Herkunfts- und Bearbeitungsinformationen. Er sagt aber ebenso klar: Provenienz allein kann nicht entscheiden, ob ein Bild, Video oder Dokument wahr, genau oder sachlich richtig ist. [9] Ein unverändertes Foto kann falsch beschriftet sein. Ein korrekt gekennzeichnetes KI-Bild kann eine erfundene Behauptung illustrieren. Herkunft und Wahrheit sind Nachbarn, keine Zwillinge.

Für Zahlen gilt dasselbe Prinzip. Übernimm nicht nur das Ergebnis, sondern Einheiten, Basiswert, Zeitraum und Rechenweg. Wenn eine KI 18 Prozent Wachstum nennt, frage: absolut oder relativ, gegenüber welchem Ausgangswert, nominal oder inflationsbereinigt? Rechne den tragenden Wert mit Taschenrechner, Tabellenkalkulation oder einem kurzen nachvollziehbaren Skript nach. Die unabhängige Methode muss zum Objekt passen. Ein weiterer elegant formulierter Absatz ist keine Rechenprobe.

Beim Code ist die Frage nicht, ob er plausibel aussieht. Kompiliert oder startet er in der vorgesehenen Version? Was passiert bei leerer Eingabe, Sonderzeichen, fehlender Datei oder doppeltem Aufruf? Sind Tests und erwartete Ergebnisse sichtbar? NIST fasst solche Arbeit als Test, Evaluierung, Verifikation und Validierung zusammen und verlangt dokumentierte, wiederholbare Verfahren, die dem Einsatz ähneln. [3] Ein einzelner grüner Lauf beweist nicht alles. Er beweist wenigstens etwas Reales.

Die Antwort ist fertig, wenn jemand sie übernehmen kann

Die letzte Prüfung findet nicht im Modell statt. Sie findet zwischen Menschen statt. Gib die Entscheidung an eine zweite Person weiter, ohne den ganzen Chat als Nebelmaschine mitzuschicken. Drei Zeilen genügen für viele Alltagssituationen: „Entscheidung: Wir planen mit dieser Frist. Belegstand: Originalquelle, Fassung oder Abrufdatum, offene Ausnahme. Verantwortung: Name der Person, die geprüft hat und bei neuen Informationen stoppt oder ändert.“

Diese Kurzakte zwingt zu einer wohltuenden Ehrlichkeit. Wenn keine Person ihren Namen daneben setzen will, ist die Antwort vielleicht noch ein Entwurf. Wenn der Belegstand nur „ChatGPT sagt“ lautet, fehlt der Anker. Wenn die offene Ausnahme die Hälfte der Fälle betrifft, ist das Urteil zu breit. Und wenn ein Fehler medizinische, rechtliche, finanzielle oder sicherheitsrelevante Folgen hätte, reichen drei Zeilen nicht: Dann braucht es die zuständige Fachperson und deren Verfahren.

Das britische Data and AI Ethics Framework verbindet menschliche Aufsicht ausdrücklich mit der Möglichkeit, Risiken zu erkennen, einzugreifen und Verantwortung zu übernehmen. [10] Das ist keine romantische Rückkehr zur papiernen Welt. Es ist der soziale Sinn von Prüfung. Andere Menschen sollen nicht erraten müssen, welcher Satz Maschine, Quelle, Interpretation oder Entscheidung war.

Am Ende darf die KI-Antwort ruhig schön klingen. Sie darf schnell gewesen sein, überraschende Verbindungen gefunden und lästige Vorarbeit abgekürzt haben. Nur ihr teuerster Satz bekommt keinen Vertrauensvorschuss. Öffne seinen Beleg. Prüfe, ob er wirklich diesen Satz trägt und noch gilt. Rechne, teste oder verifiziere mit der passenden unabhängigen Methode. Dann setze einen menschlichen Namen daneben. Tiefe entsteht genau dort: nicht auf der nassen Enzyklopädieseite, sondern an der Stelle, an der eine bessere Frage eine reale Folge verändert.

Gerichtsakte, NIST-Risikostandards, aktuelle Forschung zu KI-Konfabulationen, wissenschaftliche Status- und Medienprovenienz-Infrastruktur sowie britische Leitlinien für menschliche Verantwortung

  1. U.S. District Court, S.D.N.Y. – Mata v. Avianca, Opinion and Order on Sanctions (legal-decision-primary)
  2. NIST – Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (standard-guidance-primary)
  3. NIST AIRC – AI RMF Core (standard-framework-primary)
  4. Scientific Reports – Fabrication and errors in the bibliographic citations generated by ChatGPT (peer-reviewed-original-research)
  5. Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models (original-research-preprint)
  6. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools (preregistered-original-research-preprint)
  7. ACL Anthology – Generating Benchmarks for Factuality Evaluation of Language Models (peer-reviewed-original-research)
  8. Crossref – Crossmark (scholarly-infrastructure-primary)
  9. C2PA – Content Credentials Explainer 2.4 (open-standard-primary)
  10. GOV.UK – Data and AI Ethics Framework (government-guidance-primary)
  11. HM Revenue & Customs – Guidelines for using generative artificial intelligence if you’re a software developer (current-government-guidance-primary)

Recherche- und Redaktionsstand: 20. August 2026. Redaktionell verantwortlich: Benjamin Metzig.

Geschrieben & verantwortet von

Benjamin Metzig

Gründer und Autor von Tiefnerdig. Liebt konkrete Namen, klare Urteile und Quellen, die tatsächlich halten, was der Text ihnen zuschreibt.

Wer hier schreibt