Technik, Coding & KI

Warum ein KI-Agent denselben Fehler mit voller Überzeugung wiederholt

Ein KI-Agent wird nicht gefährlich, weil er wie HAL 9000 klingt. Gefährlich wird er, wenn eine unbelegte Antwort Werkzeuge, Wiederholungen und echte Konten erreicht. Die Handbremse gehört deshalb an die Aktion.

Eine Frau hechtet bei einer Dachterrassenrunde über eine Bank, um eine Steinkugel nach einer Kette kippender Keramikwesen aufzuhalten.KI-generiertes Symbolbild
KI-generiertes Symbolbild; keine dokumentarische Aufnahme. Absichtlich ohne Marken, Logos oder erkennbare Figuren.

Im November 2022 starb die Großmutter von Jake Moffatt. Moffatt suchte auf der Website von Air Canada nach einem Trauertarif und fragte den dortigen Chatbot. Der Bot erklärte, ein bereits gekauftes oder sogar schon genutztes Ticket könne noch binnen 90 Tagen für den reduzierten Tarif eingereicht werden. Moffatt buchte, reiste und beantragte anschließend die Erstattung. Air Canada sagte: rückwirkend geht das nicht.

Am 14. Februar 2024 entschied das Civil Resolution Tribunal in British Columbia zugunsten Moffatts. Besonders bemerkenswert war nicht nur die falsche Auskunft, sondern die Verteidigung. Air Canada wollte für die Information des eigenen Chatbots nicht haften. Das Tribunal hielt dagegen: Der Bot sei Teil der Website, und die Fluggesellschaft trage Verantwortung für die dort verbreiteten Informationen. Moffatt erhielt insgesamt 812,02 kanadische Dollar zugesprochen. [1]

Das klingt wie der perfekte Halluzinationsfall. Technisch wissen wir das aber nicht. Die Entscheidung stellt nicht fest, ob hinter dem Chatbot ein Sprachmodell, ein Entscheidungsbaum oder ein anderes System steckte. Genau diese Grenze macht den Fall besser, nicht schwächer. Er zeigt, was oft noch vor jeder Modellfrage schiefläuft: Eine Organisation lässt eine maschinelle Aussage beim Kunden wirken, behandelt sie intern aber nicht mit derselben Verantwortung wie ihre übrige Politik.

Ein moderner KI-Agent verschärft diese Lage. Er redet nicht nur. Er kann nachlesen, auswählen, klicken, senden, buchen, stornieren und nach einem Fehler noch einmal versuchen. Die eigentliche Nerdfrage lautet deshalb nicht, ob das Modell heimlich ein Bewusstsein wie HAL 9000 entwickelt. Sie lautet viel nüchterner und viel spannender: Wer hat ihm Hände gegeben, welche Türen gehen damit auf – und woran erkennt das System, dass der erste Griff bereits Wirkung hatte?

Air Canada beweist Verantwortung, nicht die Bot-Technik

Wer Moffatt v. Air Canada als Fall eines halluzinierenden Sprachmodells erzählt, fügt der belegten Geschichte eine technische Behauptung hinzu. Die Originalentscheidung trägt diesen Zusatz nicht. Sie dokumentiert die widersprüchliche Tarifauskunft, Moffatts Vertrauen darauf, die spätere Ablehnung und Air Canadas Verantwortung. Sie enthält aber keine Beweisaufnahme über Trainingsdaten, Modelltyp oder Generierung. [1] Sauber belegt ist eine falsche Chatbot-Antwort, keine nachgewiesene LLM-Halluzination.

Die Pointe bleibt scharf. Auf einer anderen Air-Canada-Seite stand die korrekte Regel. Das Tribunal akzeptierte nicht, dass ein Kunde verschiedene Teile derselben Website gegeneinander prüfen müsse, um herauszufinden, welcher stimmt. Die Qualitätssicherung darf nicht an den Menschen ausgelagert werden, der gerade wegen eines Todesfalls einen Flug organisiert. Ein sichtbarer Link zur richtigen Seite heilte die konkrete falsche Aussage nicht.

Für heutige Agenten folgt daraus mehr als ein juristischer Merksatz. Dieselbe Organisation, die dem System Daten, Oberfläche und Wirkung gibt, muss die Übergänge verantworten. Das Modell ist kein freier Mitarbeiter aus einer Parallelwelt. Wenn seine Antwort eine Buchung auslöst, wird aus „KI kann sich irren“ eine Gestaltungsfrage: Warum konnte diese ungeprüfte Aussage die nächste Stufe überhaupt öffnen?

JARVIS ist die Verheißung, Fantasia die bessere Warnung

Popkultur verkauft uns zwei herrliche Bilder von Automation. In den Iron-Man-Filmen ist JARVIS der souveräne Partner: Er kennt Tony Starks Werkstatt, versteht Andeutungen, bedient Systeme und meldet sich im richtigen Moment. Die Verantwortung bleibt dramaturgisch elegant verteilt. Der Mensch will etwas, die Maschine versteht es, die Welt reagiert. Kaum jemand muss über einen verlorenen HTTP-Response nachdenken.

Disneys Fantasia zeigt im Segment Der Zauberlehrling die interessantere Fehlerform. Ein Auftrag wird vervielfacht, während Kontext und Stoppmöglichkeit fehlen. Die Besen sind nicht böse, sie erfüllen bloß eine enge Aufgabe zu ausdauernd. Moderne Agenten sind natürlich keine verzauberten Haushaltsgeräte. Doch das Muster passt: Ein lokaler Erfolg wird zum nächsten Signal, dieselbe Logik läuft weiter, und plötzlich ist nicht der erste Schritt das Problem, sondern seine skalierte Wiederholung.

Der coole Umgang mit Agenten liegt zwischen diesen Bildern. Man muss weder jeden automatischen Schritt verteufeln noch so tun, als kaufe man mit einem Produktnamen einen JARVIS. Wer einen Abend organisiert, darf die KI die Öffnungszeiten dreier Boulderhallen sammeln, eine Gruppenmail entwerfen und freie Zugverbindungen sortieren lassen. Ob sie den Kurs verbindlich storniert, Konzerttickets kauft oder allen bereits absagt, ist eine andere Klasse von Macht.

Eine Antwort hat noch keine Hände

Ein Chatfenster produziert zunächst Information. Ein Agent steuert dagegen einen Ablauf und kann Werkzeuge benutzen. OpenAI nennt genau diese Trennung: Ein Agent nutzt ein LLM für Entscheidungen im Workflow und greift über Tools auf externe Systeme zu; ein bloßer Einzelturn-Chatbot ist danach noch kein Agent. [5] Die Differenz klingt akademisch, bis das Tool `send_mail`, `delete_file`, `cancel_booking` oder `issue_refund` heißt.

Zwischen Satz und Wirkung liegen mindestens drei eigenständige Fragen. Ist die Behauptung richtig? Ist die daraus abgeleitete Handlung wirklich gewollt? Hat das Zielsystem sie tatsächlich und genau einmal ausgeführt? Ein Modell kann die erste Frage falsch beantworten und die zweite sprachlich brillant begründen. Ein Werkzeug kann trotzdem korrekt funktionieren. Dann ist der technische Aufruf erfolgreich und das Ergebnis dennoch falsch.

Umgekehrt kann die Behauptung stimmen, aber der Agent wählt die falsche Datei, den falschen Empfänger oder den falschen Termin. Das ist keine Halluzination im engeren Sinn. Es ist ein Zuordnungs- oder Werkzeugfehler. Wer beides zusammenwirft, versucht später alles mit einem besseren Prompt zu reparieren. Doch eine falsche Empfänger-ID braucht einen Adressabgleich, und ein doppelter Kauf braucht Wiederholungsschutz – keine poetischere Systemnachricht.

Warum das Modell lieber rät als peinlich schweigt

NIST nennt selbstbewusst präsentierte falsche Inhalte Konfabulation. Dazu zählen auch Aussagen, die dem Input widersprechen oder sich im selben Kontext gegenseitig ausschließen. Das Profil warnt ausdrücklich davor, dass scheinbar logische Begründungen und erfundene Zitate falsches Vertrauen verstärken können. [2] Flüssigkeit ist also kein zusätzliches Messinstrument. Ein Satz kann elegant sein und dennoch keine Verbindung zur Welt besitzen.

Eine 2025 veröffentlichte Arbeit von Kalai und Mitautoren erklärt, warum ein Modell Unsicherheit nicht automatisch als Tugend behandelt. Viele verbreitete Bewertungen geben für die richtige Antwort einen Punkt und für „weiß ich nicht“ keinen. Unter solchen Bedingungen kann Raten den erwarteten Score erhöhen. Die Autoren argumentieren deshalb für Bewertungen, die angemessene Enthaltung belohnen. [3] Das ist keine vollständige Theorie jedes Fehlers, aber eine starke Erklärung für die hartnäckige Attraktivität spezifischer Antworten.

In einem Agenten kommt ein zweiter Anreiz hinzu: Das System soll eine Aufgabe abschließen. Wenn nur `complete` wie Erfolg aussieht, wird `unclear` zum Störfall. Gute Architektur macht Unsicherheit deshalb zu einem regulären Ausgang. „Tarifregel nicht belegt“, „zwei Empfänger möglich“ oder „Buchungsstatus unbekannt“ sind keine Niederlagen. Sie sind präzise Zustände, an denen ein Mensch mit zehn Sekunden Aufmerksamkeit mehr Wert schafft als ein weiteres Modell mit zehn Absätzen Selbstgespräch.

Der Fehler verdoppelt sich nicht im Modell, sondern im Ablauf

Stell dir ausdrücklich als Gedankenexperiment einen Agenten vor, der den gemeinsamen Boulderkurs am Samstag verlegt. Er liest eine Mail falsch und hält Sonntag für bestätigt. Dann trägt er Sonntag in den Kalender ein, sagt einer Freundin per Mail ab und storniert den Samstagstermin. Die ursprüngliche Fehlannahme blieb ein Satz. Erst drei verschiedene Werkzeuge machten daraus einen sozialen Scherbenhaufen.

Nun meldet das Buchungssystem nach der Stornierung einen Timeout. Der Agent sieht keinen Erfolg und versucht es erneut. Vielleicht erzeugt der zweite Aufruf nur dieselbe Stornierung. Vielleicht fällt eine zweite Gebühr an. Vielleicht storniert er aufgrund einer unsauberen Auswahl nun einen anderen Termin. Die Wiederholung ist nicht unbedingt dieselbe Halluzination. Sie ist eine neue Entscheidung auf Basis fehlender Zustandskenntnis.

Anthropic beschreibt Agenten als LLMs, die Tools anhand von Rückmeldungen aus der Umgebung in einer Schleife einsetzen. Gerade deshalb fordert die eigene Engineering-Dokumentation Ground Truth aus Werkzeugergebnissen, Stopbedingungen, menschliche Checkpoints und Sandbox-Tests; längere Autonomie kann Fehler verstärken. [8] Der Loop ist die Superkraft und der Multiplikator. Man sollte ihn nicht abschaffen, sondern ihm ein glaubwürdiges Ende geben.

Ein Quellenlink ist noch kein Alibi

Der Air-Canada-Chatbot verlinkte laut Entscheidung sogar auf die Seite mit der korrekten Trauertarifregel. Seine eigene Aussage widersprach ihr. Genau deshalb genügt „mit Quellen“ nicht als Qualitätsmerkmal. Eine URL kann existieren, seriös aussehen und trotzdem die konkrete Behauptung nicht tragen. Der Beleg muss auf der Ebene des entscheidenden Satzes passen.

FActScore liefert dafür ein nützliches Prinzip. Die Forschungsarbeit zerlegt Langtext in atomare Tatsachenbehauptungen und prüft, welcher Anteil durch eine verlässliche Quelle gestützt wird. Untersucht wurden Personenbiografien, nicht Buchungsagenten; die Übertragung ist deshalb eine Gestaltungsheuristik. [4] Für den Alltag lautet sie: Bevor ein Agent wegen einer Tarifregel handelt, muss genau diese Regel samt Geltungszeit und Ausnahme belegt sein – nicht bloß die Fluggesellschaft.

Das gilt besonders für Zahlen, Namen, Fristen und Zitate. „Die Halle schließt um 22 Uhr“ ist ein prüfbarer Satz. „Die Halle ist sonntags entspannt“ ist eine Einschätzung. „Stornierung bis 24 Stunden vorher kostenlos“ ist eine Handlungsgrundlage. Wer diese drei Arten im selben hübschen Absatz versteckt, lädt die Automation ein, Geschmack und Vertragsbedingung gleich zu behandeln. Der Nerdmove besteht darin, die kleine harte Aussage sichtbar zu machen, bevor sie Macht erhält.

Das wichtigste Promptwort heißt nicht bitte, sondern darf

Viele Agentendemos konzentrieren sich auf Formulierungen: ausführlicher planen, gründlicher prüfen, niemals Fehler machen. Solche Instruktionen helfen, aber sie sind keine Berechtigungskontrolle. OWASP beschreibt Excessive Agency als Schaden durch unerwarteten, mehrdeutigen oder manipulierten Modelloutput. Die Wurzeln liegen typischerweise in zu viel Funktionalität, zu vielen Rechten oder zu viel Autonomie. [9]

Ein Mail-Lesewerkzeug braucht keine Sendefunktion. Ein Rechercheagent braucht keinen Zugriff auf den Papierkorb. Ein Assistent, der Konzertoptionen sammelt, muss nicht mit der Kreditkarte kaufen können. Das klingt weniger spektakulär als ein universeller Superagent, ist aber im Alltag oft leistungsfähiger: schmale Werkzeuge haben klare Ergebnisse, eindeutige Parameter und Fehler, die man versteht.

Die Freigabe gehört außerdem möglichst in das Werkzeug oder das nachgelagerte System, nicht nur in den Chat. Wenn `cancel_booking` eine Bestätigung für exakt Buchungsnummer, Gebühr und Termin verlangt, kann kein kreativer Umweg des Modells diese drei Felder durch gute Laune ersetzen. Der Agent darf den Antrag vorbereiten. Die wirkende Grenze prüft, ob er in diesem Moment, für dieses Ziel und mit diesem Inhalt autorisiert ist.

Der zweite Klick ist gefährlicher als der erste

Ein sauberer Fehler ist angenehm: Der Server sagt Nein, nichts wurde verändert. Gefährlich ist die verlorene Antwort. Die Anfrage ging raus, die Verbindung brach ab, und der Agent weiß nicht, ob das Ziel bereits reagiert hat. Menschen kennen das vom Bezahlbutton. Niemand möchte zweimal drücken, nur weil der Spinner hängen blieb. Automationen besitzen dieselbe Ungeduld, nur mit besserer Ausdauer.

RFC 9110 definiert idempotente Methoden danach, ob mehrere identische Anfragen dieselbe beabsichtigte Wirkung haben wie eine. Bei einer nicht idempotenten Anfrage soll ein Client nach einem Verbindungsfehler nicht automatisch wiederholen, solange er weder tatsächliche Idempotenz noch die Nichtausführung des ersten Versuchs feststellen kann. [10] Das ist HTTP-Semantik, keine Garantie für jede Geschäftslogik. Als Denkregel ist sie Gold wert.

Nach dem Timeout folgt daher zuerst Lesen. Existiert die Buchung, Mail, Zahlung oder Datei mit derselben Auftragskennung bereits? Stimmt ihr Inhalt? Erst wenn der Außenstand sicher fehlt oder die Operation durch einen stabilen Idempotenzschlüssel geschützt ist, darf derselbe Auftrag erneut laufen. „Keine Antwort“ bedeutet unbekannt, nicht fehlgeschlagen. Diese eine sprachliche Korrektur verhindert mehr Doppelaktionen als ein kilometerlanger Prompt über Sorgfalt.

Microsoft und OpenAI bauen den Menschen ausdrücklich wieder ein

Die Herstellertexte selbst erzählen keine Geschichte grenzenloser Autonomie. OpenAIs Agentenleitfaden nennt zwei typische Gründe für menschliche Übergabe: überschrittene Fehlerschwellen und Aktionen, die sensibel, irreversibel oder folgenreich sind – etwa Bestellungen stornieren, große Erstattungen genehmigen oder Zahlungen ausführen. [5] Der Mensch ist darin kein nostalgisches Hindernis, sondern ein vorgesehener Systemzustand.

Microsoft beschreibt Copilot-Studio-Agenten im Juni 2026 als Systeme, die auf Ereignisse reagieren und ohne neuen Nutzerprompt handeln können. Dieselbe Dokumentation fordert klaren Umfang, minimale Rechte, kontrollierte Tests, Audit-Logs und menschliche Aufsicht für kritische Aktionen. [6] Bei AI Approvals grenzt Microsoft noch deutlicher ab: Die Funktion sei für routinemäßige, klar definierte Entscheidungen gedacht, nicht für lebensverändernde Bereiche wie Kredit, Versicherung, Medizin oder Einwanderung. [7]

Das ist keine Erfolgsgarantie und auch kein Beweis, dass jede Implementierung vernünftig konfiguriert ist. Es zeigt aber, wie schief die übliche Produktdebatte liegt. „Human in the loop“ ist nicht das Eingeständnis, dass KI nutzlos sei. Es ist die bewusste Platzierung von Verantwortung. Der kluge Aufbau fragt nicht, ob irgendwo ein Mensch vorkommt, sondern ob er vor der teuren, schwer rückgängig zu machenden Wirkung tatsächlich noch etwas entscheiden kann.

Nicht jeder Klick verdient dieselbe Handbremse

Wer jede kleine Agentenaktion einzeln bestätigt, baut keinen Assistenten, sondern einen besonders nervigen Dialog. Die sinnvollere Grenze folgt drei Eigenschaften: Kosten, Reversibilität und Sichtbarkeit. Einen neuen Entwurf in einem versionierten Arbeitsordner kann man leicht zurücknehmen und sofort sehen. Eine Gruppenmail lässt sich nicht zurückholen. Ein Ticketkauf kostet Geld. Eine gelöschte Cloudakte kann zugleich teuer, schlecht sichtbar und schwer wiederherstellbar sein.

Für den geplanten Samstag darf der Agent deshalb vielleicht selbstständig Zugverbindungen vergleichen, Wetterquellen öffnen und einen Ablaufentwurf aktualisieren. Vor dem Senden an zwölf Leute zeigt er Empfänger und finalen Wortlaut. Vor dem Kauf nennt er Preis, Datum und Sitzplätze. Vor der Stornierung zeigt er Gebühr und Ersatzplan. Das sind keine universellen Produktregeln, sondern bewusst gedachte Beispiele für eine Wirkungsskala.

Entscheidend ist, dass die Grenze vorab feststeht. Wenn der Agent erst nach eigener Einschätzung entscheidet, ob seine Aktion riskant sei, prüft dieselbe unsichere Instanz ihre eigene Macht. Besser ist eine feste Werkzeugklasse: Lesen frei, lokale reversible Entwürfe begrenzt frei, externe Kommunikation bestätigungspflichtig, Geld und irreversible Änderungen besonders geschützt. So bleibt Automation schnell, ohne dass der gemeinsame Abend zum unbemerkten Integrationstest wird.

Ein guter Agent darf sichtbar scheitern

Agenten wirken in Demos besonders beeindruckend, wenn sie jede Hürde selbst überwinden. In Produktion ist ein klarer Stopp oft das intelligentere Verhalten. Anthropic empfiehlt Stopbedingungen und menschliche Checkpoints; OpenAI nennt Fehlerschwellen als Übergabegrund; Microsoft verlangt für kritische Aktionen Aufsicht. [8] [5] [6] Drei konkurrierende Plattformen landen damit bei derselben unspektakulären Wahrheit: Autonomie braucht eine Ausfahrt.

Der Stopp muss konkret sein. „Etwas ist schiefgegangen“ hilft kaum. „Zwei Buchungen passen zur Mail“, „Tarifseite und Supportantwort widersprechen sich“ oder „Zahlungsanfrage gesendet, Außenstatus unbekannt“ gibt einem Menschen eine echte Entscheidung. Der Agent sollte Belege, bisherigen Verlauf und den genau blockierten nächsten Schritt zeigen – nicht hundert Seiten inneren Monolog.

Das verändert auch die soziale Dynamik. Niemand möchte beim Abendessen zum Vollzeit-Sicherheitsprüfer werden. Eine gute Übergabe verlangt selten Aufmerksamkeit, aber an der richtigen Stelle. Der Agent erledigt die Fleißarbeit und meldet sich, wenn Kontext, Verantwortung oder Außenwirkung nicht aus Daten ableitbar sind. Das ist näher an einem guten Crewmitglied als die Pose des unfehlbaren Bordcomputers.

Evals müssen den Werkzeugfilm sehen, nicht nur den letzten Satz

Ein Agent kann am Ende die perfekte Entschuldigung formulieren und vorher zweimal bezahlt haben. Wer nur die Abschlussantwort bewertet, misst deshalb den falschen Ausschnitt. OpenAIs Eval-Dokumentation beginnt sinnvoll mit gewünschtem Verhalten, repräsentativen Testeingaben und anschließender Analyse. [11] Für Agenten gehört zum Verhalten aber auch die Spur: Welche Tools wurden mit welchen Parametern wie oft aufgerufen, und welcher Außenstand entstand?

Ein gutes Testset enthält die unglamourösen Momente. Zwei Termine tragen denselben Namen. Eine Quelle widerspricht der anderen. Ein Formular bestätigt erst nach 40 Sekunden. Die Zahlung ist erfolgt, aber die Antwort fehlt. Eine Mail enthält eine fremde Anweisung. Der sichere Ausgang kann richtige Aktion, Rückfrage oder Stopp sein. Immer „Aufgabe abgeschlossen“ als Erfolg zu werten, trainiert genau die Selbstüberschätzung, die man vermeiden wollte.

Nach einem echten Fehler kommt sein Muster in die Tests. Wenn der Agent zweimal klickte, zählt der Test externe Schreibaufrufe. Wenn er einen Link mit einem Beleg verwechselte, prüft der Test die konkrete Fundstelle. Wenn ein Mensch den falschen Empfänger übersah, muss die Freigabe künftig Adressat und Inhalt gemeinsam zeigen. So lernt das System nicht durch magische Reue, sondern durch eine wachsende Sammlung überprüfbarer Grenzen.

Die Außenwelt hat das letzte Wort

Ein Tool kann „success“ melden und trotzdem ist die falsche Sache sichtbar. Vielleicht aktualisierte es den Entwurf statt der Veröffentlichung. Vielleicht zeigt ein Cache den alten Stand. Vielleicht ging die Mail an eine ähnlich benannte Liste. Anthropic nennt Werkzeugergebnisse Ground Truth für den nächsten Schritt. [8] Bei wichtigen Aktionen reicht jedoch oft nicht die Quittung desselben Werkzeugs. Der Zielzustand muss unabhängig gelesen werden.

Bei einer Veröffentlichung bedeutet das: endgültige URL aufrufen, Inhalt, Bild, Links und sichtbare Version prüfen. Bei einer Buchung: Termin, Name, Anzahl und Preis aus der bestätigten Ressource lesen. Bei einer Datei: Pfad, Hash oder Versionsstand kontrollieren. Bei einer Mail: Versandstatus und Empfängerliste prüfen, ohne aus einer lokalen „gesendet“-Meldung mehr abzuleiten, als sie beweist.

Diese Prüfung ist der Moment, in dem Nerdigkeit wirklich cool wird. Nicht weil jemand stundenlang Logs anstarrt, sondern weil Technik wieder mit dem wirklichen Leben verbunden wird. Der Kalender soll am Ende den richtigen Kurs enthalten, die Freunde sollen dieselbe Information bekommen, und das Konto soll genau einmal belastet sein. Ein Agent arbeitet nicht für seine eigene Erfolgsmeldung. Er arbeitet für diesen Außenstand.

Mehr Autonomie muss man sich verdienen

Der vernünftige Start ist klein. Erst lesen, dann lokale Entwürfe, dann klar begrenzte externe Aktionen. Rechte wachsen nicht, weil eine Demo beeindruckend war, sondern weil reale Tests, Fehlerspuren und Rückholbarkeit stimmen. Microsoft empfiehlt eine gestufte Einführung und kleine Erweiterungen der Verantwortung; Anthropic rät, Komplexität nur hinzuzufügen, wenn sie messbar hilft. [6] [8]

Damit verschwindet auch der falsche Kulturkampf. Man muss nicht zwischen „KI macht alles“ und „KI darf nichts“ wählen. Ein Agent kann den organisatorischen Kleinkram eines aktiven Lebens wunderbar abfedern: Reiseoptionen, Terminabgleich, Quellen, Entwürfe, Versionen. Gerade weil das nützlich ist, lohnt es sich, Buchung, Geld, Öffentlichkeit und irreversible Änderungen sauber zu behandeln.

Der entscheidende Satz lautet deshalb: Kontrolle gehört an die Handlung, nicht bloß an die Antwort. Ein falscher Satz darf an einer Quellenprüfung sterben. Eine mehrdeutige Entscheidung darf nachfragen. Ein Werkzeug darf nur den nötigen Radius besitzen. Ein Timeout darf zunächst unbekannt bleiben. Und der Erfolg darf erst gelten, wenn die Welt außerhalb des Modells ihn bestätigt. Dann ist der Agent weder JARVIS noch Mickys Besenarmee. Er ist ein starkes Werkzeug mit einer vernünftigen Hand am Griff.

Geöffnete Quellen zu Chatbot-Verantwortung, Konfabulation, Agenten, Werkzeugrechten, Wiederholungen und Evals

  1. British Columbia Civil Resolution Tribunal – Moffatt v. Air Canada, 2024 BCCRT 149 (legal-decision-primary)
  2. NIST – AI RMF Generative AI Profile 600-1 (standard-guidance-primary)
  3. OpenAI et al. – Why Language Models Hallucinate (research-primary)
  4. ACL Anthology – FActScore: Fine-grained Atomic Evaluation of Factual Precision (research-primary)
  5. OpenAI – A Practical Guide to Building Agents (platform-engineering-primary)
  6. Microsoft Learn – Design Autonomous Agent Capabilities in Copilot Studio (platform-technical-primary)
  7. Microsoft Learn – FAQ for AI Approvals in Copilot Studio (platform-safety-primary)
  8. Anthropic Engineering – Building Effective Agents (platform-engineering-primary)
  9. OWASP – LLM06:2025 Excessive Agency (security-guidance-primary)
  10. IETF – RFC 9110 HTTP Semantics, Idempotent Methods (internet-standard-primary)
  11. OpenAI Developer Documentation – Working with evals (platform-technical-primary)

Recherche- und Redaktionsstand: 17. August 2026. Redaktionell verantwortlich: Benjamin Metzig.

Geschrieben & verantwortet von

Benjamin Metzig

Gründer und Autor von Tiefnerdig. Liebt konkrete Namen, klare Urteile und Quellen, die tatsächlich halten, was der Text ihnen zuschreibt.

Wer hier schreibt