Technik, Coding & KI

Multimodal ist kein Qualitätssiegel

Ein Modell kann Bilder sehen, ohne welche zu erzeugen. Eine Oberfläche kann multimodal wirken, obwohl mehrere Spezialisten arbeiten. Entscheidend ist nicht das Etikett, sondern Aufgabe, Übergabe und Fehlerkosten.

Eine Bühnenhandwerkerin spannt in einer sonnenhellen Probebühne mit einem Zugwerkzeug einen schweren blauen Stoffkörper; zwei andere Werkzeuge bleiben unbenutzt.KI-generiertes Symbolbild
KI-generiertes Symbolbild; keine dokumentarische Aufnahme. Absichtlich ohne Marken, Logos oder erkennbare Figuren.

Der Flyer für den nächsten Kulturabend ist fast fertig – jedenfalls in der ausdrücklich hypothetischen Teamsitzung. Der Einladungstext ist zu lang, drei vorhandene Fotos müssen geprüft werden, ein neues Titelmotiv fehlt und am Ende soll jemand die Veröffentlichung verantworten. Auf dem Bildschirm wartet nur ein Chatfenster. Praktisch. Aber vier verschiedene Arbeiten werden nicht dadurch dieselbe Arbeit, dass sie denselben Senden-Knopf benutzen.

Genau hier kippt das Wort „multimodal“ vom nützlichen Hinweis zum Nebelwerfer. Ein System kann Bilder annehmen und trotzdem Text ausgeben. Es kann ein spezialisiertes Bildmodell als Werkzeug aufrufen. Oder es kann mehrere Medien in einer gemeinsamen Architektur verarbeiten. Das sind echte Unterschiede. Keiner davon ist allein ein Qualitätssiegel.

Ein Wort trägt drei verschiedene Fragen

Die erste Frage lautet: Was darf hinein? Ein klassisches Sprachmodell bekam Text und produzierte Text. Aktuelle Hauptmodelle sind oft breiter. OpenAI beschreibt seine jüngsten Modelle beispielsweise mit Text- und Bildeingabe, aber Textausgabe; Bildgenerierung und Bildbearbeitung stehen daneben als spezialisierte Modellfamilie. [1] Ein Modell kann ein Foto also verstehen, ohne selbst das fertige Plakatbild zu malen.

Die zweite Frage lautet: Was kommt heraus? Eine Bildbeschreibung ist Text. Eine markierte Fundstelle in einem Foto kann Text oder Koordinate sein. Eine neue PNG-Datei ist ein anderes Artefakt. Wer nur fragt, ob ein Werkzeug „Bilder kann“, wirft Erkennen, Schlussfolgern, Bearbeiten und Erzeugen in einen Sack. Das ist ungefähr so präzise wie die Aussage, ein Mensch könne „Papier“ – lesen, falten, drucken und restaurieren seien schließlich alles Papierdinge.

Die dritte Frage lautet: Arbeitet ein einziges Modell oder ein System aus mehreren Komponenten? Für den Nutzer kann beides wie dieselbe Unterhaltung aussehen. Technisch und organisatorisch ist es nicht dasselbe. Sobald ein Modell ein Bildwerkzeug aufruft, gibt es eine Übergabe: Der Textkontext muss in einen Bildauftrag übersetzt, das Ergebnis zurückgeführt und anschließend geprüft werden. Diese Naht kann sehr produktiv sein. Unsichtbar ist sie trotzdem nicht.

Sehen ist noch kein Erzeugen

Für den Vereinsflyer ist das sofort praktisch. Die vorhandenen Fotos sollen nicht neu erfunden, sondern auf lesbare Schilder, ungünstigen Beschnitt und erkennbare Personen geprüft werden. Dafür braucht das Team Bildverstehen. Anthropic dokumentiert, dass Claude mehrere Bilder gemeinsam analysieren kann. Dieselbe Dokumentation warnt aber vor Fehlern bei kleinen, gedrehten oder schlechten Bildern, vor ungenauen Zählungen und davor, sich bei Präzisionsaufgaben ohne menschliche Kontrolle auf die Ausgabe zu verlassen. [4]

Das neue Titelmotiv ist eine andere Aufgabe. OpenAI bietet dafür eine direkte Image API sowie Bildgenerierung als Werkzeug in mehrstufigen Responses-Abläufen an. In der Unterhaltung kann ein Hauptmodell den Auftrag formulieren und ein spezialisiertes Bildmodell das Bild erzeugen. [2] Für den Menschen bleibt es ein Chat. Für die Qualitätskontrolle sind es mindestens zwei Rollen: Auftrag und Artefakt.

Diese Trennung ist kein Makel. Ein guter Übergang kann stärker sein als ein angeblicher Universalist, solange klar bleibt, was geprüft werden muss. Beim Text kontrolliert das Team Aussage, Ton und Namen. Beim vorhandenen Foto kontrolliert es, ob das Modell wirklich das sichtbare Material gelesen hat. Beim generierten Bild kontrolliert es Motiv, Anatomie, Rechte-Risiken, Textartefakte und Beschnitt. Ein einziger grüner Haken wäre bequem – und für drei Fehlerarten ziemlich nutzlos.

Nativ multimodal löst die Auswahl nicht auf

Google beschreibt Gemini ausdrücklich als von Grund auf multimodal. Das ist eine echte architektonische Aussage: Text und Bild sind nicht bloß zwei getrennte Produkte im selben Menü. Doch selbst dort bleibt die Aufgabe relevant. Googles Dokumentation macht die Medienauflösung zu einer einstellbaren Größe: Mehr Auflösung kann feinen Text und kleine Details besser erfassbar machen, kostet aber zusätzliche Tokens und Latenz. [3]

Auch eine einheitliche Architektur beseitigt also keine Zielkonflikte. Für ein unscharfes Handyfoto einer Raumskizze kann höhere Auflösung sinnvoll sein. Für 200 grobe Vorschaubilder ist sie vielleicht nur teurer. Wer „multimodal“ mit „ohne Entscheidungen“ übersetzt, verschiebt die Entscheidungen lediglich in Voreinstellungen.

Meta Chameleon zeigt noch deutlicher, wie viele Ebenen in dem Wort stecken. Meta beschrieb 2024 eine gemeinsame Architektur, die Text und Bilder als Ein- und Ausgabe kombinieren kann. Die veröffentlichten Forschungsmodelle unterstützten damals jedoch gemischte Eingaben und Textausgabe; das Bildgenerierungsmodell wurde ausdrücklich nicht freigegeben. [5] Architektur, trainierte Fähigkeit und öffentlich nutzbare Funktion sind drei verschiedene Tatsachen. Ein Produktvergleich muss sagen, welche davon er meint.

Die Nahtstelle ist kein peinlicher Defekt

Technikdebatten behandeln Übergaben gern wie eine Schwäche: Wenn ein System mehrere Modelle braucht, sei es weniger elegant. Für reale Arbeit kann gerade die sichtbare Naht wertvoll sein. Sie erlaubt dem Team, nur die drei tatsächlich freigegebenen Fotos an ein Bildverständnismodell zu senden, den Einladungstext separat zu bearbeiten und das neue Symbolbild in einem klar begrenzten Generierungsschritt zu erzeugen.

Damit wird Verantwortung adressierbar. Wer prüft die Namen im Text? Wer bestätigt, dass auf einem vorhandenen Foto keine ungewollte Person erkennbar ist? Wer nimmt das synthetische Motiv ab und kennzeichnet es? Ein Universalmodell kann diese Fragen nicht durch Breite beantworten. Es kann höchstens mehrere Arbeitsschritte in einem Interface verstecken.

Umgekehrt ist eine Kette aus fünf Spezialwerkzeugen nicht automatisch professioneller. Jeder Export, jedes Dateiformat und jede neue Oberfläche kostet Zeit. Kontext kann verloren gehen, Versionen können auseinanderlaufen, und niemand fühlt sich mehr für das Gesamtstück zuständig. Die kleinste überprüfbare Kette ist deshalb meist besser als beide Extreme: ein Modell für alles oder ein Werkzeugmuseum für jede Kleinigkeit.

Der teuerste Fehler wählt mit

Das passende Werkzeug hängt nicht nur vom gewünschten Ergebnis ab, sondern vom Schaden eines falschen Ergebnisses. Ein etwas hölzerner erster Textentwurf kostet vor allem Redaktionszeit. Ein erfundener Termin auf dem fertigen Flyer kann den ganzen Abend beschädigen. Ein missverstandenes Foto kann Persönlichkeitsrechte berühren. Ein generiertes Motiv mit pseudolesbarer Schrift sieht vielleicht nur peinlich aus – bis es als falsche Information gelesen wird.

Darum beginnt ein brauchbarer Test nicht mit zehn allgemeinen Bestenlistenfragen. Er beginnt mit drei oder vier echten Aufgaben aus dem eigenen Ablauf, bekannten Soll-Ergebnissen und einem klaren Abbruchkriterium. NIST verlangt im AI Risk Management Framework, Geschäftskontext, konkrete Aufgabe, eingesetzte Methode und Bedingungen ähnlich der späteren Nutzung zu definieren und zu dokumentieren. [6] Das ist weniger glamourös als ein Gesamtsieger und viel näher an der Arbeit.

Kosten und Geschwindigkeit gehören ebenfalls in diesen Test, aber nicht als einzelne Preisspalte. Bei Bildverstehen hängen Aufwand und Latenz unter anderem an Zahl, Größe und Auflösung der Bilder; Google und Anthropic dokumentieren diese Beziehung ausdrücklich. [3] [4] Ein billiger Durchlauf, der kleine Beschriftungen übersieht, ist für diese Aufgabe nicht billig. Ein hochauflösender Durchlauf für grobe Motivauswahl kann dagegen Verschwendung sein.

Vier Zeilen schlagen den Modellkrieg

Für den hypothetischen Kulturflyer reicht am Ende ein kurzer Arbeitszettel. Eingang: freigegebener Einladungstext, drei vorhandene Fotos und ein Bildbriefing. Ausgang: geprüfter Kurztext, begründete Fotoauswahl und ein originäres gekennzeichnetes Titelmotiv. Teuerster Fehler: falscher Termin, ungewollte Person oder irreführendes Bilddetail. Abnahme: eine benannte Person prüft Inhalt, Rechte und fertiges Layout.

Erst jetzt lohnt sich die Werkzeugfrage. Ein textstarkes Modell darf kürzen und Varianten formulieren. Ein multimodales Modell darf die vorhandenen Fotos gemeinsam lesen, wenn Auflösung und Datenschutz passen. Ein Bildmodell darf das neue Motiv erzeugen. Ein System darf diese Schritte in einer Oberfläche verbinden, wenn die Übergaben sichtbar und die Ergebnisse einzeln prüfbar bleiben.

Vielleicht erledigt ein einziges Produkt alle drei Schritte gut. Vielleicht arbeiten zwei Modelle besser. Vielleicht entscheidet die vertrauliche Fotodatei gegen den bequemsten Cloudweg. Das ist kein unbefriedigendes „Es kommt darauf an“. Es ist die eigentliche Entscheidung: worauf, für wen und mit welchem Fehlerpreis.

Wer immer denselben KI-Sieger findet, hat wahrscheinlich die Frage nicht gewechselt. Multimodal ist nützlich, wenn mehrere Medien wirklich gemeinsam verstanden werden müssen. Spezialisiert ist nützlich, wenn ein bestimmtes Artefakt und seine Fehler klar begrenzt werden sollen. Gut ist die Lösung erst, wenn das Team weiß, was hinein darf, was herauskommen muss und wer am Ende noch hinsieht.

Geöffnete Quellen zu Modellen, Bildfunktionen und Einsatzkontext

  1. OpenAI API – aktuelle Modelle, Ein- und Ausgabemodalitäten (provider-model-documentation-primary)
  2. OpenAI API – Bildgenerierung über Image API und Responses-Werkzeug (provider-image-generation-documentation-primary)
  3. Google AI for Developers – Gemini Image Understanding (provider-multimodal-documentation-primary)
  4. Anthropic Claude Platform – Vision, Auflösung und Grenzen (provider-multimodal-documentation-primary)
  5. Meta FAIR – Chameleon als einheitliche gemischtmodale Architektur (research-lab-model-release-primary)
  6. NIST AI RMF Core – Kontext, konkrete Aufgaben und einsatznahe Evaluation (standards-institution-risk-framework-primary)

Recherche- und Redaktionsstand: 18. September 2026. Redaktionell verantwortlich: Benjamin Metzig.

Geschrieben & verantwortet von

Benjamin Metzig

Gründer und Autor von Tiefnerdig. Liebt konkrete Namen, klare Urteile und Quellen, die tatsächlich halten, was der Text ihnen zuschreibt.

Wer hier schreibt