Stell dir einen Samstag vor, den es so nicht gegeben hat. Zwei Menschen wollen mit dem Rad zu einem Badesee. Die Wetteranzeige nennt für den Nachmittag 30 Prozent Regen. Der Himmel ist hell, die gelbe Jacke bleibt an der Garderobe, und ein gefaltetes Papiermodell der geplanten Strecke verschwindet unter dem Arm. Siebzehn Kilometer später kippt die Luft. Innerhalb weniger Minuten ist die Straße dunkel, Wasser springt von den Reifen, das Papier fällt in sich zusammen. Beide lachen und rennen unter das Vordach eines geschlossenen Kiosks. Hat das Modell versagt? Nur wenn es etwas versprochen hatte, das es wahrscheinlich nie versprach. Dreißig Prozent bedeutet nicht „es regnet zu dreißig Prozent der Zeit“, nicht „dreißig Prozent der Stadt werden nass“ und erst recht nicht „heute bleibt es trocken“. Es ist eine Wahrscheinlichkeitsaussage über ein definiertes Ereignis an einem Ort und in einem Zeitfenster. Der Wolkenbruch ist mit ihr vereinbar. Trotzdem kann die Anzeige für den Ausflug schlecht aufbereitet, räumlich zu grob oder für genau diese Entscheidung unzureichend gewesen sein. Das ist die interessante Stelle. Ein Modell ist keine Miniaturwelt, die kleiner und blasser dasselbe tut wie die Realität. Es ist ein Werkzeug, das manches absichtlich wegwirft. Ob es gut ist, entscheidet sich nicht daran, ob es perfekt trifft, sondern ob Auswahl, Unsicherheit und Nutzungsgrenze zu der Frage passen, die ein Mensch wirklich beantworten muss.
Der Regen beweist zunächst nur, dass es geregnet hat
Ein einzelnes Ereignis kann eine Wahrscheinlichkeitsprognose selten beurteilen. Wenn für hundert vergleichbare Situationen jeweils 30 Prozent Niederschlagswahrscheinlichkeit angegeben werden, wäre langfristig grob in dreißig dieser Fälle das definierte Regenereignis zu erwarten – vorausgesetzt, die Prognosen sind kalibriert und die Fälle sinnvoll vergleichbar. An welchem konkreten Samstag es regnet, bleibt offen. Ein nasser Ausflug ist daher kein Gegenbeweis, ein trockener kein Ritterschlag.
Die Formulierung „vergleichbar“ trägt viel Gewicht. War das Ereignis mindestens ein Millimeter in sechs Stunden, irgendein messbarer Tropfen oder Starkregen? Galt die Zahl für den See, die Startadresse oder eine größere Rasterzelle? Wurde sie morgens oder zehn Minuten vor Abfahrt erstellt? Ohne diese Definition gibt es keine faire Trefferprüfung.
Der aktuelle ECMWF Forecast User Guide behandelt Niederschlagswahrscheinlichkeit als Überschreiten einer festgelegten Menge in einem definierten Intervall. Schwellen können nutzerbezogen gewählt werden; für manche Entscheidungen zählt jeder Regen, für andere erst eine gefährliche Kombination aus Wind und Niederschlag. [4] Die Zahl ist also keine Wetterstimmung, sondern eine konditionale Aussage mit unsichtbarem Kleingedrucktem.
Für die beiden Radfahrer ist der Wolkenbruch trotzdem reale Information. Er kann zeigen, dass ihr Entscheidungsprozess schlecht war. Vielleicht kostete die Jacke fast nichts, während Nasswerden den ganzen Tag ruinierte. Dann hätte schon eine kleine Wahrscheinlichkeit genügt, um sie einzupacken. Das wäre kein besseres Atmosphärenmodell, sondern eine bessere Entscheidungsschwelle.
Ein Modell ist die Kunst, das Richtige wegzulassen
Ein Modell bildet nie alles ab. Selbst ein detailreiches Wettermodell kennt nicht jede warme Hauswand, jedes Blatt und jede Luftbewegung über dem Asphalt. Es teilt Atmosphäre und Oberfläche in Rechenzellen, beschreibt Prozesse mit Gleichungen und ersetzt nicht aufgelöste Vorgänge durch Parametrisierungen. Diese Auslassungen machen es überhaupt erst berechenbar.
Die Stanford Encyclopedia of Philosophy beschreibt Modelle als Repräsentationen ausgewählter Aspekte eines Zielsystems. Idealisation kann Eigenschaften bewusst weglassen oder verzerren, damit ein schwieriges System untersuchbar wird. [1] Isaac Newton behandelte Himmelskörper in manchen Rechnungen als Punktmassen. Niemand hielt die Erde deshalb für punktförmig. Die Vereinfachung isolierte Beziehungen, die für die Bahnfrage entscheidend waren.
Der Qualitätsmaßstab lautet folglich nicht Vollständigkeit, sondern Relevanz. Ein U-Bahn-Plan verzieht Entfernungen und Winkel, damit Umstiege lesbar werden. Für die Frage „Wo steige ich um?“ ist das stark. Für „Wie weit jogge ich?“ ist derselbe Plan schwach. Mehr Wirklichkeit auf dem Papier wäre nicht automatisch mehr Nutzen.
Das nasse Papiermodell aus der Eingangsszene ist deshalb eine passende Karikatur. Es scheitert als wasserfeste Karte, kann aber die Route trotzdem richtig gezeigt haben. Ein Werkzeug darf für eine Aufgabe gut und für eine zweite offensichtlich ungeeignet sein.
Ein Wettermodell startet nicht bei null, sondern bei einem rekonstruierten Jetzt
Bevor ein Computer die Zukunft rechnet, braucht er den gegenwärtigen Zustand der Atmosphäre. Der liegt nicht als vollständige Datei bereit. Satelliten, Wetterballons, Bodenstationen, Flugzeuge, Schiffe und weitere Messsysteme liefern ungleich verteilte Daten mit Messfehlern und Lücken. Datenassimilation verbindet diese Beobachtungen mit einem vorherigen Modellzustand zu einer konsistenten Analyse.
Dieses „Jetzt“ ist bereits eine modellgestützte Rekonstruktion. Kleine Unterschiede in Feuchte, Temperatur oder Wind können später verschiedene Entwicklungen anstoßen, weil die Atmosphäre chaotisch ist. Zusätzlich vereinfachen die Rechengleichungen Prozesse und lösen nur endliche Skalen auf. ECMWF nennt genau diese beiden verbundenen Unsicherheitsquellen: unvollkommene Anfangsbedingungen und notwendige Approximationen des realen atmosphärischen Systems. [3]
Das Wort Fehler ist hier tückisch. Es kann einen Programmierfehler meinen, einen Messfehler, eine numerische Näherung, eine falsche Prozessbeschreibung oder schlicht eine Abweichung zwischen Prognose und späterer Beobachtung. Diese Dinge verlangen unterschiedliche Reparaturen. Mehr Sensoren beheben keinen falschen Code. Feinere Gitter beheben keine unbekannte Anfangsfeuchte. Ein perfekter Algorithmus macht eine unpassende Modellstruktur nicht passend.
Wenn die Regenfront am See früher ankommt als im wahrscheinlichsten Lauf, ist daher noch nicht klar, welche Kante der Kette schwach war. Die Abweichung wird erst nützlich, wenn sie über viele Fälle einem Fehlerort zugeordnet werden kann.
ECMWF rechnet 51 mögliche Wetter – nicht 51 Wahrheiten
Eine einzelne scharf gezeichnete Wetterkarte verführt zur Vorstellung, der Computer kenne die Zukunft auf die Stunde. Moderne mittelfristige Vorhersage arbeitet deshalb mit Ensembles. ECMWF beschreibt sein aktuelles physikbasiertes System als 51 Läufe mit rund neun Kilometern horizontaler Auflösung: ein Kontrolllauf und fünfzig weitere Rechnungen mit leicht veränderten Anfangsbedingungen und Modellphysik. Die Reichweite reicht bis zu 15 Tage. [2]
Die 51 Läufe sind keine Abstimmung unabhängiger Experten. Sie teilen große Teile von Modell, Daten und Rechenarchitektur. Ihre Variation soll bekannte Unsicherheiten abtasten. Wenn viele Mitglieder ein Regenband nahe der Route zeigen, wächst die Unterstützung für dieses Ereignis. Wenn Ort und Zeit stark auseinanderlaufen, wird genau diese Streuung zur wichtigen Information.
Ein Ensemble-Mittel kann dabei ein Wetter erzeugen, das kein Mitglied tatsächlich berechnet hat. Zwei kräftige Tiefs an leicht verschiedenen Orten werden im Durchschnitt zu einem breiten schwachen Tief. Der ECMWF-Leitfaden warnt deshalb davor, Mittelwerte bei Niederschlag oder gefährlichen Entwicklungen isoliert zu lesen. [4]
Für den Ausflug wäre eine einzige bunte Wolke auf 16 Uhr weniger ehrlich als die Information: Ein Teil des Ensembles lässt die Front südlich vorbeiziehen, ein anderer trifft die Route, und die zeitliche Streuung ist groß. Das sieht weniger entschieden aus, enthält aber mehr Wissen über die Entscheidung.
30 Prozent werden erst zusammen mit einem Preis handlungsfähig
Die gleiche Regenwahrscheinlichkeit kann drei vernünftige Entscheidungen erzeugen. Eine leichte Jacke einzupacken kostet wenig, also kann schon eine kleine Wahrscheinlichkeit reichen. Ein Fußballturnier abzusagen kostet viel, also braucht es eine höhere Schwelle oder zusätzliche Gefahreninformation. Eine Bergtour mit Gewitterrisiko verlangt wiederum eine andere Größe als bloße Niederschlagswahrscheinlichkeit und konservativere Sicherheitsregeln.
Das Modell liefert eine Aussage über Wetter. Die Handlung entsteht erst aus Nutzen, Schaden, Alternativen und Risikotoleranz. Wer diese Ebenen vermischt, wirft dem Modell später eine Entscheidung vor, die Menschen getroffen haben. Umgekehrt darf ein Anbieter die Verantwortung nicht mit einer nackten Prozentzahl abgeben, wenn Definition, Zeitfenster oder relevante Gefahren verborgen bleiben.
Der ECMWF-Leitfaden beschreibt Wahrscheinlichkeiten ausdrücklich relativ zu Ereignisschwellen, an denen Nutzer Maßnahmen ergreifen können. [4] Das ist die Verbindung von Modell und Leben: Nicht „Wie sicher ist die Zukunft?“, sondern „Welche Unsicherheit ist für diese Handlung wichtig?“
Im hypothetischen Fall hätten die beiden die Jacke vermutlich eingepackt, wenn sie 30 Prozent als Kostenvergleich statt als fast sicheres Trockenversprechen gelesen hätten. Das macht den Regen nicht vorherbestimmt. Es macht die Entscheidung robuster gegen mehrere mögliche Wetter.
Ein Modell kann richtig gerechnet und trotzdem falsch eingesetzt sein
Mindestens vier verschiedene Niederlagen werden im Alltag „Das Modell lag falsch“ genannt. Erstens kann die Implementierung fehlerhaft sein: falsche Einheit, defekter Algorithmus, vertauschte Variable. Zweitens kann die Struktur einen entscheidenden Prozess unzureichend beschreiben. Drittens kann der Parameterbereich außerhalb der Prüfung liegen. Viertens kann ein gutes Ergebnis für die falsche Frage verwendet werden.
NASA-STD-7009B trennt deshalb nicht nur Modellbau und Codeprüfung, sondern bindet Glaubwürdigkeit an Anforderungen, Akzeptanzkriterien, Verifikation, Validierung und konkreten Einsatz. [5] Verifikation fragt grob, ob die Gleichungen und Algorithmen wie beabsichtigt umgesetzt wurden. Validierung fragt, ob das Modell sein Zielsystem für den vorgesehenen Zweck hinreichend beschreibt. Beides ergibt keine universelle Wahrheitsplakette.
Eine regionale Regenprognose kann statistisch gut kalibriert und für eine einzelne schmale Talroute räumlich zu grob sein. Eine Vorhersage der Regenmenge kann für Rasenpflege reichen und Gewittergefahr verfehlen. Eine zehn Tage alte Prognose kann korrekt erzeugt worden sein und als Grundlage für eine kurzfristige Sicherheitsentscheidung dennoch unangemessen sein.
Die faire Kritik benennt daher Ziel, Zeit, Ort und Toleranz: „Das System unterschätzte in vergleichbaren Lagen Starkregen an dieser Topografie“ ist prüfbar. „Modelle sind halt falsch“ klingt lässig, hilft aber weder dem nächsten Ausflug noch der Wissenschaft.
Newtons Pizza ist falsch genug, um nützlich zu sein
Ein überschaubares Modell zeigt die Logik besser als die ganze Atmosphäre. Newtons Abkühlungsgesetz setzt die Änderungsrate einer Temperatur proportional zur Differenz zwischen Objekt und Umgebung. OpenStax formuliert daraus eine Differentialgleichung und löst sie für eine abkühlende Pizza. [10] Das Modell behandelt die Pizza sinngemäß wie ein Objekt mit einer einzigen Temperatur und konstanter Umgebung.
Eine echte Pizza hat Kruste, Belag, Feuchtigkeit, Luftströmung und unterschiedliche Temperaturen zwischen Oberfläche und Innerem. Das Modell weiß davon nichts. Trotzdem kann es in einem begrenzten Bereich eine brauchbare Frage beantworten: Wie nähert sich eine gemessene Temperatur ungefähr der Raumtemperatur an? Seine Einfachheit zeigt, welche Größe den Verlauf treibt, und erlaubt eine überprüfbare Kurve.
Soll das Modell Verbrennungsgefahr an einer heißen Käseblase beurteilen, ist die mittlere Temperatur die falsche Zielgröße. Soll es den ungefähren Warteverlauf eines gleichförmigen Körpers erklären, kann es genügen. Derselbe mathematische Ausdruck kann außerdem andere Prozesse beschreiben, wenn Variablen anders interpretiert werden. Die Gleichung allein kennt weder Pizza noch Physik; Zuordnung, Annahmen und Messung geben ihr Bedeutung.
Das Beispiel schützt vor einem verbreiteten Irrtum: Mehr Detail ist nicht automatisch besser. Ein kompliziertes Modell mit zehn schlecht bekannten Parametern kann außerhalb der Trainingsdaten fragiler sein als ein einfaches mit einem gut geprüften Gültigkeitsbereich. Komplexität muss sich durch bessere Entscheidungen oder neue bestätigte Vorhersagen verdienen.
Monte Carlo würfelt mit unserem Wissen, nicht mit der Wahrheit
Wenn Eingaben unsicher sind, kann man viele plausible Werte ziehen, das Modell wiederholt rechnen und die Verteilung der Ergebnisse betrachten. Diese Familie von Monte-Carlo-Verfahren ist überall dort attraktiv, wo nichtlineare Beziehungen eine einfache Fehlerfortpflanzung erschweren. Bei einer Ausflugsplanung könnten Startzeit, Frontgeschwindigkeit und Routenlänge variiert werden; bei einer Messung Sensorwerte und Kalibrierparameter.
Die BIPM/JCGM-GUM-Familie führt Monte-Carlo-Methoden als Weg der Unsicherheitsfortpflanzung. [7] NIST TN 1297 fordert, statistisch ausgewertete und anderweitig bewertete Unsicherheitskomponenten nachvollziehbar zu kombinieren und die Berichterstattung offenzulegen. [6] Der Computer macht dabei aus Annahmen eine Ergebnisverteilung. Er entdeckt nicht automatisch, welche wichtige Unsicherheit im Modell fehlt.
Sind alle gezogenen Fronten zu langsam, wird auch eine Million Läufe selbstbewusst zu spät regnen lassen. Sind Eingaben fälschlich unabhängig, kann die Streuung zu klein sein. Monte Carlo ersetzt daher keine Modellkritik. Es transportiert das spezifizierte Nichtwissen durch eine Rechenstruktur.
Das ist trotzdem wertvoll. Statt einer scheinpräzisen Ankunft um 16:12 Uhr entsteht vielleicht ein Intervall, in dem die Route mit unterschiedlicher Häufigkeit nass wird. Für die Jackenfrage ist diese Verteilung näher an der wirklichen Unsicherheit – solange niemand sie mit dem gesamten Raum des Möglichen verwechselt.
Eine Wetterprognose und ein IPCC-Szenario versprechen nicht dasselbe
„Das Wetter für Samstag“ und „eine Emissionsentwicklung bis 2100“ werden beide aus Modellen erzeugt, stehen aber in völlig anderen Beziehungen zur Zukunft. Eine kurzfristige Wetterprognose startet bei einem rekonstruierten Atmosphärenzustand und versucht, die wahrscheinlichere Entwicklung zu quantifizieren. Ein Szenario bündelt Annahmen darüber, wie Bevölkerung, Technik, Wirtschaft, Politik oder Energie sich entwickeln könnten.
Das IPCC definiert Szenarien als plausible, intern konsistente Beschreibungen möglicher Zukunft auf Basis zusammenhängender Annahmen und betont, dass sie weder Vorhersagen noch Prognosen sind. [8] Im AR6-WGIII-Bericht werden große Szenarioensembles und ausgewählte illustrative Pfade genutzt, um unterschiedliche Transformationsstrategien und ihre Folgen zu untersuchen. [9]
Ein Pfad mit starkem Ausbau erneuerbarer Energien ist nicht das Ensemblemitglied, das „gewinnen“ wird. Er beantwortet eine Wenn-dann-Frage. Das Klimamodell berechnet unter diesem Annahmenbündel mögliche physikalische Reaktionen; gesellschaftliche Entscheidungen verändern den Input selbst. Eine Wetterfront lässt sich nicht durch politischen Beschluss verlangsamen, Emissionen durchaus.
Wer ein Szenario nach einem einzelnen Jahr für „falsch“ erklärt, liest es wie eine Wochenendprognose. Wer eine Wetterwahrscheinlichkeit wie ein frei wählbares Zukunftsbild behandelt, macht den umgekehrten Fehler. Beide nutzen Modelle. Ihre Verpflichtungen sind verschieden.
Die scharfe Karte ist nicht automatisch die ehrlichere Karte
Hohe räumliche Auflösung zeigt kleinere Strukturen und produziert Bilder, die überzeugend real wirken. Aber ein neun Kilometer breites Gitterfeld ist kein quadratischer Behälter mit einheitlichem Wetter. Berge, Städte und Wolkenprozesse wirken auf feineren Skalen. Ihre Effekte müssen teils parametrisiert oder in nachgeschalteten Produkten lokalisiert werden.
ECMWF weist für sein aktuelles mittelfristiges Ensemble rund neun Kilometer horizontale Auflösung aus. [2] Das ist eine technische Größe, kein Radius garantierter Ortsgenauigkeit. Eine fein gezeichnete Regenkante kann zwischen Ensemblemitgliedern springen. Visuelle Präzision darf diese Streuung nicht verdecken.
Für die Radroute sind drei Karten denkbar. Eine zeigt die wahrscheinlichste Front scharf und verführt zu einem exakten Zeitpunkt. Eine zweite zeigt einen verwaschenen Mittelwert und lässt Starkregen harmlos aussehen. Eine dritte zeigt Wahrscheinlichkeiten für relevante Schwellen entlang der Route und die zeitliche Streuung. Die dritte ist optisch weniger spektakulär, aber näher an der Entscheidung.
Gute Kommunikation zeigt deshalb nicht nur den erwarteten Wert. Sie zeigt, welche Alternativen ernsthaft im Ensemble liegen, wie sich die Aussage seit dem letzten Lauf verändert hat und worauf sie empfindlich reagiert. Unsicherheit ist kein Makel, den Design verstecken sollte. Sie ist ein Teil des Produkts.
Unter dem Kioskdach bleibt vom Modell eine bessere Frage übrig
Die beiden erfundenen Radfahrer sind nass. Das Papier hängt weich über dem Arm, die gelbe Jacke trocken zu Hause. Der leichte Spott über die Wetteranzeige wäre verständlich. Interessanter ist die gemeinsame Fehlersuche: Welches Regenereignis meinte die Zahl? Für welchen Ort und Zeitraum? Wie alt war die Prognose? Zeigte sie ein Ensemble oder nur ein Symbol? Welche Vorsorge hätte wenig gekostet?
Danach lässt sich die Kritik staffeln. Wenn 30-Prozent-Fälle langfristig viel häufiger als dreißigmal von hundert eintreten, ist die Kalibrierung schwach. Wenn Starkregen regelmäßig in derselben Landschaft unterschätzt wird, fehlt womöglich lokale Struktur oder Nachbearbeitung. Wenn die Anzeige gut war, aber als Trockenversprechen gelesen wurde, lag das Problem in Kommunikation und Entscheidung. Diese Diagnosen können gleichzeitig gelten.
Ein Modell ist nicht glaubwürdig, weil es kompliziert ist, von ECMWF stammt oder Millionen Rechenstunden verbraucht. Es wird glaubwürdig, wenn Zweck, Daten, Annahmen, Unsicherheit, Vergleichsfälle und Fehlergrenzen offenliegen. NASA bindet Modellglaubwürdigkeit aus gutem Grund an einen Lebenszyklus statt an eine einmalige Freigabe. [5]
Beim nächsten Ausflug lautet die kluge Frage daher nicht „Kann ich der App vertrauen?“ Sie lautet: „Welche Entscheidung will ich treffen, welches Ereignis würde sie ändern, und zeigt mir dieses Produkt dafür die relevante Unsicherheit?“ Vielleicht landet die gelbe Jacke dann trotz blauem Himmel im Rucksack. Das Modell hat die Zukunft nicht perfekter gemacht. Es hat nur geholfen, mit mehreren möglichen Zukünften besser zu leben.
ECMWF-, NASA-, NIST-, BIPM- und IPCC-Grundlagen zu Modellzweck, Ensemble, Unsicherheit und Szenarien
- Stanford Encyclopedia of Philosophy – Models in Science (research-reference)
- ECMWF – Medium-range forecasts (research-institution)
- ECMWF – Quantifying forecast uncertainty (research-institution)
- ECMWF Forecast User Guide – Basic ensemble products and precipitation probabilities (research-institution)
- NASA-STD-7009B – Standard for Models and Simulations (standard-primary)
- NIST Technical Note 1297 – Measurement Uncertainty (standard-primary)
- BIPM/JCGM – Guides in Metrology and Measurement Uncertainty (standard-primary)
- IPCC AR6 WGII – Annex II: Glossary (research-institution)
- IPCC AR6 – Mitigation Pathways and Scenarios (research-institution)
- OpenStax Calculus – Newton’s Law of Cooling (university-reference)
Recherche- und Redaktionsstand: 17. August 2026. Redaktionell verantwortlich: Benjamin Metzig.
