Nachweise · Daten, Berechnung, Genauigkeit

Was wir mit echten Daten belegen können

Die Nachweise der MESSAI-Plattform für Vorhersagegenauigkeit, Tiefe der Modellierung und einen kuratierten Datenkorpus – aus gespeicherten Trainingsartefakten und Live-Zählungen der Datenbank. Die Zahlen werden bei jeder Anfrage neu gelesen; jede Kachel nennt ihre Quelldatei. Wo die Evidenz dünn ist oder fehlt, sagt das der Abschnitt „Offene Lücken“ – nichts wird stillschweigend verborgen. Die Methode, für die diese Zahlen den Nachweis liefern, beschreibt die Seite Wissenschaft ▸ Methodik.

Out-of-Sample-Abdeckung

97,98 %

95-%-Intervall · 940 zurückgehaltene Beob.

Erwarteter Kalibrierungsfehler

1,96 %

gesamt · calibration.json

Gemessene Parameterwerte

196.580

live · ExtractedParameterData

Publikationen

23.598

live · ResearchPaper

Kanonische Parameter

706

live · ParameterClassification

DAG-Kanten

2.812

live · ParameterEdge

Alle Zahlen oben werden zum Zeitpunkt der Anfrage aus apps/web/public/data/computed/research/ + Prisma gelesen. Live-Zählungen wachsen über Sitzungen hinweg; ist die Datenbank nicht erreichbar, erscheinen Werte aus Momentaufnahmen.

§1 Vorhersagegenauigkeit

Out-of-Sample-Abdeckung des 95-%-Glaubwürdigkeitsintervalls

Out-of-Sample-Vorhersagegenauigkeit

7 Strata · 940 zurückgehaltene Beobachtungen · Kohorte holdout-2026-05-21 · erstellt am 21.05.2026

generalisiert

OOS-Abdeckung

97,98 %

vs. Ziel 95 %

In-Sample-Abdeckung

95,85 %

-2,13 Pp. Abstand (kleiner ist besser)

Erwarteter Kalibrierungsfehler

—

calibration.json

Holdout-Strata

7

940 Beobachtungen

Abdeckung je Stratum (sortiert nach n)

ParameterSystemnInnerhalbOOS-AbdeckungIS − OOS (Pp.)
power_density_arealMFC23422997,86 %-0,43
cod_removalMFC22021497,27 %-3,18
current_density_arealMFC16315997,55 %-0,61
coulombic_efficiencyMFC135135100,00 %-7,41
current_density_arealMEC6969100,00 %-1,45
coulombic_efficiencyMEC6464100,00 %+0,00
cod_removalMEC555192,73 %+0,00

Ein negativer Abstand IS − OOS bedeutet, dass das Modell besser generalisiert, als seine Anpassungskohorte erwarten ließe – die Holdout-Publikationen waren zufällig etwas einfacher als der Durchschnitt. Ein großer positiver Abstand würde auf Überanpassung hindeuten; keines der 7 Strata zeigt das.

§2 Methodischer Burggraben

Modelle, Physik und entdeckte Gesetzmäßigkeiten

GP-SCM – strukturelles Kausalmodell auf Basis von Gauß-Prozessen

GP mit mehreren Ausgaben und gelerntem Koregionalisierungs-Kernel. Unterstützt Inversion (Zielgröße → Designparameter), Pareto-Front und globale Sensitivität.

im Produktivbetrieb

Trainiertes Artefakt

508 KB

gp-scm-fitted-named-db-2026-05-19-v3.pkl

Kernel

ICM

Intrinsic Coregionalization

Trainingsdaten

195.846

aus 9.511 Publikationen

Trainiert am

19.05.2026

v3, neueste von 6 Momentaufnahmen

Physikalische Gesetze als Randbedingungen – 5 kodiert

Residuenprüfungen als reine Funktionen (services/ml-engine/physics/constraints.py), verankert in Logan et al. und Newman & Thomas-Alyea. Sie laufen über jeden extrahierten Betriebspunkt, dessen Eingangsgrößen berichtet sind; ein Verstoß wird als Kennzeichnung an den beteiligten Zeilen gespeichert, sodass nachgelagerte Abfragen sie ausschließen können.

GesetzFormelQuelle
LeistungsgleichungP = V · INewman & Thomas-Alyea
Coulomb-Effizienz zwischen 0 und 100 %0 ≤ CE ≤ 100%Logan et al. 2006
Ladungsbilanz der Coulomb-EffizienzCE = ∫I dt / Q_substrateLogan et al. 2006
Zellspannung unter der LeerlaufspannungV_cell ≤ V_oc (I > 0)Thevenin
Satz der LeistungsanpassungP_max = V_oc² / 4R_intThevenin

Symbolische Regression – PySR (Cranmer 2023)

Suche nach mechanistischen Gesetzen in geschlossener Form per genetischer Programmierung. 2 von 5 Anpassungen erfolgreich · 18,7 s Laufzeit

40 % erfolgreich

Entdeckte Gesetzmäßigkeiten

  • powerDensity ~ f(currentDensity)MFC · n=51 · Komplexität=11
    (x0 + (0.22200376 / ((x0 + 2.3158035) * -1.8066067))) - 0.6148749

    P = V·I. At matched load V≈V_oc/2 ≈ const → P ∝ I

  • coulombic_efficiency ~ f(cod_removal)MFC · n=29 · Komplexität=13
    ((x0 + -0.19921306) / ((x0 + (x0 + 0.46581972)) / 0.0033559396)) + -1.308836

    At high COD removal, more substrate goes to biomass (not e-) → CE drops

Übersprungene Anpassungen (3) – ehrlich ausgewiesen

  • · internalResistance ~ f(electrolyte_conductivity) — insufficient_data (n=1)
  • · specific_h2_production ~ f(currentDensity) — insufficient_data (n=2)
  • · powerDensity ~ f(currentDensity, internalResistance) — insufficient_data (n=15)

Gelernter kausaler DAG (gerichteter azyklischer Graph) – Strukturlernen bayesscher Netze

HillClimbSearch + BICScore auf 173 Publikationen mit 9 Merkmalen · v1-pgmpy-hillclimb-bic-2026-05-10

Neu gelernte Kanten (1)

  • · powerDensity → currentDensity

Von Hand gesetzte Kanten, die die Daten NICHT bestätigen (14)

  • · appliedPotential → currentDensity
  • · biofilmThickness → massTransportLimitation
  • · coulombic_efficiency → energy_efficiency
  • · coulombic_efficiency → h2_yield
  • · coulombic_efficiency → specific_h2_production
  • · electrodeMaterial → specificSurfaceArea
  • · exchangeCurrentDensity → chargeTransferResistance
  • · flowRate → biofilmThickness
  • … und 6 weitere

§3 Daten-Burggraben

Kuratierter Korpus, Taxonomien und Datenherkunft

Datenkorpus und Taxonomien

Live-Zählungen aus der Datenbank + Momentaufnahmen kuratierter Kataloge. Alle Zählungen werden live aus Supabase Postgres gelesen.

live

Eigener Korpus (live aus der DB)

Publikationen

23.598

ResearchPaper

Extrahierte Parameterwerte

196.580

ExtractedParameterData

Kanonische Parameter

706

ParameterClassification

DAG-Kanten

2.812

ParameterEdge

Kuratierte Taxonomien (Momentaufnahme – open-source/mess-*)

Mikrobenarten + Priors

28

mess-microbes seed v1.3

Priors zur Elektroaktivität je Gattung

28

EET-Pfad × Inokulumquelle

Einträge im Elektrodenkatalog

7

Pourbaix · Leitfähigkeit · Kosten

Einträge aus Materials Project

160

DFT-gestützt, mit Querverweisen

Was diesen Burggraben ausmacht

  • · Jeder extrahierte Wert trägt seine Herkunft mit: derivationMethod, uncertaintyPlus/Minus/Type, confidence, snippet, conditions (JSONB), canonical (JSONB).
  • · Der Parameter-DAG nutzt die Datenbank als maßgebliche Quelle, mit Fremdschlüssel-Constraints auf den Slug-Kennungen (seit 09.05.2026); kein JSON-Drift.
  • · Der Materialkatalog verbindet DFT (Materials Project API) + Laborelektrochemie + Pourbaix-Daten je Systemklasse – von Hand kuratiert, nicht massenhaft importiert.
  • · Zweistufige Extraktion mit Provider-Fallback (Anthropic Gateway / Gemini / Groq) + einer Kompatibilitätsschicht für die Schematoleranz bei Providern außer Anthropic.

Was Kuration ist, nicht Eigentum

  • · ~35 MB Metadaten von Zenodo / FigShare / Recherche Data Gouv in mess-datasets-catalog sind verknüpft & klassifiziert – die zugrunde liegenden Datensätze sind aber öffentlich.
  • · Öffentliche Datensätze zählen als Kurations-Burggraben (Aufwand für Konsolidierung + Querklassifikation), aber nicht als Daten-Burggraben (die zugrunde liegenden Messwerte gehören uns nicht).
  • · Die Publikationen selbst sind öffentlich; der Burggraben ist die Pipeline von der Extraktion in die DB mit Freigabe durch den Verifizierer, Archivieren statt Löschen und Reproduzierbarkeitsbewertung je Zeile.

§4 Vertrauenskarte

Zustände der bayesschen Priors je Parameter

Vertrauenskarte der Parameter

102 eindeutige Parameter-Slugs · 268 Zustände auf Stratum-Ebene (gepoolt + nach system_type + nach application_domain) · v2-trust-2026-05-16 · angepasst am 16.05.2026

Live-Momentaufnahme

Kalibriert

12

4,5 % der Strata · konvergiert + LOO verlässlich

Modelliert

69

25,7 % der Strata · konvergiert, schwaches LOO

Kuratiert

178

66,4 % der Strata · Literatur-Prior, kleines n

Markiert

9

3,4 % der Strata · auffälliges Posterior-p

Aufschlüsselung nach Achse

AchseKalibriertModelliertKuratiertMarkiert
Gepoolt (über alle Systeme)820713
Nach system_type336754
Nach application_domain113322

Jeder Parameter hat bis zu 3 Stratifizierungsachsen; ein Parameter, der auf gepoolter Ebene mit verlässlichem LOO konvergiert, kann in engeren system_type-Ausschnitten mit kleinem n dennoch „kuratiert“ sein. Das ist ehrliche Stratifizierung – die Kennzahl oben zählt jeden Zustand auf Stratum-Ebene, nicht nur die besten.

§5 Retrospektiver Literatur-Rückvergleich (Backtest)

25+ begutachtete Publikationen, kodiert und erneut vorhergesagt

Retrospektiver Rückvergleich mit der Literatur

25 begutachtete Publikationen, kodiert als LoganPaperPreset-Objekte mit DOI, Abbildungsverweis, berichteten Werten, Einheiten und Einschränkungen. Erneut vorhergesagt bei der exakten Versuchskonfiguration jeder Publikation; die prozentuale Abweichung von den berichteten Werten wird nach ihrer Größe in drei Bänder eingeteilt (Schwellen unten).

93 % grün (MFC)

Kodierte Publikationen

25

apps/lab/src/lib/sweep/presets/*.ts

MFC im grünen Band

13/14

|Δ| ≤ 25 % · 92,9 %

Median |Δ|

6,7 %

über alle MFC-Vorlagen

Bestandene Ankertests

10/10

100 % · Jest-CI-Prüfung

Verteilung der MFC-Bänder (MESSAI-Schwellen)

Grün – |Δ| ≤ 25 %13 / 14 · 92,9 %

Nahe am berichteten Wert

Gelb – 25 % < |Δ| ≤ 50 %1 / 14 · 7,1 %

Prüfen; kann auf einen fehlenden physikalischen Term hindeuten

Rot – |Δ| > 50 %0 / 14 · 0,0 %

Echte Modelllücke

Quelldateien

  • · apps/lab/src/lib/sweep/presets/ (25 Vorlagendateien)
  • · apps/lab/src/lib/sweep/__tests__/backtest-presets.test.ts
  • · apps/lab/src/lib/sweep/__tests__/butler-volmer-calibration.test.ts

Ankertests prüfen 10 fest kodierte Zahlenbereiche aus kanonischen begutachteten Publikationen (Liu-Logan 2004 Abwasser/PEM/Acetat, Cheng 2006 Kohlenstoffgewebe, Cheng-Logan 2007 Bürstenanode sowie 5 weitere). Alle 10 bestehen vor jedem Release die Jest-Regressionsprüfung. Momentaufnahme vom 21.05.2026; eine automatische Aktualisierung bräuchte einen Helfer scripts/research/snapshot-backtest.ts (geplanter Folgeschritt).

§6 Offene Lücken

Wofür uns noch Nachweise fehlen

Lücke · cov-power-density1.285 %

Variationskoeffizient (VK) der Leistungsdichte ~1.285 %

Warum & Gegenmaßnahmen›

Messwerte der Leistungsdichte streuen in der Literatur über ~4 Größenordnungen; Punktschätzungen sind ohne Konditionierung auf Systemklasse, Maßstab und Elektrodengeometrie nicht aussagekräftig.

Quelle

open-source/mess-parameters/data/SCIENTIFIC_INTEGRITY.md (Rule §3)

Gegenmaßnahme

Vorhersageintervalle werden je Stratum (system_class × application_domain) über hierarchische bayessche Priors ausgewiesen; Punktschätzungen erscheinen in der Labor-Oberfläche nur bei n ≥ 5 im Stratum.

Lücke · canonical-coverage51,6 %

Abdeckung kanonischer Slugs: 51,6 % der extrahierten Werte

Warum & Gegenmaßnahmen›

104.116 von 201.954 extrahierten Werten tragen einen kanonischen Parameter-Slug (gemessen am 11.08.2026). Die übrigen 48,4 % sind Rohnamen ohne kanonischen Parameter – Aliasse, für die DAG-Knoten ergänzt werden müssen.

Quelle

apps/site/src/data/methodology-stats.ts (canonicalMappingRatePct, measured 2026-08-11)

Gegenmaßnahme

Die Zuordnung der Aliasse läuft weiter in open-source/mess-parameters/scripts/sync-from-database.js.

Lücke · extraction-success

Erfolgsquote der v2-Extraktion: derzeit nicht gemessen

Warum & Gegenmaßnahmen›

Die frühere Angabe von ~75 % wurde zurückgezogen; ein gemessener Ersatz liegt nicht vor. Bekannte Fehlerursachen: Schematoleranz bei Providern außer Anthropic, fehlerhafte PDFs und Bezahlschranken.

Quelle

apps/site/src/data/methodology-stats.ts (extractionSuccessPct: withdrawn)

Gegenmaßnahme

Eine Kompatibilitätsschicht für die Schematoleranz kam am 09.05.2026 hinzu (Commit 3d215187b); der BioC-PMC-XML-Pfad ist die nächste geplante Gegenmaßnahme.

Lücke · gemini-other-regression52 %

system_class=OTHER 52 % beim Gemini-Fallback

Warum & Gegenmaßnahmen›

Wird das Gateway gedrosselt und übernimmt Gemini-2.5-flash, verschlechtert sich die system_class-Klassifikation bei den ersten 21 Publikationen aus batch5 von ~14 % OTHER (Haiku) auf ~52 % OTHER. Mehrere Publikationen mit „microbial fuel cell“ im Titel landen in OTHER.

Quelle

docs/extraction/provider-fallback-2026-05-09.md

Gegenmaßnahme

Gegenmaßnahmen in Prüfung: Aufzählung direkt im Prompt, eine einfache Tier-1-Regex als Vergleichsbasis, ein Versuch mit gemini-2.5-pro. Das Feld paper_class IST unter Gemini verlässlich.

Lücke · multiclass-validation2 von 7

Bayessche Holdout-Validierung: nur MFC + MEC

Warum & Gegenmaßnahmen›

Die OOS-Abdeckung von 97,98 % umfasst 7 Strata aus MFC + MEC. Die analytischen Vorhersagemodelle für MDC, MES, MNRC, MMRC und MBES kamen am 15.05.2026 hinzu, sind aber nicht an zurückgehaltenen Publikationskohorten validiert.

Quelle

libs/shared/electrochemistry/src/predictors/{mdc,mes,mnrc,mmrc,mbes}.ts + holdout-coverage-2026-05-21.json

Gegenmaßnahme

Der Aufbau einer Holdout-Kohorte über mehrere Klassen ist das nächste geplante Arbeitspaket der Validierung.

Lücke · bioc-pmc-unconsumed1.400+

1.400+ BioC-PMC-XML-Dateien ungenutzt

Warum & Gegenmaßnahmen›

paperscraper hat neben den PDFs 1.400+ BioC-PMC-XML-Dateien gesammelt. Weder der v1- noch der v2-Extraktor verarbeitet heute XML – dabei ist das Volltext in Ground-Truth-Qualität, der v2 genauer versorgen würde als PDF + Nougat.

Quelle

CLAUDE.local.md → "Known gaps" → "BioC-PMC XML extraction path"

Gegenmaßnahme

Entweder einen XML-fähigen Extraktor schreiben oder XML mit einem anderen System-Prompt an v2 übergeben – abgeschätzt, aber nicht eingeplant.

Lücke · bvm-mechanistic-data-gated19 / 30 Zellen

Mechanistische BVM-Kinetik: durch die Datenlage begrenzt, noch nicht identifizierbar

Warum & Gegenmaßnahmen›

Seit die Korrektur der Kurvensynchronisierung vom 09.06.2026 liegengebliebene 3-Elektroden-Daten zurückgeholt hat, enthält der Korpus 843 Polarisationspunkte für Halbzellen (vs. SHE) und 19 von 30 Zellen, die für den BVM-Posterior (A-posteriori-Verteilung) bereit sind (zuvor 0 und 13). Das bleibt aber hinter dem Ziel von 30 Zellen zurück, und echte Daten aus Potenzialscans sind dünn (≈3 CV-Kurven), sodass der Butler-Volmer-Durchtrittsfaktor α unterbestimmt bleibt. Wir treffen derzeit KEINE mechanistischen BVM-Vorhersageaussagen.

Quelle

scripts/audits/bvm-identifiability-audit.ts + scripts/extraction/sync-curves-to-polarization-points.ts (2026-06-09)

Gegenmaßnahme

Stattdessen zeigen wir die validierte Treffsicherheit bei der RICHTUNG innerhalb eines Designs (Leistung↔Substrat 63 %, Leistung↔pH 62 %, Strom↔externer Widerstand 71–78 %); um die verbleibende Lücke bei α zu schließen, braucht es neue Publikationen mit 3-Elektroden-Messungen / Cyclovoltammetrie + Laborpartnerschaften.

Lücke · ml-predict-uq-heuristic±25-%-Band

Die Unsicherheitsquantifizierung (UQ) je Klasse in /api/ml/predict ist ein heuristisches Band

Warum & Gegenmaßnahmen›

Das Routing je Klasse IST live: /api/ml/predict leitet MEC/MES/MDC/MNRC/MMRC/MBES an eigene analytische Vorhersagemodelle weiter (runFullPrediction → predictBaseForSystemClass), MFC läuft über den auf Daten abgestimmten empirischen Pfad. Die verbleibende Lücke ist die Unsicherheit: Diese analytischen Vorhersagemodelle geben ein pauschales heuristisches ±25-%-Band aus (uncertaintyBasis="heuristic_fixed_fraction"), KEINE physikalisch propagierte oder kalibrierte UQ, und MES/MNRC/MMRC/MBES greifen bei der physikalischen Anreicherung weiterhin auf ein MFC-Surrogat zurück.

Quelle

libs/shared/ml/src/run-full-prediction.ts + libs/shared/ml/src/predictions/per-class-base.ts

Gegenmaßnahme

Posterior-UQ je Parameter (WS-D) und physikalische Anreicherung je Klasse für MES/MNRC/MMRC/MBES sind erfasste Folgeaufgaben; die Intervallbeschriftung weist schon heute aus, ob ein Band heuristisch oder kalibriert ist.

Lücke · symbolic-regression-coverage2/5

Symbolische Regression: 2 von 5 Anpassungen erfolgreich

Warum & Gegenmaßnahmen›

Der PySR-Lauf vom 10.05.2026 versuchte 5 mechanistische Anpassungen; 2 gelangen (powerDensity↔currentDensity, coulombic_efficiency↔cod_removal); 3 wurden wegen insufficient_data übersprungen (internalResistance, specific_h2_production, P aus Strom + R).

Quelle

apps/web/public/data/computed/research/symbolic-regression-laws.json

Gegenmaßnahme

PySR erneut ausführen, sobald Nachextraktionen das n je Paar über die Schwelle ausreichender Daten heben (derzeit liegen viele Paare bei n < 5).

Was wir nicht behaupten

Wir behaupten nicht, Eigentümer der öffentlichen Datensätze zu sein, die wir verknüpfen (Zenodo, FigShare, Recherche Data Gouv) – das ist Kuration, kein Dateneigentum. Wir behaupten nicht, dass die Modelle im Feldeinsatz validiert sind – alle Genauigkeitszahlen oben beziehen sich auf begutachtete Labor- und Pilotliteratur, nicht auf Einsätze in realen Anlagen. Wir behaupten nicht, dass die Vorhersagemodelle je Klasse (MDC / MES / MNRC / MMRC / MBES) bayessch validiert sind – derzeit gehören nur MFC und MEC zur Holdout-Kohorte mit 7 Strata.

Quell-Pipeline: Der Trainer in services/ml-engine/ veröffentlicht Artefakte nach apps/web/public/data/computed/research/; Live-Zählungen stammen aus der Supabase-PostgreSQL-Datenbank über @messai/database/server. Die Korpus-Übersicht, auf der diese Zahlen beruhen, finden Sie unter /insights.