Nachweise · Daten, Berechnung, Genauigkeit
Was wir mit echten Daten belegen können
Die Nachweise der MESSAI-Plattform für Vorhersagegenauigkeit, Tiefe der Modellierung und einen kuratierten Datenkorpus – aus gespeicherten Trainingsartefakten und Live-Zählungen der Datenbank. Die Zahlen werden bei jeder Anfrage neu gelesen; jede Kachel nennt ihre Quelldatei. Wo die Evidenz dünn ist oder fehlt, sagt das der Abschnitt „Offene Lücken“ – nichts wird stillschweigend verborgen. Die Methode, für die diese Zahlen den Nachweis liefern, beschreibt die Seite Wissenschaft ▸ Methodik.
Out-of-Sample-Abdeckung
97,98 %
95-%-Intervall · 940 zurückgehaltene Beob.
Erwarteter Kalibrierungsfehler
1,96 %
gesamt · calibration.json
Gemessene Parameterwerte
196.580
live · ExtractedParameterData
Publikationen
23.598
live · ResearchPaper
Kanonische Parameter
706
live · ParameterClassification
DAG-Kanten
2.812
live · ParameterEdge
Alle Zahlen oben werden zum Zeitpunkt der Anfrage aus apps/web/public/data/computed/research/ + Prisma gelesen. Live-Zählungen wachsen über Sitzungen hinweg; ist die Datenbank nicht erreichbar, erscheinen Werte aus Momentaufnahmen.
§1 Vorhersagegenauigkeit
Out-of-Sample-Abdeckung des 95-%-Glaubwürdigkeitsintervalls
Out-of-Sample-Vorhersagegenauigkeit
7 Strata · 940 zurückgehaltene Beobachtungen · Kohorte holdout-2026-05-21 · erstellt am 21.05.2026
OOS-Abdeckung
97,98 %
vs. Ziel 95 %
In-Sample-Abdeckung
95,85 %
-2,13 Pp. Abstand (kleiner ist besser)
Erwarteter Kalibrierungsfehler
—
calibration.json
Holdout-Strata
7
940 Beobachtungen
Abdeckung je Stratum (sortiert nach n)
| Parameter | System | n | Innerhalb | OOS-Abdeckung | IS − OOS (Pp.) |
|---|---|---|---|---|---|
| power_density_areal | MFC | 234 | 229 | 97,86 % | -0,43 |
| cod_removal | MFC | 220 | 214 | 97,27 % | -3,18 |
| current_density_areal | MFC | 163 | 159 | 97,55 % | -0,61 |
| coulombic_efficiency | MFC | 135 | 135 | 100,00 % | -7,41 |
| current_density_areal | MEC | 69 | 69 | 100,00 % | -1,45 |
| coulombic_efficiency | MEC | 64 | 64 | 100,00 % | +0,00 |
| cod_removal | MEC | 55 | 51 | 92,73 % | +0,00 |
Ein negativer Abstand IS − OOS bedeutet, dass das Modell besser generalisiert, als seine Anpassungskohorte erwarten ließe – die Holdout-Publikationen waren zufällig etwas einfacher als der Durchschnitt. Ein großer positiver Abstand würde auf Überanpassung hindeuten; keines der 7 Strata zeigt das.
§2 Methodischer Burggraben
Modelle, Physik und entdeckte Gesetzmäßigkeiten
GP-SCM – strukturelles Kausalmodell auf Basis von Gauß-Prozessen
GP mit mehreren Ausgaben und gelerntem Koregionalisierungs-Kernel. Unterstützt Inversion (Zielgröße → Designparameter), Pareto-Front und globale Sensitivität.
Trainiertes Artefakt
508 KB
gp-scm-fitted-named-db-2026-05-19-v3.pkl
Kernel
ICM
Intrinsic Coregionalization
Trainingsdaten
195.846
aus 9.511 Publikationen
Trainiert am
19.05.2026
v3, neueste von 6 Momentaufnahmen
Physikalische Gesetze als Randbedingungen – 5 kodiert
Residuenprüfungen als reine Funktionen (services/ml-engine/physics/constraints.py), verankert in Logan et al. und Newman & Thomas-Alyea. Sie laufen über jeden extrahierten Betriebspunkt, dessen Eingangsgrößen berichtet sind; ein Verstoß wird als Kennzeichnung an den beteiligten Zeilen gespeichert, sodass nachgelagerte Abfragen sie ausschließen können.
| Gesetz | Formel | Quelle |
|---|---|---|
| Leistungsgleichung | P = V · I | Newman & Thomas-Alyea |
| Coulomb-Effizienz zwischen 0 und 100 % | 0 ≤ CE ≤ 100% | Logan et al. 2006 |
| Ladungsbilanz der Coulomb-Effizienz | CE = ∫I dt / Q_substrate | Logan et al. 2006 |
| Zellspannung unter der Leerlaufspannung | V_cell ≤ V_oc (I > 0) | Thevenin |
| Satz der Leistungsanpassung | P_max = V_oc² / 4R_int | Thevenin |
Symbolische Regression – PySR (Cranmer 2023)
Suche nach mechanistischen Gesetzen in geschlossener Form per genetischer Programmierung. 2 von 5 Anpassungen erfolgreich · 18,7 s Laufzeit
Entdeckte Gesetzmäßigkeiten
- powerDensity ~ f(currentDensity)MFC · n=51 · Komplexität=11
(x0 + (0.22200376 / ((x0 + 2.3158035) * -1.8066067))) - 0.6148749P = V·I. At matched load V≈V_oc/2 ≈ const → P ∝ I
- coulombic_efficiency ~ f(cod_removal)MFC · n=29 · Komplexität=13
((x0 + -0.19921306) / ((x0 + (x0 + 0.46581972)) / 0.0033559396)) + -1.308836At high COD removal, more substrate goes to biomass (not e-) → CE drops
Übersprungene Anpassungen (3) – ehrlich ausgewiesen
- · internalResistance ~ f(electrolyte_conductivity) — insufficient_data (n=1)
- · specific_h2_production ~ f(currentDensity) — insufficient_data (n=2)
- · powerDensity ~ f(currentDensity, internalResistance) — insufficient_data (n=15)
Gelernter kausaler DAG (gerichteter azyklischer Graph) – Strukturlernen bayesscher Netze
HillClimbSearch + BICScore auf 173 Publikationen mit 9 Merkmalen · v1-pgmpy-hillclimb-bic-2026-05-10
Neu gelernte Kanten (1)
- · powerDensity → currentDensity
Von Hand gesetzte Kanten, die die Daten NICHT bestätigen (14)
- · appliedPotential → currentDensity
- · biofilmThickness → massTransportLimitation
- · coulombic_efficiency → energy_efficiency
- · coulombic_efficiency → h2_yield
- · coulombic_efficiency → specific_h2_production
- · electrodeMaterial → specificSurfaceArea
- · exchangeCurrentDensity → chargeTransferResistance
- · flowRate → biofilmThickness
- … und 6 weitere
§3 Daten-Burggraben
Kuratierter Korpus, Taxonomien und Datenherkunft
Datenkorpus und Taxonomien
Live-Zählungen aus der Datenbank + Momentaufnahmen kuratierter Kataloge. Alle Zählungen werden live aus Supabase Postgres gelesen.
Eigener Korpus (live aus der DB)
Publikationen
23.598
ResearchPaper
Extrahierte Parameterwerte
196.580
ExtractedParameterData
Kanonische Parameter
706
ParameterClassification
DAG-Kanten
2.812
ParameterEdge
Kuratierte Taxonomien (Momentaufnahme – open-source/mess-*)
Mikrobenarten + Priors
28
mess-microbes seed v1.3
Priors zur Elektroaktivität je Gattung
28
EET-Pfad × Inokulumquelle
Einträge im Elektrodenkatalog
7
Pourbaix · Leitfähigkeit · Kosten
Einträge aus Materials Project
160
DFT-gestützt, mit Querverweisen
Was diesen Burggraben ausmacht
- · Jeder extrahierte Wert trägt seine Herkunft mit:
derivationMethod,uncertaintyPlus/Minus/Type,confidence, snippet, conditions (JSONB), canonical (JSONB). - · Der Parameter-DAG nutzt die Datenbank als maßgebliche Quelle, mit Fremdschlüssel-Constraints auf den Slug-Kennungen (seit 09.05.2026); kein JSON-Drift.
- · Der Materialkatalog verbindet DFT (Materials Project API) + Laborelektrochemie + Pourbaix-Daten je Systemklasse – von Hand kuratiert, nicht massenhaft importiert.
- · Zweistufige Extraktion mit Provider-Fallback (Anthropic Gateway / Gemini / Groq) + einer Kompatibilitätsschicht für die Schematoleranz bei Providern außer Anthropic.
Was Kuration ist, nicht Eigentum
- · ~35 MB Metadaten von Zenodo / FigShare / Recherche Data Gouv in mess-datasets-catalog sind verknüpft & klassifiziert – die zugrunde liegenden Datensätze sind aber öffentlich.
- · Öffentliche Datensätze zählen als Kurations-Burggraben (Aufwand für Konsolidierung + Querklassifikation), aber nicht als Daten-Burggraben (die zugrunde liegenden Messwerte gehören uns nicht).
- · Die Publikationen selbst sind öffentlich; der Burggraben ist die Pipeline von der Extraktion in die DB mit Freigabe durch den Verifizierer, Archivieren statt Löschen und Reproduzierbarkeitsbewertung je Zeile.
§4 Vertrauenskarte
Zustände der bayesschen Priors je Parameter
Vertrauenskarte der Parameter
102 eindeutige Parameter-Slugs · 268 Zustände auf Stratum-Ebene (gepoolt + nach system_type + nach application_domain) · v2-trust-2026-05-16 · angepasst am 16.05.2026
Kalibriert
12
4,5 % der Strata · konvergiert + LOO verlässlich
Modelliert
69
25,7 % der Strata · konvergiert, schwaches LOO
Kuratiert
178
66,4 % der Strata · Literatur-Prior, kleines n
Markiert
9
3,4 % der Strata · auffälliges Posterior-p
Aufschlüsselung nach Achse
| Achse | Kalibriert | Modelliert | Kuratiert | Markiert |
|---|---|---|---|---|
| Gepoolt (über alle Systeme) | 8 | 20 | 71 | 3 |
| Nach system_type | 3 | 36 | 75 | 4 |
| Nach application_domain | 1 | 13 | 32 | 2 |
Jeder Parameter hat bis zu 3 Stratifizierungsachsen; ein Parameter, der auf gepoolter Ebene mit verlässlichem LOO konvergiert, kann in engeren system_type-Ausschnitten mit kleinem n dennoch „kuratiert“ sein. Das ist ehrliche Stratifizierung – die Kennzahl oben zählt jeden Zustand auf Stratum-Ebene, nicht nur die besten.
§5 Retrospektiver Literatur-Rückvergleich (Backtest)
25+ begutachtete Publikationen, kodiert und erneut vorhergesagt
Retrospektiver Rückvergleich mit der Literatur
25 begutachtete Publikationen, kodiert als LoganPaperPreset-Objekte mit DOI, Abbildungsverweis, berichteten Werten, Einheiten und Einschränkungen. Erneut vorhergesagt bei der exakten Versuchskonfiguration jeder Publikation; die prozentuale Abweichung von den berichteten Werten wird nach ihrer Größe in drei Bänder eingeteilt (Schwellen unten).
Kodierte Publikationen
25
apps/lab/src/lib/sweep/presets/*.ts
MFC im grünen Band
13/14
|Δ| ≤ 25 % · 92,9 %
Median |Δ|
6,7 %
über alle MFC-Vorlagen
Bestandene Ankertests
10/10
100 % · Jest-CI-Prüfung
Verteilung der MFC-Bänder (MESSAI-Schwellen)
Nahe am berichteten Wert
Prüfen; kann auf einen fehlenden physikalischen Term hindeuten
Echte Modelllücke
Quelldateien
- · apps/lab/src/lib/sweep/presets/ (25 Vorlagendateien)
- · apps/lab/src/lib/sweep/__tests__/backtest-presets.test.ts
- · apps/lab/src/lib/sweep/__tests__/butler-volmer-calibration.test.ts
Ankertests prüfen 10 fest kodierte Zahlenbereiche aus kanonischen begutachteten Publikationen (Liu-Logan 2004 Abwasser/PEM/Acetat, Cheng 2006 Kohlenstoffgewebe, Cheng-Logan 2007 Bürstenanode sowie 5 weitere). Alle 10 bestehen vor jedem Release die Jest-Regressionsprüfung. Momentaufnahme vom 21.05.2026; eine automatische Aktualisierung bräuchte einen Helfer scripts/research/snapshot-backtest.ts (geplanter Folgeschritt).
§6 Offene Lücken
Wofür uns noch Nachweise fehlen
Wir legen Lücken offen – gleichrangiger Abschnitt, nicht versteckt
Variationskoeffizient (VK) der Leistungsdichte ~1.285 %
Warum & Gegenmaßnahmen›
Messwerte der Leistungsdichte streuen in der Literatur über ~4 Größenordnungen; Punktschätzungen sind ohne Konditionierung auf Systemklasse, Maßstab und Elektrodengeometrie nicht aussagekräftig.
Quelle
open-source/mess-parameters/data/SCIENTIFIC_INTEGRITY.md (Rule §3)Gegenmaßnahme
Vorhersageintervalle werden je Stratum (system_class × application_domain) über hierarchische bayessche Priors ausgewiesen; Punktschätzungen erscheinen in der Labor-Oberfläche nur bei n ≥ 5 im Stratum.
Abdeckung kanonischer Slugs: 51,6 % der extrahierten Werte
Warum & Gegenmaßnahmen›
104.116 von 201.954 extrahierten Werten tragen einen kanonischen Parameter-Slug (gemessen am 11.08.2026). Die übrigen 48,4 % sind Rohnamen ohne kanonischen Parameter – Aliasse, für die DAG-Knoten ergänzt werden müssen.
Quelle
apps/site/src/data/methodology-stats.ts (canonicalMappingRatePct, measured 2026-08-11)Gegenmaßnahme
Die Zuordnung der Aliasse läuft weiter in open-source/mess-parameters/scripts/sync-from-database.js.
Erfolgsquote der v2-Extraktion: derzeit nicht gemessen
Warum & Gegenmaßnahmen›
Die frühere Angabe von ~75 % wurde zurückgezogen; ein gemessener Ersatz liegt nicht vor. Bekannte Fehlerursachen: Schematoleranz bei Providern außer Anthropic, fehlerhafte PDFs und Bezahlschranken.
Quelle
apps/site/src/data/methodology-stats.ts (extractionSuccessPct: withdrawn)Gegenmaßnahme
Eine Kompatibilitätsschicht für die Schematoleranz kam am 09.05.2026 hinzu (Commit 3d215187b); der BioC-PMC-XML-Pfad ist die nächste geplante Gegenmaßnahme.
system_class=OTHER 52 % beim Gemini-Fallback
Warum & Gegenmaßnahmen›
Wird das Gateway gedrosselt und übernimmt Gemini-2.5-flash, verschlechtert sich die system_class-Klassifikation bei den ersten 21 Publikationen aus batch5 von ~14 % OTHER (Haiku) auf ~52 % OTHER. Mehrere Publikationen mit „microbial fuel cell“ im Titel landen in OTHER.
Quelle
docs/extraction/provider-fallback-2026-05-09.mdGegenmaßnahme
Gegenmaßnahmen in Prüfung: Aufzählung direkt im Prompt, eine einfache Tier-1-Regex als Vergleichsbasis, ein Versuch mit gemini-2.5-pro. Das Feld paper_class IST unter Gemini verlässlich.
Bayessche Holdout-Validierung: nur MFC + MEC
Warum & Gegenmaßnahmen›
Die OOS-Abdeckung von 97,98 % umfasst 7 Strata aus MFC + MEC. Die analytischen Vorhersagemodelle für MDC, MES, MNRC, MMRC und MBES kamen am 15.05.2026 hinzu, sind aber nicht an zurückgehaltenen Publikationskohorten validiert.
Quelle
libs/shared/electrochemistry/src/predictors/{mdc,mes,mnrc,mmrc,mbes}.ts + holdout-coverage-2026-05-21.jsonGegenmaßnahme
Der Aufbau einer Holdout-Kohorte über mehrere Klassen ist das nächste geplante Arbeitspaket der Validierung.
1.400+ BioC-PMC-XML-Dateien ungenutzt
Warum & Gegenmaßnahmen›
paperscraper hat neben den PDFs 1.400+ BioC-PMC-XML-Dateien gesammelt. Weder der v1- noch der v2-Extraktor verarbeitet heute XML – dabei ist das Volltext in Ground-Truth-Qualität, der v2 genauer versorgen würde als PDF + Nougat.
Quelle
CLAUDE.local.md → "Known gaps" → "BioC-PMC XML extraction path"Gegenmaßnahme
Entweder einen XML-fähigen Extraktor schreiben oder XML mit einem anderen System-Prompt an v2 übergeben – abgeschätzt, aber nicht eingeplant.
Mechanistische BVM-Kinetik: durch die Datenlage begrenzt, noch nicht identifizierbar
Warum & Gegenmaßnahmen›
Seit die Korrektur der Kurvensynchronisierung vom 09.06.2026 liegengebliebene 3-Elektroden-Daten zurückgeholt hat, enthält der Korpus 843 Polarisationspunkte für Halbzellen (vs. SHE) und 19 von 30 Zellen, die für den BVM-Posterior (A-posteriori-Verteilung) bereit sind (zuvor 0 und 13). Das bleibt aber hinter dem Ziel von 30 Zellen zurück, und echte Daten aus Potenzialscans sind dünn (≈3 CV-Kurven), sodass der Butler-Volmer-Durchtrittsfaktor α unterbestimmt bleibt. Wir treffen derzeit KEINE mechanistischen BVM-Vorhersageaussagen.
Quelle
scripts/audits/bvm-identifiability-audit.ts + scripts/extraction/sync-curves-to-polarization-points.ts (2026-06-09)Gegenmaßnahme
Stattdessen zeigen wir die validierte Treffsicherheit bei der RICHTUNG innerhalb eines Designs (Leistung↔Substrat 63 %, Leistung↔pH 62 %, Strom↔externer Widerstand 71–78 %); um die verbleibende Lücke bei α zu schließen, braucht es neue Publikationen mit 3-Elektroden-Messungen / Cyclovoltammetrie + Laborpartnerschaften.
Die Unsicherheitsquantifizierung (UQ) je Klasse in /api/ml/predict ist ein heuristisches Band
Warum & Gegenmaßnahmen›
Das Routing je Klasse IST live: /api/ml/predict leitet MEC/MES/MDC/MNRC/MMRC/MBES an eigene analytische Vorhersagemodelle weiter (runFullPrediction → predictBaseForSystemClass), MFC läuft über den auf Daten abgestimmten empirischen Pfad. Die verbleibende Lücke ist die Unsicherheit: Diese analytischen Vorhersagemodelle geben ein pauschales heuristisches ±25-%-Band aus (uncertaintyBasis="heuristic_fixed_fraction"), KEINE physikalisch propagierte oder kalibrierte UQ, und MES/MNRC/MMRC/MBES greifen bei der physikalischen Anreicherung weiterhin auf ein MFC-Surrogat zurück.
Quelle
libs/shared/ml/src/run-full-prediction.ts + libs/shared/ml/src/predictions/per-class-base.tsGegenmaßnahme
Posterior-UQ je Parameter (WS-D) und physikalische Anreicherung je Klasse für MES/MNRC/MMRC/MBES sind erfasste Folgeaufgaben; die Intervallbeschriftung weist schon heute aus, ob ein Band heuristisch oder kalibriert ist.
Symbolische Regression: 2 von 5 Anpassungen erfolgreich
Warum & Gegenmaßnahmen›
Der PySR-Lauf vom 10.05.2026 versuchte 5 mechanistische Anpassungen; 2 gelangen (powerDensity↔currentDensity, coulombic_efficiency↔cod_removal); 3 wurden wegen insufficient_data übersprungen (internalResistance, specific_h2_production, P aus Strom + R).
Quelle
apps/web/public/data/computed/research/symbolic-regression-laws.jsonGegenmaßnahme
PySR erneut ausführen, sobald Nachextraktionen das n je Paar über die Schwelle ausreichender Daten heben (derzeit liegen viele Paare bei n < 5).