← Alle Präsentationen

bes-benchmark-v1 · Vorhersagefehler auf dem Holdout-Set · gemessen am 2026-09-02

MESSAI · lokaler Korpus, nur lesend

bes-benchmark-v1

Das erste publikationsdisjunkte, auf Datenlecks geprüfte Holdout-Set für die Leistungsvorhersage bioelektrochemischer Systeme – und was jedes Vorhersagemodell von MESSAI darauf erreicht.

3.593 Zeilen · 590 Publikationen · 4 ZielgrößenBranch feat/bes-benchmark-v1
×6
typischer Holdout-Fehler bei der Leistungsdichte – für jedes Modell und jede Baseline gleichermaßen
0,80 dex
0 von 4
Zielgrößen, bei denen irgendein Modell die Hürde von ≥ 10 % RMSE-Reduktion gegenüber dem Klassenmedian nimmt
M1 · M2 · M4
96,7 %
der Benchmark-Zeilen kann das ausgelieferte physikalische Vorhersagemodell nicht bewerten – es braucht eine HRT, die die Publikation nie berichtet hat
3.463 von 3.593 Zeilen
590
Publikationen, drei Splits, die die adversariale Prüfung bestehen
Hash · gruppiert 5-fach · zeitlich

Die Zahl, die MESSAI seit Mai zitiert – 372 Holdout-Vorhersagen, ECE 1,96 % –, passt zu keinem Artefakt. Was tatsächlich existiert, ist schwächer, als es aussieht.

ArtefaktWas es aussagtWas es tatsächlich ist
calibration.json (live, 2026-07-22)517 Zeilen · 95,9 % Abdeckung · ECE 0,036Zufälliger 80/20-Split auf Zeilenebene eines RandomForest mit 7 Merkmalen. Publikationen liegen zugleich in Training und Test. Sein eigenes Test-R² für die Leistungsdichte beträgt −3,7 × 10⁶. σ wird aus denselben Holdout-Residuen neu geschätzt und dann über Volt, Ohm und W/m² gepoolt – die Abdeckung ist damit nahezu tautologisch.
„372 Holdout-Vorhersagen, ECE 1,96 %“auf 6 Oberflächen zitiertKeine solche Datei. Die Lab-App hat beim Build einen dritten Stand (377 Zeilen) gebündelt, sodass Lab und Web für dasselbe Konzept unterschiedliche Zahlen zeigten.
Split nach fit_validation_role97,98 % OOS-Abdeckung · 940 Beob.Nicht austauschbar. Ein Klassifikator, der nur Design-Kovariaten nutzt, unterscheidet gespeicherte Fit-Publikationen von Validierungspublikationen mit einer AUC von 0,77–0,92 (Permutations-Nullwert ≈ 0,50). Jede Abdeckungs-, Conformal- und PSIS-LOO-Zahl aus dem Mai wurde darauf berechnet.
Ausgeliefertes 95-%-Intervall auf /api/ml/predict„kalibriert“Ein fest codiertes ±25-%-Band, multipliziert mit einem Conformal-q̂, das an die Residuen eines anderen Modells angepasst wurde. Die Warnung vor Versionsdrift wird bei 100 % der Antworten ausgelöst – zu Recht.

Drei Splits, die die Prüfung bestehen

Vier Zielgrößen aus dem modellierbaren Korpus, gefiltert in einer protokollierten Reihenfolge. Zwei Filter leisteten die meiste Arbeit: 1.128 Zeilen waren Werte, die eine Publikation aus einer anderen Publikation zitierte, und 1.372 waren exakte Duplikate.

Filtertrichter
verbleibende Zeilen
alle modellierbaren Zeilen
7.336
Stand v2 / kuratiert
6.884
Verifier nicht fehlgeschlagen
6.466
nicht aus anderer Publikation zitiert
5.338
keine Physik-/Dedupe-Flags
5.281
BES, kein Review
5.023
physikalische Grenzen
4.965
exakte Duplikate entfernt
3.593
Nur Extraktor-Stand v2 oder kuratierte Tupel; Verifier nicht fehlgeschlagen; nicht aus einer anderen Publikation zitiert; keine Physik- oder Deduplizierungs-Flags; kein Review und keine Nicht-BES-Publikation; innerhalb physikalischer Grenzen; exakte Duplikate entfernt.
Split-Prüfung – adversariale AUC
Publikationsebene · 0,5 = austauschbar
SplitLeistungStromCECSB
gespeicherte fit_validation_role0,8990,9200,7700,845
Hash-Split0,5190,4700,4640,531
gruppiert 5-fach0,6000,6180,4120,602
zeitlich ≥ 20240,4290,5240,5800,491
Ein LightGBM-Klassifikator auf Design-Kovariaten, ein Vektor pro Publikation, 5-fach. Oberhalb von 0,65 ist der Split undicht. Der gespeicherte Split ist bei jeder Zielgröße undicht; die Benchmark-Splits liegen auf Zufallsniveau.
ZielgrößeTransformationZeilenPublikationenSD innerhalb der PublikationSD zwischen Publikationen
power_density_areallog10 W/m²1.0373050,61 dex1,10 dex
current_density_areallog10 A/m²9112420,61 dex1,16 dex
coulombic_efficiencylogit6001900,962,04
cod_removallogit1.0452910,861,35

Die Streuung zwischen Publikationen ist etwa doppelt so groß wie innerhalb einer Publikation. Es gibt publikationsübergreifende Varianz, die ein Kovariatenmodell erklären könnte. Der nächste Abschnitt zeigt: Keines tut es.

Medianer absoluter Holdout-Fehler, gruppiert 5-fach Out-of-Fold, mit 95-%-Konfidenzintervallen aus einem nach Publikationen gruppierten Bootstrap. Die grüne Zeile ist die Messlatte: der Median der Trainingspublikationen derselben Systemklasse und Anwendungsdomäne. B3 ist das ausgelieferte physikalische Vorhersagemodell, bewertet nur dort, wo es vorhersagen kann.

power_density_areal
Median |Fehler| · dex
ModellMedian95-%-Intervall
B0 · globaler Median0,800[0,679; 0,948]
B1 · Median je Klasse × Domäne (die Messlatte)0,795[0,645; 0,952]
B2 · ausgelieferte Priors v20,831[0,710; 0,968]
M1 · LightGBM, 35 Design-Kovariaten0,812[0,721; 0,940]
M2 · Klassenmedian + Residuen-GBM0,813[0,704; 0,940]
M4 · RidgeCV, One-Hot + imputiert0,942[0,797; 1,093]
B3 · ausgeliefertes Physikmodell, nur wo es vorhersagen kann0,462[0,351; 1,659] · n=15/1.037
Messlatte: 0,80 dex ≈ ×6,2. Gruppiert 5-fach OOF, Publikations-Bootstrap, 95-%-Intervall.
current_density_areal
Median |Fehler| · dex
ModellMedian95-%-Intervall
B0 · globaler Median0,885[0,741; 1,016]
B1 · Median je Klasse × Domäne (die Messlatte)0,784[0,666; 0,941]
B2 · ausgelieferte Priors v20,719[0,644; 0,839]
M1 · LightGBM, 35 Design-Kovariaten0,895[0,755; 1,025]
M2 · Klassenmedian + Residuen-GBM0,824[0,669; 1,022]
M4 · RidgeCV, One-Hot + imputiert1,140[0,962; 1,359]
B3 · ausgeliefertes Physikmodell, nur wo es vorhersagen kannkeine Zeile bewertbar
Messlatte: 0,78 dex ≈ ×6,1. Gruppiert 5-fach OOF, Publikations-Bootstrap, 95-%-Intervall.
coulombic_efficiency
Median |Fehler| · logit
ModellMedian95-%-Intervall
B0 · globaler Median1,474[1,299; 1,683]
B1 · Median je Klasse × Domäne (die Messlatte)1,194[1,003; 1,374]
B2 · ausgelieferte Priors v21,199[1,020; 1,373]
M1 · LightGBM, 35 Design-Kovariaten1,173[1,019; 1,331]
M2 · Klassenmedian + Residuen-GBM1,096[0,968; 1,320]
M4 · RidgeCV, One-Hot + imputiert1,317[1,190; 1,485]
B3 · ausgeliefertes Physikmodell, nur wo es vorhersagen kann1,953[1,074; 3,189] · n=22/600
Messlatte: 1,19 logit. Gruppiert 5-fach OOF, Publikations-Bootstrap, 95-%-Intervall.
cod_removal
Median |Fehler| · logit
ModellMedian95-%-Intervall
B0 · globaler Median0,936[0,849; 1,053]
B1 · Median je Klasse × Domäne (die Messlatte)1,056[0,939; 1,153]
B2 · ausgelieferte Priors v20,989[0,863; 1,085]
M1 · LightGBM, 35 Design-Kovariaten0,992[0,844; 1,128]
M2 · Klassenmedian + Residuen-GBM1,013[0,882; 1,170]
M4 · RidgeCV, One-Hot + imputiert1,078[0,951; 1,200]
B3 · ausgeliefertes Physikmodell, nur wo es vorhersagen kann1,306[0,721; 1,908] · n=58/1.045
Messlatte: 1,06 logit. Gruppiert 5-fach OOF, Publikations-Bootstrap, 95-%-Intervall.
Hürde · ≥ 10 % weniger RMSE als B1, Konfidenzintervalle disjunkt, auf beiden publikationsdisjunkten Splits, richtungskorrekt ab 2024LeistungStromCECSB
M1 · LightGBM, 35 Design-Kovariatenverfehlt −3,2 %verfehlt −1,5 %verfehlt −4,0 %verfehlt +1,5 %
M2 · Klassenmedian + Residuen-GBMverfehlt −6,0 %verfehlt −4,0 %verfehlt −2,8 %verfehlt −0,9 %
M4 · RidgeCV, One-Hot + imputiertverfehlt −21 %verfehlt −33 %verfehlt −24 %verfehlt −8 %
Gleiche Hürde, ein Spitzenwert pro Publikationverfehltverfehltverfehltverfehlt

Die Merkmale mit dem größten GBM-Gain sind Substratkonzentration, Erscheinungsjahr, Reaktorvolumen und Elektrodenfläche mit je 9–18 %. Kein physikalischer Treiber dominiert, und die Kovariaten, die der Korpus für diese Zeilen enthält, sind dünn: Temperatur 49 %, pH-Wert 44 %, Anodenmaterial 74 %, HRT 6 %, Inokulum 0 %.

Abdeckung der 90-%-Intervalle
Ziel 0,90
BandLeistungStromCECSB
B2 · ausgelieferte Priors v20,890,900,920,82
B1 · Residuenband0,880,850,870,86
M3 · Conformal-Quantilregression0,910,920,900,87
ausgeliefertes ±25-%-Band0,00—0,000,19
Das ausgelieferte ±25-%-Band deckt 0 % der Leistungsdichte-Zeilen und 19 % der CSB-Abbau-Zeilen ab – dort, wo es überhaupt vorhersagt.
Intervallbreite
Dekaden (log10) · Logit-Einheiten für Anteile
BandLeistungStromCECSB
B2 · ausgelieferte Priors v24,14,26,65,8
B1 · Residuenband4,03,85,94,5
M3 · Conformal-Quantilregression4,44,66,54,8
ausgeliefertes ±25-%-Band0,2—0,70,7
Abdeckung wird mit Breite erkauft: Ein Band über 4 Dekaden reicht bei der Leistungsdichte von 0,0001 bis 10 W/m². M3 ist nie schmaler als das Band des Klassenmedians.
Warum predictForSystem die Literatur nicht bewerten konnte
Zeilen · keine erfundenen Eingaben
vorhergesagt
118 · 3,3 %
unzureichende Eingaben
3.463 · 96,4 %
Klasse/Einheit nicht zuordenbar
12 · 0,3 %
Kombinationen fehlender Eingaben, Zeilen (Top 6 von 15)
nur HRT
959
alle vier
482
pH + HRT
453
Temperatur + HRT
412
Temperatur + pH + HRT
344
HRT + CSB
247
Das Vorhersagemodell benötigt Temperatur, pH-Wert, HRT und CSB. Bei 959 Zeilen fehlt allein die HRT; Batch-Reaktoren haben keine. Das alte Skill-Harness füllte die Lücken mit 30 °C, pH 7, 12 h und 1000 mg/L. Dieser Export tut das nicht.

Publizierte R²-Werte von 0,95 bis 0,997 für die Leistungsdichte von MFC stammen aus zufälligen Splits eines einzigen Datensatzes innerhalb eines Labors. Das ist genau das Artefakt, das diese Plattform bereits in ihren eigenen Trainern diagnostiziert hat: Trainings-R² 1,000, Out-of-Fold unter null. Auf einem publikationsdisjunkten Benchmark ist die Zahl des Fachgebiets – hier erstmals gemessen – ein typischer Fehler von ×6 und R² ≈ 0 für jedes Kovariatenmodell.

Die Genauigkeit bewegt sich nicht mit einem weiteren Modell. Sie bewegt sich, wenn für genug Publikationen vollständige Tupel aus Design → Bedingungen → Ergebnis vorliegen – das ist eine gezielte Neuextraktion, kein Fit.

Als Nächstes
  1. Das MFC-Intervall neu verdrahten: das prädiktive Band der Priors ausliefern statt σ = 25 % des Punktwerts, und insufficient_inputs zurückgeben statt der Heuristik aus 46 Publikationen, wenn Design-Kovariaten fehlen.
  2. run_benchmark_v1 erneut ausführen; das ausgelieferte Band sollte dann ~90 % statt 0 % abdecken.
  3. Die vier Experten-Datensätze mit dem Tag holdout_set als externen Test bewerten.
  4. Eine gezielte Neuextraktion vollständiger Tupel an 20 Publikationen im Smoke-Test prüfen, bevor Geld in den ganzen Korpus fließt.

Der Arbeitsstrang Modellqualität der Roadmap misst sich an dieser Tabelle. Ein Modell erhält nur dann eine Zeile, wenn es die Hürde oben auf bes-benchmark-v1 nimmt; bis dahin ist die Baseline die Ergebnistafel. Medianer absoluter Fehler, gruppiert 5-fach Out-of-Fold.

ModellMetrikHoldout-ScoreDatum
Prior-Mittelwert (Baseline) · B1 Median je Klasse × DomäneMedian |Fehler| · power_density_areal0,795 dex (≈ ×6,2) · Konfidenzintervall [0,645; 0,952]2026-09-02
Noch kein Modell bewertet – B2-M1 (fällig am 10. Okt. 2026)≥ 10 % weniger RMSE als B1——
Was wir nicht behaupten
  • M1, M2 und M4 verfehlen die Hürde bei allen vier Zielgrößen (RMSE-Änderung gegenüber B1 von −33 % bis +1,5 %); sie werden nicht als bewertete Modelle geführt.
  • B3, das ausgelieferte physikalische Vorhersagemodell, liefert Werte für 118 von 3.593 Zeilen und bleibt ausgeschlossen, bis es ohne erfundene Eingaben vorhersagen kann.
  • Die Werte hier sind die Zahlen des Artefakts vom 2026-09-02; führen Sie run_benchmark_v1 erneut aus, bevor Sie eine Zeile hinzufügen.
Quellen: Artefakt bes-benchmark-v1 (gemessen am 2026-09-02, lokaler Korpus, nur lesend) · Branch feat/bes-benchmark-v1 · services/ml-engine/training/benchmark/ · Übergabe docs/handoffs/2026-09-02-bes-benchmark-v1.md · 34 Offline-Tests · Datenleck-Prüfung in manifest.json · calibration.json, Stand 2026-07-22.