bes-benchmark-v1 · Vorhersagefehler auf dem Holdout-Set · gemessen am 2026-09-02
MESSAI · lokaler Korpus, nur lesend
bes-benchmark-v1
Das erste publikationsdisjunkte, auf Datenlecks geprüfte Holdout-Set für die Leistungsvorhersage bioelektrochemischer Systeme – und was jedes Vorhersagemodell von MESSAI darauf erreicht.
Die Zahl, die MESSAI seit Mai zitiert – 372 Holdout-Vorhersagen, ECE 1,96 % –, passt zu keinem Artefakt. Was tatsächlich existiert, ist schwächer, als es aussieht.
| Artefakt | Was es aussagt | Was es tatsächlich ist |
|---|---|---|
| calibration.json (live, 2026-07-22) | 517 Zeilen · 95,9 % Abdeckung · ECE 0,036 | Zufälliger 80/20-Split auf Zeilenebene eines RandomForest mit 7 Merkmalen. Publikationen liegen zugleich in Training und Test. Sein eigenes Test-R² für die Leistungsdichte beträgt −3,7 × 10⁶. σ wird aus denselben Holdout-Residuen neu geschätzt und dann über Volt, Ohm und W/m² gepoolt – die Abdeckung ist damit nahezu tautologisch. |
| „372 Holdout-Vorhersagen, ECE 1,96 %“ | auf 6 Oberflächen zitiert | Keine solche Datei. Die Lab-App hat beim Build einen dritten Stand (377 Zeilen) gebündelt, sodass Lab und Web für dasselbe Konzept unterschiedliche Zahlen zeigten. |
| Split nach fit_validation_role | 97,98 % OOS-Abdeckung · 940 Beob. | Nicht austauschbar. Ein Klassifikator, der nur Design-Kovariaten nutzt, unterscheidet gespeicherte Fit-Publikationen von Validierungspublikationen mit einer AUC von 0,77–0,92 (Permutations-Nullwert ≈ 0,50). Jede Abdeckungs-, Conformal- und PSIS-LOO-Zahl aus dem Mai wurde darauf berechnet. |
| Ausgeliefertes 95-%-Intervall auf /api/ml/predict | „kalibriert“ | Ein fest codiertes ±25-%-Band, multipliziert mit einem Conformal-q̂, das an die Residuen eines anderen Modells angepasst wurde. Die Warnung vor Versionsdrift wird bei 100 % der Antworten ausgelöst – zu Recht. |
Drei Splits, die die Prüfung bestehen
Vier Zielgrößen aus dem modellierbaren Korpus, gefiltert in einer protokollierten Reihenfolge. Zwei Filter leisteten die meiste Arbeit: 1.128 Zeilen waren Werte, die eine Publikation aus einer anderen Publikation zitierte, und 1.372 waren exakte Duplikate.
| Split | Leistung | Strom | CE | CSB |
|---|---|---|---|---|
| gespeicherte fit_validation_role | 0,899 | 0,920 | 0,770 | 0,845 |
| Hash-Split | 0,519 | 0,470 | 0,464 | 0,531 |
| gruppiert 5-fach | 0,600 | 0,618 | 0,412 | 0,602 |
| zeitlich ≥ 2024 | 0,429 | 0,524 | 0,580 | 0,491 |
| Zielgröße | Transformation | Zeilen | Publikationen | SD innerhalb der Publikation | SD zwischen Publikationen |
|---|---|---|---|---|---|
| power_density_areal | log10 W/m² | 1.037 | 305 | 0,61 dex | 1,10 dex |
| current_density_areal | log10 A/m² | 911 | 242 | 0,61 dex | 1,16 dex |
| coulombic_efficiency | logit | 600 | 190 | 0,96 | 2,04 |
| cod_removal | logit | 1.045 | 291 | 0,86 | 1,35 |
Die Streuung zwischen Publikationen ist etwa doppelt so groß wie innerhalb einer Publikation. Es gibt publikationsübergreifende Varianz, die ein Kovariatenmodell erklären könnte. Der nächste Abschnitt zeigt: Keines tut es.
Medianer absoluter Holdout-Fehler, gruppiert 5-fach Out-of-Fold, mit 95-%-Konfidenzintervallen aus einem nach Publikationen gruppierten Bootstrap. Die grüne Zeile ist die Messlatte: der Median der Trainingspublikationen derselben Systemklasse und Anwendungsdomäne. B3 ist das ausgelieferte physikalische Vorhersagemodell, bewertet nur dort, wo es vorhersagen kann.
| Modell | Median | 95-%-Intervall |
|---|---|---|
| B0 · globaler Median | 0,800 | [0,679; 0,948] |
| B1 · Median je Klasse × Domäne (die Messlatte) | 0,795 | [0,645; 0,952] |
| B2 · ausgelieferte Priors v2 | 0,831 | [0,710; 0,968] |
| M1 · LightGBM, 35 Design-Kovariaten | 0,812 | [0,721; 0,940] |
| M2 · Klassenmedian + Residuen-GBM | 0,813 | [0,704; 0,940] |
| M4 · RidgeCV, One-Hot + imputiert | 0,942 | [0,797; 1,093] |
| B3 · ausgeliefertes Physikmodell, nur wo es vorhersagen kann | 0,462 | [0,351; 1,659] · n=15/1.037 |
| Modell | Median | 95-%-Intervall |
|---|---|---|
| B0 · globaler Median | 0,885 | [0,741; 1,016] |
| B1 · Median je Klasse × Domäne (die Messlatte) | 0,784 | [0,666; 0,941] |
| B2 · ausgelieferte Priors v2 | 0,719 | [0,644; 0,839] |
| M1 · LightGBM, 35 Design-Kovariaten | 0,895 | [0,755; 1,025] |
| M2 · Klassenmedian + Residuen-GBM | 0,824 | [0,669; 1,022] |
| M4 · RidgeCV, One-Hot + imputiert | 1,140 | [0,962; 1,359] |
| B3 · ausgeliefertes Physikmodell, nur wo es vorhersagen kann | keine Zeile bewertbar |
| Modell | Median | 95-%-Intervall |
|---|---|---|
| B0 · globaler Median | 1,474 | [1,299; 1,683] |
| B1 · Median je Klasse × Domäne (die Messlatte) | 1,194 | [1,003; 1,374] |
| B2 · ausgelieferte Priors v2 | 1,199 | [1,020; 1,373] |
| M1 · LightGBM, 35 Design-Kovariaten | 1,173 | [1,019; 1,331] |
| M2 · Klassenmedian + Residuen-GBM | 1,096 | [0,968; 1,320] |
| M4 · RidgeCV, One-Hot + imputiert | 1,317 | [1,190; 1,485] |
| B3 · ausgeliefertes Physikmodell, nur wo es vorhersagen kann | 1,953 | [1,074; 3,189] · n=22/600 |
| Modell | Median | 95-%-Intervall |
|---|---|---|
| B0 · globaler Median | 0,936 | [0,849; 1,053] |
| B1 · Median je Klasse × Domäne (die Messlatte) | 1,056 | [0,939; 1,153] |
| B2 · ausgelieferte Priors v2 | 0,989 | [0,863; 1,085] |
| M1 · LightGBM, 35 Design-Kovariaten | 0,992 | [0,844; 1,128] |
| M2 · Klassenmedian + Residuen-GBM | 1,013 | [0,882; 1,170] |
| M4 · RidgeCV, One-Hot + imputiert | 1,078 | [0,951; 1,200] |
| B3 · ausgeliefertes Physikmodell, nur wo es vorhersagen kann | 1,306 | [0,721; 1,908] · n=58/1.045 |
| Hürde · ≥ 10 % weniger RMSE als B1, Konfidenzintervalle disjunkt, auf beiden publikationsdisjunkten Splits, richtungskorrekt ab 2024 | Leistung | Strom | CE | CSB |
|---|---|---|---|---|
| M1 · LightGBM, 35 Design-Kovariaten | verfehlt −3,2 % | verfehlt −1,5 % | verfehlt −4,0 % | verfehlt +1,5 % |
| M2 · Klassenmedian + Residuen-GBM | verfehlt −6,0 % | verfehlt −4,0 % | verfehlt −2,8 % | verfehlt −0,9 % |
| M4 · RidgeCV, One-Hot + imputiert | verfehlt −21 % | verfehlt −33 % | verfehlt −24 % | verfehlt −8 % |
| Gleiche Hürde, ein Spitzenwert pro Publikation | verfehlt | verfehlt | verfehlt | verfehlt |
Die Merkmale mit dem größten GBM-Gain sind Substratkonzentration, Erscheinungsjahr, Reaktorvolumen und Elektrodenfläche mit je 9–18 %. Kein physikalischer Treiber dominiert, und die Kovariaten, die der Korpus für diese Zeilen enthält, sind dünn: Temperatur 49 %, pH-Wert 44 %, Anodenmaterial 74 %, HRT 6 %, Inokulum 0 %.
| Band | Leistung | Strom | CE | CSB |
|---|---|---|---|---|
| B2 · ausgelieferte Priors v2 | 0,89 | 0,90 | 0,92 | 0,82 |
| B1 · Residuenband | 0,88 | 0,85 | 0,87 | 0,86 |
| M3 · Conformal-Quantilregression | 0,91 | 0,92 | 0,90 | 0,87 |
| ausgeliefertes ±25-%-Band | 0,00 | — | 0,00 | 0,19 |
| Band | Leistung | Strom | CE | CSB |
|---|---|---|---|---|
| B2 · ausgelieferte Priors v2 | 4,1 | 4,2 | 6,6 | 5,8 |
| B1 · Residuenband | 4,0 | 3,8 | 5,9 | 4,5 |
| M3 · Conformal-Quantilregression | 4,4 | 4,6 | 6,5 | 4,8 |
| ausgeliefertes ±25-%-Band | 0,2 | — | 0,7 | 0,7 |
Publizierte R²-Werte von 0,95 bis 0,997 für die Leistungsdichte von MFC stammen aus zufälligen Splits eines einzigen Datensatzes innerhalb eines Labors. Das ist genau das Artefakt, das diese Plattform bereits in ihren eigenen Trainern diagnostiziert hat: Trainings-R² 1,000, Out-of-Fold unter null. Auf einem publikationsdisjunkten Benchmark ist die Zahl des Fachgebiets – hier erstmals gemessen – ein typischer Fehler von ×6 und R² ≈ 0 für jedes Kovariatenmodell.
Die Genauigkeit bewegt sich nicht mit einem weiteren Modell. Sie bewegt sich, wenn für genug Publikationen vollständige Tupel aus Design → Bedingungen → Ergebnis vorliegen – das ist eine gezielte Neuextraktion, kein Fit.
- Das MFC-Intervall neu verdrahten: das prädiktive Band der Priors ausliefern statt σ = 25 % des Punktwerts, und insufficient_inputs zurückgeben statt der Heuristik aus 46 Publikationen, wenn Design-Kovariaten fehlen.
- run_benchmark_v1 erneut ausführen; das ausgelieferte Band sollte dann ~90 % statt 0 % abdecken.
- Die vier Experten-Datensätze mit dem Tag holdout_set als externen Test bewerten.
- Eine gezielte Neuextraktion vollständiger Tupel an 20 Publikationen im Smoke-Test prüfen, bevor Geld in den ganzen Korpus fließt.
Der Arbeitsstrang Modellqualität der Roadmap misst sich an dieser Tabelle. Ein Modell erhält nur dann eine Zeile, wenn es die Hürde oben auf bes-benchmark-v1 nimmt; bis dahin ist die Baseline die Ergebnistafel. Medianer absoluter Fehler, gruppiert 5-fach Out-of-Fold.
| Modell | Metrik | Holdout-Score | Datum |
|---|---|---|---|
| Prior-Mittelwert (Baseline) · B1 Median je Klasse × Domäne | Median |Fehler| · power_density_areal | 0,795 dex (≈ ×6,2) · Konfidenzintervall [0,645; 0,952] | 2026-09-02 |
| Noch kein Modell bewertet – B2-M1 (fällig am 10. Okt. 2026) | ≥ 10 % weniger RMSE als B1 | — | — |
- M1, M2 und M4 verfehlen die Hürde bei allen vier Zielgrößen (RMSE-Änderung gegenüber B1 von −33 % bis +1,5 %); sie werden nicht als bewertete Modelle geführt.
- B3, das ausgelieferte physikalische Vorhersagemodell, liefert Werte für 118 von 3.593 Zeilen und bleibt ausgeschlossen, bis es ohne erfundene Eingaben vorhersagen kann.
- Die Werte hier sind die Zahlen des Artefakts vom 2026-09-02; führen Sie run_benchmark_v1 erneut aus, bevor Sie eine Zeile hinzufügen.