Gebäudelog

Evaluationsmodus

AP-B1/B2: Precision / Recall / F1 der KI-Extraktion auf Testdokumenten + reale Korrekturquoten

Phase 2 – In Vorbereitung

Der Evaluationsmodus wird in Phase 2 vollständig implementiert. Er umfasst:

  • 10 Testdokumente (3 Rechnungen, 3 Wartungsprotokolle, 2 Bescheide, 2 Sprachmemos)
  • Ground-Truth-Vergleich mit Precision/Recall/F1 je Zielfeld je Dokumenttyp
  • Konfidenz-Kalibrierung in 3 Buckets (0–0.33, 0.33–0.67, 0.67–1.0)
  • Reale Korrekturquoten aus den Review-Logs (Säule A + B Schnittstelle)

Testdokument-Evaluation (Mock)

FeldPrecisionRecallF1
datum0.880.920.90
leistungstyp0.820.850.83
gewerk0.760.790.77
kostenbetrag_eur0.910.880.89
betroffenes_bauteil0.710.680.69
material0.640.610.63

Mock-Werte · Echte Evaluation in Phase 2

Konfidenz-Kalibrierung (Mock)

Konfidenz-BucketØ KonfidenzTrefferquote
0.0 – 0.330.180.21
0.33 – 0.670.550.58
0.67 – 1.000.840.87

Gut kalibriert wenn Ø-Konfidenz ≈ Trefferquote · Mock-Werte