Evaluationsmodus
AP-B1/B2: Precision / Recall / F1 der KI-Extraktion auf Testdokumenten + reale Korrekturquoten
Phase 2 – In Vorbereitung
Der Evaluationsmodus wird in Phase 2 vollständig implementiert. Er umfasst:
- 10 Testdokumente (3 Rechnungen, 3 Wartungsprotokolle, 2 Bescheide, 2 Sprachmemos)
- Ground-Truth-Vergleich mit Precision/Recall/F1 je Zielfeld je Dokumenttyp
- Konfidenz-Kalibrierung in 3 Buckets (0–0.33, 0.33–0.67, 0.67–1.0)
- Reale Korrekturquoten aus den Review-Logs (Säule A + B Schnittstelle)
Testdokument-Evaluation (Mock)
| Feld | Precision | Recall | F1 |
|---|---|---|---|
| datum | 0.88 | 0.92 | 0.90 |
| leistungstyp | 0.82 | 0.85 | 0.83 |
| gewerk | 0.76 | 0.79 | 0.77 |
| kostenbetrag_eur | 0.91 | 0.88 | 0.89 |
| betroffenes_bauteil | 0.71 | 0.68 | 0.69 |
| material | 0.64 | 0.61 | 0.63 |
Mock-Werte · Echte Evaluation in Phase 2
Konfidenz-Kalibrierung (Mock)
| Konfidenz-Bucket | Ø Konfidenz | Trefferquote |
|---|---|---|
| 0.0 – 0.33 | 0.18 | 0.21 |
| 0.33 – 0.67 | 0.55 | 0.58 |
| 0.67 – 1.00 | 0.84 | 0.87 |
Gut kalibriert wenn Ø-Konfidenz ≈ Trefferquote · Mock-Werte