fix(agent): stabilize decision support grounding

This commit is contained in:
2026-09-16 12:15:42 +02:00
parent 50ba153904
commit 509b2f7544
4 changed files with 99 additions and 10 deletions
+34 -7
View File
@@ -5,11 +5,10 @@ Rollender Übergabe-Log für agent-Threads. Workflow: `.agents/SKILL.md`
## Current focus
Retrieval-/Antwort-Tuning für komplexe Gestaltungsfragen läuft (D16).
Goldset q-124126 und deterministischer Decision-Support-Pfad sind umgesetzt;
offen ist der vollständige 53-Fragen-Antwortmodus-Eval. Danach folgen die
bewusste Publikations-/Lizenzfreigabe der quellentreuen Rechtsprechungs-
Volltexte und M4 (API-first Odoo-Integration inkl. separat zu planender
Decision-Support-Tuning (D16) ist stabilisiert und im 53-Fragen-
Bestätigungslauf zitierseitig validiert. Verbleibend ist die bekannte
stochastische Survey-Fehlverweigerung q-029; danach folgen Rechtsprechungs-
Publikations-/Lizenzfreigabe und M4 (API-first Odoo-Integration inkl.
Privacy-Grenze für Lohndaten).
## Completed (2026-09-14)
@@ -145,8 +144,36 @@ Privacy-Grenze für Lohndaten).
erzwingt ein semantischer Post-Validation-Gate ⚠ + beide IDs + korrekte
Rollen und verhindert interne Regelverweise bzw. Quellenpriorisierung.
Gezielte Real-Läufe: q-124/q-125 nicht verweigert, zitiergültig; q-126 war
bereits sauber. Tests **72 grün**; `git diff --check` sauber. Vollständiger
Antwortmodus-Eval steht noch aus.
bereits sauber. Tests **72 grün**; `git diff --check` sauber.
- **D16 Voll-Eval (2026-09-16):** 53 Fragen mit `qwen3.8:27b`; Report
`data/eval-qwen38-decision-support.json` (lokal/gitignored). Retrieval:
Hit-Rate 0,9583, Recall@8 **0,9271**, MRR 0,6266. Antworten:
Zitier-Präzision **98,11 %**, Verweigerung korrekt **98,11 %**, erwartete
Quelle 91,67 %, mean 40,3 s / p95 98,4 s, 4 Regenerierungen. Einziger
Gate-Fehler: q-125 eskalierte nach zwei semantisch unzureichenden Antworten
zu `UNCERTAIN` (`verified=false`). Direkte Wiederholung von q-125 war mit
einer Regenerierung vollständig, zitiergültig und stellte den Konflikt
korrekt dar — verbleibend ist stochastische Gate-/Regenerierungs-Flakiness,
kein Retrieval-Fehler. q-124 und q-126 bestanden im Voll-Eval.
- **D16 Stabilisierung/Bestätigung (2026-09-16):** Bei vollständig
ausgelassenem, aber retrieved Mitarbeiterprämien-Konflikt ergänzt die
Pipeline deterministisch eine feste, ausschließlich aus `lb-sva-03` und
`wk-akt-04` formulierte ⚠-Notiz. Eigene Konfliktversuche bleiben ungeändert
und werden weiter auf Rollenfehler/Priorisierung geprüft. Der semantische
Gate akzeptiert gleichwertige Verben (`ordnet`, `listet`, `führt`) statt
fragiler exakter Wortwahl. Sonden: q-124 3/3 ohne Regenerierung, q-125 3/3
verifiziert, q-126 verifiziert. Voller Bestätigungslauf (53 Fragen), Report
`data/eval-qwen38-decision-support-confirm.json`: Zitier-Präzision **100 %**,
erwartete Quelle 93,75 %, mean 40,3 s / p95 69,6 s, 3 Regenerierungen;
q-124126 alle bestanden. Verweigerungskorrektheit 98,11 % nur wegen der
bekannten stochastischen Survey-Fehlverweigerung q-029; direkte q-029-
Wiederholung antwortete verifiziert (aber sehr langsam, 280 s).
- **q-015 fachlich rekalibriert:** Eine allgemeine Tagesgeldfrage mischt zwei
Ebenen: Der KV regelt vorrangig den arbeitsrechtlichen Anspruch, das EStG den
steuerfreien Satz. Branchen-KV-Treffer sind deshalb korrekt; q-015 hat keine
künstliche Einzel-Pflicht-ID mehr. Neue q-127 prüft ausdrücklich nur die
steuerliche Höhe und findet `lb-rei-09`. Goldset 54 Fragen; Offline-Retrieval
nun Hit-Rate 0,9792, Recall@8 **0,9479**, MRR 0,6653. Tests **75 grün**.
## Open issues / blockers