mirror of
http://100.103.83.12:3003/fegger/odoo-at-payroll.git
synced 2026-09-17 16:56:42 +00:00
fix(agent): stabilize decision support grounding
This commit is contained in:
@@ -5,11 +5,10 @@ Rollender Übergabe-Log für agent-Threads. Workflow: `.agents/SKILL.md`
|
||||
|
||||
## Current focus
|
||||
|
||||
Retrieval-/Antwort-Tuning für komplexe Gestaltungsfragen läuft (D16).
|
||||
Goldset q-124–126 und deterministischer Decision-Support-Pfad sind umgesetzt;
|
||||
offen ist der vollständige 53-Fragen-Antwortmodus-Eval. Danach folgen die
|
||||
bewusste Publikations-/Lizenzfreigabe der quellentreuen Rechtsprechungs-
|
||||
Volltexte und M4 (API-first Odoo-Integration inkl. separat zu planender
|
||||
Decision-Support-Tuning (D16) ist stabilisiert und im 53-Fragen-
|
||||
Bestätigungslauf zitierseitig validiert. Verbleibend ist die bekannte
|
||||
stochastische Survey-Fehlverweigerung q-029; danach folgen Rechtsprechungs-
|
||||
Publikations-/Lizenzfreigabe und M4 (API-first Odoo-Integration inkl.
|
||||
Privacy-Grenze für Lohndaten).
|
||||
|
||||
## Completed (2026-09-14)
|
||||
@@ -145,8 +144,36 @@ Privacy-Grenze für Lohndaten).
|
||||
erzwingt ein semantischer Post-Validation-Gate ⚠ + beide IDs + korrekte
|
||||
Rollen und verhindert interne Regelverweise bzw. Quellenpriorisierung.
|
||||
Gezielte Real-Läufe: q-124/q-125 nicht verweigert, zitiergültig; q-126 war
|
||||
bereits sauber. Tests **72 grün**; `git diff --check` sauber. Vollständiger
|
||||
Antwortmodus-Eval steht noch aus.
|
||||
bereits sauber. Tests **72 grün**; `git diff --check` sauber.
|
||||
- **D16 Voll-Eval (2026-09-16):** 53 Fragen mit `qwen3.8:27b`; Report
|
||||
`data/eval-qwen38-decision-support.json` (lokal/gitignored). Retrieval:
|
||||
Hit-Rate 0,9583, Recall@8 **0,9271**, MRR 0,6266. Antworten:
|
||||
Zitier-Präzision **98,11 %**, Verweigerung korrekt **98,11 %**, erwartete
|
||||
Quelle 91,67 %, mean 40,3 s / p95 98,4 s, 4 Regenerierungen. Einziger
|
||||
Gate-Fehler: q-125 eskalierte nach zwei semantisch unzureichenden Antworten
|
||||
zu `UNCERTAIN` (`verified=false`). Direkte Wiederholung von q-125 war mit
|
||||
einer Regenerierung vollständig, zitiergültig und stellte den Konflikt
|
||||
korrekt dar — verbleibend ist stochastische Gate-/Regenerierungs-Flakiness,
|
||||
kein Retrieval-Fehler. q-124 und q-126 bestanden im Voll-Eval.
|
||||
- **D16 Stabilisierung/Bestätigung (2026-09-16):** Bei vollständig
|
||||
ausgelassenem, aber retrieved Mitarbeiterprämien-Konflikt ergänzt die
|
||||
Pipeline deterministisch eine feste, ausschließlich aus `lb-sva-03` und
|
||||
`wk-akt-04` formulierte ⚠-Notiz. Eigene Konfliktversuche bleiben ungeändert
|
||||
und werden weiter auf Rollenfehler/Priorisierung geprüft. Der semantische
|
||||
Gate akzeptiert gleichwertige Verben (`ordnet`, `listet`, `führt`) statt
|
||||
fragiler exakter Wortwahl. Sonden: q-124 3/3 ohne Regenerierung, q-125 3/3
|
||||
verifiziert, q-126 verifiziert. Voller Bestätigungslauf (53 Fragen), Report
|
||||
`data/eval-qwen38-decision-support-confirm.json`: Zitier-Präzision **100 %**,
|
||||
erwartete Quelle 93,75 %, mean 40,3 s / p95 69,6 s, 3 Regenerierungen;
|
||||
q-124–126 alle bestanden. Verweigerungskorrektheit 98,11 % nur wegen der
|
||||
bekannten stochastischen Survey-Fehlverweigerung q-029; direkte q-029-
|
||||
Wiederholung antwortete verifiziert (aber sehr langsam, 280 s).
|
||||
- **q-015 fachlich rekalibriert:** Eine allgemeine Tagesgeldfrage mischt zwei
|
||||
Ebenen: Der KV regelt vorrangig den arbeitsrechtlichen Anspruch, das EStG den
|
||||
steuerfreien Satz. Branchen-KV-Treffer sind deshalb korrekt; q-015 hat keine
|
||||
künstliche Einzel-Pflicht-ID mehr. Neue q-127 prüft ausdrücklich nur die
|
||||
steuerliche Höhe und findet `lb-rei-09`. Goldset 54 Fragen; Offline-Retrieval
|
||||
nun Hit-Rate 0,9792, Recall@8 **0,9479**, MRR 0,6653. Tests **75 grün**.
|
||||
|
||||
## Open issues / blockers
|
||||
|
||||
|
||||
Reference in New Issue
Block a user