Stufe 1: komplexe Fragen via Query-Planer, Per-Query-Slots, Scope-Filter (D12, M6)
- Query-Planer (agent/query_planner.py): Heuristik-Gate (Jahr, Vergleichs-/ Aggregationsmarker, Laenge) entscheidet ueber einen kleinen LLM-Call, der komplexe Fragen in 1-3 Sub-Queries zerlegt (JSON, temp 0; Fehler -> Original als Einzel-Query). Je Sub-Query optional stand_year und scope. - Multi-Query-Retrieval: je Sub-Query BM25+Dense mit RRF-Summe; Per-Query-Slots (2 je Sub-Query) sichern jeden Frageaspekt im Kontext (sonst dominieren Eintraege, die in mehreren Sub-Queries mittelgut matchen — q-113-Befund). Scope-Filter: 'gesetz' (nur Lexis/WIKU/RIS) und 'kv' (nur Branchen-KV) mit Fallback auf unscoped bei leerem Ergebnis. Temporal-Intent: stand_year + temporal_boost (default 0, FTS-jahr-Tag-Signal reichte). - Grounding unveraendert: eine Retrieved-Menge (Union), eine Antwort, Post-Validierung ueber die Union, Verweigerungspflicht unveraendert. - Goldset 42 -> 46: q-110 (Temporal 2023; 2024er-Lohnordnung existiert im Korpus nicht - Mantelvertrag ohne Lohntabelle, korrekt verweigert), q-111 (2025), q-112 (Abfertigung-Vergleich), q-113 (Gesetz+KV). - Eval (46 Fragen): Zitier-Praezision 97,8 %, Verweigerung 97,8 % (Gate >94,3 % erfuellt), erwartete Quelle 90,2 %, Latenz mean 33,5 s. - Tests 50 -> 57. Reports lokal: data/eval-qwen38-stage1*.json. API-first festgehalten (D13-Vorbereitung): Odoo bleibt duenner Client; Lohndaten-Zugriff in M4 erfordert Privacy-Neubewertung.
This commit is contained in:
@@ -298,4 +298,12 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
|
||||
Präzision 97,6 %, Verweigerung 97,6 % (Gate ✓), erwartete Quelle
|
||||
91,9 %, Latenz mean 33 s. Offen: q-015 Branchen-Noise, q-024
|
||||
transiente Flakiness (leerer Draft).
|
||||
- **Komplexe-Fragen Stufe 1 (2026-09-15, M6/D12):** Query-Planer
|
||||
(Heuristik-Gate → 1-3 Sub-Queries mit Stand-Jahr und Scope), Multi-
|
||||
Query-Retrieval mit Per-Query-Slots und Scope-Filtern („gesetz“/„kv“).
|
||||
Eval (46 Fragen): Zitier-Präzision 97,8 %, Verweigerung 97,8 %
|
||||
(Gate ✓), erwartete Quelle 90,2 %, Latenz mean 33,5 s. Goldset 42 →
|
||||
46 Fragen (q-110–113). Offen für Stufe 2: Aggregation → Map-Reduce
|
||||
(q-029), Rückfragen statt Verweigerung (API-first), danach
|
||||
Rechtsprechung-Intake (`rj-*`, Lexis-md/json).
|
||||
- Betrieb: `agent/README.md`.
|
||||
|
||||
Reference in New Issue
Block a user