fegger
|
062e010d7b
|
Stufe 1: komplexe Fragen via Query-Planer, Per-Query-Slots, Scope-Filter (D12, M6)
- Query-Planer (agent/query_planner.py): Heuristik-Gate (Jahr, Vergleichs-/
Aggregationsmarker, Laenge) entscheidet ueber einen kleinen LLM-Call,
der komplexe Fragen in 1-3 Sub-Queries zerlegt (JSON, temp 0; Fehler ->
Original als Einzel-Query). Je Sub-Query optional stand_year und scope.
- Multi-Query-Retrieval: je Sub-Query BM25+Dense mit RRF-Summe;
Per-Query-Slots (2 je Sub-Query) sichern jeden Frageaspekt im Kontext
(sonst dominieren Eintraege, die in mehreren Sub-Queries mittelgut
matchen — q-113-Befund). Scope-Filter: 'gesetz' (nur Lexis/WIKU/RIS)
und 'kv' (nur Branchen-KV) mit Fallback auf unscoped bei leerem
Ergebnis. Temporal-Intent: stand_year + temporal_boost (default 0,
FTS-jahr-Tag-Signal reichte).
- Grounding unveraendert: eine Retrieved-Menge (Union), eine Antwort,
Post-Validierung ueber die Union, Verweigerungspflicht unveraendert.
- Goldset 42 -> 46: q-110 (Temporal 2023; 2024er-Lohnordnung existiert
im Korpus nicht - Mantelvertrag ohne Lohntabelle, korrekt verweigert),
q-111 (2025), q-112 (Abfertigung-Vergleich), q-113 (Gesetz+KV).
- Eval (46 Fragen): Zitier-Praezision 97,8 %, Verweigerung 97,8 %
(Gate >94,3 % erfuellt), erwartete Quelle 90,2 %, Latenz mean 33,5 s.
- Tests 50 -> 57. Reports lokal: data/eval-qwen38-stage1*.json.
API-first festgehalten (D13-Vorbereitung): Odoo bleibt duenner Client;
Lohndaten-Zugriff in M4 erfordert Privacy-Neubewertung.
|
2026-09-15 09:58:25 +02:00 |
|