Stufe 2: Antworttyp-Routing — Survey Map-Reduce + Rueckfrage-Regel (D13, M6)

- Planer liefert jetzt type: survey|specific. Survey-Fragen (Uebersicht
  ueber viele Dokumente) laufen ueber Map-Reduce: Retrieval auf
  survey_blocks=16 erweitert, ein Map-Call destilliert JE Block als
  Stichpunkte mit seiner KB-ID (MAP_SYSTEM_PROMPT), ein Reduce-Call
  synthetisiert die Endantwort. Grounding unveraendert: Zitier-Validierung
  strikt ueber die Retrieved-Union; leerer Map-Output -> Fallback auf
  Einzelantwort.
- Systemprompt-Regel 9: haengt die Antwort wesentlich von nicht genanntem
  Kontext ab (Branche, Bundesland, Zeitraum), belegte allgemeine Aussage
  plus EINE Rueckfrage statt Verweigerung (API-first; Odoo-Chat kann die
  Rueckfrage als Follow-up nutzen).
- Ergebnis: q-029 (WIKU-Survey, bisher hartnaeckigste Fehlverweigerung)
  geheilt - Teilantwort mit 5 belegten Heften; q-015 antwortet mit
  expliziter KV-Abhaengigkeit + Rueckfrage statt Branchen-Noise.
- Eval (46 Fragen): Zitier-Praezision 97,8 %, Verweigerung 97,8 % (Gate
  erfuellt), erwartete Quelle 90,2 %, Latenz mean 34,2 s (Map-Reduce nur
  bei Survey-Fragen, ~95 s). Report lokal data/eval-qwen38-stage2.json.
- Tests 57 -> 59 (Survey-Integration, Typ-Parsing).
This commit is contained in:
2026-09-15 11:16:53 +02:00
parent 062e010d7b
commit 4a9e06f66e
7 changed files with 163 additions and 32 deletions
+9
View File
@@ -306,4 +306,13 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
46 Fragen (q-110113). Offen für Stufe 2: Aggregation → Map-Reduce
(q-029), Rückfragen statt Verweigerung (API-first), danach
Rechtsprechung-Intake (`rj-*`, Lexis-md/json).
- **Antworttyp-Routing Stufe 2 (2026-09-15, M6/D13):** Planer-Typ
`survey` → Map-Reduce (survey_blocks=16; Map destilliert je Block
mit KB-ID, Reduce synthetisiert; Validierung unverändert über die
Union). Systemprompt-Regel 9: Kontext-Abhängigkeit → belegte allgemeine
Aussage + eine Rückfrage (API-first). q-029 geheilt (vorher hart-
näckigste Fehlverweigerung), q-015 mit KV-Abhängigkeits-Hinweis.
Eval: 97,8 % / 97,8 % / 90,2 %, Latenz mean 34,2 s (Map-Reduce nur
bei Survey-Fragen, ~95 s). Nächster Schritt: Rechtsprechung-Intake
(`rj-*`), dann M4 (Odoo; Privacy-Neubewertung für Lohndaten-Zugriff).
- Betrieb: `agent/README.md`.