Stufe 2: Antworttyp-Routing — Survey Map-Reduce + Rueckfrage-Regel (D13, M6)
- Planer liefert jetzt type: survey|specific. Survey-Fragen (Uebersicht ueber viele Dokumente) laufen ueber Map-Reduce: Retrieval auf survey_blocks=16 erweitert, ein Map-Call destilliert JE Block als Stichpunkte mit seiner KB-ID (MAP_SYSTEM_PROMPT), ein Reduce-Call synthetisiert die Endantwort. Grounding unveraendert: Zitier-Validierung strikt ueber die Retrieved-Union; leerer Map-Output -> Fallback auf Einzelantwort. - Systemprompt-Regel 9: haengt die Antwort wesentlich von nicht genanntem Kontext ab (Branche, Bundesland, Zeitraum), belegte allgemeine Aussage plus EINE Rueckfrage statt Verweigerung (API-first; Odoo-Chat kann die Rueckfrage als Follow-up nutzen). - Ergebnis: q-029 (WIKU-Survey, bisher hartnaeckigste Fehlverweigerung) geheilt - Teilantwort mit 5 belegten Heften; q-015 antwortet mit expliziter KV-Abhaengigkeit + Rueckfrage statt Branchen-Noise. - Eval (46 Fragen): Zitier-Praezision 97,8 %, Verweigerung 97,8 % (Gate erfuellt), erwartete Quelle 90,2 %, Latenz mean 34,2 s (Map-Reduce nur bei Survey-Fragen, ~95 s). Report lokal data/eval-qwen38-stage2.json. - Tests 57 -> 59 (Survey-Integration, Typ-Parsing).
This commit is contained in:
@@ -222,6 +222,25 @@ zu planen).
|
||||
q-113 (Gesetz+KV Multi-Source). Tests 50 -> 57.
|
||||
Offen: q-029 Survey (Stufe-2-Hebel: Map-Reduce), q-113 Planer-
|
||||
Scope flaky (1/2 Laeufe ohne gesetz-Marker).
|
||||
- **D13 (Antworttyp-Routing / Stufe 2, 2026-09-15):** (a) Planer liefert
|
||||
jetzt `type: survey|specific`; Survey-Fragen („Welche Neuerungen …“)
|
||||
laufen ueber Map-Reduce: breiteres Retrieval (`survey_blocks`=16,
|
||||
PV_SURVEY_BLOCKS), ein Map-Call destilliert JE Block als Stichpunkte
|
||||
mit seiner KB-ID (MAP_SYSTEM_PROMPT), ein Reduce-Call synthetisiert
|
||||
daraus die Antwort mit dem normalen Grounding-Prompt; Zitier-
|
||||
Validierung weiterhin strikt ueber die Retrieved-Union, leerer
|
||||
Map-Output -> Fallback Einzelantwort. (b) Systemprompt-Regel 9: bei
|
||||
wesentlicher Kontextabhaengigkeit (Branche, Bundesland, Zeitraum)
|
||||
belegte allgemeine Aussage + EINE Rueckfrage statt Verweigerung
|
||||
(API-first; Odoo-Chat kann die Rueckfrage als Follow-up nutzen).
|
||||
Ergebnis: **q-029 geheilt** (vorher jahrelange Fehlverweigerung;
|
||||
jetzt Teilantwort mit 5 belegten Heften, 95 s — Map-Reduce-Latenz
|
||||
nur bei Survey-Fragen), **q-015** antwortet mit expliziter
|
||||
KV-Abhaengigkeit + Rueckfrage statt Branchen-Noise. Eval (46 Fragen):
|
||||
Zitier-Praezision 97,8 %, Verweigerung 97,8 % (Gate erfuellt),
|
||||
erwartete Quelle 90,2 %, Latenz mean 34,2 s. Tests 57 -> 59.
|
||||
Report `data/eval-qwen38-stage2.json`. Verbleibend: q-024 transiente
|
||||
Flakiness (Think-Ghost-Verdacht, 2/3 Laeufe sauber).
|
||||
- **Bake-off-Protokoll** (Skill): Modellwechsel nur über dokumentierten
|
||||
Goldset-Vergleich; Kriterium: Zitier-Präzision > Verweigerungs-
|
||||
korrektheit > Latenz.
|
||||
|
||||
Reference in New Issue
Block a user