Tuning: Prompt-Budget + cross_ref-Erweiterung heilt Fehlverweigerungen (D11)

- Ursache der 4 Fehlverweigerungen nach KV/RIS-Erweiterung: lange
  KV-Chunks ueberlieferten num_ctx=16384 (bis 62,7 KB Prompt) — Ollama
  trunciert den Systemprompt vorn, das Modell verliert die Zitierregeln
  ('Block-N'-Zitate statt IDs -> Regenerierung -> Verweigerung).
- Fix: num_ctx 32768; trim_results (max_context_chars=90.000, niedrig
  gerankte Bloecke ganz weglassen statt truncieren, Mindestbestand 6);
  cross_ref_expand 3 -> 6 (Top-3 sind oft Branchen-KV-Bloecke mit leeren
  cross_refs - kuratierte Nachbarn kamen sonst nie nach).
- Eval: alle 4 Faelle geheilt, 10/10 Bestaetigungslaeufe OK.
  Retrieval Recall@8 0,851 -> 0,946 (cross_ref-Extras bringen
  Expected-IDs nach). Antworten: Zitier-Praezision 97,6 %, Verweigerung
  97,6 % (>94,3 %-Gate), erwartete Quelle 83,8 -> 91,9 %, Latenz mean 33 s.
- Tests 49 -> 50 (trim_results); Reports lokal (data/eval-*).
This commit is contained in:
2026-09-15 08:31:02 +02:00
parent a8234771cb
commit c594c553b5
6 changed files with 105 additions and 17 deletions
+8
View File
@@ -290,4 +290,12 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
Antwortmodus: Zitier-Präzision 95,2 %, Verweigerung 90,5 % —
Fehlverweigerungs-Tuning (offen, laufender Arbeitsstand) fortsetzen.
Intake: `tools/ingest_sources.py`, Registry: `tools/build_registry.py`.
- **Tuning abgeschlossen (2026-09-15, D11):** Ursache der Fehlverweige-
rungen war Prompt-Overflow (lange KV-Chunks > 16k — Systemprompt
trunciert weg). Fix: num_ctx 32 768, max_context_chars=90 000
(`trim_results`), cross_ref_expand 6 → alle 4 Fälle geheilt (10/10
Bestätigungsläufe). Retrieval Recall@8 0,946 · Antworten: Zitier-
Präzision 97,6 %, Verweigerung 97,6 % (Gate ✓), erwartete Quelle
91,9 %, Latenz mean 33 s. Offen: q-015 Branchen-Noise, q-024
transiente Flakiness (leerer Draft).
- Betrieb: `agent/README.md`.