Tuning: Prompt-Budget + cross_ref-Erweiterung heilt Fehlverweigerungen (D11)
- Ursache der 4 Fehlverweigerungen nach KV/RIS-Erweiterung: lange
KV-Chunks ueberlieferten num_ctx=16384 (bis 62,7 KB Prompt) — Ollama
trunciert den Systemprompt vorn, das Modell verliert die Zitierregeln
('Block-N'-Zitate statt IDs -> Regenerierung -> Verweigerung).
- Fix: num_ctx 32768; trim_results (max_context_chars=90.000, niedrig
gerankte Bloecke ganz weglassen statt truncieren, Mindestbestand 6);
cross_ref_expand 3 -> 6 (Top-3 sind oft Branchen-KV-Bloecke mit leeren
cross_refs - kuratierte Nachbarn kamen sonst nie nach).
- Eval: alle 4 Faelle geheilt, 10/10 Bestaetigungslaeufe OK.
Retrieval Recall@8 0,851 -> 0,946 (cross_ref-Extras bringen
Expected-IDs nach). Antworten: Zitier-Praezision 97,6 %, Verweigerung
97,6 % (>94,3 %-Gate), erwartete Quelle 83,8 -> 91,9 %, Latenz mean 33 s.
- Tests 49 -> 50 (trim_results); Reports lokal (data/eval-*).
This commit is contained in:
@@ -290,4 +290,12 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
|
||||
Antwortmodus: Zitier-Präzision 95,2 %, Verweigerung 90,5 % —
|
||||
Fehlverweigerungs-Tuning (offen, laufender Arbeitsstand) fortsetzen.
|
||||
Intake: `tools/ingest_sources.py`, Registry: `tools/build_registry.py`.
|
||||
- **Tuning abgeschlossen (2026-09-15, D11):** Ursache der Fehlverweige-
|
||||
rungen war Prompt-Overflow (lange KV-Chunks > 16k — Systemprompt
|
||||
trunciert weg). Fix: num_ctx 32 768, max_context_chars=90 000
|
||||
(`trim_results`), cross_ref_expand 6 → alle 4 Fälle geheilt (10/10
|
||||
Bestätigungsläufe). Retrieval Recall@8 0,946 · Antworten: Zitier-
|
||||
Präzision 97,6 %, Verweigerung 97,6 % (Gate ✓), erwartete Quelle
|
||||
91,9 %, Latenz mean 33 s. Offen: q-015 Branchen-Noise, q-024
|
||||
transiente Flakiness (leerer Draft).
|
||||
- Betrieb: `agent/README.md`.
|
||||
|
||||
Reference in New Issue
Block a user