Prompt v2 + Kontext-Section-Prioritaet: Fehlverweigerungen behoben (D8)

Diagnose: q-008 bekam die 'Verweise'-Navigationssektion von lb-end-03 als
Kontext (BM25-Langennormalisierung bevorzugt duenne Chunks) -> inhaltlose
Bloecke -> korrekte Verweigerung nach Regel 4. q-031 enthaelt eine falsche
Praemisse (kein 'Mindestlohngesetz' in Oesterreich; Wissensbasis sagt:
kein gesetzlich betraglich festgelegtes Mindestentgelt).

Fixes: (a) retrieve.py _representative_chunk - pro Eintrag beste Inhalts-
sektion (Zusammenfassung > Kernwerte > Rechtsgrundlagen > Payroll >
sonstige > Verweise), Section-Swap aus dem Index falls nur 'Verweise'
rangiert; (b) generate.py Prompt v2 - Regel 4 erlaubt Teilantworten,
Regel 8 verlangt Prämisse-Korrektur mit Muster-Beispiel.

Bestaetigungslauf qwen3.8:27b (35 Fragen): Zitier-Praezision 100 % (8
Regenerierungen, alle geheilt), Verweigerung korrekt 94,3 %, erwartete
Quelle 83,9 % (v1 80,6 %), mean 34 s. q-008 + q-031 behoben; verbleibender
bekannter Fall q-029 (breite Survey-Frage, sicherer Fehlermodus).
Retrieval-Metriken unveraendert (Recall@8 0,952). 41 Tests gruen.
This commit is contained in:
2026-09-15 00:22:41 +02:00
parent 6cd37429f3
commit eb1a768876
8 changed files with 227 additions and 15 deletions
+10
View File
@@ -271,6 +271,16 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
vorhandener Zitate) und 37,5 s mean — Rang 5 von 6, schlägt qwen3.8
in keiner Kennzahl. q-008 und q-031 verweigern alle Top-Kandidaten —
Prompt-/Retrieval-Tuning-Thema, kein Modellthema.
**Prompt v2 + Kontext-Tuning (2026-09-14):** (a) Regel 4 erlaubt
Teilantworten, Regel 8 verlangt Prämisse-Korrektur mit Muster-Beispiel;
(b) Kontextblöcke pro Eintrag = beste Inhaltssektion statt bester
Rangfolge-Chunk („Verweise“-Sektionen zuletzt — BM25-Längennormalisierung
rangiert die dünnen Navigations-Chips bevorzugt, Ursache q-008).
Bestätigungslauf qwen3.8:27b (35 Fragen): Zitier-Präzision **100 %**,
Verweigerung korrekt 94,3 % (q-008/q-031 behoben; neuer bekannter Fall
q-029 — breite Survey-Frage, sicherer Fehlermodus), erwartete Quelle
**83,9 %** (v1: 80,6 %), mean 34 s. Report `data/eval-qwen38-v2.json`.
- **M4 offen:** Odoo-Integration (separater Plan nach Verifikation der
Odoo-19-LLM-Module).
- Betrieb: `agent/README.md`.