Prompt v2 + Kontext-Section-Prioritaet: Fehlverweigerungen behoben (D8)
Diagnose: q-008 bekam die 'Verweise'-Navigationssektion von lb-end-03 als Kontext (BM25-Langennormalisierung bevorzugt duenne Chunks) -> inhaltlose Bloecke -> korrekte Verweigerung nach Regel 4. q-031 enthaelt eine falsche Praemisse (kein 'Mindestlohngesetz' in Oesterreich; Wissensbasis sagt: kein gesetzlich betraglich festgelegtes Mindestentgelt). Fixes: (a) retrieve.py _representative_chunk - pro Eintrag beste Inhalts- sektion (Zusammenfassung > Kernwerte > Rechtsgrundlagen > Payroll > sonstige > Verweise), Section-Swap aus dem Index falls nur 'Verweise' rangiert; (b) generate.py Prompt v2 - Regel 4 erlaubt Teilantworten, Regel 8 verlangt Prämisse-Korrektur mit Muster-Beispiel. Bestaetigungslauf qwen3.8:27b (35 Fragen): Zitier-Praezision 100 % (8 Regenerierungen, alle geheilt), Verweigerung korrekt 94,3 %, erwartete Quelle 83,9 % (v1 80,6 %), mean 34 s. q-008 + q-031 behoben; verbleibender bekannter Fall q-029 (breite Survey-Frage, sicherer Fehlermodus). Retrieval-Metriken unveraendert (Recall@8 0,952). 41 Tests gruen.
This commit is contained in:
+10
@@ -271,6 +271,16 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
|
||||
vorhandener Zitate) und 37,5 s mean — Rang 5 von 6, schlägt qwen3.8
|
||||
in keiner Kennzahl. q-008 und q-031 verweigern alle Top-Kandidaten —
|
||||
Prompt-/Retrieval-Tuning-Thema, kein Modellthema.
|
||||
|
||||
**Prompt v2 + Kontext-Tuning (2026-09-14):** (a) Regel 4 erlaubt
|
||||
Teilantworten, Regel 8 verlangt Prämisse-Korrektur mit Muster-Beispiel;
|
||||
(b) Kontextblöcke pro Eintrag = beste Inhaltssektion statt bester
|
||||
Rangfolge-Chunk („Verweise“-Sektionen zuletzt — BM25-Längennormalisierung
|
||||
rangiert die dünnen Navigations-Chips bevorzugt, Ursache q-008).
|
||||
Bestätigungslauf qwen3.8:27b (35 Fragen): Zitier-Präzision **100 %**,
|
||||
Verweigerung korrekt 94,3 % (q-008/q-031 behoben; neuer bekannter Fall
|
||||
q-029 — breite Survey-Frage, sicherer Fehlermodus), erwartete Quelle
|
||||
**83,9 %** (v1: 80,6 %), mean 34 s. Report `data/eval-qwen38-v2.json`.
|
||||
- **M4 offen:** Odoo-Integration (separater Plan nach Verifikation der
|
||||
Odoo-19-LLM-Module).
|
||||
- Betrieb: `agent/README.md`.
|
||||
|
||||
Reference in New Issue
Block a user