Retrieval-Kalibrierung nach Korpusverdopplung (D10) + Goldset-Erweiterung

- Hybrid-Fusion um dense_weight erweitert; kalibriert per Goldset-Sweep:
  dense_weight=2.0 (BM25 durch KV-S-Titel-Matches inflationiert),
  rrf_k=20, candidate_pool=150 -> Recall@8 0,851 -> 0,923 (>0,9),
  Hit-Rate 0,973, MRR 0,667. ENV: PV_DENSE_WEIGHT/PV_RRF_K/
  PV_CANDIDATE_POOL.
- CITE_RE um kv|ris erweitert (Post-Validierung deckt neue ID-Raeume).
- Goldset: +6 KV/RIS-Fragen (q-101-106) + Branchen-Refusal r-005;
  q-021 auf lb-kar-04 rekalibriert (Top-1, deckt Beginn/Dauer voll -
  dokumentiert im Note).
- Antwortmodus-Eval (qwen3.8:27b, 42 Fragen): Zitier-Praezision 95,2 %,
  Verweigerung 90,5 % - unter den M3-Gates, Tuning folgt
  (Report data/eval-qwen38-kvris.json, lokal).
- Docs: agent/README.md Baseline, planung.md Umsetzungsstand,
  .agents/MEMORY.md (D9/D10, offene Punkte).
This commit is contained in:
2026-09-15 07:45:04 +02:00
parent 97aa3c1c82
commit 7fb569b7cf
7 changed files with 139 additions and 10 deletions
+7
View File
@@ -283,4 +283,11 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
**83,9 %** (v1: 80,6 %), mean 34 s. Report `data/eval-qwen38-v2.json`.
- **M4 offen:** Odoo-Integration (separater Plan nach Verifikation der
Odoo-19-LLM-Module).
- **KV/RIS-Erweiterung (2026-09-15, D9/D10):** Korpus 601 → 1 274 Einträge
(614 WKO-KV-Dokumente `kv-kvt-…`, 59 RIS-Gesetze `ris-…`; quelltreu
generiert — D9), 14 984 Chunks. Retrieval kalibriert (D10:
dense_weight 2.0, rrf_k 20, Pool 150) → Recall@8 0,923 (>0,9 ✓).
Antwortmodus: Zitier-Präzision 95,2 %, Verweigerung 90,5 % —
Fehlverweigerungs-Tuning (offen, laufender Arbeitsstand) fortsetzen.
Intake: `tools/ingest_sources.py`, Registry: `tools/build_registry.py`.
- Betrieb: `agent/README.md`.