fegger
a11f2740f7
chore: consolidate local source directories
2026-09-15 15:58:22 +02:00
fegger
5209539ba3
feat(kb): ingest rechtsprechung corpus
2026-09-15 15:27:28 +02:00
fegger
1594aa9cbd
length-Retry: abgeschnittene Antworten sind die q-024-Ursache, kein Thinking (D14)
...
- Diagnose: q-024-Flakiness war KEIN Think-Ghost (thinking-Feld leer,
keine Tags), sondern num_predict=1024 — lange belegte Antworten
brachen bei done_reason=length ab (3/3 Sondenlaeufe), Zitationen
wurden unvollstaendig, CITE_RE matchte partielle IDs -> Verletzung ->
Regenerierungs-Eskalation -> UNCERTAIN.
- Fix: num_predict 1024 -> 2048; OllamaClient.chat_full() liefert
(content, done_reason); chat_with_length_retry() wiederholt bei
length einmal mit 2x Budget (technischer Retry, kein Regel-
Regenerierungszaehler) - im Antwort-, Map- und Regenerierungspfad.
- Voll-Eval (46 Fragen): Zitier-Praezision 100 %, Verweigerung korrekt
100 % (46/46) - erstmals alle M3-Gates erfuellt; erwartete Quelle
92,7 %; Latenz mean 39,6 s / p95 78 s (vollstaendige statt
abgeschnittener Antworten). q-024: 4/4 stabil.
- Tests 59 -> 60. Report lokal data/eval-qwen38-lengthfix.json.
2026-09-15 14:14:27 +02:00
fegger
4a9e06f66e
Stufe 2: Antworttyp-Routing — Survey Map-Reduce + Rueckfrage-Regel (D13, M6)
...
- Planer liefert jetzt type: survey|specific. Survey-Fragen (Uebersicht
ueber viele Dokumente) laufen ueber Map-Reduce: Retrieval auf
survey_blocks=16 erweitert, ein Map-Call destilliert JE Block als
Stichpunkte mit seiner KB-ID (MAP_SYSTEM_PROMPT), ein Reduce-Call
synthetisiert die Endantwort. Grounding unveraendert: Zitier-Validierung
strikt ueber die Retrieved-Union; leerer Map-Output -> Fallback auf
Einzelantwort.
- Systemprompt-Regel 9: haengt die Antwort wesentlich von nicht genanntem
Kontext ab (Branche, Bundesland, Zeitraum), belegte allgemeine Aussage
plus EINE Rueckfrage statt Verweigerung (API-first; Odoo-Chat kann die
Rueckfrage als Follow-up nutzen).
- Ergebnis: q-029 (WIKU-Survey, bisher hartnaeckigste Fehlverweigerung)
geheilt - Teilantwort mit 5 belegten Heften; q-015 antwortet mit
expliziter KV-Abhaengigkeit + Rueckfrage statt Branchen-Noise.
- Eval (46 Fragen): Zitier-Praezision 97,8 %, Verweigerung 97,8 % (Gate
erfuellt), erwartete Quelle 90,2 %, Latenz mean 34,2 s (Map-Reduce nur
bei Survey-Fragen, ~95 s). Report lokal data/eval-qwen38-stage2.json.
- Tests 57 -> 59 (Survey-Integration, Typ-Parsing).
2026-09-15 11:16:53 +02:00
fegger
062e010d7b
Stufe 1: komplexe Fragen via Query-Planer, Per-Query-Slots, Scope-Filter (D12, M6)
...
- Query-Planer (agent/query_planner.py): Heuristik-Gate (Jahr, Vergleichs-/
Aggregationsmarker, Laenge) entscheidet ueber einen kleinen LLM-Call,
der komplexe Fragen in 1-3 Sub-Queries zerlegt (JSON, temp 0; Fehler ->
Original als Einzel-Query). Je Sub-Query optional stand_year und scope.
- Multi-Query-Retrieval: je Sub-Query BM25+Dense mit RRF-Summe;
Per-Query-Slots (2 je Sub-Query) sichern jeden Frageaspekt im Kontext
(sonst dominieren Eintraege, die in mehreren Sub-Queries mittelgut
matchen — q-113-Befund). Scope-Filter: 'gesetz' (nur Lexis/WIKU/RIS)
und 'kv' (nur Branchen-KV) mit Fallback auf unscoped bei leerem
Ergebnis. Temporal-Intent: stand_year + temporal_boost (default 0,
FTS-jahr-Tag-Signal reichte).
- Grounding unveraendert: eine Retrieved-Menge (Union), eine Antwort,
Post-Validierung ueber die Union, Verweigerungspflicht unveraendert.
- Goldset 42 -> 46: q-110 (Temporal 2023; 2024er-Lohnordnung existiert
im Korpus nicht - Mantelvertrag ohne Lohntabelle, korrekt verweigert),
q-111 (2025), q-112 (Abfertigung-Vergleich), q-113 (Gesetz+KV).
- Eval (46 Fragen): Zitier-Praezision 97,8 %, Verweigerung 97,8 %
(Gate >94,3 % erfuellt), erwartete Quelle 90,2 %, Latenz mean 33,5 s.
- Tests 50 -> 57. Reports lokal: data/eval-qwen38-stage1*.json.
API-first festgehalten (D13-Vorbereitung): Odoo bleibt duenner Client;
Lohndaten-Zugriff in M4 erfordert Privacy-Neubewertung.
2026-09-15 09:58:25 +02:00
fegger
c594c553b5
Tuning: Prompt-Budget + cross_ref-Erweiterung heilt Fehlverweigerungen (D11)
...
- Ursache der 4 Fehlverweigerungen nach KV/RIS-Erweiterung: lange
KV-Chunks ueberlieferten num_ctx=16384 (bis 62,7 KB Prompt) — Ollama
trunciert den Systemprompt vorn, das Modell verliert die Zitierregeln
('Block-N'-Zitate statt IDs -> Regenerierung -> Verweigerung).
- Fix: num_ctx 32768; trim_results (max_context_chars=90.000, niedrig
gerankte Bloecke ganz weglassen statt truncieren, Mindestbestand 6);
cross_ref_expand 3 -> 6 (Top-3 sind oft Branchen-KV-Bloecke mit leeren
cross_refs - kuratierte Nachbarn kamen sonst nie nach).
- Eval: alle 4 Faelle geheilt, 10/10 Bestaetigungslaeufe OK.
Retrieval Recall@8 0,851 -> 0,946 (cross_ref-Extras bringen
Expected-IDs nach). Antworten: Zitier-Praezision 97,6 %, Verweigerung
97,6 % (>94,3 %-Gate), erwartete Quelle 83,8 -> 91,9 %, Latenz mean 33 s.
- Tests 49 -> 50 (trim_results); Reports lokal (data/eval-*).
2026-09-15 08:31:02 +02:00
fegger
a8234771cb
Retrieval-Kalibrierung nach Korpusverdopplung (D10) + Goldset-Erweiterung
...
- Hybrid-Fusion um dense_weight erweitert; kalibriert per Goldset-Sweep:
dense_weight=2.0 (BM25 durch KV-S-Titel-Matches inflationiert),
rrf_k=20, candidate_pool=150 -> Recall@8 0,851 -> 0,923 (>0,9),
Hit-Rate 0,973, MRR 0,667. ENV: PV_DENSE_WEIGHT/PV_RRF_K/
PV_CANDIDATE_POOL.
- CITE_RE um kv|ris erweitert (Post-Validierung deckt neue ID-Raeume).
- Goldset: +6 KV/RIS-Fragen (q-101-106) + Branchen-Refusal r-005;
q-021 auf lb-kar-04 rekalibriert (Top-1, deckt Beginn/Dauer voll -
dokumentiert im Note).
- Antwortmodus-Eval (qwen3.8:27b, 42 Fragen): Zitier-Praezision 95,2 %,
Verweigerung 90,5 % - unter den M3-Gates, Tuning folgt
(Report data/eval-qwen38-kvris.json, lokal).
- Docs: agent/README.md Baseline, planung.md Umsetzungsstand,
.agents/MEMORY.md (D9/D10, offene Punkte).
2026-09-15 07:45:04 +02:00
fegger
ac060c4977
KV/RIS-Erweiterung: 614 WKO-KV-Dokumente + 59 RIS-Gesetze (D9)
...
- Korpus 601 -> 1274 Layer-2-Eintraege: kv-kvt-001...614 (ein Cluster
kollektivvertraege, Branche als Tag) und ris-<cluster-prefix>-nn auf
der bestehenden Cluster-Map + 7 neue Cluster (zvr/avr/agg/lst/abo/
nso/kvt); LAW_MAP dokumentiert die 59 Gesetz-Zuordnungen.
- kv/ris-Eintraege sind quellentreu generiert (D9) - Gesetze sind
amtliche Werke, KV-Lohntabellen zahlenexakt; Tool-Output in
tools/ (ingest_sources.py, build_registry.py, kb_common.py),
eingefrorene ID-Kataloge tools/catalogs/*.json (nur Metadaten).
- kb.json/INDEX.md regeneriert (1274 Eintraege, 76 Cluster);
agent/kb.py: ID-Raeume kv|ris, source akzeptiert html-only.
- Tests 41 -> 49 (Konverter, LAW_MAP-Abdeckung, neue ID-Raeume,
Korpus-Integrationszahl).
2026-09-15 07:44:56 +02:00
fegger
eb1a768876
Prompt v2 + Kontext-Section-Prioritaet: Fehlverweigerungen behoben (D8)
...
Diagnose: q-008 bekam die 'Verweise'-Navigationssektion von lb-end-03 als
Kontext (BM25-Langennormalisierung bevorzugt duenne Chunks) -> inhaltlose
Bloecke -> korrekte Verweigerung nach Regel 4. q-031 enthaelt eine falsche
Praemisse (kein 'Mindestlohngesetz' in Oesterreich; Wissensbasis sagt:
kein gesetzlich betraglich festgelegtes Mindestentgelt).
Fixes: (a) retrieve.py _representative_chunk - pro Eintrag beste Inhalts-
sektion (Zusammenfassung > Kernwerte > Rechtsgrundlagen > Payroll >
sonstige > Verweise), Section-Swap aus dem Index falls nur 'Verweise'
rangiert; (b) generate.py Prompt v2 - Regel 4 erlaubt Teilantworten,
Regel 8 verlangt Prämisse-Korrektur mit Muster-Beispiel.
Bestaetigungslauf qwen3.8:27b (35 Fragen): Zitier-Praezision 100 % (8
Regenerierungen, alle geheilt), Verweigerung korrekt 94,3 %, erwartete
Quelle 83,9 % (v1 80,6 %), mean 34 s. q-008 + q-031 behoben; verbleibender
bekannter Fall q-029 (breite Survey-Frage, sicherer Fehlermodus).
Retrieval-Metriken unveraendert (Recall@8 0,952). 41 Tests gruen.
2026-09-15 00:22:41 +02:00
fegger
6cd37429f3
Bake-off ergaenzt: muse-glimmer:latest (Rang 5 von 6)
...
Nach User-Wunsch im selben Protokoll gemessen (35 Goldset-Fragen):
100% Zitier-Praezision bei nur 1 Regenerierung (diszipliniertestes
Modell), aber 8/35 falsche Verweigerungen (Ueberverweigerung teils trotz
vorhandener Zitate) und 37,5s mean - schlaegt qwen3.8:27b in keiner
Kennzahl. D7 unveraendert: qwen3.8:27b bleibt fixiert.
2026-09-14 23:55:45 +02:00
fegger
d156da205d
M3 Bake-off abgeschlossen: qwen3.8:27b als Antwortmodell fixiert (D7)
...
Alle 5 Kandidaten auf dem Goldset (35 Fragen, Antwortmodus) gemessen.
Protokoll Zitier-Praezision > Verweigerungskorrektheit > Latenz:
qwen3.8:27b 100% / 94,3% / 80,6% 32s -> Sieger, fixiert
gemma4:26b 100% / 91,4% / 67,7% 7,9s -> Latenz-Kandidat (4x schneller)
gemma4:12B 94,3% / 91,4% / 77,4% 21s
qwen3.6:27B 94,3% / 85,7% / 80,6% 43s
mistral-small3.1:24b 100% / 71,4% / 58,1% 20s
mistral-Deutsch-Hypothese praktisch widerlegt (71,4% Verweigerungs-
korrektheit). q-008/q-031 verweigern beide Finalisten -> Prompt-/
Retrieval-Tuning, nicht modellspezifisch. Tabelle in planung.md 13,
README und MEMORY aktualisiert.
2026-09-14 23:30:36 +02:00
fegger
0281d8fa24
Bake-off M3: qwen3.8 vs qwen3.6 gemessen; Topologie korrigiert (Remote-GPU-Maschine)
...
Zwischenstand Bake-off (Antwortmodus, 35 Goldset-Fragen):
qwen3.8:27b 100% Zitier-Praezision / 94,3% Verweigerung korrekt / 32s;
qwen3.6:27B 94,3% / 85,7% / 43s (10 Regenerierungen) - klar schwächer.
Topologie korrigiert: 100.103.83.12:11435 ist die Remote-GPU-Maschine
(Tailscale, R9700), NICHT dieselbe wie die Dev-Maschine (deren localhost:
11434 ist ein eigener, fast leerer Ollama; URL-Nicht-auf-11434-Korrigieren
in Skill/README/Config präzisiert). bge-m3 auf der GPU-Maschine gepullt.
gemma4:26b-Lauf brach ab: auf der GPU-Maschine sterben seit dem Crash
alle llama-server-Loads (API 500 'exit status 1'), auch bge-m3. Neustart
dort noetig: sudo systemctl restart ollama. Danach mistral-small3.1:24b
und gemma4:12B ausstehen.
2026-09-14 22:42:54 +02:00
fegger
b6a6f5b788
Ollama-URL korrigiert (100.103.83.12:11435) und M1/M2 gegen Echt-System validiert
...
Der Host betreibt zwei Ollama-Instanzen: 11434 (fast leer, 0.16.2) und
11435 (Ziel-Instanz, 0.32.13, Modell-Zoo) — Port nicht mehr auf 11434
'korrigieren' (Dokumentation + Skill + Config-Default angepasst).
Validierung gegen das echte System: bge-m3 per API gepullt, Hybrid-Index
(3005 Chunks, 100 % eingebettet, 144 s), M1-Akzeptanz erreicht (Recall@8
0,952 > 0,9; Hit-Rate 0,968). Antwortmodus-Eval mit qwen3.8:27b (Thinking
verifiziert aus): Zitier-Präzision 100 % (4 Regenerierungen), Verweigerung
korrekt 94,3 %, Latenz mean 32 s. ATZ-Konfliktfall korrekt beide Werte
mit Warnung. generate.py: sources enthaelt jetzt nur zitierte Quellen;
Systemprompt ohne redundante Quellenzeile.
Bake-off-Feld (M3) bereits installiert: qwen3.6:27B, gemma4:26b,
mistral-small3.1:24b, gemma4:12B.
2026-09-14 22:09:09 +02:00
fegger
2cba72aeb0
M1+M2: RAG-Pipeline mit verbindlichem Grounding
...
agent/-Paket: Ingest (601 Layer-2-Eintraege -> 3005 Chunks, FTS5-BM25 +
Vektoren-Cache), Hybrid-Retrieval (RRF, Stand-Boost, cross_ref-Erweiterung),
Ollama-Client (embed/chat, think-Flag-Fallback, kurzes Connect-Budget),
Systemprompt mit Zitierpflicht, Post-Validierung (zitierte IDs gemaess
Retrieved-Set, 1x Regenerierung, dann Verweigerung), FastAPI (/ask, /health,
/reindex), CLI, Goldset (31 Fragen, IDs gegen kb.json verifiziert, inkl.
ATZ-Konfliktfall + 4 Verweigerungsfaelle), Eval-Suite, Test-Chat.
41 Offline-Tests gruen. Baseline BM25-only: Hit-Rate 0,871 / Recall@8 0,855 /
MRR 0,476. Hybrid-Messung, Antwortmodus-Eval und Modell-Bake-off (M3) auf
dem Host ausstaendig (Ollama aus der Zed-Sandbox nicht erreichbar).
MEMORY.md und planung.md Umsetzungsstand aktualisiert.
2026-09-14 16:53:04 +02:00
fegger
bf8191b013
Planung und Skills für den Wissensbasis-RAG-Agenten
...
planung.md: Architektur (schlanker RAG-Service, SQLite-Index, Hybrid-Retrieval),
verbindliche Grounding-Regeln, Modell-Bake-off M3 (qwen3.8:27b, qwen3:32b,
gemma3:27b, mistral-small3.2:24b, qwen3:14b als Latenz-Untergrenze),
Meilensteine M1-M4 und Odoo-Integrationsoptionen.
.agents: neuer Skill pv-rag-agent (verbindliche Regeln für die Implementierung)
sowie bestehende Projekt-Skills (agent-memory, wissensbasis,
odoo19-development, opendataloader-pdf).
2026-09-14 16:34:13 +02:00
fegger
25eb285160
Initialimport: Wissensbasis Layer 2 (601 kuratierte Einträge)
...
571 Lexis-Briefings (lb-*) + 30 WIKU-Publikationen (wk-*) in 69 Clustern,
Frontmatter-Schema als Single Source of Truth; kb.json + INDEX.md generiert.
.gitignore für lizenzierte/lokale Corpora (.lexis360, .wiku, .firecrawl, .ris)
sowie künftige RAG-Artefakte (data/).
2026-09-14 16:34:07 +02:00