Prompt v2 + Kontext-Section-Prioritaet: Fehlverweigerungen behoben (D8)
Diagnose: q-008 bekam die 'Verweise'-Navigationssektion von lb-end-03 als Kontext (BM25-Langennormalisierung bevorzugt duenne Chunks) -> inhaltlose Bloecke -> korrekte Verweigerung nach Regel 4. q-031 enthaelt eine falsche Praemisse (kein 'Mindestlohngesetz' in Oesterreich; Wissensbasis sagt: kein gesetzlich betraglich festgelegtes Mindestentgelt). Fixes: (a) retrieve.py _representative_chunk - pro Eintrag beste Inhalts- sektion (Zusammenfassung > Kernwerte > Rechtsgrundlagen > Payroll > sonstige > Verweise), Section-Swap aus dem Index falls nur 'Verweise' rangiert; (b) generate.py Prompt v2 - Regel 4 erlaubt Teilantworten, Regel 8 verlangt Prämisse-Korrektur mit Muster-Beispiel. Bestaetigungslauf qwen3.8:27b (35 Fragen): Zitier-Praezision 100 % (8 Regenerierungen, alle geheilt), Verweigerung korrekt 94,3 %, erwartete Quelle 83,9 % (v1 80,6 %), mean 34 s. q-008 + q-031 behoben; verbleibender bekannter Fall q-029 (breite Survey-Frage, sicherer Fehlermodus). Retrieval-Metriken unveraendert (Recall@8 0,952). 41 Tests gruen.
This commit is contained in:
+18
-5
@@ -58,11 +58,13 @@ zu planen).
|
||||
|
||||
- **Push**: Remote localhost:3003 aus der Sandbox nicht erreichbar — User
|
||||
pusht vom Host.
|
||||
- **Fehlverweigerungen**: q-008 (Abfertigung/Verfügungsmöglichkeiten),
|
||||
q-031 (Mindestlohngesetz) — breite Fragen, Retrieval erfolgreich, Modell
|
||||
verweigert. M3-Tuning: Regel-4-Formulierung lockern („behandle den
|
||||
behandelten Teil“) oder Kontextblöcke erhöhen. Vorher Prompt einfrieren
|
||||
für den Bake-off-Vergleich.
|
||||
- **Fehlverweigerungen — Stand nach Prompt v2:** q-008 und q-031 sind
|
||||
**behoben** (Section-Priorität + Regel 8). Verbleibend: q-029
|
||||
(„Welche Neuerungen behandelt WIKU Personal aktuell 2026?“) — breite
|
||||
Survey-Frage über 12 Hefte; Kontext enthält echte Zusammenfassungen,
|
||||
Modell verweigert trotzdem (sicherer Fehlermodus). Mögliche spätere
|
||||
Hebel: Survey-Rule im Prompt, mehr Kontextblöcke oder Map-Reduce-artige
|
||||
Zusammenfassung. Weitere Iterationen erst mit neuen Evaluationsdaten.
|
||||
- **Latenz**: mean 32 s/ Antwort ist hoch (Dense 27B + große Prompts).
|
||||
Hebel: weniger Kontextblöcke (aktuell 8+6), schnellere Kandidaten.
|
||||
- **Cloud-Modelle** (`*:cloud` auf der Ollama-Instanz) sind für Antworten
|
||||
@@ -92,6 +94,17 @@ zu planen).
|
||||
(100 % Zitier-Präzision, 94,3 % Verweigerung korrekt). `gemma4:26b` als
|
||||
dokumentierter Latenz-Kandidat; ein Modellwechsel läuft nur erneut über
|
||||
das dokumentierte Protokoll (Skill).
|
||||
- **D8 (Prompt-Tuning 2026-09-14):** Prompt v2 + Kontext-Section-
|
||||
Priorität. (a) Regel 4 erlaubt Teilantworten bei unvollständiger Deckung;
|
||||
Regel 8 verlangt Prämisse-Korrektur statt Verweigerung (Muster-Beispiel
|
||||
„Mindestlohngesetz“). (b) `_representative_chunk` wählt pro Eintrag die
|
||||
beste **Inhaltssektion** (Zusammenfassung > Kernwerte > Rechtsgrundlagen
|
||||
> Payroll > sonstige; „Verweise“ nur als letzter Rückgriff — BM25
|
||||
rangiert die dünnen Navigations-Chunks bevorzugt, q-008-Ursache).
|
||||
Ergebnis v1→v2: Zitier-Präzision 100 % gehalten; q-008 + q-031 behoben;
|
||||
erwartete Quelle 80,6 → 83,9 %; Verweigerung 94,3 % (Fehler getauscht:
|
||||
neu q-029 — breite Survey-Frage über 12 Hefte, sicherer Fehlermodus).
|
||||
Report `data/eval-qwen38-v2.json`.
|
||||
- **Bake-off-Protokoll** (Skill): Modellwechsel nur über dokumentierten
|
||||
Goldset-Vergleich; Kriterium: Zitier-Präzision > Verweigerungs-
|
||||
korrektheit > Latenz.
|
||||
|
||||
Reference in New Issue
Block a user