length-Retry: abgeschnittene Antworten sind die q-024-Ursache, kein Thinking (D14)
- Diagnose: q-024-Flakiness war KEIN Think-Ghost (thinking-Feld leer, keine Tags), sondern num_predict=1024 — lange belegte Antworten brachen bei done_reason=length ab (3/3 Sondenlaeufe), Zitationen wurden unvollstaendig, CITE_RE matchte partielle IDs -> Verletzung -> Regenerierungs-Eskalation -> UNCERTAIN. - Fix: num_predict 1024 -> 2048; OllamaClient.chat_full() liefert (content, done_reason); chat_with_length_retry() wiederholt bei length einmal mit 2x Budget (technischer Retry, kein Regel- Regenerierungszaehler) - im Antwort-, Map- und Regenerierungspfad. - Voll-Eval (46 Fragen): Zitier-Praezision 100 %, Verweigerung korrekt 100 % (46/46) - erstmals alle M3-Gates erfuellt; erwartete Quelle 92,7 %; Latenz mean 39,6 s / p95 78 s (vollstaendige statt abgeschnittener Antworten). q-024: 4/4 stabil. - Tests 59 -> 60. Report lokal data/eval-qwen38-lengthfix.json.
This commit is contained in:
@@ -241,6 +241,21 @@ zu planen).
|
||||
erwartete Quelle 90,2 %, Latenz mean 34,2 s. Tests 57 -> 59.
|
||||
Report `data/eval-qwen38-stage2.json`. Verbleibend: q-024 transiente
|
||||
Flakiness (Think-Ghost-Verdacht, 2/3 Laeufe sauber).
|
||||
- **D14 (Output-Budget + length-Retry, 2026-09-15):** q-024-Flakiness
|
||||
Ursache gefunden — NICHT Thinking (Hypothese widerlegt: thinking-Feld
|
||||
leer, keine Tags), sondern `num_predict=1024`: lange belegte Antworten
|
||||
wurden bei `done_reason=length` abgschnitten (q-024: 3/3 Sondenlaeufe)
|
||||
→ unvollstaendige Zitationen → CITE_RE matcht partielle IDs →
|
||||
Verletzung → Regen-Eskalation → UNCERTAIN. Fix: (a) num_predict
|
||||
1024 → 2048; (b) `OllamaClient.chat_full()` liefert (content,
|
||||
done_reason); (c) `chat_with_length_retry`: ein technischer Retry
|
||||
mit 2× num_predict bei length (zaehlt nicht als Regel-Regenerierung,
|
||||
laeuft auch im Map- und im Regenerierungspfad).
|
||||
**Voll-Eval: Zitier-Praezision 100 %, Verweigerung korrekt 100 %**
|
||||
(46/46 — alle M3-Gates erfuellt, erstmals ueber Basislinie),
|
||||
erwartete Quelle 92,7 %, Latenz mean 39,6 s / p95 78 s (+5 s:
|
||||
vollstaendige statt abgeschnittener Antworten). q-024: 4/4 stabil.
|
||||
Tests 59 → 60. Report `data/eval-qwen38-lengthfix.json`.
|
||||
- **Bake-off-Protokoll** (Skill): Modellwechsel nur über dokumentierten
|
||||
Goldset-Vergleich; Kriterium: Zitier-Präzision > Verweigerungs-
|
||||
korrektheit > Latenz.
|
||||
|
||||
Reference in New Issue
Block a user