length-Retry: abgeschnittene Antworten sind die q-024-Ursache, kein Thinking (D14)
- Diagnose: q-024-Flakiness war KEIN Think-Ghost (thinking-Feld leer, keine Tags), sondern num_predict=1024 — lange belegte Antworten brachen bei done_reason=length ab (3/3 Sondenlaeufe), Zitationen wurden unvollstaendig, CITE_RE matchte partielle IDs -> Verletzung -> Regenerierungs-Eskalation -> UNCERTAIN. - Fix: num_predict 1024 -> 2048; OllamaClient.chat_full() liefert (content, done_reason); chat_with_length_retry() wiederholt bei length einmal mit 2x Budget (technischer Retry, kein Regel- Regenerierungszaehler) - im Antwort-, Map- und Regenerierungspfad. - Voll-Eval (46 Fragen): Zitier-Praezision 100 %, Verweigerung korrekt 100 % (46/46) - erstmals alle M3-Gates erfuellt; erwartete Quelle 92,7 %; Latenz mean 39,6 s / p95 78 s (vollstaendige statt abgeschnittener Antworten). q-024: 4/4 stabil. - Tests 59 -> 60. Report lokal data/eval-qwen38-lengthfix.json.
This commit is contained in:
+3
-1
@@ -51,7 +51,9 @@ class Config:
|
||||
# (KV-Cache @32k ~6-8 GB -> gesamt ~21 GB, Budget ok)
|
||||
max_context_chars: int = 90_000 # Budget fuer User-Content; niedrig gerankte
|
||||
# Bloecke werden weggelassen statt trunciert
|
||||
num_predict: int = 1024
|
||||
num_predict: int = 2048 # Output-Budget; 1024 schnitt lange belegte
|
||||
# Antworten ab (done_reason=length, q-024-Fall)
|
||||
# -> unvollstaendige Zitationen
|
||||
think: bool = False # Thinking per Request abschalten (Latenz)
|
||||
chat_timeout_s: float = 300.0
|
||||
embed_timeout_s: float = 240.0
|
||||
|
||||
Reference in New Issue
Block a user