M3 Bake-off abgeschlossen: qwen3.8:27b als Antwortmodell fixiert (D7)
Alle 5 Kandidaten auf dem Goldset (35 Fragen, Antwortmodus) gemessen. Protokoll Zitier-Praezision > Verweigerungskorrektheit > Latenz: qwen3.8:27b 100% / 94,3% / 80,6% 32s -> Sieger, fixiert gemma4:26b 100% / 91,4% / 67,7% 7,9s -> Latenz-Kandidat (4x schneller) gemma4:12B 94,3% / 91,4% / 77,4% 21s qwen3.6:27B 94,3% / 85,7% / 80,6% 43s mistral-small3.1:24b 100% / 71,4% / 58,1% 20s mistral-Deutsch-Hypothese praktisch widerlegt (71,4% Verweigerungs- korrektheit). q-008/q-031 verweigern beide Finalisten -> Prompt-/ Retrieval-Tuning, nicht modellspezifisch. Tabelle in planung.md 13, README und MEMORY aktualisiert.
This commit is contained in:
+21
-5
@@ -107,6 +107,9 @@ Verbindliche Entscheidung erst nach Bake-off auf dem Goldset — Kriterium
|
||||
bleibt Zitier-Präzision vor Latenz; liegt `qwen3:14b` bei gleicher
|
||||
Zitierqualität auf, gewinnt Latenz.
|
||||
|
||||
> **Bake-off-Ergebnis (2026-09-14, Abschnitt 13):** `qwen3.8:27b` hat
|
||||
> gewonnen und ist als Antwortmodell fixiert.
|
||||
|
||||
## 5. Grounding-Konzept (der kritische Teil)
|
||||
|
||||
1. **Systemprompt (deutsch):** antworte ausschließlich aus den
|
||||
@@ -245,11 +248,24 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
|
||||
Validierung → Regenerierung, alle geheilt), Verweigerung korrekt 94,3 %,
|
||||
Latenz mean 32 s / p95 53 s. ATZ-Konfliktfall wird korrekt beidseitig
|
||||
mit ⚠ beantwortet; harte Verweigerungsfälle (UStVA) funktionieren.
|
||||
- **M3 teilweise:** qwen3.8:27b-Baseline gemessen (`data/eval-qwen38.json`).
|
||||
Bake-off-Kandidaten sind bereits installiert: qwen3.6:27B, gemma4:26b,
|
||||
mistral-small3.1:24b, gemma4:12B (Latenz-Untergrenze). Bekannte
|
||||
Fehlverweigerungen (q-008, q-031) und Latenz sind Tuning-Kandidaten —
|
||||
Prompt für den Bake-off vorher einfrieren.
|
||||
- **M3 erledigt — Bake-off (2026-09-14, Goldset 35 Fragen, Thinking aus):**
|
||||
|
||||
| Kandidat | Zitier-Präzision | Verweigerung korrekt | Erw. Quelle | mean/p95 | Regen |
|
||||
|---|---|---|---|---|---|
|
||||
| **qwen3.8:27b** ✅ | **100 %** | **94,3 %** | **80,6 %** | 32 s / 53 s | 4 |
|
||||
| gemma4:26b | 100 % | 91,4 % | 67,7 % | 7,9 s / 12 s | 4 |
|
||||
| gemma4:12B | 94,3 % | 91,4 % | 77,4 % | 21 s / 40 s | 8 |
|
||||
| qwen3.6:27B | 94,3 % | 85,7 % | 80,6 % | 43 s / 89 s | 10 |
|
||||
| mistral-small3.1:24b | 100 % | 71,4 % | 58,1 % | 20 s / 43 s | 2 |
|
||||
|
||||
**Entscheidung (D7):** `qwen3.8:27b` ist das Antwortmodell (Protokoll:
|
||||
Zitier-Präzision → Verweigerungskorrektheit → Latenz). `gemma4:26b`
|
||||
wird als dokumentierter Latenz-Kandidat für späteres interaktives Tuning
|
||||
geführt (4× schneller bei 100 % Zitier-Präzision, aber schwächere
|
||||
Quellentreue und 3 statt 2 Fehlverweigerungen). mistral-small3.1
|
||||
(Deutsch-Hypothese) ist praktisch widerlegt: 71,4 % Verweigerungs-
|
||||
korrektheit. q-008 und q-031 verweigern beide Finalisten —
|
||||
Prompt-/Retrieval-Tuning-Thema, kein Modellthema.
|
||||
- **M4 offen:** Odoo-Integration (separater Plan nach Verifikation der
|
||||
Odoo-19-LLM-Module).
|
||||
- Betrieb: `agent/README.md`.
|
||||
|
||||
Reference in New Issue
Block a user