Bake-off ergaenzt: muse-glimmer:latest (Rang 5 von 6)
Nach User-Wunsch im selben Protokoll gemessen (35 Goldset-Fragen): 100% Zitier-Praezision bei nur 1 Regenerierung (diszipliniertestes Modell), aber 8/35 falsche Verweigerungen (Ueberverweigerung teils trotz vorhandener Zitate) und 37,5s mean - schlaegt qwen3.8:27b in keiner Kennzahl. D7 unveraendert: qwen3.8:27b bleibt fixiert.
This commit is contained in:
+10
-5
@@ -35,16 +35,21 @@ zu planen).
|
||||
einen eigenen, fast leeren Ollama auf localhost:11434 (dorthin ging der
|
||||
erste bge-m3-Pull — auf die GPU-Maschine neu gepullt). Ziel-Instanz ist
|
||||
ausschließlich `http://100.103.83.12:11435`.
|
||||
- **Bake-off M3 — abgeschlossen (D7)**: alle 5 Kandidaten gemessen
|
||||
- **Bake-off M3 — abgeschlossen (D7)**: alle 6 Kandidaten gemessen
|
||||
(Tabelle in `planung.md` Abschnitt 13). **`qwen3.8:27b` gewinnt**
|
||||
(100 % Zitier-Präzision, 94,3 % Verweigerung korrekt, 80,6 % erwartete
|
||||
Quelle, 32 s mean). `gemma4:26b` = dokumentierter Latenz-Kandidat
|
||||
(7,9 s mean, 100 % Zitier-Präzision, aber 67,7 % Quellentreue, 3
|
||||
Fehlverweigerungen). mistral-small3.1: 71,4 % Verweigerungskorrektheit
|
||||
— Deutsch-Hypothese praktisch widerlegt. qwen3.6:27B: 2 dauerhafte
|
||||
Zitierverletzungen, 10 Regenerierungen. gemma4:12B: 2 Verletzungen.
|
||||
Reports: `data/eval-*.json`. q-008/q-031 verweigern beide Finalisten —
|
||||
Prompt-/Retrieval-Tuning (nicht modellspezifisch).
|
||||
— Deutsch-Hypothese praktisch widerlegt. **muse-glimmer:latest**
|
||||
(nachgereicht): 100 % Zitier-Präzision bei nur 1 Regenerierung
|
||||
(diszipliniertestes Modell), aber 8/35 falsche Verweigerungen
|
||||
(Überverweigerung teils trotz vorhandener Zitate) und 37,5 s mean —
|
||||
Rang 5 von 6, schlägt qwen3.8 in keiner Kennzahl. qwen3.6:27B: 2
|
||||
dauerhafte Zitierverletzungen, 10 Regenerierungen. gemma4:12B:
|
||||
2 Verletzungen.
|
||||
Reports: `data/eval-*.json`. q-008/q-031 verweigern alle
|
||||
Top-Kandidaten — Prompt-/Retrieval-Tuning (nicht modellspezifisch).
|
||||
- **Remote-GPU-Maschine**: nach `systemctl restart ollama` (User-Aktion)
|
||||
liefen alle Läufe stabil; zwischen Kandidaten wurde per `keep_alive: 0`
|
||||
entladen (Crash-Ursache war der Modell-Swap-Stress beim gemma4-Lauf).
|
||||
|
||||
@@ -92,6 +92,7 @@ Post-Validierung abgefangen und regeneriert) · Verweigerung korrekt
|
||||
| gemma4:26b | 100 % | 91,4 % | 67,7 % | **7,9 s** / 12 s |
|
||||
| gemma4:12B | 94,3 % | 91,4 % | 77,4 % | 21 s / 40 s |
|
||||
| qwen3.6:27B | 94,3 % | 85,7 % | 80,6 % | 43 s / 89 s |
|
||||
| muse-glimmer:latest | 100 % | 77,1 % | 74,2 % | 37,5 s / 51 s |
|
||||
| mistral-small3.1:24b | 100 % | 71,4 % | 58,1 % | 20 s / 43 s |
|
||||
|
||||
`gemma4:26b` bleibt als dokumentierter Latenz-Kandidat für späteres
|
||||
|
||||
+6
-1
@@ -256,6 +256,7 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
|
||||
| gemma4:26b | 100 % | 91,4 % | 67,7 % | 7,9 s / 12 s | 4 |
|
||||
| gemma4:12B | 94,3 % | 91,4 % | 77,4 % | 21 s / 40 s | 8 |
|
||||
| qwen3.6:27B | 94,3 % | 85,7 % | 80,6 % | 43 s / 89 s | 10 |
|
||||
| muse-glimmer:latest | 100 % | 77,1 % | 74,2 % | 37,5 s / 51 s | 1 |
|
||||
| mistral-small3.1:24b | 100 % | 71,4 % | 58,1 % | 20 s / 43 s | 2 |
|
||||
|
||||
**Entscheidung (D7):** `qwen3.8:27b` ist das Antwortmodell (Protokoll:
|
||||
@@ -264,7 +265,11 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
|
||||
geführt (4× schneller bei 100 % Zitier-Präzision, aber schwächere
|
||||
Quellentreue und 3 statt 2 Fehlverweigerungen). mistral-small3.1
|
||||
(Deutsch-Hypothese) ist praktisch widerlegt: 71,4 % Verweigerungs-
|
||||
korrektheit. q-008 und q-031 verweigern beide Finalisten —
|
||||
korrektheit. **muse-glimmer** (2026-09-14 nachgereicht): 100 %
|
||||
Zitier-Präzision bei nur 1 Regenerierung (diszipliniertestes Modell),
|
||||
aber 8/35 falsche Verweigerungen (Überverweigerung teils trotz
|
||||
vorhandener Zitate) und 37,5 s mean — Rang 5 von 6, schlägt qwen3.8
|
||||
in keiner Kennzahl. q-008 und q-031 verweigern alle Top-Kandidaten —
|
||||
Prompt-/Retrieval-Tuning-Thema, kein Modellthema.
|
||||
- **M4 offen:** Odoo-Integration (separater Plan nach Verifikation der
|
||||
Odoo-19-LLM-Module).
|
||||
|
||||
Reference in New Issue
Block a user