Bake-off ergaenzt: muse-glimmer:latest (Rang 5 von 6)

Nach User-Wunsch im selben Protokoll gemessen (35 Goldset-Fragen):
100% Zitier-Praezision bei nur 1 Regenerierung (diszipliniertestes
Modell), aber 8/35 falsche Verweigerungen (Ueberverweigerung teils trotz
vorhandener Zitate) und 37,5s mean - schlaegt qwen3.8:27b in keiner
Kennzahl. D7 unveraendert: qwen3.8:27b bleibt fixiert.
This commit is contained in:
2026-09-14 23:55:45 +02:00
parent d156da205d
commit 6cd37429f3
3 changed files with 17 additions and 6 deletions
+10 -5
View File
@@ -35,16 +35,21 @@ zu planen).
einen eigenen, fast leeren Ollama auf localhost:11434 (dorthin ging der einen eigenen, fast leeren Ollama auf localhost:11434 (dorthin ging der
erste bge-m3-Pull — auf die GPU-Maschine neu gepullt). Ziel-Instanz ist erste bge-m3-Pull — auf die GPU-Maschine neu gepullt). Ziel-Instanz ist
ausschließlich `http://100.103.83.12:11435`. ausschließlich `http://100.103.83.12:11435`.
- **Bake-off M3 — abgeschlossen (D7)**: alle 5 Kandidaten gemessen - **Bake-off M3 — abgeschlossen (D7)**: alle 6 Kandidaten gemessen
(Tabelle in `planung.md` Abschnitt 13). **`qwen3.8:27b` gewinnt** (Tabelle in `planung.md` Abschnitt 13). **`qwen3.8:27b` gewinnt**
(100 % Zitier-Präzision, 94,3 % Verweigerung korrekt, 80,6 % erwartete (100 % Zitier-Präzision, 94,3 % Verweigerung korrekt, 80,6 % erwartete
Quelle, 32 s mean). `gemma4:26b` = dokumentierter Latenz-Kandidat Quelle, 32 s mean). `gemma4:26b` = dokumentierter Latenz-Kandidat
(7,9 s mean, 100 % Zitier-Präzision, aber 67,7 % Quellentreue, 3 (7,9 s mean, 100 % Zitier-Präzision, aber 67,7 % Quellentreue, 3
Fehlverweigerungen). mistral-small3.1: 71,4 % Verweigerungskorrektheit Fehlverweigerungen). mistral-small3.1: 71,4 % Verweigerungskorrektheit
— Deutsch-Hypothese praktisch widerlegt. qwen3.6:27B: 2 dauerhafte — Deutsch-Hypothese praktisch widerlegt. **muse-glimmer:latest**
Zitierverletzungen, 10 Regenerierungen. gemma4:12B: 2 Verletzungen. (nachgereicht): 100 % Zitier-Präzision bei nur 1 Regenerierung
Reports: `data/eval-*.json`. q-008/q-031 verweigern beide Finalisten — (diszipliniertestes Modell), aber 8/35 falsche Verweigerungen
Prompt-/Retrieval-Tuning (nicht modellspezifisch). (Überverweigerung teils trotz vorhandener Zitate) und 37,5 s mean —
Rang 5 von 6, schlägt qwen3.8 in keiner Kennzahl. qwen3.6:27B: 2
dauerhafte Zitierverletzungen, 10 Regenerierungen. gemma4:12B:
2 Verletzungen.
Reports: `data/eval-*.json`. q-008/q-031 verweigern alle
Top-Kandidaten — Prompt-/Retrieval-Tuning (nicht modellspezifisch).
- **Remote-GPU-Maschine**: nach `systemctl restart ollama` (User-Aktion) - **Remote-GPU-Maschine**: nach `systemctl restart ollama` (User-Aktion)
liefen alle Läufe stabil; zwischen Kandidaten wurde per `keep_alive: 0` liefen alle Läufe stabil; zwischen Kandidaten wurde per `keep_alive: 0`
entladen (Crash-Ursache war der Modell-Swap-Stress beim gemma4-Lauf). entladen (Crash-Ursache war der Modell-Swap-Stress beim gemma4-Lauf).
+1
View File
@@ -92,6 +92,7 @@ Post-Validierung abgefangen und regeneriert) · Verweigerung korrekt
| gemma4:26b | 100 % | 91,4 % | 67,7 % | **7,9 s** / 12 s | | gemma4:26b | 100 % | 91,4 % | 67,7 % | **7,9 s** / 12 s |
| gemma4:12B | 94,3 % | 91,4 % | 77,4 % | 21 s / 40 s | | gemma4:12B | 94,3 % | 91,4 % | 77,4 % | 21 s / 40 s |
| qwen3.6:27B | 94,3 % | 85,7 % | 80,6 % | 43 s / 89 s | | qwen3.6:27B | 94,3 % | 85,7 % | 80,6 % | 43 s / 89 s |
| muse-glimmer:latest | 100 % | 77,1 % | 74,2 % | 37,5 s / 51 s |
| mistral-small3.1:24b | 100 % | 71,4 % | 58,1 % | 20 s / 43 s | | mistral-small3.1:24b | 100 % | 71,4 % | 58,1 % | 20 s / 43 s |
`gemma4:26b` bleibt als dokumentierter Latenz-Kandidat für späteres `gemma4:26b` bleibt als dokumentierter Latenz-Kandidat für späteres
+6 -1
View File
@@ -256,6 +256,7 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
| gemma4:26b | 100 % | 91,4 % | 67,7 % | 7,9 s / 12 s | 4 | | gemma4:26b | 100 % | 91,4 % | 67,7 % | 7,9 s / 12 s | 4 |
| gemma4:12B | 94,3 % | 91,4 % | 77,4 % | 21 s / 40 s | 8 | | gemma4:12B | 94,3 % | 91,4 % | 77,4 % | 21 s / 40 s | 8 |
| qwen3.6:27B | 94,3 % | 85,7 % | 80,6 % | 43 s / 89 s | 10 | | qwen3.6:27B | 94,3 % | 85,7 % | 80,6 % | 43 s / 89 s | 10 |
| muse-glimmer:latest | 100 % | 77,1 % | 74,2 % | 37,5 s / 51 s | 1 |
| mistral-small3.1:24b | 100 % | 71,4 % | 58,1 % | 20 s / 43 s | 2 | | mistral-small3.1:24b | 100 % | 71,4 % | 58,1 % | 20 s / 43 s | 2 |
**Entscheidung (D7):** `qwen3.8:27b` ist das Antwortmodell (Protokoll: **Entscheidung (D7):** `qwen3.8:27b` ist das Antwortmodell (Protokoll:
@@ -264,7 +265,11 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests
geführt (4× schneller bei 100 % Zitier-Präzision, aber schwächere geführt (4× schneller bei 100 % Zitier-Präzision, aber schwächere
Quellentreue und 3 statt 2 Fehlverweigerungen). mistral-small3.1 Quellentreue und 3 statt 2 Fehlverweigerungen). mistral-small3.1
(Deutsch-Hypothese) ist praktisch widerlegt: 71,4 % Verweigerungs- (Deutsch-Hypothese) ist praktisch widerlegt: 71,4 % Verweigerungs-
korrektheit. q-008 und q-031 verweigern beide Finalisten — korrektheit. **muse-glimmer** (2026-09-14 nachgereicht): 100 %
Zitier-Präzision bei nur 1 Regenerierung (diszipliniertestes Modell),
aber 8/35 falsche Verweigerungen (Überverweigerung teils trotz
vorhandener Zitate) und 37,5 s mean — Rang 5 von 6, schlägt qwen3.8
in keiner Kennzahl. q-008 und q-031 verweigern alle Top-Kandidaten —
Prompt-/Retrieval-Tuning-Thema, kein Modellthema. Prompt-/Retrieval-Tuning-Thema, kein Modellthema.
- **M4 offen:** Odoo-Integration (separater Plan nach Verifikation der - **M4 offen:** Odoo-Integration (separater Plan nach Verifikation der
Odoo-19-LLM-Module). Odoo-19-LLM-Module).