Bake-off ergaenzt: muse-glimmer:latest (Rang 5 von 6)
Nach User-Wunsch im selben Protokoll gemessen (35 Goldset-Fragen): 100% Zitier-Praezision bei nur 1 Regenerierung (diszipliniertestes Modell), aber 8/35 falsche Verweigerungen (Ueberverweigerung teils trotz vorhandener Zitate) und 37,5s mean - schlaegt qwen3.8:27b in keiner Kennzahl. D7 unveraendert: qwen3.8:27b bleibt fixiert.
This commit is contained in:
+10
-5
@@ -35,16 +35,21 @@ zu planen).
|
||||
einen eigenen, fast leeren Ollama auf localhost:11434 (dorthin ging der
|
||||
erste bge-m3-Pull — auf die GPU-Maschine neu gepullt). Ziel-Instanz ist
|
||||
ausschließlich `http://100.103.83.12:11435`.
|
||||
- **Bake-off M3 — abgeschlossen (D7)**: alle 5 Kandidaten gemessen
|
||||
- **Bake-off M3 — abgeschlossen (D7)**: alle 6 Kandidaten gemessen
|
||||
(Tabelle in `planung.md` Abschnitt 13). **`qwen3.8:27b` gewinnt**
|
||||
(100 % Zitier-Präzision, 94,3 % Verweigerung korrekt, 80,6 % erwartete
|
||||
Quelle, 32 s mean). `gemma4:26b` = dokumentierter Latenz-Kandidat
|
||||
(7,9 s mean, 100 % Zitier-Präzision, aber 67,7 % Quellentreue, 3
|
||||
Fehlverweigerungen). mistral-small3.1: 71,4 % Verweigerungskorrektheit
|
||||
— Deutsch-Hypothese praktisch widerlegt. qwen3.6:27B: 2 dauerhafte
|
||||
Zitierverletzungen, 10 Regenerierungen. gemma4:12B: 2 Verletzungen.
|
||||
Reports: `data/eval-*.json`. q-008/q-031 verweigern beide Finalisten —
|
||||
Prompt-/Retrieval-Tuning (nicht modellspezifisch).
|
||||
— Deutsch-Hypothese praktisch widerlegt. **muse-glimmer:latest**
|
||||
(nachgereicht): 100 % Zitier-Präzision bei nur 1 Regenerierung
|
||||
(diszipliniertestes Modell), aber 8/35 falsche Verweigerungen
|
||||
(Überverweigerung teils trotz vorhandener Zitate) und 37,5 s mean —
|
||||
Rang 5 von 6, schlägt qwen3.8 in keiner Kennzahl. qwen3.6:27B: 2
|
||||
dauerhafte Zitierverletzungen, 10 Regenerierungen. gemma4:12B:
|
||||
2 Verletzungen.
|
||||
Reports: `data/eval-*.json`. q-008/q-031 verweigern alle
|
||||
Top-Kandidaten — Prompt-/Retrieval-Tuning (nicht modellspezifisch).
|
||||
- **Remote-GPU-Maschine**: nach `systemctl restart ollama` (User-Aktion)
|
||||
liefen alle Läufe stabil; zwischen Kandidaten wurde per `keep_alive: 0`
|
||||
entladen (Crash-Ursache war der Modell-Swap-Stress beim gemma4-Lauf).
|
||||
|
||||
Reference in New Issue
Block a user