diff --git a/.agents/MEMORY.md b/.agents/MEMORY.md index c4716ff..59a2c76 100644 --- a/.agents/MEMORY.md +++ b/.agents/MEMORY.md @@ -35,16 +35,21 @@ zu planen). einen eigenen, fast leeren Ollama auf localhost:11434 (dorthin ging der erste bge-m3-Pull — auf die GPU-Maschine neu gepullt). Ziel-Instanz ist ausschließlich `http://100.103.83.12:11435`. -- **Bake-off M3 — abgeschlossen (D7)**: alle 5 Kandidaten gemessen +- **Bake-off M3 — abgeschlossen (D7)**: alle 6 Kandidaten gemessen (Tabelle in `planung.md` Abschnitt 13). **`qwen3.8:27b` gewinnt** (100 % Zitier-Präzision, 94,3 % Verweigerung korrekt, 80,6 % erwartete Quelle, 32 s mean). `gemma4:26b` = dokumentierter Latenz-Kandidat (7,9 s mean, 100 % Zitier-Präzision, aber 67,7 % Quellentreue, 3 Fehlverweigerungen). mistral-small3.1: 71,4 % Verweigerungskorrektheit - — Deutsch-Hypothese praktisch widerlegt. qwen3.6:27B: 2 dauerhafte - Zitierverletzungen, 10 Regenerierungen. gemma4:12B: 2 Verletzungen. - Reports: `data/eval-*.json`. q-008/q-031 verweigern beide Finalisten — - Prompt-/Retrieval-Tuning (nicht modellspezifisch). + — Deutsch-Hypothese praktisch widerlegt. **muse-glimmer:latest** + (nachgereicht): 100 % Zitier-Präzision bei nur 1 Regenerierung + (diszipliniertestes Modell), aber 8/35 falsche Verweigerungen + (Überverweigerung teils trotz vorhandener Zitate) und 37,5 s mean — + Rang 5 von 6, schlägt qwen3.8 in keiner Kennzahl. qwen3.6:27B: 2 + dauerhafte Zitierverletzungen, 10 Regenerierungen. gemma4:12B: + 2 Verletzungen. + Reports: `data/eval-*.json`. q-008/q-031 verweigern alle + Top-Kandidaten — Prompt-/Retrieval-Tuning (nicht modellspezifisch). - **Remote-GPU-Maschine**: nach `systemctl restart ollama` (User-Aktion) liefen alle Läufe stabil; zwischen Kandidaten wurde per `keep_alive: 0` entladen (Crash-Ursache war der Modell-Swap-Stress beim gemma4-Lauf). diff --git a/agent/README.md b/agent/README.md index a212cad..7de1822 100644 --- a/agent/README.md +++ b/agent/README.md @@ -92,6 +92,7 @@ Post-Validierung abgefangen und regeneriert) · Verweigerung korrekt | gemma4:26b | 100 % | 91,4 % | 67,7 % | **7,9 s** / 12 s | | gemma4:12B | 94,3 % | 91,4 % | 77,4 % | 21 s / 40 s | | qwen3.6:27B | 94,3 % | 85,7 % | 80,6 % | 43 s / 89 s | +| muse-glimmer:latest | 100 % | 77,1 % | 74,2 % | 37,5 s / 51 s | | mistral-small3.1:24b | 100 % | 71,4 % | 58,1 % | 20 s / 43 s | `gemma4:26b` bleibt als dokumentierter Latenz-Kandidat für späteres diff --git a/planung.md b/planung.md index ffd0d11..edc7cad 100644 --- a/planung.md +++ b/planung.md @@ -256,6 +256,7 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests | gemma4:26b | 100 % | 91,4 % | 67,7 % | 7,9 s / 12 s | 4 | | gemma4:12B | 94,3 % | 91,4 % | 77,4 % | 21 s / 40 s | 8 | | qwen3.6:27B | 94,3 % | 85,7 % | 80,6 % | 43 s / 89 s | 10 | + | muse-glimmer:latest | 100 % | 77,1 % | 74,2 % | 37,5 s / 51 s | 1 | | mistral-small3.1:24b | 100 % | 71,4 % | 58,1 % | 20 s / 43 s | 2 | **Entscheidung (D7):** `qwen3.8:27b` ist das Antwortmodell (Protokoll: @@ -264,7 +265,11 @@ tests/ # pytest: Ingest-, Retrieval-, Grounding-Unit-Tests geführt (4× schneller bei 100 % Zitier-Präzision, aber schwächere Quellentreue und 3 statt 2 Fehlverweigerungen). mistral-small3.1 (Deutsch-Hypothese) ist praktisch widerlegt: 71,4 % Verweigerungs- - korrektheit. q-008 und q-031 verweigern beide Finalisten — + korrektheit. **muse-glimmer** (2026-09-14 nachgereicht): 100 % + Zitier-Präzision bei nur 1 Regenerierung (diszipliniertestes Modell), + aber 8/35 falsche Verweigerungen (Überverweigerung teils trotz + vorhandener Zitate) und 37,5 s mean — Rang 5 von 6, schlägt qwen3.8 + in keiner Kennzahl. q-008 und q-031 verweigern alle Top-Kandidaten — Prompt-/Retrieval-Tuning-Thema, kein Modellthema. - **M4 offen:** Odoo-Integration (separater Plan nach Verifikation der Odoo-19-LLM-Module).