// runner GPU w drodze — na razie zgłoś model na Discordzie
| Model | Generatywny | MCQ | Guardy | Data | Suite |
|---|
Tylko benchmarki na publicznych datasetach. Ranking wg agregatu generatywnego (oficjalna miara jakości), Δ liczone vs Qwen3.5-9B. Dwa protokoły — generatywny (exact_match) i MCQ (acc) — są niezależne i nieporównywalne między sobą. metodologia →
⚠ Liczby bazy (Qwen3.5-9B) i Bielika oraz guardów EN to dane poglądowe — placeholder do czasu realnego runu na GPU. Liczby kandydata pochodzą z realnego pomiaru.