BENCHMARK RUNNER — modele × Open PL Suite

Wrzuć model, dostań wyniki

PROTOTYP

// runner GPU w drodze — na razie zgłoś model na Discordzie

ModelGeneratywnyMCQGuardyDataSuite

Tylko benchmarki na publicznych datasetach. Ranking wg agregatu generatywnego (oficjalna miara jakości), Δ liczone vs Qwen3.5-9B. Dwa protokoły — generatywny (exact_match) i MCQ (acc) — są niezależne i nieporównywalne między sobą. metodologia →
⚠ Liczby bazy (Qwen3.5-9B) i Bielika oraz guardów EN to dane poglądowe — placeholder do czasu realnego runu na GPU. Liczby kandydata pochodzą z realnego pomiaru.