LEADERBOARD — natywność + benchmarki zewnętrzne
Wyniki na żywo
LIVE · AUTO-SYNCPOLNATIVE — nasz benchmarkNatywność polszczyzny
Czy model pisze po polsku jak rodzimy użytkownik: fleksja, składnia, leksyka, frazeologia, literatura, realia, kalibracja, styl. 111 itemów, sędzia otwarty. Mierzy to, czego nie łapią benchmarki MCQ.
eval_only · czystoBENCHMARKI ZEWNĘTRZNE — Qwen3.5-9B
wczytuję…
0
benchmarki
suita zewnętrzna
Macierz: benchmarki × modele
sekcje rozdzielone per protokół — liczb między sekcjami nie porównujemywczytuję macierz…