LEADERBOARD — natywność + benchmarki zewnętrzne

Wyniki na żywo

LIVE · AUTO-SYNC
POLNATIVE — nasz benchmark

Natywność polszczyzny

Czy model pisze po polsku jak rodzimy użytkownik: fleksja, składnia, leksyka, frazeologia, literatura, realia, kalibracja, styl. 111 itemów, sędzia otwarty. Mierzy to, czego nie łapią benchmarki MCQ.

eval_only · czysto
wczytuję…
skala 0–100 · pass=1, mixed=0.5, fail=0wizualny raport →strategia SFT/CPT →
BENCHMARKI ZEWNĘTRZNE — Qwen3.5-9B

wczytuję…

model
Qwen3.5-9B
0
benchmarki
suita zewnętrzna

Macierz: benchmarki × modele

sekcje rozdzielone per protokół — liczb między sekcjami nie porównujemy
wczytuję macierz…