Benchmark poprawnej polszczyzny i polskości generacji: fleksja, składnia, ortografia,
leksyka, frazeologia, atrybucja literacka, realia, kalibracja wiedzy lokalnej, EQ i naturalność.
Mierzy osie, na których wykładają się modele trenowane głównie na angielskim.
DATA 2026-06-13ITEMÓW 111SĘDZIA qwen/qwen3.5-122b-a10bSKALA pass=1, mixed=0.5, fail=0 → 0–100
Wynik ogólny
Per domena
Qwen3.5-27B
Sprawdzalne formy vs ocena stylu
Qwen3.5-27B
auto (formy)
60.7
sędzia (styl, kalibracja)
54.9
Wnioski
Qwen3.5-27B (baza) uzyskuje 58.6/100. To punkt startu dla treningu.
Najsilniejsze domeny bazy: realia 89, leksyka 85, składnia 71 — wiedza i poprawność leksykalna są już mocne.
Najsłabsze domeny: literatura 16, kalibracja 40, naturalność 43 — pamięć kulturowa, granica wiedzy i de-translationese to główne cele SFT/CPT.
Czerwona lampa: literatura 16/100 — atrybucja i pamięć parametryczna o polskiej literaturze wymaga CPT na korpusie PL.
Rozjazd auto−sędzia (60.7 vs 54.9) niewielki: forma i styl są zbliżone, ale obie poniżej celu — przestrzeń dla Slayera.
Proweniencja. Tryb auto = deterministyczne grupy substringów/regexów (formy w użyciu).
Tryb judge = otwarty sędzia qwen/qwen3.5-122b-a10b z rubryką pass/mixed/fail per item.
Każdy model na rekomendowanym samplingu wydawcy (nie handicap). Czystość. Raport pokazuje wyłącznie agregaty. Itemy benchmarku są prywatne
(eval_only, nie wchodzą do treningu) — anti-leak. Runy bez pustych odpowiedzi i błędów sędziego. Slayer protocol · otwarte laboratorium polskiego LLM-a.