SLAYER PROTOCOL · BENCHMARKPOLNATIVE v1 · RAPORT

PolNative v1 — natywność polszczyzny

Benchmark poprawnej polszczyzny i polskości generacji: fleksja, składnia, ortografia, leksyka, frazeologia, atrybucja literacka, realia, kalibracja wiedzy lokalnej, EQ i naturalność. Mierzy osie, na których wykładają się modele trenowane głównie na angielskim.

DATA 2026-06-13 ITEMÓW 111 SĘDZIA qwen/qwen3.5-122b-a10b SKALA pass=1, mixed=0.5, fail=0 → 0–100

Wynik ogólny

Qwen3.5-27B openrouter · temp 0.7 58.6

Per domena

Qwen3.5-27B
0 25 50 75 100 leksyka 85 realia 89 składnia 71 frazeologia 68 ortografia 68 rejestr 62 EQ / pragmatyka 62 fleksja 56 naturalność 43 kalibracja 40 literatura 16

Sprawdzalne formy vs ocena stylu

Qwen3.5-27B
auto (formy)
60.7
sędzia (styl, kalibracja)
54.9

Wnioski

Proweniencja. Tryb auto = deterministyczne grupy substringów/regexów (formy w użyciu). Tryb judge = otwarty sędzia qwen/qwen3.5-122b-a10b z rubryką pass/mixed/fail per item. Każdy model na rekomendowanym samplingu wydawcy (nie handicap).
Czystość. Raport pokazuje wyłącznie agregaty. Itemy benchmarku są prywatne (eval_only, nie wchodzą do treningu) — anti-leak. Runy bez pustych odpowiedzi i błędów sędziego.
Slayer protocol · otwarte laboratorium polskiego LLM-a.