Każda domena benchmarku ma inną dźwignię. Skille i zachowania (fleksja, kalibracja, styl) bije capability-SFT. Pamięć kulturowa (literatura, realia) wymaga CPT na korpusie PL. Liczby bazy są realne (PolNative v1); SFT/CPT to prognoza z planu.
Sama capability-SFT podnosi większość domen, ale literatura (waga 16/111, baza 16/100) trzyma overall poniżej — dopiero CPT domyka lukę. SFT to ~2/3 drogi.
| domena | n | klasa | baza | +SFT | +CPT | dźwignia |
|---|---|---|---|---|---|---|
| kalibracja | 5 | SFT | 40 | 72 | 74 | granica wiedzy: 'nie wiem' + pytania odwrotne |
| naturalność | 7 | SFT | 43 | 78 | 80 | de-translationese, anty-AI-tell (mamy pipeline) |
| fleksja | 18 | SFT | 56 | 82 | 84 | Morfeusz2 → gold deterministyczny; correction-pairs |
| rejestr | 4 | SFT | 62 | 85 | 86 | przepisywanie między rejestrami; styl |
| EQ | 8 | SFT | 62 | 78 | 80 | krótkie ludzkie odpowiedzi, anty-coaching |
| ortografia | 11 | SFT | 68 | 85 | 86 | skończona lista confusables + reforma 1997 |
| składnia | 12 | SFT | 71 | 84 | 86 | inwentarz rekcji/imiesłów/swój; correction-pairs |
| leksyka | 10 | SFT | 85 | 88 | 89 | pleonazmy/paronimy PRESKRYPTYWNIE |
| literatura | 16 | CPT | 16 | 30 | 88 | atrybucja = pamięć parametryczna; CPT na Wolnych Lekturach/wiki |
| frazeologia | 11 | MIX | 68 | 74 | 90 | znaczenie/dokończenie SFT-em; głęboki recall CPT |
| realia | 9 | CPT | 89 | 90 | 96 | długi ogon tradycji; CPT na korpusie PL |