Lokálne AI modely v slovenčine: Ktoré zvládnu nárečia a prečo je kvalita tréningových dát kľúčová
Predstavte si, že zadáte lokálnemu modelu vetu „Ideme na hríby, ale treba si vziať krompáče a poriadny kabát, lebo fučí ako zo železnej baby." Výstup, ktorý dostanete, rozhodne o tom, či AI rozumie nielen spisovnej slovenčine, ale aj vášmu regiónu. Kým globálne modely ako GPT-4o alebo Claude dominujú v angličtine, pre slovenčinu je situácia diametrálne odlišná. Poďme sa pozrieť na to, ktoré lokálne modely (LLM) zvládajú naše nárečia a prečo je kvalita tréningových dát alfou a omegou celého problému.
Prečo je slovenčina pre AI tvrdý oriešok?
Na rozdiel od angličtiny, ktorá má relatívne jednotnú štruktúru, slovenčina je flektívny jazyk. To znamená, že koncovky slov sa menia podľa pádu, rodu a čísla. Model, ktorý sa učí na dátach, musí pochopiť nielen lexikálny význam slova, ale aj jeho gramatickú funkciu vo vete. K tomu sa pridávajú nárečia – od západoslovenského trnavského cez stredoslovenské až po východniarske šarišské. Každé z nich má vlastnú fonetiku, slovnú zásobu a syntax.
Podiel slovenských textov v bežných tréningových korpusoch, ako je The Pile, je menej ako 0,1 %. To je alarmujúce číslo. Model, ktorý videl milióny anglických viet, ale len pár tisíc slovenských, bude mať tendenciu „premýšľať" po anglicky a slovenčinu len pretavovať. Výsledkom sú gramaticky chybné vety, nesprávny slovosled a úplné zlyhanie pri nárečových výrazoch.
Ktoré modely teda stoja za zváženie?
Pre lokálne nasadenie (napr. cez Ollama alebo LM Studio) máte v roku 2026 niekoľko zaujímavých volieb. Kľúčový je pomer výkonu a veľkosti, keďže bežný používateľ nemá k dispozícii datacentrum.
-
Mistral 7B a jej slovenské odnože (napr. slovenian-mistral-7b): Tento model je vynikajúci na generovanie textu a sumarizáciu. Jeho slovenské fine-tune verzie, trénované na dátach z korpusu SlovakSum (približne 1,2 milióna článkov), zvládajú spisovnú slovenčinu na vysokej úrovni. Kontextové okno je 8 000 tokenov, čo je dostatok na bežnú prácu. Problém nastáva pri nárečiach – model ich pozná len okrajovo, pretože tréningové dáta boli primárne z periodík.
-
Qwen 2.5 14B (Instruct): Tento model od Alibaba Cloud prekvapil mnohých. Hoci je primárne trénovaný na čínštine a angličtine, jeho viacjazyčné schopnosti sú nadpriemerné. V testoch porozumenia slovenčine (napr. na báze slovenského Belebele) dosahuje približne 82 % úspešnosť (Qwen Team, 2025). Čo je dôležitejšie, vďaka svojej veľkosti a lepšej architektúre si poradí aj s niektorými stredoslovenskými nárečovými prvkami, najmä ak im predchádza kontextová nápoveda. Jeho maximálny kontext je 32 000 tokenov, čo je výborné na analýzu dlhých dokumentov.
-
Llama 3.1 8B (Instruct): Meta je síce veľký hráč, ale pre slovenčinu to nie je žiadna výhra. Model je trénovaný na dátach, kde slovenský jazyk tvorí menej ako 0,05 % (Meta, 2024). Výsledkom je, že rozumie jednoduchým vetám, ale pri komplexnejšej syntaxi alebo nárečiach generuje nezmysly. Použiteľný je len na jednoduché úlohy, ako je extrakcia kľúčových slov, nie na tvorbu obsahu.
-
Špecializované modely pre slovenčinu (napr. SlovakBERT, SlovakT5): Tieto modely nie sú univerzálne LLM, ale skôr enkodéry alebo špecializované generátory. SlovakT5 (Kocur a kol., 2024) je výborný na prepis a sumarizáciu, ale nie je to chatbot. Pre bežného používateľa, ktorý chce „rozprávať" s AI, sú tieto modely menej vhodné, ale pre špecifické úlohy, ako je analýza sentimentu v recenziách, sú nenahraditeľné.
Kvalita tréningových dát: Tichý zabijak výkonu
Prečo teda modely ako Qwen zvládajú nárečia lepšie ako Mistral, hoci Mistral je „bližšie" k Európe? Odpoveď je v dátach. Qwen použil pri tréningu agresívnejšiu stratégiu deduplikácie a vyváženia jazykov. Namiesto toho, aby do modelu napchal všetko, čo našiel, použil kvalitatívne filtre. To znamená, že aj keď mal menej slovenských dát, tie, ktoré použil, boli gramaticky správne a pokrývali širšie spektrum žánrov vrátane fór a blogov, kde sa nárečia prirodzene vyskytujú.
Naopak, mnohé open-source fine-tune modely trpia na „otravu dátami". Ak trénujete model na prekladoch z angličtiny, ktoré sú robotické a neprirodzené, model sa to naučí. Výsledkom je, že generuje text, ktorý je síce po slovensky, ale znie ako zlý strojový preklad. Preto je kľúčové sledovať, na akom korpuse bol model trénovaný. Hľadajte modely, ktoré uvádzajú, že použili dáta z korpusu Slovak National Corpus alebo HuggingFace Slovak dataset, nie len „random web crawl".
Praktické odporúčanie pre rok 2026
Ak chcete lokálny model, ktorý rozumie nárečiam a je použiteľný na bežnú prácu, odporúčam zvoliť Qwen 2.5 14B (Instruct). Je to ideálny bod medzi výkonom a hardvérovými nárokmi. Na jeho spustenie potrebujete GPU s aspoň 10 GB VRAM (napr. RTX 3080 alebo lepšiu), alebo ho môžete kvantizovať na 4-bit, čo zníži nároky na 6 GB.
Pre tých, ktorí majú slabší hardvér, je tu možnosť použiť Mistral 7B, ale počítajte s tým, že nárečia pre vás zostanú nedostupné. Ak je vašou prioritou výhradne spisovná slovenčina a potrebujete rýchle odpovede, Mistral je stále dobrou voľbou.
Vyhnite sa modelom ako Llama 3.1 8B, ak potrebujete kvalitný slovenský výstup. Jeho výkon je v tomto smere sklamaním a strávite viac času opravovaním chýb, ako samotnou prácou.
Technický záver: Kvalita dát nad kvantitou, Qwen ako víťaz pre nárečia
Záver je jasný: pre lokálne spracovanie slovenčiny a nárečí v roku 2026 je Qwen 2.5 14B (Instruct) najlepšou voľbou z hľadiska pomeru výkon/cena. Jeho schopnosť pracovať s kontextom a generalizovať na základe kvalitných dát ho stavia nad konkurenciu. Kľúčom k úspechu nie je množstvo dát, ale ich čistota a diverzita. Ak váš model nepozná šarišské „idzem" alebo trnavské „pôjdem", nie je to chyba architektúry, ale tréningového korpusu. Sledujte, na akých dátach bol model trénovaný, a vyhnete sa tak mnohým frustráciám.
Zdroje
- Qwen Team — Qwen 2.5 Technical Report, qwenlm.github.io (citované 5. 8. 2026)
- Meta — Llama 3 Model Card, llama.meta.com (citované 5. 8. 2026)
- Kocur a kol. — SlovakT5: Pre-training and Evaluation, arxiv.org (citované 5. 8. 2026)