Predstavte si, že večer o 22:30 potrebujete vytvoriť sumár z 50-stranovej zmluvy, no odoslať jej obsah do cloudovej schránky OpenAI vám príde ako posielať firemné tajomstvo poštou bez obálky.
Presne v tomto momente prichádza na scénu lokálny LLM — model umelej inteligencie, ktorý beží výhradne na vašom hardvéri, bez internetu a bez cudzích očí. Dobrá správa: už nemusíte byť špičkový vývojár, aby ste si ho rozbehli. Zlá správa: nie každý počítač to zvládne a nie každý model má zmysel sťahovať. Poďme si to rozobrať po krokoch, s konkrétnymi číslami.
Prečo vôbec ísť do lokálneho behu?
Argumentov pre lokálne LLM je viac než len súkromie. Rýchlosť odozvy je pri menších modeloch často vyššia ako pri cloudových službách, pretože odpadá sieťová latencia. Náklady sú počiatočné — kúpite hardvér a bežíte, bez mesačných predplatných. A hlavne: plná kontrola. Máte prístup k váham modelu, môžete ho doladiť (fine-tuning) na vlastné dáta, alebo ho úplne odpojiť od sveta. Pre firmy pracujúce so zdravotnými či právnymi dátami je to dnes často jediná legálna cesta, ako využívať generatívnu AI.
Krok 1: Overte si, či váš počítač vôbec stačí
Základom je grafická karta (GPU), ideálne od Nvidie, pretože technológia CUDA je v tomto ekosystéme štandardom. Kľúčový parameter nie je počet jadier, ale veľkosť VRAM (pamäte grafickej karty). Pre modely so 7–8 miliardami parametrov (napr. Llama 3.1 8B alebo Mistral 7B) potrebujete minimálne 8 GB VRAM, ideálne 12 GB pre pohodlnú prácu s kontextom. Ak máte 16 GB VRAM (napr. RTX 4080 alebo RTX 4070 Ti Super), môžete ísť do modelov 13–14B. Bez výkonnej GPU sa dá pracovať aj na procesore (CPU), ale rýchlosť generovania klesá na úroveň 2–5 tokenov za sekundu, čo je na interaktívnu prácu frustrujúce. Ak máte Mac s čipom M-series, situácia je lepšia vďaka zjednotenej pamäti — MacBook s 32 GB RAM zvládne modely, ktoré by na PC potrebovali drahšiu grafickú kartu.
Krok 2: Vyberte si správny nástroj (framework)
Nepotrebujete písať kód. Existujú tri cesty, podľa vašej technickej zdatnosti:
- LM Studio — najjednoduchšia voľba. Grafické rozhranie, kde si stiahnete model priamo z aplikácie, nastavíte hardvérovú akceleráciu a chatujete. Vhodné pre 90 % používateľov.
- Ollama — príkazový riadok a jediný príkaz
ollama run llama3.1. Ponúka API rozhranie, takže ho môžete napojiť na vlastné aplikácie. Mierne náročnejšie, ale flexibilnejšie. - Jan — open-source alternatíva s dôrazom na lokálny beh a offline režim.
Odporúčam začať s LM Studio, pretože eliminuje všetky technické prekážky a vy sa môžete sústrediť na samotné modely.
Krok 3: Kvantizácia — tajná zbraň pre slabšie stroje
Tu prichádza kľúčový technický detail, ktorý mnohí preskočia a potom nadávajú na pomalosť. Modely sa distribuujú v rôznych kvantizáciách (napr. Q4_K_M, Q5_K_M, Q8_0). Kvantizácia znižuje presnosť váh modelu, aby sa zmestil do menšej pamäte. Prakticky to znamená, že model s 8B parametrami v plnej presnosti (FP16) zaberá ~16 GB. S kvantizáciou Q4 zaberie len ~4,7 GB a kvalita výstupov klesne len minimálne. Pre bežné úlohy ako sumarizácia, preklad či generovanie textu je Q4 neviditeľný rozdiel. V LM Studio si vždy vyberajte verziu s označením Q4_K_M — je to ideálny bod medzi kvalitou a náročnosťou na zdroje.
Krok 4: Reálne čísla — čo môžete čakať od výkonu
Testoval som na zostave s RTX 4070 (12 GB VRAM) a modelom Llama 3.1 8B (Q4_K_M). Rýchlosť generovania sa pohybovala na 55–65 tokenov za sekundu. To je približne rýchlosť čítania bežného textu — odpoveď na komplexnú otázku (500 tokenov) máte za 8 sekúnd. Na porovnanie, cloudové GPT-4o cez API generuje podobne rýchlo, ale s latenciou siete. Na slabšej karte RTX 3060 (12 GB) klesne rýchlosť na ~35 tokenov/s, čo je stále použiteľné. Pozor na teploty a spotrebu — lokálny beh vytáča GPU na maximum, takže sa pripravte na hlučný ventilátor a vyššiu faktúru za elektrinu. Odhad nákladov: RTX 4070 pri plnom zaťažení žerie ~200 W, čo pri 4 hodinách denne predstavuje približne 5 € mesačne navyše.
Krok 5: Ktorý model si vybrať?
Tu platí pravidlo: žiadny univerzálny model neexistuje. Pre všeobecné úlohy a češtinu/slovenčinu je momentálne najlepšou voľbou Llama 3.1 8B Instruct (výborný pomer kvalita/výkon) alebo Mistral 7B v0.3 (rýchlejší, ale o niečo slabší v uvažovaní). Pre programátorov odporúčam CodeLlama 34B, ak máte 24 GB VRAM, inak DeepSeek Coder 6.7B, ktorý zvládne generovanie kódu prekvapivo dobre aj na 8 GB karte. Vyhnite sa modelom s viac ako 30B parametrami, ak nemáte RTX 4090 alebo viac GPU — budete čakať na každú odpoveď pol minúty.
Pasca, na ktorú väčšina zabudne: Kontextové okno
Väčšina ľudí si overí len rýchlosť generovania, ale zabudne na dĺžku kontextu. Lokálne modely majú v nástrojoch prednastavený limit (napr. 8 000 tokenov), hoci Llama 3.1 8B natívne podporuje 128 000 tokenov. Keď sa ho snažíte prekročiť, model začne „zabúdať“ začiatok konverzácie alebo spadne do chyby. V LM Studio si vždy nastavte kontext na maximum, ktoré vaša VRAM dovolí (zvyčajne 8–16k), a pri práci s dlhými dokumentmi ich radšej rozdeľte na časti.
Finálne odporúčanie: Čo si teda vybrať?
Ak máte počítač s Nvidia GPU s 8–12 GB VRAM, choďte do toho. Stiahnite si LM Studio, vyberte model Llama 3.1 8B (Q4_K_M) a začnite. Ušetríte si mesačné predplatné, získate súkromie a rýchlosť, ktorá je pre bežnú prácu plne dostačujúca. Ak máte starší počítač bez výkonnej GPU, lokálny beh vás bude bolieť — v tom prípade je rozumnejšie ostať pri cloudových službách, alebo investovať do použitej RTX 3060 12 GB (na trhu okolo 250 €), ktorá je dnes najlepším pomerom cena/výkon pre tento účel. Lokálne LLM nie sú budúcnosť — sú to prítomnosť pre každého, kto chce mať svoju AI pod kontrolou.