Kvantizácia modelov: Ako zmestiť „mozgového giganta“ LLM do vášho notebooku

Kvantizácia modelov: Ako zmestiť „mozkového giganta“ LLM do vášho notebooku
Ilustračné foto: vytvorené umelou inteligenciou (AZOIA)

Váš herný notebook s RTX 4060 má 8 GB vlastnej videopamäte a vy práve skúšate spustiť lokálny jazykový model.

Systém zamrzne, swapuje a po troch minútach dostanete odpoveď, ktorá by sa na webe načítala za sekundu. Presne v tomto momente zistíte, že výkon GPU nie je jediný limit – je ním kapacita VRAM. Kvantizácia je jediný spôsob, ako dostať výkonné modely do malej pamäte bez toho, aby ste museli predať obličku na nákup H100.

Čo sa vlastne deje pod kapotou

Keď model ako Llama 3 70B načítate v štandardnej presnosti FP16, každý parameter zaberá 2 bajty. To znamená, že samotné váhy modelu potrebujú 140 GB pamäte – a to ešte nepočítame kontext, medzivrstvy a aktivačné mapy. Na bežnom hardvéri je to sci-fi. Kvantizácia znižuje presnosť čísel, ktorými sú váhy uložené, a tým radikálne zmenšuje pamäťovú stopu.

  • FP16 / BF16 – 16 bitov na parameter, plná presnosť, 2 bajty
  • INT8 – 8 bitov, 1 bajt, strata presnosti minimálna
  • INT4 – 4 bity, 0,5 bajtu, viditeľná degradácia, ale stále použiteľné
  • INT3 / INT2 – extrémna kompresia, vhodná len pre experimenty

Praktická matematika: čo si môžete dovoliť

Poďme na konkrétne čísla, ktoré vám dajú okamžitú predstavu. Model Llama 3 8B v rôznych presnostiach:

Presnosť Veľkosť v RAM Výsledok
FP16 ~16 GB Plynulý chod len na výkonnom GPU
INT8 ~8 GB Beží na RTX 3060 / 4060
INT4 (GGUF) ~4,5 GB Beží aj na integrovanej grafike

Vidíte ten skok? Z 16 GB na 4,5 GB je rozdiel medzi „nemám šancu“ a „beží to na mojom starom notebooku“. Pre model 70B je to ešte dramatickejšie – s kvantizáciou na 4 bity sa zmestí do 35 GB, čo je reálne na dvoch RTX 3090 alebo jednom Mac Studio s dostatkom unifikovanej pamäte.

Nie je kvantizácia ako kvantizácia

Tu začína byť téma zaujímavá. Pri kvantizácii totiž nejde len o „koľko bitov“, ale o to, ako presne to urobíte. Dve hlavné metódy, ktoré dnes dominujú:

Post-tréningová kvantizácia (PTQ) – vezmete hotový model a prepočítate váhy na nižšiu presnosť. Rýchle, jednoduché, ale pri veľmi nízkych bitoch strácate kvalitu.

Kvantizácia s vedomým tréningom (QAT) – model sa trénuje už s kvantizovanými váhami, takže sa naučí kompenzovať stratu presnosti. Výsledok je kvalitnejší, ale vyžaduje prístup k tréningovým dátam a výpočtovému výkonu.

Pre bežného používateľa je dôležité vedieť, že formát GGUF od projektu llama.cpp je de facto štandardom pre lokálne spúšťanie. Obsahuje kvantizované verzie modelov a môžete si vybrať z rôznych úrovní – od Q2_K po Q8_0. Každá má iný pomer veľkosť/kvalita.

Konkrétne odporúčania pre váš hardvér

Podľa dostupnej pamäte sa dá voliť takto:

  • 8 GB VRAM (RTX 3060/4060): Zvoľte model 7B–8B v kvantizácii Q4_K_M. Zaberie ~4,5 GB, zvyšok pamäte nechajte pre kontext. S 8k tokenmi kontextu to pôjde plynulo.
  • 12 GB VRAM (RTX 4070, RTX 3080 12GB — základná 3080 má len 10 GB): Môžete siahnuť po modeli 13B v Q5_K_M (~8 GB) alebo 8B v Q8_0 (~8,5 GB). Kvalita výstupov je výrazne lepšia ako pri 4-bitovej verzii.
  • 16 GB VRAM (RTX 4080/4080 Super): Model 34B v Q4_K_M (~20 GB) sa nezmestí, ale 13B v Q8_0 (~14 GB) je ideálny. Prípadne skúste 30B v Q3_K_S, ak tolerujete nižšiu kvalitu.
  • Mac s 32 GB unifikovanej pamäte: Modely 30B–34B v Q4_K_M bežia prekvapivo dobre vďaka veľkej priepustnosti pamäte.

Pasca, na ktorú každý zabudne

Najväčší omyl začiatočníkov? Sledujú len veľkosť váh a ignorujú pamäť pre kontext. Keď modelu dáte 32 000 tokenov kontextu, aktivačné mapy a key-value cache môžu zjesť ďalších 5–10 GB v závislosti od architektúry. To znamená, že model, ktorý sa „tesne zmestí“ do VRAM, v praxi spadne na swap a výkon sa prepadne na desatinu.

Praktické pravidlo: veľkosť modelu + 20 % rezerva pre kontext a výpočty = minimálna pamäť. Ak máte 12 GB VRAM, nekupujte model, ktorý zaberá 11 GB. Budete frustrovaní.

Čo si teda vybrať?

Pre 90 % používateľov je odpoveď jednoznačná: Q4_K_M. Je to ideálny bod medzi veľkosťou a kvalitou, ktorý podporujú všetky populárne nástroje (Ollama, LM Studio, llama.cpp). Ak máte dostatok pamäte a chcete maximálnu kvalitu, skúste Q8_0 – rozdiel v kvalite je citeľný hlavne pri dlhších a komplexnejších odpovediach.

Vyhnite sa Q2 a Q3, pokiaľ neexperimentujete. Pri týchto úrovniach model stráca schopnosť logického uvažovania a generuje nezmysly, ktoré vyzerajú sebavedome – čo je horšie ako priznanie nevedomosti.

Technický verdikt

Kvantizácia nie je kompromis, ale nevyhnutná evolúcia pre lokálne spúšťanie AI. V roku 2026 je Q4_K_M štandardom, ktorý odporúčame ako východiskový bod pre akýkoľvek model a hardvér. Ak máte výkonnejšiu grafiku, posuňte sa na Q8_0 a uvidíte rozdiel. Ak máte slabší stroj, kvantizácia vám umožní spustiť modely, o ktorých ste si mysleli, že sú mimo váš dosah – a to za cenu, ktorú vo väčšine prípadov na výstupe ani nespoznáte.