Koľko VRAM potrebujete na lokálne LLM: Koniec hádania a realita kvantizácie

Koľko VRAM potrebujete na lokálne LLM: Koniec hádania a realita kvantizácie
Ilustračné foto: vytvorené umelou inteligenciou (AZOIA)

Sedíte nad objednávkou novej grafickej karty a v prehliadači máte otvorených päť kariet s porovnávačmi.

Srdce vám hovorí „vezmi 24 GB, nech máš pokoj“, no rozpočet našepkáva „stačí 12 GB“. Otázka, ktorú si kladiete, nie je nová, ale odpoveď sa mení každý polrok: koľko VRAM naozaj potrebujete na lokálne spustenie LLM?

Poďme si to rozobrať bez prehnaných očakávaní a s konkrétnymi číslami, ktoré vám pomôžu pri rozhodovaní. Či už túžite po 7B modeloch na bežnú prácu, alebo snívate o 70B „mozgu“ na domácom serveri, realita je tvrdšia, než sľubujú marketingové materiály.

Základná matematika: Prečo 8 GB nestačí ani na 7B?

Prvý omyl, ktorý spraví takmer každý, je spočítanie veľkosti modelu. Model so 7 miliardami parametrov vo formáte FP16 (16-bitová presnosť) zaberá približne 14 GB pamäte. To je už nad rámcom väčšiny bežných grafických kariet. Používateľská skúsenosť je ale o niečom inom – o kvantizácii.

Kvantizácia je proces, ktorý znižuje presnosť váh modelu, aby sa zmestil do menšej pamäte. Tu je hrubý prehľad pre 7B model:

Kvantizácia Veľkosť modelu Minimálna VRAM (s KV cache) Kvalita výstupu
FP16 ~14 GB 16 GB Referenčná
INT8 ~7 GB 10 GB Takmer na nerozoznanie
INT4 (GGUF Q4_K_M) ~4,1 GB 6 GB Mierne zhoršenie, ale použiteľné

Vidíte ten rozdiel? S 8 GB VRAM (napr. RTX 4060, RTX 3050) dokážete spustiť 7B model len v 4-bitovej kvantizácii. A to ešte narazíte na problém s dĺžkou kontextu. Každý token, ktorý model „vidí“ (vstup aj výstup), zaberá miesto v pamäti. Pri 8 GB VRAM a kontexte 4096 tokenov sa vám model zmestí, ale len čo zvýšite kontext na 8192, pamäť začne byť tesná a výrazne sa spomalí generovanie.

Reálna skúsenosť: Na 8 GB karte beží 7B Q4 model rýchlosťou 20 – 40 tokenov za sekundu. To je čitateľné, ale len čo začnete používať väčší kontext alebo multitasking, narazíte na „out of memory“ chyby.

70B model: Kde sa začína skutočný hardvér

Tu prichádza realita, ktorá mnohých šokuje. 70B model vo FP16 zaberá neuveriteľných 140 GB VRAM. To je mimo dosahu bežných spotrebiteľských kariet. Aj v 4-bitovej kvantizácii (GGUF Q4_K_M) to je stále ~40 GB čistej pamäte na váhy modelu. K tomu si pripočítajte KV cache a operačný systém, a dostávate sa na 48 GB VRAM.

Čo to znamená v praxi?

  • NVIDIA RTX 4090 (24 GB): Nestačí. Model sa nezmestí, pokiaľ nepoužijete extrémnu kvantizáciu (Q2), ktorá výrazne degraduje kvalitu.
  • Dve RTX 4090 (48 GB): Tu sa začína reálna práca, ale narazíte na limit zdieľania pamäte cez PCIe zbernicu. Rýchlosť bude nižšia, ako pri jednej karte, a budete musieť použiť softvér ako llama.cpp, ktorý podporuje rozdelenie modelu.
  • NVIDIA RTX 6000 Ada (48 GB) alebo A6000: Ideálna voľba pre profesionálov, ale cena začína na 7 000 €.

Dôležité upozornenie: Existuje riešenie, ako obísť VRAM – presun časti modelu do systémovej RAM (CPU offloading). Pokiaľ máte 64 GB RAM, môžete spustiť 70B model na karte s 24 GB VRAM, ale rýchlosť generovania klesne na 1 – 3 tokeny za sekundu. To je nepoužiteľné na interaktívnu konverzáciu, ale vhodné na dávkové spracovanie textu.

Pasca na „lacné“ riešenia: Apple Silicon a NPU

Nenechajte sa zmiasť reklamami na notebooky s „Neural Engine“. Spoločnosť Apple síce ponúka zjednotenú pamäť, ale jej šírka pásma je limitujúca. M3 Pro s 18 GB pamäte zvládne 7B model (~25 – 35 tok./s), ale pomalšie ako RTX 4060 (~42 tok./s). Pre 70B modely potrebujete M3 Max s 128 GB RAM, čo je finančne náročnejšie ako postaviť PC s dvoma RTX 4090.

Praktický sprievodca: Čo si teda vybrať?

Rozhodovanie nie je o tom, koľko VRAM „chcete“, ale koľko „potrebujete“. Tu je jasný návod:

  1. Experimentátor (7B modely): Kúpte si grafickú kartu s 12 GB VRAM (napr. RTX 4070). Zvládnete všetky 7B modely v 4-bitovej kvantizácii s dostatočným kontextom a slušnou rýchlosťou. Toto je ideálny bod pomeru cena/výkon.
  2. Náročný používateľ (13B – 34B modely): Potrebujete 16 GB VRAM (RTX 4080 Super, RTX 4070 Ti Super). Zvládnete modely veľkosti 13 – 14B v 4-bitovej kvantizácii (napr. Llama 2 13B); Llama 3 8B a Mistral 7B patria do nižšej kategórie. Na 34B modely to bude tesné, ale s kvantizáciou Q4 to zvládnete.
  3. Profesionál (70B modely): Tu nezostáva nič iné, ako investovať do 48 GB VRAM. Či už kúpite jednu profesionálnu kartu, alebo postavíte dual-GPU setup, rozpočet sa pohybuje od 3 500 € vyššie. Alternatívou je cloudové riešenie s API, ktoré vás vyjde lacnejšie, ak model nepoužívate nonstop.

Skryté náklady, na ktoré sa zabúda

Okrem samotnej VRAM vás čakajú ďalšie výdavky:

  • Napájanie: 70B model na dvoch kartách znamená zdroj s výkonom 1200 W. To je ďalších 200 – 300 €.
  • Chladenie: Dve grafické karty v skrini generujú obrovské teplo. Kvalitné vodné chladenie je takmer nutnosťou pre dlhodobú stabilitu.
  • Softvér: Kým llama.cpp je zadarmo, používateľsky prívetivejšie riešenia ako LM Studio alebo KoboldAI sú síce free, ale pokročilé funkcie (napr. OpenAI kompatibilné API) si vyžadujú konfiguráciu, ktorá zaberie hodiny.

Verdikt: koľko VRAM si naozaj kúpiť

Nekupujte VRAM do zásoby. Kupujte ju podľa modelu, ktorý chcete reálne používať. Pre 80 % používateľov je ideálnou voľbou karta s 12 – 16 GB VRAM. Je to zlatá stredná cesta, ktorá zvládne všetky bežné 7B a 8B modely v plnej kvalite a otvára dvere k experimentovaniu s 13B modelmi. Investícia do 24 GB kariet sa oplatí len vtedy, ak viete, že o pol roka prejdete na väčšie modely. A ak túžite po 70B, pripravte sa na to, že ide o profesionálny hardvér s profesionálnou cenovkou – nie o spotrebnú elektroniku.