Lokálna AI za rozumné peniaze: koľko VRAM reálne potrebujete a kde sú hranice rozpočtu

Lokálna AI: Prestaňte platiť predplatné a postavte si vlastný „mozog“ v PC
Ilustračné foto: vytvorené umelou inteligenciou (AZOIA)

Lokálna AI za rozumné peniaze: Koľko VRAM reálne potrebujete a kde sú hranice rozpočtu?

Predstavte si, že práve spustíte inštaláciu modelu Llama 3 70B a po piatich minútach čakania vám systém vypľuje chybu „CUDA out of memory“. Presne v tomto momente pochopíte, že stavba PC na lokálnu AI nie je o výkone CPU, ale o šírke pamäťovej zbernice a kapacite VRAM. Poďme si rozobrať, ako vyzerá rozpočet od 1 000 € do 4 000 € a čo zaň reálne dostanete.

Prečo je VRAM kráľ a jadrá sú len dekorácia

Pri lokálnom spúšťaní modelov (LLM) platí jednoduchá rovnica: veľkosť modelu v gigabajtoch = kapacita VRAM. Ak chcete spustiť kvantizovaný model so 7 miliardami parametrov (napr. Mistral 7B Q4), potrebujete približne 5 – 6 GB VRAM. Pre modely s 13B parametrami už hovoríme o 8 – 10 GB. A ak túžite po kvalite GPT-4 triedy (70B+), musíte mať na karte 24 GB VRAM a viac.

Tu je prvý kameň úrazu. Herné GPU ako RTX 4060 Ti majú síce 16 GB, ale ich pamäťová zbernica (128-bit) je úzka. Pre AI je kľúčová pamäťová priepustnosť (bandwidth), ktorá sa počíta ako násobok frekvencie a šírky zbernice. RTX 4090 s 24 GB a 384-bitovou zbernicou dosahuje priepustnosť 1 008 GB/s. RTX 4060 Ti s 16 GB iba 288 GB/s. Rozdiel v rýchlosti generovania tokenov je priepastný – hovoríme o 3-násobku až 5-násobku.

Rozpočet do 1 500 €: Vstup do sveta 7B a 13B modelov

Ak začínate a nechcete minúť majland, zamerajte sa na použitú RTX 3090 (24 GB VRAM). Táto karta je v komunitných kruhoch legendou, pretože ponúka 936 GB/s priepustnosť za zlomok ceny novej RTX 4090. Na slovenskom bazári ju zoženiete za 700 – 850 €.

  • CPU: Ryzen 5 7600 (170 €)
  • Základná doska: B650 (150 €)
  • RAM: 32 GB DDR5 6000 MHz (110 €)
  • GPU: Použitá RTX 3090 (800 €)
  • Zdroj a case: 750W Gold (200 €)

Celkom: ~1 430 €. Táto zostava plynule rozbehá všetky 7B a 13B modely s kvantizáciou Q4/Q5. Generovanie textu dosiahne 40 – 60 tokenov za sekundu, čo je plne postačujúce na interaktívnu konverzáciu. Dokonca zvládnete aj 34B modely (napr. Yi-34B) so zníženou kvantizáciou, ale rýchlosť klesne na 10 – 15 tokenov/s.

Rozpočet 2 500 €: Ideálny bod pre nadšencov

Tu sa dostávame k pomeru cena/výkon, ktorý dáva zmysel pre väčšinu čitateľov ai.ezin.sk. Kľúčovou voľbou je RTX 4080 Super s 16 GB VRAM (1 100 €) alebo opäť použitá RTX 3090 v SLI konfigurácii (nepraktické) vs. jedna výkonná karta.

Odporúčam skôr RTX 4080 Super pre jej rýchlosť, ale upozorňujem na limit 16 GB. S ňou komfortne zvládnete: - Všetky 7B – 13B modely s plnou kvalitou (Q8) - 34B modely (napr. CodeLlama) s kvantizáciou Q4 – rýchlosť 25 – 35 tokenov/s

  • CPU: Ryzen 7 7800X3D (400 €)
  • RAM: 64 GB DDR5 (230 €)
  • GPU: RTX 4080 Super (1 100 €)
  • Úložisko: 2 TB NVMe (130 €)

Celkom: ~1 860 €. Táto konfigurácia je výborná aj na prácu s obrazom – Stable Diffusion XL generuje obrázky za 2 – 3 sekundy. Pridaná hodnota: 16 GB VRAM zvládne aj RAG systémy (vyhľadávanie v dokumentoch) s embeddings modelmi bez problémov.

Rozpočet 3 500 € a viac: Keď chcete lokálny GPT-4

Tu už nie je o čom diskutovať. Jediná voľba je RTX 4090 (24 GB VRAM, ~1 800 €) alebo profesionálne karty ako RTX A6000 (48 GB) za 4 500 €. Pre bežného nadšenca má zmysel riešiť dve RTX 4090 v jednej zostave, ale pozor – modely ako Llama 3 70B sa dajú spustiť na dvoch GPU, no narazíte na komunikačné úzke miesta cez PCIe zbernicu.

Praktickejšia cesta: jedna RTX 4090 s 24 GB VRAM.

  • CPU: Ryzen 9 7950X (550 €)
  • RAM: 128 GB DDR5 (450 €)
  • GPU: RTX 4090 (1 800 €)
  • Chladenie a zdroj: 1000W Platinum (350 €)

Celkom: ~3 500 €. Llama 3 70B v Q4 zaberá približne 42 GB, takže na jednu 24 GB kartu sa nezmestí — s druhou rovnakou kartou ho spustíte rýchlosťou 15 – 20 tokenov/s. Nie je to blesk, ale je to plnohodnotná lokálna náhrada cloudových služieb s tým, že dáta neopustia váš počítač. Navyše zvládnete aj Qwen3 32B, ktorý dnes patrí k najlepším otvoreným modelom použiteľným lokálne pre bežné úlohy.

Pasca, ktorej sa treba vyhnúť: Spotreba a chladenie

Tu je skrytý náklad, ktorý marketingové recenzie nespomínajú. RTX 3090 pri plnom zaťažení žerie 350 W, RTX 4090 450 W. Ak plánujete trénovať modely (fine-tuning), počítajte s tým, že GPU pobeží na 100 % niekoľko hodín. To znamená: - Účet za elektrinu navyše 15 – 30 € mesačne pri každodennom používaní - Hluk – vzduchové chladenie pri záťaži dosahuje 45 – 50 dB, čo je rušivé v open-space kancelárii

Riešenie? Buď investujte do vodného chladenia (EKWB blok za 200 €), alebo umiestnite PC do vedľajšej miestnosti a používajte vzdialenú plochu.

Verdikt: ako sa rozhodnúť pri zostave

Ak plánujete len experimentovať s chatbotmi, použitá RTX 3090 za 800 € je najlepší pomer cena/výkon. Ak potrebujete rýchlosť pre kódovanie a RAG, siahnite po RTX 4080 Super. A ak chcete lokálnu náhradu GPT-4, neexistuje alternatíva k RTX 4090.

Nezabudnite na jednu vec: modely sa zlepšujú rýchlejšie ako hardvér. Dá sa čakať, že o rok zvládne 8 GB VRAM podstatne silnejší model než dnes — kvantizácia sa vyvíja rýchlo. Preto odporúčam nekupovať najdrahšie riešenie, ale zvoliť zostavu, ktorá vám vydrží 2 – 3 roky a potom upgradovať GPU. Technológia kvantizácie (GGUF, EXL2) sa vyvíja tak rýchlo, že dnešných 24 GB VRAM môže byť o dva roky priemer.

Náš tip: Začnite s použitou RTX 3090. Ak vás lokálna AI nadchne, o rok predáte kartu za 600 € a dokúpite RTX 5090 (32 GB GDDR7). Týmto spôsobom minimalizujete stratu a vždy máte aktuálny hardvér.