Vlajkový model vo vlastnej serverovni: čo beží za 189-tisíc, na čo treba 369-tisíc a prečo Qwen 3.8 Max nerozbeháte ani za milión

Vlajkový model vo vlastnej serverovni: čo beží za 189-tisíc, na čo treba 369-tisíc a prečo Qwen 3.8 Max nerozbeháte ani za milión
Ilustračné foto: vytvorené umelou inteligenciou (AZOIA)

Predstavte si, že si kúpite špičkový stroj za 189-tisíc eur a zistíte, že model, ktorý ste si vybrali, sa naň fyzicky nezmestí.

Nie pre nedostatok výkonu, ale preto, že jeho váhy zaberajú viac pamäte, než máte k dispozícii. A najhoršie na tom je, že to zistíte až po zaplatení. Presne do tejto situácie sa dnes dostávajú firmy, ktoré chcú prevádzkovať vlajkové modely lokálne. Poďme sa pozrieť na reálne čísla.

Základ: Supermicro Super AI Station

Referenčným strojom je Supermicro Super AI Station (sk.onintelligence.eu, citované 5. 8. 2026). Jedna jednotka obsahuje NVIDIA Blackwell Ultra GPU s 252 GB HBM3e a NVIDIA Grace CPU (72 jadier Arm Neoverse V2) so 496 GB LPDDR5X. Dohromady to dáva 748 GB koherentnej unifikovanej pamäte prepojenej cez NVLink-C2C. Výkon je 20 PetaFLOPS vo FP4, zdroj 1600 W.

Predávané konfigurácie: - cluster-2 (2 jednotky) za 189 000 € — spolu ~1 496 GB unifikovanej pamäte (náš výpočet: 748 × 2) - cluster-4 (4 jednotky, 4 GPU) za 369 000 € — výrobcom uvádzaných 3 TB unifikovanej pamäte - Škálovanie ide až na 8 jednotiek, nad touto hranicou sa prechádza na HGX B300 alebo GB300 NVL72

Konfigurácia s tromi jednotkami neexistuje — ponuka ide z dvoch rovno na štyri.

Čo sa zmestí za 189-tisíc?

Do dvoch jednotiek (1 496 GB) sa pohodlne zmestí GLM 5.2 — model s 753 miliardami parametrov (MoE, ~40 miliárd aktívnych na token). V 4-bitovej kvantizácii zaberá 467 GB, v 6-bitovej 626 GB (insiderllm.com, citované 5. 8. 2026). Obe verzie bežia s veľkou rezervou a ostáva miesto aj na ďalšie modely.

Kľúčový nález: Kimi K3 sa do tejto konfigurácie NEZMESTÍ. Model od Moonshot AI má 2,8 bilióna parametrov, 896 expertov (16 aktívnych na token) a váhy zaberajú ~1,56 TB (HuggingFace model card, citované 5. 8. 2026). A tu je pasca: váhy sú natívne v MXFP4 formáte, trénované kvantizačne od fázy doladenia. To znamená, že ich nemožno ďalej kvantizovať — už sú štvorbitové. Žiadna 2-bitová verzia neexistuje a ani nemôže vzniknúť bez straty kvality.

Prečo „104 miliárd aktívnych" neznamená 104 GB

Pri MoE modeloch musí byť v pamäti CELÝ model, nie len aktívne parametre. Hoci Kimi K3 aktivuje na token len 104 miliárd parametrov, pri výpočte sa striedajú rôzni experti. Ak by v pamäti neboli všetci, každý token by znamenal presun dát z disku — a to by výpočet spomalilo na nepoužiteľnú úroveň. Preto sa počíta s celými 1,56 TB.

Čo za 369-tisíc?

Pri cluster-4 (3 TB) sa situácia mení. Kimi K3 sa sem zmestí a GLM 5.2 dokonca v plnej BF16 presnosti (1,51 TB). Rozdiel 180-tisíc eur je teda presne cena za jeden konkrétny model — Kimi K3. Ak ho nepotrebujete, za 189-tisíc eur získate plnohodnotný systém pre GLM 5.2.

Mýtus o prídavnej grafickej karte

Do každej jednotky sa dá doplniť jedna NVIDIA RTX PRO 6000 Blackwell Max-Q s 96 GB GDDR7 (300 W, dvojslotová). Pri dvoch jednotkách sú to teda dve karty, pri štyroch štyri. Prečo len jedna na jednotku? Limitom je napájanie — zdroj má 1600 W a Grace s Blackwellom Ultra si z neho vezmú väčšinu, takže na prídavnú grafiku ostáva rezerva pre jednu 300-wattovú kartu. Svedčí o tom aj samotný výber modelu: ponúka sa verzia Max-Q, teda znížená edícia pre skrine s obmedzeným rozpočtom na napájanie. Bežná RTX PRO 6000 Blackwell má výrazne vyšší odber a do tohto rozpočtu by sa nezmestila.

Ale pozor: tých 96 GB NIE JE rozšírenie 748 GB unifikovanej pamäte. Grace CPU a Blackwell Ultra sú spojené cez NVLink-C2C do jedného koherentného priestoru, kým RTX visí na PCIe ako samostatný pamäťový ostrov. Veľkému modelu nepomôže — Kimi K3 sa ňou do dvoch jednotiek nedotlačí. A nepomôžu ani dve karty naraz: každá ostáva samostatným ostrovom po 96 GB, takže ani ich sa nedá spočítať. Nikdy nepočítajte 748 + 96 ako jedno číslo.

Na čo je teda dobrá? Na súbežný beh menších modelov popri hlavnom. Do 96 GB sa zmestí model veľkosti Qwen3.8-27B (~54 GB v BF16) a vedľa neho embeddingový model. Typické delenie: veľký model odpovedá v unifikovanej pamäti, na prídavnej karte bežia embeddingy pre vyhľadávanie alebo spracovanie obrazu. Pre bežnú firmu praktickejšie než naháňanie vlajkových veľkostí.

Qwen 3.8 Max: problém nie je hardvér

Qwen 3.8 Max (Alibaba, vydaný 3. 8. 2026) má 2,4 bilióna parametrov (~95 miliárd aktívnych, kontext 1 milión tokenov), ale je dostupný LEN cez API (2 USD/mil. vstup, 6 USD/mil. výstup, qwen.ai, citované 5. 8. 2026). Váhy vlajkového modelu nie sú zverejnené. Lokálne ho nerozbeháte na žiadnom hardvéri — nie pre výkon, ale preto, že jednoducho neexistujú verejne. K 5. augustu 2026 nie sú zverejnené ani váhy menšej verzie Qwen3.8-27B; Alibaba oznámila „budúci týždeň", licencia zatiaľ potvrdená nebola. Toto ostáva otvorené.

Licenčné podmienky ako tichý zabijak

Kimi K3 má vlastnú licenciu (nie MIT). Komerčné použitie je povolené, ale firmy s tržbami nad 20 miliónov USD ročne z model-as-a-service potrebujú osobitnú dohodu a produkty nad 100 miliónov mesačných používateľov musia v rozhraní viditeľne uvádzať „Kimi K3". Pre väčšinu slovenských firiem to nie je problém, ale treba to vedieť.

Richardov biznis verdikt

Hlavná prekážka lokálneho nasadenia dnes nie je hardvér ani peniaze, ale dostupnosť váh a licenčné podmienky. Firma si môže kúpiť stroj za 369-tisíc a aj tak nespustí model, ktorý si vybrala. Kto potrebuje lokálny model kvôli citlivým dátam, dostane oveľa lepší pomer cena/výkon z menších otvorených modelov než z naháňania vlajkových veľkostí — za 189-tisíc eur získate GLM 5.2 s rezervou, a to je dnes reálna hranica rozumného nasadenia.

Zdroje

  • sk.onintelligence.eu — Supermicro Super AI Station (citované 5. 8. 2026)
  • HuggingFace — model card Kimi K3 (citované 5. 8. 2026)
  • insiderllm.com — veľkosti kvantizácií GLM 5.2 (citované 5. 8. 2026)
  • qwen.ai — Qwen 3.8 (citované 5. 8. 2026)