Richard z ai.ezin.sk: Cloud vs. vlastný hardvér na AI – čo sa reálne oplatí
Predstavte si, že vám účtovník prinesie faktúru od AWS za 4 800 € mesačne len za to, že váš interný chatbot beží na GPU inštancii p4d.24xlarge. Pritom ste si pôvodne mysleli, že cloud je najlacnejšia cesta, ako začať s AI. Toto nie je hypotetická situácia – presne takto končia prvé pokusy firiem o nasadenie generatívnej AI, keď sa z „pilotného projektu“ stane nekontrolovaný výdavok.
Rozhodnutie medzi cloudom a vlastným hardvérom (on-premise) nie je o technológii. Je to čistá matematika prevádzkových nákladov (TCO) na 3 – 5 rokov dopredu. Poďme si ju rozmeniť na drobné.
Kedy cloud jednoznačne vyhráva
Cloud nie je zlý. Je ideálny pre variabilnú záťaž a rýchly štart. Ak testujete, či sa vám AI vôbec oplatí, nekupujte GPU server. Zoberte si API alebo prenajatú inštanciu.
- Nulová vstupná investícia – neplatíte 20 000 € za server, ktorý vám bude polovicu času stáť.
- Škálovanie na počkanie – potrebujete na víkend 10× viac výkonu? Cloud to zvládne. Vlastný hardvér nie.
- Žiadna správa infraštruktúry – ovládače, chladenie, výpadky. To všetko je problém niekoho iného.
Kľúčový parameter, na ktorý sa pozeráme, je cena za milión tokenov alebo tokens/sec/€. Pri malých modeloch (7B – 8B parametrov) s kvantizáciou (znížením presnosti) vychádza cloud často lacnejšie, pretože neplatíte za nevyužitý výkon.
Kedy vlastný hardvér začína byť výhodný
Zlomový bod nastáva, keď máte stabilnú, nepretržitú záťaž. Ak váš model beží 24/7, cloudová faktúra rastie lineárne, kým hardvér máte odpísaný po 3 – 4 rokoch.
Vezmime si konkrétny príklad: NVIDIA RTX 4090 (24 GB VRAM). Táto karta zvládne inferenciu modelu Llama 3.1 8B s kvantizáciou Q4 rýchlosťou približne 80 – 120 tokenov za sekundu. Jej cena je okolo 1 800 €. Za túto sumu získate výkon, ktorý by v cloude (napr. AWS g6e.xlarge) stál približne 0,80 € na hodinu. Pri nepretržitej prevádzke je to 576 € mesačne. Po troch mesiacoch sa vám karta zaplatí.
Samozrejme, k tomu musíte pripočítať: - Zvyšok zostavy – CPU, RAM, napájanie, disk. Počítajte s ďalších 1 500 – 2 500 €. - Spotreba elektriny – RTX 4090 má TDP 450 W. Pri plnom zaťažení 24/7 je to približne 324 kWh mesačne. Pri cene 0,20 €/kWh je to 65 € mesačne. - Chladenie a údržba – tu sa skryté náklady často podcenia.
TCO: reálny výpočet pre strednú firmu
Uvažujme o nasadení modelu veľkosti 8B – 13B parametrov pre interné nástroje (sumarizácia, RAG – generovanie s rozšíreným vyhľadávaním, podpora). Potrebujete 3 repliky pre redundanciu.
Variant A: Cloud (AWS/GCP/Azure) - 3× inštancia s GPU (napr. A10G alebo L4): 1 200 € mesačne - Prenos dát a úložisko: 150 € mesačne - Spolu za 3 roky: 48 600 €
Variant B: Vlastný hardvér - 3× server s RTX 4090 alebo 2× server s RTX 6000 Ada (48 GB VRAM): 12 000 € - Elektrina (3 roky): 7 000 € - Chladenie, údržba, občasná výmena ventilátorov: 3 000 € - Spolu za 3 roky: 22 000 €
Výsledok? Vlastný hardvér je o 55 % lacnejší pre nepretržitú prevádzku. Ale pozor – tento výpočet platí len vtedy, ak máte niekoho, kto to spravuje. Ak nemáte DevOps človeka, cloud je stále bezpečnejšia voľba.
Bezpečnosť a regulácia: faktor, ktorý preváži všetko
Tu prichádza na scénu GDPR a európske nariadenie o umelej inteligencii (EU AI Act, nariadenie (EÚ) 2024/1689). Ak spracúvate osobné údaje, odosielanie dát do amerického cloudu (aj cez európske regióny) prináša právne riziká. Dátové residency požiadavky môžu vynútiť on-premise riešenie, aj keď je drahšie.
Okrem toho, vlastný hardvér eliminuje riziko úniku dát cez poskytovateľa cloudu – prompt injection, neoprávnený prístup zamestnancov poskytovateľa, či model poisoning pri trénovaní. Pre firmy s citlivými dátami (zdravotníctvo, financie, právne služby) je on-premise často jediná legálna cesta.
Hybridné riešenie: ideálny bod pre väčšinu
Nemusíte si vybrať jedno alebo druhé. Hybridný model je to, čo odporúčam v 80 % prípadov:
- Vlastný hardvér pre stabilné, opakujúce sa úlohy – sumarizácia, klasifikácia, interné vyhľadávanie.
- Cloud/API pre špičky záťaže a experimenty – testovanie nových modelov, občasné veľké dávky spracovania.
- Edge zariadenia pre low-latency úlohy priamo v prevádzke (napr. spracovanie kamier).
Richardov biznis verdikt: cloud, alebo vlastné železo?
Nasaditeľné – ale len s jasnou kalkuláciou. Ak máte stabilnú záťaž a technickú kapacitu, vlastný hardvér s RTX 4090 alebo RTX 6000 Ada vám ušetrí desaťtisíce eur za tri roky. Ak ste na začiatku a neviete, či AI vôbec použijete, začnite v cloude a preneste záťaž interne až keď budete mať istotu. A vždy, vždy si spočítajte TCO na 36 mesiacov – nie mesačnú faktúru. Cloud je pohodlie, ale pohodlie sa v AI platí draho.