Jedna odpoveď modelu GPT-4 spotrebuje približne 2,9 Wh elektriny – to je ako keby ste na 20 minút rozsvietili LED žiarovku.
Teraz si to vynásobte miliardami odpovedí denne a dostanete sa k číslu, ktoré prevádzkovateľov dátových centier nenecháva spať. Nie je to však ani zďaleka také jednoduché, ako by sa mohlo zdať.
Reálne čísla: čo dnes žerú modely
Hovorme v jednotkách, ktorým rozumie každý IT manažér. Trénovanie modelu triedy GPT-4 si vyžiadalo odhady 50 – 100 GWh – to je ročná spotreba mesta s 30 000 obyvateľmi. Ale pozor, toto číslo je už dnes zavádzajúce. Moderné modely sa netrénujú na jednom klastri, ale distribuovane, a optimalizácia efektivity napreduje rýchlejšie, než stihnú vzniknúť presné merania.
Kľúčový rozdiel medzi tréningom a inferenciou (samotným používaním) je priepastný:
- Tréning – jednorazová, ale extrémne energeticky náročná fáza. GPU bežia na 100 % výkonu týždne až mesiace.
- Inferencia – bežná prevádzka. Každý dotaz do ChatGPT, Claude alebo Gemini spustí miliardy parametrov. Tu sa odohráva 80 – 90 % celkovej spotreby počas životného cyklu modelu.
GPU vs CPU: kde sa energia stráca
Pre nasadenie v podnikovej praxi je dnes rozhodujúca efektivita inferencie. Porovnajme si orientačné čísla pre modely triedy Llama 3 8B pri dávkovom spracovaní:
| Hardvér | Výkon (tokens/s) | Spotreba (W) | Efektivita (tokens/W) |
|---|---|---|---|
| NVIDIA H100 | 2 400 | 700 | 3,4 |
| RTX 4090 | 1 100 | 450 | 2,4 |
| Apple M2 Ultra | 350 | 150 | 2,3 |
| CPU (AMD EPYC) | 80 | 400 | 0,2 |
Pri pohľade na tieto dáta je jasné, prečo hyperscaleri nakupujú H100 po tisíckach. Efektivita GPU je 15 – 17× vyššia ako CPU pri inferencii. Ak vaša firma plánuje self-hosted nasadenie, toto číslo by malo byť základom každého rozhodovania.
Skryté náklady: chladenie a PUE
Tu prichádza časť, ktorú marketingové materiály výrobcov GPU zamlčia. Samotná spotreba čipov je len polovica príbehu. Datacentrum musí odviesť generované teplo, a to stojí nemalé peniaze.
PUE (Power Usage Effectiveness) je pomer celkovej spotreby datacentra k spotrebe IT zariadení. Moderné zariadenia dosahujú PUE 1,1 – 1,3, staršie sa pohybujú okolo 1,5 – 2,0. Prepočet je jednoduchý: ak GPU rack žerie 40 kW, pri PUE 1,5 platíte za 60 kW. Rozdiel medzi dobrým a zlým PUE pri 5 MW datacentre predstavuje ročne 1,5 – 3 milióny € navyše.
Kvantizácia: nevyužitý potenciál vašej infraštruktúry
Najväčšia energetická úspora, ktorú môžete dosiahnuť bez nákupu nového hardvéru, sa volá kvantizácia. Zníženie presnosti váh z FP16 na INT8 prináša:
- až 30 % zníženie spotreby pri inferencii
- 40 – 60 % úsporu VRAM – viac modelov na jeden GPU
- minimálnu stratu kvality – pri modeloch nad 30B parametrov je rozdiel v praxi nepostrehnuteľný
Pre bežné podnikové prípady použitia (sumarizácia, extrakcia dát, RAG) je INT8 kvantizácia dnes štandardom. Ak vaše modely bežia vo FP16 a nemáte na to špecifický dôvod, míňate energiu zbytočne.
EÚ regulácia: pripravenosť sa oplatí
EU AI Act a pripravovaná smernica o energetickej efektívnosti datacentier (EED) prinášajú povinné reportovanie spotreby už od roku 2024. Pre firmy prevádzkujúce vlastné AI infraštruktúry to znamená jediné: merajte už dnes. Implementácia monitorovania spotreby na úrovni GPU nie je zložitá – nástroje ako DCGM alebo Prometheus poskytujú potrebné dáta zadarmo.
Praktické odporúčania pre vašu firmu
Na základe reálnych projektov a meraní odporúčam nasledovný postup:
- Auditujte súčasnú záťaž – merajte využitie GPU počas 30 dní. Priemerné využitie pod 40 % znamená, že preplácate hardvér.
- Zvážte kvantizáciu – začnite s INT8, otestujte kvalitu výstupov na vlastných dátach.
- Porovnajte TCO cloud vs. self-hosted – pri stabilnej záťaži nad 70 % sa vlastný hardvér oplatí už od 12 mesiacov prevádzky. Pri kolísavej záťaži vyhráva cloud.
- Sledujte PUE dodávateľa – pri cloudových službách si pýtajte údaje o PUE konkrétneho regiónu. Rozdiel medzi 1,2 a 1,8 pri dlhodobom nasadení znamená desaťtisíce eur.
Richardov biznis verdikt: čo s tým môže firma reálne urobiť — Nasaditeľné, ale s rozumom. Energetická efektivita AI nie je problém, ktorý treba vyriešiť nákupom novších GPU. Je to proces optimalizácie, ktorý začína meraním a pokračuje kvantizáciou, správnym výberom hardvéru a reálnym porovnaním TCO. Kto to dnes ignoruje, zaplatí o dva roky dvojnásobok – nielen na účtoch za elektrinu, ale aj na nesplnených regulačných povinnostiach.