Datacentrá a AI: koľko energie žerie inteligencia

Datacentrá a AI: Koľko energie žerie inteligencia?
Ilustračné foto: vytvorené umelou inteligenciou (AZOIA)

Jedna odpoveď modelu GPT-4 spotrebuje približne 2,9 Wh elektriny – to je ako keby ste na 20 minút rozsvietili LED žiarovku.

Teraz si to vynásobte miliardami odpovedí denne a dostanete sa k číslu, ktoré prevádzkovateľov dátových centier nenecháva spať. Nie je to však ani zďaleka také jednoduché, ako by sa mohlo zdať.

Reálne čísla: čo dnes žerú modely

Hovorme v jednotkách, ktorým rozumie každý IT manažér. Trénovanie modelu triedy GPT-4 si vyžiadalo odhady 50 – 100 GWh – to je ročná spotreba mesta s 30 000 obyvateľmi. Ale pozor, toto číslo je už dnes zavádzajúce. Moderné modely sa netrénujú na jednom klastri, ale distribuovane, a optimalizácia efektivity napreduje rýchlejšie, než stihnú vzniknúť presné merania.

Kľúčový rozdiel medzi tréningom a inferenciou (samotným používaním) je priepastný:

  • Tréning – jednorazová, ale extrémne energeticky náročná fáza. GPU bežia na 100 % výkonu týždne až mesiace.
  • Inferencia – bežná prevádzka. Každý dotaz do ChatGPT, Claude alebo Gemini spustí miliardy parametrov. Tu sa odohráva 80 – 90 % celkovej spotreby počas životného cyklu modelu.

GPU vs CPU: kde sa energia stráca

Pre nasadenie v podnikovej praxi je dnes rozhodujúca efektivita inferencie. Porovnajme si orientačné čísla pre modely triedy Llama 3 8B pri dávkovom spracovaní:

Hardvér Výkon (tokens/s) Spotreba (W) Efektivita (tokens/W)
NVIDIA H100 2 400 700 3,4
RTX 4090 1 100 450 2,4
Apple M2 Ultra 350 150 2,3
CPU (AMD EPYC) 80 400 0,2

Pri pohľade na tieto dáta je jasné, prečo hyperscaleri nakupujú H100 po tisíckach. Efektivita GPU je 15 – 17× vyššia ako CPU pri inferencii. Ak vaša firma plánuje self-hosted nasadenie, toto číslo by malo byť základom každého rozhodovania.

Skryté náklady: chladenie a PUE

Tu prichádza časť, ktorú marketingové materiály výrobcov GPU zamlčia. Samotná spotreba čipov je len polovica príbehu. Datacentrum musí odviesť generované teplo, a to stojí nemalé peniaze.

PUE (Power Usage Effectiveness) je pomer celkovej spotreby datacentra k spotrebe IT zariadení. Moderné zariadenia dosahujú PUE 1,1 – 1,3, staršie sa pohybujú okolo 1,5 – 2,0. Prepočet je jednoduchý: ak GPU rack žerie 40 kW, pri PUE 1,5 platíte za 60 kW. Rozdiel medzi dobrým a zlým PUE pri 5 MW datacentre predstavuje ročne 1,5 – 3 milióny € navyše.

Kvantizácia: nevyužitý potenciál vašej infraštruktúry

Najväčšia energetická úspora, ktorú môžete dosiahnuť bez nákupu nového hardvéru, sa volá kvantizácia. Zníženie presnosti váh z FP16 na INT8 prináša:

  • až 30 % zníženie spotreby pri inferencii
  • 40 – 60 % úsporu VRAM – viac modelov na jeden GPU
  • minimálnu stratu kvality – pri modeloch nad 30B parametrov je rozdiel v praxi nepostrehnuteľný

Pre bežné podnikové prípady použitia (sumarizácia, extrakcia dát, RAG) je INT8 kvantizácia dnes štandardom. Ak vaše modely bežia vo FP16 a nemáte na to špecifický dôvod, míňate energiu zbytočne.

EÚ regulácia: pripravenosť sa oplatí

EU AI Act a pripravovaná smernica o energetickej efektívnosti datacentier (EED) prinášajú povinné reportovanie spotreby už od roku 2024. Pre firmy prevádzkujúce vlastné AI infraštruktúry to znamená jediné: merajte už dnes. Implementácia monitorovania spotreby na úrovni GPU nie je zložitá – nástroje ako DCGM alebo Prometheus poskytujú potrebné dáta zadarmo.

Praktické odporúčania pre vašu firmu

Na základe reálnych projektov a meraní odporúčam nasledovný postup:

  1. Auditujte súčasnú záťaž – merajte využitie GPU počas 30 dní. Priemerné využitie pod 40 % znamená, že preplácate hardvér.
  2. Zvážte kvantizáciu – začnite s INT8, otestujte kvalitu výstupov na vlastných dátach.
  3. Porovnajte TCO cloud vs. self-hosted – pri stabilnej záťaži nad 70 % sa vlastný hardvér oplatí už od 12 mesiacov prevádzky. Pri kolísavej záťaži vyhráva cloud.
  4. Sledujte PUE dodávateľa – pri cloudových službách si pýtajte údaje o PUE konkrétneho regiónu. Rozdiel medzi 1,2 a 1,8 pri dlhodobom nasadení znamená desaťtisíce eur.

Richardov biznis verdikt: čo s tým môže firma reálne urobiť — Nasaditeľné, ale s rozumom. Energetická efektivita AI nie je problém, ktorý treba vyriešiť nákupom novších GPU. Je to proces optimalizácie, ktorý začína meraním a pokračuje kvantizáciou, správnym výberom hardvéru a reálnym porovnaním TCO. Kto to dnes ignoruje, zaplatí o dva roky dvojnásobok – nielen na účtoch za elektrinu, ale aj na nesplnených regulačných povinnostiach.