96 GB za tisíc eur: čínske AI akcelerátory sľubujú dvanásťkrát lacnejšiu pamäť. Prečo si ich aj tak väčšina firiem nekúpi

96 GB za tisíc eur: čínske AI akcelerátory sľubujú dvanásťkrát lacnejšiu pamäť. Prečo si ich aj tak väčšina firiem nekúpi
Ilustračné foto: vytvorené umelou inteligenciou (AZOIA)

Predstavte si, že potrebujete do pamäte dostať model, ktorý sa na bežnom GPU jednoducho nezmestí.

Cenník slovenského predajcu sk.onintelligence.eu (k 5. augustu 2026) ponúka lákavú skratku: osem kariet Huawei Ascend Atlas 300I Duo s celkovou kapacitou 768 GB za približne 8 800 €. Pre porovnanie, jedna karta AMD Instinct MI325X s 256 GB HBM3e stojí okolo 60 000 €. Na prvý pohľad je rozhodnutie jasné. Po hlbšej analýze však zistíte, prečo je cena taká nízka — a prečo väčšina firiem po tejto „výhodnej“ kúpe nesiahe.

Cena za gigabajt: čísla, ktoré zavádzajú

Prepočet ceny na gigabajt pamäte zvýrazňuje priepasť medzi svetmi: Atlas 300I Duo vychádza na ~11 €/GB, Moore Threads MTT S4000 na ~15 €/GB, zatiaľ čo NVIDIA DGX Spark (128 GB LPDDR5X) stojí ~31 €/GB a Intel Gaudi 3 (128 GB HBM2e) ~94 €/GB. Zdá sa to ako jednoznačné víťazstvo čínskeho hardvéru. Pozrime sa však na to, čo za týmito číslami stojí.

Prvý nález: Pozor na typ pamäte

Atlas 300I Duo sa v niektorých cenníkoch uvádza s pamäťou HBM2e. Podľa predajcov karty aj nezávislých testov však ide o LPDDR4X — dva čipy po 48 GB. HBM a LPDDR sú dve úplne odlišné triedy pamäte s odlišnou šírkou pásma aj latenciou. Práve v tomto je vysvetlenie nízkej ceny. Pred kúpou si preto vždy overte typ pamäte v oficiálnej špecifikácii výrobcu.

Druhý nález: Pásmo, nie kapacita

Tu sa dostávame k jadru problému. Atlas 300I Duo ponúka ~204 GB/s na procesor, karta má dva procesory, teda ~408 GB/s dokopy. Ale model rozdelený medzi dva čipy nemá tento súčet k dispozícii ako jeden pamäťový priestor — nedá sa s ním počítať ako s jedným číslom.

Pre porovnanie: ojazdená RTX 3090 dáva okolo 936 GB/s, teda viac než štvornásobok na procesor. Pri generovaní textu je limitom pamäťové pásmo, nie počet operácií za sekundu. Ak model potrebuje načítať váhy z pamäte pri každom kroku generovania, úzke pásmo znamená pomalé generovanie — bez ohľadu na to, koľko gigabajtov máte k dispozícii.

Namerané treťou stranou (hardware-corner.net, nie náš test): ~15 tokenov za sekundu na modeli Qwen3 32B. To je použiteľné na dávkové spracovanie, nie na interaktívnu prácu. Pri porovnaní s bežným GPU, ktoré zvládne 50 – 100 tokenov za sekundu, je rozdiel markantný.

Tretí nález: Softvérový ekosystém ako skrytá daň

Karty nebežia na CUDA, ale na Huawei CANN. Podpora je cez llama.cpp s CANN backendom alebo PyTorch cez balík torch-npu, výhradne pod Linuxom, odporúčane na serveroch Kunpeng. Moore Threads má vlastný stack (MUSA), Biren tiež vlastný — nie je to jeden spoločný ekosystém.

Recenzovaná štúdia (arXiv 2607.08215) merala nasadenie na 16-kartovom systéme Ascend 910 s vLLM-Ascend. Zistenia sú znepokojujúce: bolo treba 12 zdrojových záplat do dodávateľského pluginu, vypnúť výkonnostné funkcie, aby výsledky boli numericky správne, a doplniť prevádzkové poistky proti opakovaným výpadkom zariadení. Štúdia pomenúva osem kategórií obmedzení, okrem iného neúplnú podporu operátorov, krehký paralelizmus, numerické chyby v nízkoúrovňových kerneloch, nezrelú kompiláciu grafov a fragmentáciu ekosystému. Obe testované úlohy nakoniec bežali správne — cena za to bola inžinierska práca, ktorá sa nikde neuvádza v cenníku.

Čo teda reálne dostanete za 8 800 €?

Tých 8 800 € za 768 GB je reálna cena a pre niekoho reálna cesta — konkrétne pre toho, kto potrebuje veľký model vôbec dostať do pamäte, vie sa zmieriť s pomalým generovaním a má človeka na mesiac inžinierskej práce. Nie je to lacná náhrada NVIDIA pre bežnú firmu. To, čo v cene nie je, je funkčný softvérový ekosystém.

Pri kartách Biren BR104, Hygon DCU a Moore Threads MTT S4000 nemáme nezávislé merania — uvádzame len cenu a pamäť z cenníka. Ak uvažujete o ich nasadení, počítajte s tým, že ich softvérová podpora je ešte menej vyspelá ako pri Huawei.

Richardov biznis verdikt

Ak potrebujete dostať do pamäte obrovský model a máte inžiniera, ktorý prežije mesiac pri ladení ovládačov a záplat — čínske akcelerátory sú reálna cesta. Pre každého, kto hľadá funkčné riešenie „z krabice“, je to však pasca: cena za gigabajt neodráža náklady na softvérovú integráciu, ktoré túto „výhodu“ rýchlo zmažú. Najprv si spočítajte TCO vrátane inžinierskych hodín — nie len cenu hardvéru.

Zdroje

  • sk.onintelligence.eu — cenník AI akcelerátorov (citované 5. 8. 2026)
  • hardware-corner.net — meranie výkonu Atlas 300I Duo (citované 5. 8. 2026)
  • arXiv 2607.08215 — štúdia o nasadení Ascend 910 s vLLM-Ascend (citované 5. 8. 2026)