Small Language Models (SLM): Prečo je v prípade AI menšie často lepšie?

Small Language Models (SLM): Prečo je v prípade AI menšie často lepšie?
Ilustračné foto: vytvorené umelou inteligenciou (AZOIA)

Váš dátový tím práve dostal úlohu spracovať 200-tisíc faktúr a jediný dostupný GPU je ten vo firemnom notebooku, ktorý si šéf kúpil na „občasné hranie“.

Nasadiť na to 70-miliardový model LLaMA je ako poslať na nákup rožkov tryskové lietadlo – technicky možné, ale ekonomicky aj prakticky absurdné. Presne v tejto situácii prichádzajú na scénu Small Language Models (SLM), modely s miliardami, nie desiatkami miliárd parametrov, ktoré menia pravidlá hry pre firmy aj bežných používateľov.

Prečo veľkosť prestala byť všetko

Niekoľko rokov sme boli svedkami pretekov v zbrojení – každý nový model musel byť väčší, aby porazil predchodcu v benchmarkoch. Logika bola jednoduchá: viac parametrov = lepšie pochopenie kontextu = kvalitnejší výstup. Tento prístup však narazil na strop fyziky aj ekonómie. Trénovanie modelu s 1 biliónom parametrov stojí desiatky miliónov eur a inferencia (samotné spustenie) vyžaduje dátové centrá s chladením, ktoré by zahanbilo mrazivý sklad.

SLM prichádzajú s inou filozofiou – optimalizácia pre špecifickú úlohu namiesto univerzálneho génia. Model s 3 miliardami parametrov, natrénovaný špeciálne na extrakciu dát z faktúr, dokáže byť v tejto úlohe presnejší ako všeobecný model s 10-násobnou veľkosťou. Kľúčom je kvalita tréningových dát a cielenie na doménu, nie surový výpočtový výkon.

Reálne čísla, ktoré rozhodujú

Pozrime sa na konkrétne rozdiely, ktoré pocítite v každodennom nasadení:

  • Hardvérové nároky: Model Phi-3-mini od Microsoftu (3,8 mld. parametrov) beží plynulo na notebooku so 16 GB RAM. Model Llama 3.1 70B vyžaduje minimálne 140 GB VRAM alebo kvantizáciu, ktorá výrazne znižuje kvalitu výstupov.
  • Rýchlosť odpovede: Na spotrebiteľskom GPU (napr. RTX 4090) vygeneruje SLM odpoveď o 10-20× rýchlejšie ako 70B model. Pri spracovaní dávok dokumentov to znamená hodiny namiesto dní.
  • Cena prevádzky: Cloudová inferencia SLM stojí zlomok ceny veľkých modelov. Napríklad GPT-4o mini je približne 16-krát lacnejší na token ako GPT-4o, pričom pre väčšinu bežných úloh (sumarizácia, klasifikácia, extrakcia) je rozdiel v kvalite minimálny.
  • Spotreba energie: SLM na lokálnom hardvéri spotrebuje jednotky wattov. Veľký model v cloude – stovky wattov na jednu odpoveď, plus náklady na sieťovú infraštruktúru.

Kedy je menšie naozaj lepšie

SLM nie sú univerzálnym liekom, ale v troch oblastiach jednoznačne dominujú:

1. Spracovanie dokumentov a dát

Firmy denne spracúvajú faktúry, zmluvy, e-maily či technickú dokumentáciu. Tieto úlohy sú repetitívne a majú jasnú štruktúru. Model natrénovaný na extrakciu konkrétnych polí (DIČ, dátum, suma) dosahuje presnosť nad 95 % aj s 2-3 miliardami parametrov. Veľké modely sú v tomto prípade zbytočne pomalé a drahé.

2. Ochrana súkromia a compliance

Posielať citlivé zdravotné záznamy alebo obchodné tajomstvá do verejného cloudu je pre mnohé odvetvia neprípustné. SLM bežiaci na lokálnom serveri alebo priamo na zariadení eliminuje riziko úniku dát. Toto je hlavný dôvod, prečo banky a nemocnice investujú do open-source modelov ako Mistral 7B alebo Llama 3.2 3B.

3. Edge computing a offline nasadenie

Mobilné aplikácie, inteligentné reproduktory, priemyselné senzory – všade tam, kde nie je stabilné pripojenie alebo kde latencia nesmie presiahnuť milisekundy, sú SLM jedinou rozumnou voľbou. Apple už integruje lokálne modely do iOS pre funkcie ako sumarizácia správ či inteligentné odpovede, a to bez odosielania dát na servery.

Kde SLM narážajú na limity

Buďme úprimní – SLM nie sú všeliek. Ak potrebujete komplexné kreatívne písanie, hlbokú analýzu s viacnásobným uvažovaním alebo prácu s rozsiahlym kontextom (napr. analýza 500-stranovej knihy), veľký model stále vyhráva. SLM majú obmedzenú pamäť kontextu a pri zložitých úlohách môžu generovať povrchné alebo nekonzistentné odpovede.

Pasca č. 1: Lacné SLM v cloude môžu mať skryté limity – napríklad obmedzený počet požiadaviek za minútu alebo zníženú kvalitu pri dlhších vstupoch. Vždy si prečítajte drobné písmo v cenníku.

Pasca č. 2: Kvantizácia (zmenšenie modelu na 4 bity namiesto 16) síce zníži hardvérové nároky, ale môže degradovať kvalitu až o 10-15 % pri špecializovaných úlohách. Testujte vždy na svojich dátach, nie na benchmarkoch.

Ako si vybrať správny model

Neexistuje univerzálna odpoveď, ale existuje postup, ako sa dopracovať k správnemu rozhodnutiu:

  1. Definujte úlohu presne. Čo má model robiť? Extrahovať dáta, sumarizovať, odpovedať na otázky z databázy? Čím špecifickejšia úloha, tým menší model môžete použiť.
  2. Otestujte na vlastných dátach. Vezmite 100 reálnych vzoriek a porovnajte výstup SLM (napr. Mistral 7B, Phi-3, Gemma 2 9B) s výstupom veľkého modelu. Vyhodnoťte nielen presnosť, ale aj rýchlosť a náklady.
  3. Zvážte hybridné riešenie. SLM pre 90 % rutinných požiadaviek, veľký model iba pre zložité prípady, ktoré SLM označí ako „neistý“. Tento prístup prináša optimálny pomer ceny a kvality.
  4. Sledujte hardvérové trendy. Nové NPU (neural processing units) v notebookoch a mobiloch zvládajú modely do 8 miliárd parametrov plynulo. Už nepotrebujete herný notebook na lokálnu AI.

Trendy, ktoré stoja za pozornosť

Trh SLM sa vyvíja neuveriteľne rýchlo. Microsoft uviedol rodinu Phi-4 s dôrazom na uvažovanie, Google odpovedá modelom Gemma 2 a komunita open-source prináša modely ako Qwen2.5, ktoré v mnohých úlohách konkurujú modelom s dvojnásobnou veľkosťou. Kľúčovým trendom je destilácia – proces, pri ktorom sa znalosti z veľkého modelu prenášajú do menšieho, čím sa kvalita SLM neustále zvyšuje.

Verdikt: čo si vybrať?

Ak spracúvate dáta, potrebujete súkromie alebo nasadzujete AI na zariadenia s obmedzeným výkonom, SLM sú jasná voľba. Začnite s modelom do 8 miliárd parametrov, otestujte ho na svojich úlohách a porovnajte s veľkým modelom. V drvivej väčšine prípadov zistíte, že rozdiel v kvalite je zanedbateľný, no rozdiel v nákladoch a rýchlosti je priepastný.

Nezabúdajte, že AI nie je o veľkosti, ale o vhodnosti nástroja pre danú úlohu. A v tejto hre už menšie modely dávno nie sú slabšími hráčmi – sú špecialistami, ktorí robia svoju prácu lepšie, rýchlejšie a lacnejšie ako univerzálni giganti.