Multimodálne AI: Keď model nielen číta, ale aj vidí a počuje

Multimodálne AI: Prestaňte len písať a začnite „ukazovať“. Ako modely vidia a počujú?
Ilustračné foto: vytvorené umelou inteligenciou (AZOIA)

Predstavte si, že zadáte do Midjourney prompt „fotorealistický portrét ženy, mäkké svetlo z okna“ a model vám vráti obraz, ktorý by ste pokojne zaradili do portfólia profesionálneho fotografa.

Lenže o päť minút neskôr ten istý model vygeneruje ženu so šiestimi prstami na ruke a textom na etikete v úplne vymyslenej reči. Ako je to možné? Pretože modely ako GPT-4o, Gemini alebo Claude v skutočnosti „nevidia“ ani „nepočujú“ – oni svet prekladajú do matematiky, ktorá má s ľudským vnímaním pramálo spoločné.

Čo sa deje „pod kapotou“, keď model pozerá na obrázok

Keď do multimodálneho modelu vložíte fotografiu, systém ju najprv rozseká na drobné kúsky – takzvané tokeny (základné jednotky spracovania). Obrázok sa prevedie na mriežku malých štvorčekov, ktoré model analyzuje cez architektúru transformera (rámec strojového učenia). Každý štvorček dostane číselnú hodnotu, ktorá reprezentuje farbu, textúru a kontrast. Model potom medzi týmito hodnotami hľadá vzťahy – a práve tu vzniká kľúčový rozdiel oproti ľuďom.

Vy vidíte „tvár“, „smútok“ alebo „jeseň“. Model vidí „vektor v 768-rozmernom priestore“, ktorý sa naučil spájať s určitými slovami. Preto funguje prompt „portrét ženy, mäkké svetlo“ – model nechápe, čo je žena ani svetlo, ale naučil sa, že kombinácia istých pixelov a istých slov spolu často súvisí. A preto vám občas vygeneruje šesť prstov – model nikdy nevidel ľudskú ruku, videl miliardy obrázkov rúk a naučil sa ich štatistickú pravdepodobnosť, nie anatomickú realitu.

Ako počúvajú? Zvuk ako mriežka čísel

Pri zvuku je to podobné. Keď nahráte hlasovú správu do modelu ako Whisper alebo Gemini, systém zvukovú vlnu prevedie na spektrogram – vizuálnu reprezentáciu frekvencií v čase. Tento spektrogram sa potom spracúva rovnako ako obrázok – rozseká sa na tokeny a analyzuje cez transformer.

Zaujímavosť: model nepočúva „melódiu“ alebo „hlasitosť“ tak, ako ich vnímate vy. On sleduje vzorce v spektrograme – napríklad ako rýchlo klesá energia na určitých frekvenciách. Preto Whisper zvládne prepis slovenčiny s presnosťou okolo 91 % v čistom prostredí, ale zlyháva pri šume v pozadí alebo pri dvoch hovoriacich naraz – vzorce sa mu začnú prelínať.

Konkrétne čísla a reálne limity

Aby ste mali predstavu, s čím pracujete:

  • GPT-4o spracuje obrázok s rozlíšením 1024×1024 pixelov približne za 2–4 sekundy v závislosti od zaťaženia serverov.
  • Gemini 3.1 Pro zvládne kontext až 1 milión tokenov – to je približne 2 hodiny videa alebo 700-tisíc slov. V praxi to znamená, že doňho môžete nahrať celú prednášku a pýtať sa na detaily z 30. minúty.
  • Whisper large-v3 dosahuje pri angličtine chybovosť okolo 4 %, pri slovenčine okolo 9 % – čo je stále výrazne lepšie ako komerčné prepisy spred piatich rokov.

Pasca, na ktorú treba upozorniť: modely si nevytvárajú pamäť na obsah. Keď dokončíte konverzáciu s GPT-4o a začnete novú, model si z predchádzajúcej diskusie nepamätá nič. Všetko, čo „vedel“, bolo v kontextovom okne – po zatvorení relácie sa to stratí. Claude aj Gemini dnes majú pamäť naprieč konverzáciami - Claude ju spustil pre platené plány v roku 2025, Gemini personalizuje odpovede na základe minulých chatov

Kedy model skutočne „vidí“ a kedy len háda

Najväčší rozdiel medzi ľudským a strojovým videním spoznáte na hraničných prípadoch. Skúste modelu ukázať obrázok, kde je na stole päť jabĺk a šesť pomarančov, a opýtajte sa, koľko je ovocia. GPT-4o odpovie správne „11“ – pretože počítanie je štatisticky naučené. Ale ukážte mu obrázok s tromi jablkami, kde jedno je čiastočne zakryté listom, a model začne hádať.

Rovnako to funguje so zvukom. Model rozpozná „smutnú melódiu“ v hre na klavíri, ale keď mu pustíte skladbu, kde sa emócia prenáša cez ticho medzi tónmi, zlyhá – pretože ticho nemá žiadne tokeny.

Čo si z toho odniesť do praxe

Pre vás ako tvorcu obsahu to má konkrétne dôsledky:

  1. Pri práci s obrázkami buďte konkrétni. Prompt „fotorealistický portrét ženy, mäkké svetlo z okna, 85mm objektív, hĺbka ostrosti“ dá modelu oveľa lepšiu predstavu ako len „pekná fotka“.

  2. Overujte si fakty z obrázkov. Ak model opisuje obsah fotografie, ktorú ste mu poslali, neberte to ako overenú informáciu. Model vám môže s plnou vážnosťou povedať, že na obrázku je „modrý dom“, aj keď je v skutočnosti zelený – pretože farby sú preňho len štatistické pravdepodobnosti.

  3. Kombinujte modality pre lepší výsledok. Ak potrebujete presný prepis videa, nepoužívajte len Whisper. Nahrajte video do Gemini, nechajte ho prepísať zvuk aj popísať vizuál – výsledný text bude bohatší a presnejší, pretože model si môže overiť informácie z dvoch zdrojov naraz.

Erikov kreatívny tip

Keď pracujete s multimodálnym modelom, vždy mu dajte dve modality naraz. Napríklad: nahrajte fotku svojej grafiky a súčasne napíšte „toto je draft loga pre kaviareň, navrhni 3 alternatívy v rovnakom štýle“. Model si prepojí vizuál s textom a výsledok bude o triedu lepší, ako keby ste mu dali len obrázok alebo len slovný opis. Funguje to aj naopak – pri zvuku pridajte textový kontext „toto je hlas staršieho muža, smutný tón“, a Whisper či Gemini výrazne zníži chybovosť pri prepise.