3D in prostorska modaliteta v svetu AI

3D in prostorska modaliteta omogočata, da AI sveta ne zaznava več samo kot ravno sliko, temveč kot prostor, v katerem imajo predmeti obliko, velikost, globino, položaj, orientacijo in medsebojna razmerja. To je temelj za robote, avtonomna vozila, AR-očala, digitalne...

Besedilo kot temeljna modaliteta LLM-ja

Besedilo je prva in še vedno najpomembnejša modaliteta velikih jezikovnih modelov. Klasični LLM je bil prvotno zasnovan tako, da prejme zaporedje besedilnih enot, v njih prepozna vzorce in nato napove, kako naj se zaporedje nadaljuje. Toda model besedila ne bere tako...

Kako AI razume ultrazvok?

Ultrazvok pri AI- oziroma večmodalnem LLM-ju praviloma ne deluje tako, da bi jezikovni model neposredno »slišal« ultrazvočne valove. Ultrazvočna sonda in naprava najprej pretvorita odboje visokofrekvenčnih zvočnih valov v digitalne podatke oziroma slike. Šele nato...

Kako AI sliši in razume zvok?

AI-modaliteta za zvok pomeni, da umetna inteligenca ne obdeluje samo besedila ali slik, temveč zna zvok tudi poslušati, analizirati, razumeti in ustvarjati. Pri tem zvoka ne »sliši« tako kot človek, ampak zvočno valovanje pretvori v matematično predstavitev, iz katere...

Kako AI vidi sliko?

KKatulusDomovRazmišljanjaAI Hub NexusLinkedInRazmišljanja o AIKako AI vidi sliko?Kratek vpogled v to, kako multimodalni modeli pretvorijo slike v matematične predstavitve in o njih sklepajo.Ko danes modelu, kot je GPT, Gemini ali Claude, pokažemo fotografijo, se zdi,...