Blyerts
MenyTeach & TalkSköt hemsidan med AILagarna kring AI och dataDet nya arbetslivetAI och samhälletAlla temanRedaktörernaKurserMetoderKontexterOrdbokenPlattformenCoWork StudioMedlemskap BasNytt och omskrivetMedlemskap Bas · gratis till nyår

Multimodalitet

Text, bild, ljud, video i samma modell.

OrdbokenBegreppEtablerad kunskap

Multimodalitet

Text, bild, ljud, video i samma modell.

Multimodalitet betyder att en och samma modell kan hantera flera typer av innehåll — text, bild, ljud och video — i stället för bara text. En multimodal modell kan till exempel läsa en bild och beskriva den, tolka ett diagram, transkribera tal eller resonera kring en video. Detta breddar användningsområdena avsevärt, från dokumentgranskning och tillgänglighet till analys av foton och inspelningar.

Tekniskt bygger det ofta på att olika innehållstyper översätts till samma slags representation som modellen kan bearbeta gemensamt. Under 2026 har multimodalitet nått även det öppna, lokalkörbara lagret: Gemma 4:s 12B Unified-variant hanterar även ljud, Qwen3.8-27B har nativ vision under Apache 2.0, och Moonshots Kimi K3 släpptes med öppna vikter och nativ bild- och ljudförståelse. Multimodal bearbetning förutsätter därmed inte längre nödvändigtvis en molntjänst, vilket har direkt betydelse när materialet innehåller personuppgifter.

För verksamheter innebär multimodalitet att material som tidigare krävde separata verktyg nu kan hanteras i ett flöde. Det reser samtidigt nya frågor om upphovsrätt och integritet när bilder, röster och video matas in.

Källor

Modellkapaciteter hos ledande leverantörer 2024-2026; Gemma 4 12B Unified (Google, jun 2026); Qwen3.8-27B (Alibaba, 2 sep 2026); Kimi K3 (Moonshot AI, jul 2026 — Hugging Face).

Etablerad kunskap · Ordboken kontrolleras varje natt, ett urval ord i taget

Secret Link