Blyerts
MenyTeach & TalkSköt hemsidan med AILagarna kring AI och dataDet nya arbetslivetAI och samhälletAlla temanRedaktörernaKurserMetoderKontexterOrdbokenPlattformenCoWork StudioMedlemskap BasNytt och omskrivetMedlemskap Bas · gratis till nyår

Mixture-of-Experts (MoE)

Bara delar av modellen aktiveras — billigare, större.

OrdbokenBegreppEtablerad kunskap

Mixture-of-Experts (MoE)

Mixture-of-Experts (MoE): bara en delmängd av modellens experter aktiveras per token, vilket ger stor kapacitet till lägre beräkningskostnad.

Mixture-of-Experts (MoE) är en neural arkitektur där nätverket innehåller många parallella delmodeller (experter) men bara en liten delmängd aktiveras för varje token, styrt av en router. Detta gör att den totala parameterbudgeten kan vara mycket stor medan den faktiska beräkningen per token förblir låg: man skiljer på totala parametrar och aktiva parametrar. MoE möjliggör därför modeller med hög kapacitet till lägre inferens- och träningskostnad än en lika stor tät modell.

Tekniken popularis erades i stor skala av bland andra Google (Switch Transformer) och är i dag standard bland de största öppna modellerna, där annonserade totalparametrar kan ligga i biljonklassen medan aktiva parametrar per token ligger en till två storleksordningar lägre. Utmaningar rör lastbalansering mellan experter, träningsstabilitet och minneskrav. Den praktiskt viktigaste konsekvensen är att minnesbehovet styrs av totalen medan hastigheten styrs av de aktiva parametrarna: stora MoE-modeller är därför billiga att köra per token men fortfarande tunga att hosta, vilket gör dem svåra att använda som lokalt suveränitetsalternativ trots öppna vikter.

Källor

Shazeer m.fl. (2017); Fedus, Zoph och Shazeer, Switch Transformer (2021). 2026 års användningsmönster enligt Blyerts ai-kartan-granskning-2026-08-30.

Etablerad kunskap · Ordboken kontrolleras varje natt, ett urval ord i taget

Secret Link