Blyerts
MenyTeach & TalkSköt hemsidan med AILagarna kring AI och dataDet nya arbetslivetAI och samhälletAlla temanRedaktörernaKurserMetoderKontexterOrdbokenPlattformenCoWork StudioMedlemskap BasNytt och omskrivetMedlemskap Bas · gratis till nyår

Kvantisering

Krympa modellen så den körs lokalt.

OrdbokenBegreppEtablerad kunskap

Kvantisering

Kvantisering: att representera modellens vikter med färre bitar för att minska minne och öka hastighet, ofta med liten kvalitetsförlust.

Kvantisering innebär att en neural modells vikter (och ibland aktiveringar) representeras med lägre numerisk precision, till exempel 8-bitars eller 4-bitars heltal i stället för 16- eller 32-bitars flyttal. Syftet är att minska minnesåtgång och öka inferenshastighet, vilket gör det möjligt att köra stora modeller på mindre hårdvara, inklusive lokala datorer. Man skiljer på post-training quantization och quantization-aware training.

Format och metoder som GGUF, GPTQ och AWQ är vanliga i öppen-vikt-ekosystemet. Kvalitetsförlusten är ofta liten vid måttlig kvantisering men växer vid mycket låg precision, särskilt för känsliga uppgifter. I praktiken är kvantisering och destillation de två tekniker som tillsammans avgör vad som går att köra på egen hårdvara: destillationen bestämmer hur stor modellen är, kvantiseringen hur mycket minne den kräver.

En kvantiserad variant av en mindre modell kan i dag rymmas i några gigabyte arbetsminne, vilket är vad som gjort lokal inferens till ett realistiskt alternativ och inte bara ett principargument.

Källor

Dettmers m.fl. (LLM.int8, QLoRA); GGUF- och llama.cpp-dokumentation. Minneskrav för små modeller enligt Blyerts ai-kartan-granskning-2026-08-30.

Etablerad kunskap · Ordboken kontrolleras varje natt, ett urval ord i taget

Secret Link