RAG
RAG (Retrieval-Augmented Generation): att komplettera en språkmodell med hämtad extern information vid svarstillfället.
RAG (Retrieval-Augmented Generation) är en arkitektur där en språkmodell kompletteras med information som hämtas från en extern källa vid svarstillfället i stället för att förlita sig enbart på det som finns i modellens vikter. Ett typiskt flöde: frågan omvandlas till en sökning (ofta via embeddings mot en vektordatabas), relevanta textstycken hämtas och läggs in i modellens kontextfönster, och modellen genererar svar grundat på dessa. Termen introducerades av Lewis m.fl. (2020).
Fördelarna är färre hallucinationer, möjlighet att använda färsk eller privat data utan omträning, och spårbarhet till källor. Utmaningar rör hämtningskvalitet, chunkning och ranking. Att kontextfönstren under 2026 växt till storleksordningen en miljon tokens har förskjutit men inte upphävt behovet: mer text ryms visserligen in direkt, men kostnad, latens och kvalitetsförlust vid mycket långa kontexter gör urvalet fortsatt avgörande, och spårbarheten till källa försvinner om allt bara slängs in.
RAG är i praktiken standard för företagslösningar som ska svara utifrån egna dokument, och konceptuellt besläktat med kontext-engineering.
Källor
Lewis m.fl. (2020), Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Noteringen om kontextfönster bygger på Blyerts ai-kartan-granskning-2026-08-30 (modeller med 1 M kontext).
Etablerad kunskap · Ordboken kontrolleras varje natt, ett urval ord i taget
