Transformer
Arkitekturen (2017) som gör moderna modeller möjliga.
Transformer är den neurala nätverksarkitektur som presenterades 2017 i artikeln Attention Is All You Need av Vaswani med flera, och som ligger till grund för i princip alla moderna språkmodeller. Dess kärna är självuppmärksamhet (self-attention), en mekanism som låter modellen väga samman alla delar av en text mot varandra parallellt i stället för att läsa ord för ord i sekvens. Det gjorde det möjligt att träna mycket större modeller effektivt på moderna GPU:er.
Bokstaven T i GPT står för Transformer. Arkitekturen är generell och används inte bara för text utan även för bild, ljud och kod. Att känna till Transformer förklarar varför sprången i AI kom efter 2017 och varför compute och parallellisering blev så avgörande.
Källor
Vaswani et al., Attention Is All You Need (2017) (kontrollerad 2026-10-05, inga sakförändringar).
Etablerad kunskap · Ordboken kontrolleras varje natt, ett urval ord i taget
