Blyerts
MenyTeach & TalkSköt hemsidan med AILagarna kring AI och dataDet nya arbetslivetAI och samhälletAlla temanRedaktörernaKurserMetoderKontexterOrdbokenPlattformenCoWork StudioMedlemskap BasNytt och omskrivetMedlemskap Bas · gratis till nyår

Interpretabilitet

Att förstå vad som händer inuti modellen.

OrdbokenBegreppEtablerad kunskap

Interpretabilitet

Att förstå vad som händer inuti modellen.

Interpretabilitet är forskningsfältet och praktiken kring att förstå vad som faktiskt händer inuti en AI-modell — varför den ger ett visst svar och vilka inre mönster som driver den. Moderna modeller är i grunden svarta lådor: de fungerar utan att vi i detalj kan följa deras resonemang. Mekanistisk interpretabilitet försöker kartlägga de inre strukturerna, till exempel vilka delar av nätverket som representerar vissa begrepp.

Bättre interpretabilitet är viktigt för säkerhet, tillit och felsökning, och för att kunna motivera beslut i känsliga tillämpningar som vård, juridik och myndighetsutövning. Det är också en förutsättning för att på sikt kunna lita på mer autonoma system. Fältet är aktivt men långt ifrån löst, och full insyn i stora modeller är ännu inte möjlig.

Källor

Forskning inom mekanistisk interpretabilitet (bland annat Anthropic)

Etablerad kunskap · Ordboken kontrolleras varje natt, ett urval ord i taget

Secret Link