Logit Lens och Tuned Lens
Logit-linsen och den avstämda linsen är tolkningstekniker som tittar på en transformators dolda tillstånd lager för lager för att se vad modellen "tänker" innan den ger ett slutgiltigt svar.
Översikt
They reveal how a prediction gradually forms as information flows up through the network.
Djupdykning
En transformator bygger sitt svar stegvis: varje lager läggs till en löpande "restström" som bara förvandlas till ordsannolikheter i slutet. Logit-linsen, som introducerades av nostalgebraist 2020, genvägar detta genom att applicera modellens slutliga inbäddning (och lagernorm) direkt på mellanskikt, så att du kan läsa upp nätverkets bästa gissning på varje djup. Detta visar ofta att svaret kristalliseras i mellan-till-sena lager. Den avstämda linsen (Belrose och kollegor, 2023) förbättrar den genom att träna en liten affin sond per lager för att översätta dolda tillstånd till den slutliga basen, och fixa den förspänning och felaktighet som den råa logit-linsen lider av, särskilt i tidiga lager och över olika modellfamiljer.
Teknisk insikt
Båda metoderna utnyttjar restströmsvyn: varje lager skriver additiva uppdateringar till en delad vektor som den inbäddade matrisen senare projicerar till vokabulärlogiter. Logit-linsen återanvänder den exakta inbäddningen på mellanliggande tillstånd utan extra träning. Den avstämda linsen lär sig istället en linjär karta per lager (en inlärd "översättare") så varje lagers tillstånd omvandlas till det format som det slutliga lagret förväntar sig, vilket ger jämnare, mer trovärdiga förutsägelser med lägre förvirring.
Strategisk inverkan
Cost and budget
Arkitekturbeslut driver prestanda och driftskostnader i flera år.
Clearer decisions
Teknisk utbildning hjälper team att välja rätt stack, inte bara den nyaste.
Quality control
Bättre tekniska val minskar tillförlitlighetsincidenter i produktionen.
Framtiden för Logit Lens och Tuned Lens
Linstekniker blir standard för att spåra hur fakta, avslag eller fördomar dyker upp på djupet, och för att upptäcka när en modell "vet" ett svar tidigt. Räkna med att de i kombination med glesa autokodare och kausal patching går från att beskriva förutsägelser till att förklara mekanismer. Forskning undersöker också om mellanavläsningar avslöjar latent kunskap eller bedrägeri som en modell döljer i sin slutliga produktion, vilket gör linser till en kandidatbyggsten för säkerhetsrevisioner och övervakning av tidiga varningar.
Real-World Implementation
Att använda logit-linsen för att se ett sakligt svar som en huvudstad dyka upp i en modells mellanlager
Använd den avstämda linsen för att jämföra hur olika modellfamiljer konvergerar på en förutsägelse över djupet
Att upptäcka att en modell internt har "bestämt" ett svar flera lager före utgången
Diagnostisera lager där skadliga eller partiska tokenförutsägelser först blir dominerande i restströmmen
Risker & skyddsräcken
Att optimera ett riktmärke kan dölja bredare systemsvagheter.
Infrastruktur- och underhållskostnader underskattas ofta.
Säkerhets- och observerbarhetsluckor kan växa i takt med att systemen blir mer komplexa.
Färdplan för genomförande
Definiera latens-, kvalitet- och kostnadsmål före implementering.
Benchmark under realistiska belastnings- och dataförhållanden.
Instrumentövervakning för fel, drift och användarpåverkan.
Förbered återställnings- och incidentsvarsvägar innan skalning.
Fortsätt utforska
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Logit Lens and Tuned Lens quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Logit-objektiv och avkodning av mellanlager
Frequently asked questions
What is Logit Lens and Tuned Lens?
Logit-linsen och den avstämda linsen är tolkningstekniker som tittar på en transformators dolda tillstånd lager för lager för att se vad modellen "tänker" innan den ger ett slutgiltigt svar. De avslöjar hur en förutsägelse gradvis bildas när information strömmar upp genom nätverket.
Vad gör logit-linsen?
Logit-linsen projicerar mellanliggande restströmstillstånd genom den befintliga inbäddningen för att se modellens förutspådda tokens på varje djup.
Vilken viktig förbättring tillför den inställda linsen jämfört med den råa logit-linsen?
Den avstämda linsen lär sig en linjär översättare per lager, korrigerar fördomar och ger mer trovärdiga avläsningar med lägre förvirring än den råa logit-linsen.
Vilken struktur i transformatorer gör dessa linser möjliga?
Varje lager skriver additiva uppdateringar till en delad restström, så att projicera den strömmen tidigt närmar sig en mellanliggande förutsägelse.
Vem introducerade den ursprungliga logit-linsen, och ungefär när?
Logit-linsen introducerades av nostalgebraist i ett blogginlägg 2020 som analyserade GPT-2:s mellanliggande förutsägelser.
Var visar logit-linsen ofta det slutliga svaret "kristallisera"?
Avläsningar visar vanligtvis sannolikheten för korrekt tokenförstärkning över mitten-till-sena lager när beräkningen ackumuleras.