Olofofo Autoencoders fun Itumọ
Sparse autoencoders (SAEs) jẹ ohun elo kan ti o fa yato si awọn iṣẹ ṣiṣe inu inu ti o tangled ti nẹtiwọọki nkankikan sinu eto mimọ ti o tobi pupọ, awọn ẹya-itumọ eniyan.
Akopọ
They are one of the leading techniques for opening the 'black box' and seeing what concepts a model actually represents.
Jin Dive
Ninu ẹrọ oluyipada kan, fekito imuṣiṣẹ kan ṣopọpọ ẹgbẹẹgbẹrun awọn imọran ni ẹẹkan, eyiti o jẹ ki o nira lati ka. Ayipada autoencoder fọnka jẹ nẹtiwọọki kekere-Layer meji ti oṣiṣẹ lati tun ṣe awọn iṣẹ ṣiṣe wọnyẹn nipasẹ ipele ti o farapamọ jakejado, ṣugbọn pẹlu ijiya ifiyaje fipa nikan diẹ ninu ọpọlọpọ awọn neuron rẹ lati ina ni akoko kan. Nitori ti awọn ti titẹ, kọọkan farasin kuro duro lati amọja ni ọkan Erongba, bi 'mẹnuba ti Golden Gate Bridge' tabi 'Python koodu'. Ni ọdun 2024 Anthropic ṣe iwọn eyi si Claude 3 Sonnet, yiyo ni aijọju awọn ẹya miliọnu 34, ati OpenAI ati DeepMind ṣe atẹjade iṣẹ SAE ni afiwe. Awọn oniwadi le lẹhinna di ẹya kan soke tabi isalẹ lati ṣe idanwo idiwo ohun ti o ṣe.
Imọ-imọ-ẹrọ
An SAE maapu kan d-onisẹpo ibere ise sinu kan Elo anfani farasin Layer (nigbagbogbo 8x to 100x tobi), ki o si reconstructs awọn atilẹba. Ikẹkọ dinku aṣiṣe atunkọ pẹlu ijiya L1 kan lori awọn iṣẹ ṣiṣe ti o farapamọ, eyiti o ṣe iwuri fun sparsity nitorinaa ọpọlọpọ awọn ẹya duro nitosi odo. Awọn iyatọ bii TopK SAE fi agbara mu sparsity taara nipa titọju awọn iṣẹ ṣiṣe K ti o tobi julọ, ati awọn SAE ti o ya sọtọ ipinnu lati ṣe ina lati titobi, dinku aiṣedeede eto L1 ṣafihan.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ojo iwaju ti Awọn oluyipada Autoencoders fun Itumọ
Reti awọn SAE lati gbe lati iwariiri iwadi si iṣatunṣe ilowo ati irinṣẹ irinṣẹ ailewu, pẹlu awọn dasibodu ti o ṣe aami awọn ẹya ati rii awọn iyika ẹtan tabi ailewu. Awọn iṣoro ṣiṣi pẹlu 'pipa ẹya-ara' (agbekale kan ti n fọ si ọpọlọpọ), awọn ẹya ti o padanu, ati idiyele ti ikẹkọ SAE lori gbogbo ipele ti awọn awoṣe aala. Awọn itọnisọna tuntun bii awọn alakọja, transcoders, ati matryoshka SAEs ṣe ifọkansi lati mu iṣiro-iṣiro kọja awọn fẹlẹfẹlẹ ati ni awọn granularities pupọ ni ẹẹkan.
Real-World imuse
Anthropic's 'Golden Gate Claude' demo, nibiti imudara ẹya SAE kan jẹ ki awoṣe naa ṣe itọka afara ni gbogbo idahun
Yiyọ ati isamisi ni aijọju awọn ẹya miliọnu 34 lati Claude 3 Sonnet si maapu awọn ero bii sycophancy, awọn aṣiṣe koodu, ati ihuwasi ailewu
Wiwa awọn ẹya ti o ni ibatan si ailewu gẹgẹbi ẹtan, abosi, tabi akoonu ti o lewu ti o le ṣe abojuto tabi darí lakoko imuṣiṣẹ
N ṣatunṣe aṣiṣe idi ti awoṣe kan ṣe aṣiṣe awọn igbewọle nipasẹ ṣiṣayẹwo iru awọn ẹya itumọ ti o mu ṣiṣẹ lori itọsi ti a fun
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Sparse Autoencoders for Interpretability quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
Sparse Autoencoders fun Isediwon Ẹya
Awọn ibeere ti a beere nigbagbogbo
What is Sparse Autoencoders for Interpretability?
Sparse autoencoders (SAEs) jẹ ohun elo kan ti o fa yato si awọn iṣẹ ṣiṣe inu inu ti o tangled ti nẹtiwọọki nkankikan sinu eto mimọ ti o tobi pupọ, awọn ẹya-itumọ eniyan. Wọn jẹ ọkan ninu awọn imọ-ẹrọ aṣaaju fun ṣiṣi 'apoti dudu' ati rii kini awọn imọran awoṣe jẹ aṣoju gangan.
Kini idi akọkọ ti ikẹkọ autoencoder fọnka lori awọn iṣẹ ṣiṣe awoṣe?
Awọn iṣẹ ṣiṣe SAE tun ṣe nipasẹ fife, fọnka ti o farapamọ Layer ki awọn ẹya kọọkan ṣọ lati badọgba si awọn imọran ti o ni oye eniyan nikan.
Bawo ni SAE ṣe ṣe iwuri fun ẹyọkan ti o farapamọ kọọkan lati ṣe aṣoju imọran kan?
Ijiya idawọle (gẹgẹbi ọrọ L1 tabi idiwọ TopK) fi agbara mu awọn ẹya ti o farapamọ pupọ julọ lati duro nitosi odo, titari ẹyọkan ti nṣiṣe lọwọ si itumọ pataki kan.
O fẹrẹ to awọn ẹya melo ni Anthropic jade nigbati o ṣe iwọn SAEs si Claude 3 Sonnet ni 2024?
Anthropic's 2024 'Scaling Monosemanticity' ti a fa jade lori aṣẹ ti awọn ẹya miliọnu 34 lati awoṣe iṣelọpọ kan.
Kí ni 'Ẹnubodè Golden Claude' ṣe afihan?
Nipa imudara ẹya Golden Gate Bridge, awọn oniwadi ṣe atunṣe awoṣe lori afara, ti n ṣafihan awọn ẹya jẹ awọn lefa idi, kii ṣe awọn aami nikan.
Kini idi ti Layer ti o farapamọ ninu SAE jẹ igbagbogbo WIDER ju imuṣiṣẹ ti o tun ṣe?
Awọn awoṣe gbe ọpọlọpọ awọn imọran sinu awọn iwọn to lopin (superposition); ohun overcomplete, jakejado SAE yoo fun kọọkan Erongba yara to a kun okan awọn oniwe-ara kuro.