Forskere introduserer OmniLens for storskala språkmodelltolkbarhet
En ny arXiv-artikkel beskriver OmniLens, en rimeligere metode for å undersøke interne signaler på tvers av hele store språkmodeller og identifisere hvor atferd vises kontra hvor intervensjoner fungerer.