Onderzoekers introduceren OmniLens voor de interpreteerbaarheid van taalmodellen op grote schaal
Een nieuw arXiv-paper beschrijft OmniLens, een goedkopere methode voor het onderzoeken van interne signalen in hele grote taalmodellen en het identificeren van waar gedrag verschijnt versus waar interventies werken.