Peneliti Memperkenalkan OmniLens untuk Interpretabilitas Model Bahasa Skala Besar
Makalah arXiv baru menjelaskan OmniLens, metode berbiaya rendah untuk memeriksa sinyal internal di seluruh model bahasa besar dan mengidentifikasi di mana perilaku muncul versus di mana intervensi berhasil.