Haberlere Geri Dön
YenilikAI Understanding brifing

Preprint, yorumlanabilirlik araçlarını tek bir ölçüm problemi olarak kullanıyor ve bunu GPT-2 ve Qwen'de test ediyor

Tek yazarlı bir arXiv ön baskısı, tek bir doğrusal ölçüm problemi olarak aktivasyon yaması, gradyanlar ve Hessian vektör çarpımlarının yazılmasını önerir ve bir oyuncak kontrol sistemi olan Tracr, GPT-2-small ve Qwen-2.5-7B üzerinde yapılan testleri rapor eder.

6 min readRead the primary source
Primary-source figure accompanying Preprint casts interpretability tools as one measurement problem, tests it on GPT-2 and Qwen
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.19338
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

API (Uygulama Programlama Arayüzü)
Bir yazılım sisteminin başka bir sisteme istek göndermesi ve bu sistemden yanıt alması için yapılandırılmış bir yol.
Yapay Zeka (AI)
Örüntü tanıma, akıl yürütme, dil veya karar verme gerektiren görevleri yerine getiren sistemlerin geniş alanı.
Makine Öğrenimi (ML)
Sistemlerin verilerden kalıpları öğrenmesine ve zaman içinde iyileşmesine olanak tanıyan yöntemler.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

19 Ağustos 2026'da arXiv'de yayınlanan tek yazarlı bir ön baskı, mekanik yorumlanabilirlik yöntemlerinin (yama, gradyan ilişkilendirme, Hessian vektör ürünleri ve alt küme müdahaleleri) tasarlanmış ölçüm probleminin örnekleri olarak ele alınmasını öneriyor ve bir oyuncak kontrol sistemi olan Tracr, GPT-2-small ve Qwen-2.5-7B üzerindeki testleri rapor ediyor.

"Mekanistik Tomografi: Kontrol Odaklı Yorumlanabilirlik için Tasarlanmış Ölçüm" başlıklı makale Vijay Erramilli'ye atfedildi ve makine öğrenimi ve yapay zeka altında 24 sayfada 13 rakamla listelendi. Başlangıç ​​gözlemi, yorumlanabilirlik araştırmacılarının nicelik modellerinin temsil edilen durumları, bileşen etkilerini, bileşenler arasındaki etkileşimleri ve müdahalelere verilen yanıtları doğrudan ortaya çıkarmamasını istemesi ve mevcut tekniklerin bu nicelikleri farklı erişim varsayımları altında ölçmesi ve aynı şeyi hedeflemeyebilmesidir. Aktivasyon yaması, gradyan ilişkilendirme, Hessian vektör ürünleri ve alt küme müdahalelerini rakip yöntemler olarak ele almak yerine yazar, bunların bir ölçüm yapısını paylaştıklarını ve ortak bir biçimde yazılabileceklerini savunuyor.

Bu yaygın biçim, y = Ax + w doğrusal modelidir. Seçilen bir temel ve bir müdahale ailesi göz önüne alındığında, A, hangi müdahalelerin yürütüldüğünü kodlar, x, araştırmacının kurtarmak istediği hedef haritasıdır ve w, doğrusal formun yakalayamadığını emer: doğrusal olmayan tepki, örnekleme hatası ve temelin yanlış belirtilmesi. Çerçeveleme, tek bir algoritma yerine bir prosedür sağlar; erişim seviyeniz altında mevcut olan en ucuz ölçümlerle başlayın, gerçekte çalışmayı düşündüğünüz ölçekte uzun süren müdahaleleri değerlendirin, basit uyumsuzluğu kalibre edin ve ardından ölçüm ailesini yalnızca yapılandırılmış artıklar kaldığında genişletin.

Kontrol, bir modeli yönlendirmek için kullanılan bir tahminin geri bildirim döngüsü içinde bir gözlemci haline geldiği argümanına dayanarak makalenin doğrulama ayarıdır. İki gizli Markov modelinden oluşturulan bir sistemde, soyut raporlar, gözlemci hatası arttıkça artan hatayı kontrol eder ve rahatsız edici bir durum hareket ederken hedeflenen miktarın arttığı bir başarısızlık modunu işaretler. Yalnızca ileri erişim altında, seyrek toplu ölçümlerin, koordinat bazında yamalamaya göre daha az müdahaleyle sonlu etki haritasını kurtardığı belirtiliyor. Gradyan erişimiyle, sonlu sondalar yerel bir ilişkilendirme haritasını geliştirirken, yükseltilmiş ölçümler ve Hessian vektör ürünleri birinci dereceden haritaların gözden kaçırdığı etkileşimleri kurtardı. Tracr (bilinen temel gerçeği olan derlenmiş transformatörler) ile yapılan deneyler, gerekli ölçüm ailesinin seçilen esasa bağlı olduğunu göstermektedir.

İki dil modeli sonucu belirtilmiştir. Bu literatürde uzun süredir çalışılan bir devre olan GPT-2-small'ın dolaylı nesne tanımlama görevinde, Ad Taşıyıcı ve Negatif Ad Taşıyıcı kafaları arasındaki etkileşim, test edilen üç çapraz grup çifti arasında en uzun süre uzatılan tahmin terimiydi. Qwen-2.5-7B'de, sonlu kalibrasyon, reddetme yanıtının ilave haritasını yeterli hale getirdi, bu nedenle ertelenen hata, ikili etkileşim terimlerinin eklenmesini desteklemedi. Özet, etki boyutlarını, seyrek yaklaşımın kaç müdahaleyi kurtardığını, hangi istem kümelerinin veya örnek boyutlarının kullanıldığını veya koordinat yamasının ötesindeki temel çizgileri bildirmiyor. arXiv girişinin yanında ilgili bir Zenodo kaydı listelenir; içeriği özet sayfasında açıklanmamıştır.

Kaynak ayrıntıları: arxiv.org

Neden önemli?

Yorumlanabilirlik sonuçları, model davranışını yalnızca tanımlamak için değil, yönlendirmek için de giderek daha fazla kullanılıyor. Makalenin katkısı, dahili bir haritanın bu kullanım için yeterince doğru olup olmadığına ilişkin bir testin yanı sıra, başka bir şey değişirken yönlendirme müdahalesinin başarılı görünebileceğine dair bir uyarıdır.

Çoğu yorumlanabilirlik çalışması bir modele ilişkin bulgu olarak aktarılıyor: Bu dikkat kafası şunu yapıyor, bu özellik şunu kodluyor. Dağıtım baskısı soruyu değiştirdi. Reddetme yönlendirme, aktivasyon düzenleme ve devre düzeyinde izlemenin tümü, davranışı değiştirmek için dahili bir tahmin kullanır; bu, bu tahminin doğruluğunu bilimsel bir incelikten ziyade bir mühendislik gereksinimi haline getirir. Yöntemleri tasarlanmış ölçüm olarak kullanmak, üzerine inşa edilen bir müdahaleye güvenilmeden önce, hangi erişim düzeyinde ne kadar ölçüme ihtiyaç duyulduğunu sormak için bir kelime dağarcığı sağlar.

Uzatılmış müdahale testi makaledeki en taşınabilir fikirdir. Yorumlanabilirlik iddiaları genellikle bunları uydurmak için kullanılan müdahalelerin aynısı kullanılarak doğrulanır; bu da gerçek bir mekanizmayı, uyan bir eğriden ayırt etmeyi zorlaştırır. Uydurulması engellenen müdahalelerin ve kullanılması amaçlanan ölçekte tutulması için tahminlerin gerekli kılınması, istatistik ve kontrolde yorumlanabilirliğin eşitsiz bir şekilde uygulandığı tanıdık bir disiplindir. Bu aynı zamanda uygulayıcıların makalenin daha geniş biçimciliğini kabul etmeden benimseyebilecekleri bir kriterdir.

Rahatsız edici durum sonucu güvenlikle ilgili bir uyarıdır ancak oyuncak ortamında belirtilir. Bir müdahale hedeflenen miktarı hareket ettirirken başka bir şeyi sessizce hareket ettiriyorsa, yalnızca hedefi takip eden bir değerlendirme başarıyı raporlayacaktır. Bu model, alakasız davranışları değiştirirken bir modeli istenmeyen bir çıktıdan uzaklaştırmaya yönelik gerçek kaygılarla eşleşir. Makale bunu dil modeli yerine iki HMM sisteminde göstermektedir ve özette aksi iddia edilmemektedir.

Qwen-2.5-7B bulgusu, yorumlanabilirlik araçlarının büyüme eğiliminde olması nedeniyle dikkate değer olan ilave karmaşıklığı ortadan kaldırıyor. Orada, reddetme yanıtına ilişkin daha basit bir ek açıklama, uzun süren testlerden sağ çıktı ve veriler, etkileşim koşullarını haklı çıkarmadı. Bir etkileşim teriminin öngörücü ağırlık taşıdığı GPT-2-küçük sonucunun yanı sıra okunduğunda, doğru miktarda makinenin sabit bir metodolojik seçimden ziyade model, görev ve temel başına ampirik bir soru olduğu anlamına gelir.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

System Requirements:
Best ArchitecturePure RAGRecommended pattern
Hallucination RiskVery LowGrounding efficacy
Update Cost$0 (Vector sync)Ongoing maintenance
Core takeaway: Fine-tuning teaches models how to speak (form, style, syntax); RAG teaches models what to say (verifiable facts). Never use fine-tuning alone for factual memory.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Bundan sonra ne izlenecek?

Uzatılan testlerin daha büyük modellerde ve bağımsız ekipler tarafından tekrarlanıp tekrarlanmadığı, kod ve müdahale setlerinin kullanılabilir olup olmadığı ve sonuçların hakem incelemesinden sağ çıkıp çıkmadığı.

Acil açık soru ölçektir. Bildirilen dil modeli kanıtı, 2019'da yayımlanan 124 milyon parametreli bir model olan GPT-2-small'daki bir görev ve 7 milyar parametreli Qwen modelindeki bir reddetme-yanıt haritasından oluşuyor. Seyrek toplu ölçümün, ileri geçişlerin maliyetli olduğu ve erişimin genellikle bir API ile sınırlı olduğu mevcut sınır ölçekli sistemlerde müdahale sayımı avantajını sürdürüp sürdürmediği, soyutta ifade edilenlerde ele alınmamaktadır. Diğer model aileleri üzerindeki bağımsız çoğaltma, prosedürün genelleştirilip genelleştirilmediğini veya bu durumlara göre ayarlanıp ayarlanmadığını gösterecektir.

Bu kontrol için kullanılabilirlik önemlidir. Listede ilgili Zenodo DOI ve TeX kaynağı yer alıyor ancak özet sayfasında yayınlanan kod, müdahale setleri veya kayıtlı ölçümler açıklanmıyor. Bir ölçüm tasarımı iddiasını yeniden üretmek, tam müdahale ailesini ve temelini gerektirir, çünkü makalenin kendi Tracr sonucu, gerekli ailenin temele bağlı olduğunu söylüyor. Okuyucular ayrıca bunun tek bir yazarın listelendiği birinci versiyon bir ön baskı olduğunu, özet sayfasında herhangi bir bağlantının belirtilmediğini ve dergi veya konferans mekanının bulunmadığını dikkate almalıdır; hakem incelemesinden geçmemiştir.

Son olarak, uzatılan tahmin standardının bu makalenin dışında ele alınıp alınmadığını izleyin. Yorumlanabilirlik, önerilen çeşitli değerlendirme disiplinlerini (doğruluk ölçümleri, nedensel temizleme, ablasyon temel çizgileri) eşit olmayan bir şekilde benimsenerek biriktirmiştir. Yönlendirme ve izleme üzerinde çalışan gruplar, devre iddialarının yanı sıra uzatılmış müdahale hatasını da bildirmeye başlarsa, bu, tomografi formalizminin kendisinin anlayıp anlamamasına bakılmaksızın somut bir etki olacaktır. Aynı derecede izlemeye değer olan şey, sıkıntı durumu başarısızlık modunun gerçek bir dil modelinde gösterilip gösterilmediğidir; bu, oyuncak uyarısını bir değerlendirme gereksinimine dönüştürecektir.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıTransformatörlerChatGPT ve LLM'lerBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakın
Bunu yararlı buldunuz mu?