Ne oldu?
MIT Technology Review, yapay zeka modellerinin nasıl akıl yürüttüğünü araştıran yedi bulmaca etrafında oluşturulmuş etkileşimli bir özellik yayınladı. Makale, modellerin bazı görevlerde hızlı bir şekilde geliştiğini ancak hala mekansal manipülasyon, tanıdık problemlerin ince varyasyonları, görsel soyutlama ve giderek daha karmaşık hale gelen çok adımlı akıl yürütme ile mücadele ettiğini bildiriyor.
MIT Technology Review, özelliğinin mekansal akıl yürütme, hafıza ve uyarlanabilirlik, soyut ve görsel akıl yürütme, insan sezgisi ve artan karmaşıklığı kapsayan yedi test sunduğunu bildiriyor. Makale bulmaca çözmeyi yapay zeka değerlendirmesinin uzun geçmişine yerleştiriyor; dama, satranç ve Go gibi oyunların bu alanın ilk yıllarından bu yana test ortamı olarak kullanıldığına dikkat çekiyor. Bulmaca performansının önemli ölçüde arttığını söylüyor: Columbia Üniversitesi'nden bir ekip 2024'ün sonlarında önde gelen modellerin New York Times Connections bulmacalarının yalnızca %18'ini çözdüğünü, 2025'in başlarında ise bazı modellerin bunları her seferinde neredeyse mükemmel bir şekilde çözebildiğini buldu. Kaynak, modelleri tanımlamamakta veya özellikteki örnekler arasında standartlaştırılmış bir karşılaştırma sağlamamaktadır.
MIT Technology Review, mekansal akıl yürütmenin büyük bir zayıflık olmaya devam ettiğini söylüyor. Zihinsel döndürme bölümü, okuyuculardan başka bir açıdan gösterilen üç boyutlu bir nesneyi tanımlamalarını istiyor ve makale, görsel girdi yeteneklerine sahip dil modellerinin bu tür görevlerde hala çok düşük performans gösterdiğini bildiriyor. Bu özellik, bu zorluğu, dünya modelleri geliştiren yapay zeka sistemleri hakkındaki iddialara bağlayarak, mevcut büyük dil modellerinin, üç boyutlu nesneleri insan mekansal uzmanlarıyla aynı şekilde manipüle etmediğini öne sürüyor. Makalede ayrıca bir hafıza ve uyum sorunu da anlatılıyor: Büyük miktarda bilgiyle eğitilen modeller, tanıdık bir bulmaca modelini tanıyabilir ve küçük bir değişikliği gözden kaçırabilir. Bu kaygının kanıtı olarak, Knights and Knaves bulmacalarının çeşitlerini içeren 2024 Google ve Illinois Üniversitesi Urbana-Champaign çalışmasını gösteriyor.
Bu özellik daha sonra iki boyutlu soyutlamaya ve görsel akıl yürütmeye dönüşür. MIT Technology Review, ızgaralar görüntüler yerine hücre renklerini kodlayan sayısal diziler olarak sağlandığında modellerin ARC-AGI bulmacalarında daha iyi performans gösterdiğini bildiriyor. Ayrıca araştırmaların, modellerin bazen karmaşık, genelleştirilemeyen kurallar yoluyla doğru cevaba ulaşabildiğini, oysa insanların daha basit görsel kavramlara güvenebileceğini bulduğunu söylüyor. Makalede SimpleBench soruları, Knights and Knaves problemleri ve bir ARC-AGI dönüşüm bulmacası bu farklılıkları ortaya çıkarabilecek görev örnekleri olarak sunulmaktadır.
İnsanların sıklıkla hızlı ama yanlış yanıtlar verdiği, modellerin ise daha bilinçli yanıt verebileceği sezgi testlerini ayrıca açıklar. Bir örnek, yarasa popülasyonu her gün iki katına çıktığında bir mağaranın yarıya kadar dolmasının ne kadar zaman alacağını soruyor; bir diğeri okuyuculardan Alice ile ilgili bir alıntıyı tanımlamalarını istiyor.
Son olarak MIT Technology Review, sorunlar karmaşıklaştıkça performansın genellikle kötüleştiğini bildiriyor. Dil modellerinin Hanoi Kulesi ve nehir geçiş problemlerinin basit versiyonlarını çözebileceğini ancak disk veya insan sayısı altı veya daha fazlasına ulaştığında bocalamaya başladığını ortaya koyan bir Apple çalışmasına atıfta bulunuyor. Aynı zamanda Washington Üniversitesi, Stanford Üniversitesi ve Allen Enstitüsü'ndeki araştırmacıların mantıksal ızgara bulmacalarında benzer zorluklar bulan çalışmalarına da değiniyor. Bu özellik, yorumcuların, bu sonuçların benzersiz bir makine benzeri akıl yürütme sınırlamasını mı ortaya çıkardığını yoksa yalnızca karmaşıklık arttıkça insanların daha fazla hata yaptığı gerçeğini mi yansıttığını sorguladığını belirtiyor. Bu nedenle nehir geçişi ve mantıksal ızgara örnekleri, bir modelin yalnızca bir cevap üretip üretemeyeceğini değil, aynı zamanda birden fazla bağlantılı çıkarım boyunca kısıtlamaları koruyup koruyamayacağını da test eder.
Kaynak ayrıntıları: technologyreview.com ↗
Neden önemli?
Bu özellik, yapay zeka zekasına ilişkin geniş kapsamlı iddiaların neden yanıltıcı olabileceğini gösteriyor. Bir model, önemsiz şeylerde veya tanıdık bir kıyaslamada iyi performans gösterebilirken, ifadelerde küçük bir değişiklik, görsel bir dönüşüm veya birkaç bağımlı adım gerektiren bir problemde başarısız olabilir. Bu farklılıklar, sistemlerin gösteriler yerine kararlar için kullanıldığı durumlarda önemlidir.
Temel ders, bir test sınıfındaki performansın genel bir zeka ölçüsü olarak ele alınmaması gerektiğidir. MIT Technology Review'un örnekleri, yüzeysel olarak basit görünen ancak farklı yetenekler gerektiren görevleri kapsar: bir nesneyi zihinsel olarak döndürmek, ifadeler arasında doğruyu ve yanlışı izlemek, görsel bir kural çıkarmak, yanıltıcı bir sezgiye direnmek veya kısıtlamalar altında bir dizi planlamak. Bir sistem bir alanda alışılmadık derecede güçlü olabilirken diğer alanda güvenilmez olabilir. Bu eşitsizlik, özellikle kullanıcılar akıcı yanıtları modelin temel sorunu anladığının kanıtı olarak yorumladığında anlamlıdır.
Makale ayrıca bir değerlendirme probleminin altını çiziyor: Bir görevin formatı, sonucu maddi olarak etkileyebilir. MIT Technology Review, görsel ızgaralar sayısal temsillere dönüştürüldüğünde ARC-AGI performansının arttığını bildiriyor. Bu, bir puanın yalnızca modelin muhakeme yeteneğini değil aynı zamanda problemin kodlanma ve sunulma şeklini de yansıtabileceğini göstermektedir. Aynı endişe tanıdık bulmacalar için de geçerlidir. Bir model, eğitim sırasında yakın bir değişkenle karşılaştıysa, doğru yanıt, bir kuralı yeni bir duruma uyarlama yeteneğinden ziyade örüntü tanıma veya geri getirme becerisini yansıtabilir. Kaynak, konuşlandırılmış sistemlerde her iki mekanizmanın ne sıklıkta meydana geldiğini belirlemez.
Bu sınırlamaların yapay zekayı eğitimde, yazılımda, araştırmada, yönetimde veya alışılmadık vakaları içeren diğer ortamlarda kullanan herkes için pratik sonuçları vardır. Rutin örneklerde başarılı olan bir model, ifadeler değiştiğinde, çeşitli kısıtlamalar birbiriyle etkileşime girdiğinde veya ilgili bilgiler metin yerine görsel olduğunda yine de başarısız olabilir. Bu özellik, yeni bir ürün lansmanını, yeni bir model sürümünü veya belirli bir ticari sistemin kontrollü değerlendirmesini bildirmez. Değeri açıklayıcıdır: Okuyuculara, karşılaştırmalı değerlendirme kazanımlarının ve gösterişli dilin neden kendi başlarına sağlam bir akıl yürütme oluşturmadığını görmeleri için somut yollar sunar. Makale aynı zamanda önemli bir özelliği de koruyor: İnsanların kendi önyargıları var ve bazı problemlerde daha yavaş veya daha az güvenilir olabiliyorlar.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
Which component of an AI application is the machine-learning model itself?
Bundan sonra ne izlenecek?
Gelecekteki değerlendirmelerin başlık puanlarından daha fazlasını test etmesi gerekecek. Önemli sorular arasında modellerin alışılmadık sorunlara genelleme yapıp yapamayacağı, yanıtlarının bilginin nasıl temsil edildiğine bağlı olup olmadığı, karmaşıklık arttıkça performansın nasıl değiştiği ve başarının yeniden kullanılabilir bir stratejiyi mi yoksa ezberlenmiş kalıpları mı yansıttığı yer alır.
Bir sonraki faydalı gelişme, modeller ve görev formatları arasında daha geniş, tekrarlanabilir testler olacaktır. MIT Technology Review'un özelliği, yedi testin tümünü kapsayan tek bir puan kartı sağlamaz ve kaynak çoğu örnek için model adlarını, versiyonlarını, örnek boyutlarını, yönlendirme koşullarını veya hata oranlarını belirtmez. Bildirilen zayıflıkların yaygın olup olmadığını, belirli model ailelerinde yoğunlaşıp yoğunlaşmadığını veya testlerin nasıl uygulandığına duyarlı olup olmadığını belirlemek için bu ayrıntılara ihtiyaç duyulacaktır.
Bağımsız değerlendirmeler ayrıca, altta yatan bulmacayı sabit tutarken temsilini değiştirerek görsel algı başarısızlıklarını muhakeme başarısızlıklarından ayırmalıdır. Araştırmacılar ve değerlendiriciler ayrıca modellerin gerçek genelleme yoluyla mı yoksa kıyaslama benzeri materyale daha fazla maruz kalma yoluyla mı iyileştiğini izlemelidir. Makalenin Bağlantı bulmacaları ve Şövalyeler ve Knaves çeşitleri hakkındaki tartışması, kirlenmenin ve aşinalığın neden önemli olduğunu gösteriyor. Yayınlanmış veya yakından ilgili sorularda iyi performans gösteren bir model, aynı temel yapıya sahip yeni oluşturulan problemlerde aynı derecede yetenekli olmayabilir. Bu nedenle test, uzun süren bulmacaları, değiştirilmiş ifadeleri, alışılmadık görsel düzenleri ve ikna edici bir cevabın doğru olduğunu varsaymadan ara kısıtlamaların açıklanmasını veya kontrol edilmesini gerektiren görevleri içermelidir.
Karmaşıklık ve gerçek dünya aktarımı açık sorular olmaya devam ediyor. MIT Technology Review, öğe sayısı veya gerekli adımlar arttıkça performansın düşebileceğini bildiriyor ancak kaynak, bu bulguların araçlar, erişim, harici bellek veya insan gözetimi içeren pratik sistemlere nasıl dönüştüğünü ortaya koymuyor. Gelecekteki raporlama, bu tür eklemelerin güvenilirliği artırıp artırmadığını, yalnızca modellerin daha etkili bir şekilde aranmasına yardımcı olup olmadığını veya yeni hata modları getirip getirmediğini izlemelidir. Okuyucular ayrıca yalnızca nihai cevabı değil, stratejinin kalitesini ölçen değerlendirmeleri de izlemelidir, çünkü kırılgan veya genellenemeyen bir kuralla ulaşılan doğru sonuç, problemdeki küçük bir değişiklikten sağ çıkamayabilir.