Ne oldu?
24 Ağustos'ta arXiv'ye gönderilen bir ön baskı, otomatik sistemlerin büyük dil modelleri tarafından oluşturulan öykülerdeki yaratıcılığı güvenilir bir şekilde değerlendirip değerlendiremeyeceğini inceliyor. Yazarlar, insan değerlendirmelerini LLM tabanlı hakimler tarafından üretilen objektif ölçümler ve değerlendirmelerle karşılaştırmaktadır.
“Büyük Dil Modellerinde Yaratıcılığın Otomatik Değerlendirilmesinin Sınırları” başlıklı makale, yaratıcılığın hesaplamalı ölçümleri ile insan muhakemesi arasındaki boşluğu araştırıyor. Yazarlar, insanlar tarafından yazılan hikayeler ve yapay zeka sistemleri tarafından oluşturulan hikayeler de dahil olmak üzere WritingPrompts veri kümesindeki kısa hikayeleri kullanıyor ve yaratıcılığın 11 boyutuna ilişkin insan değerlendirmelerini topluyor. Kaynak, değerlendirmeyi yapanların kimliğini belirtmiyor veya özetinde öykülerin sayısını belirtmiyor. Bu anlamda çalışmanın karşılaştırması, yaratıcılığın son tanımını bir başkasıyla değiştirmekle değil, farklı değerlendirme türleri arasındaki ilişkiyle ilgilidir. Özet, çalışmayı bir güvenilirlik ve uyum araştırması olarak çerçeveliyor.
Bu insan değerlendirmeleri, iki geniş otomatik değerlendirme sınıfıyla karşılaştırılır: nesnel ölçümler ve Hakim Olarak Yüksek Lisans sistemleri. Makale, otomatik sonuçlar ile insan değerlendirmeleri arasında "önemli bir uyumsuzluk" olduğunu bildiriyor. Ayrıca, yaygın olarak kullanılan otomatik ölçümlerin, hem insan tarafından yazılan hem de yapay zeka tarafından oluşturulan hikayeler için insan kararlarıyla sıfıra yakın korelasyon gösterdiğini de bildiriyor. Sonuç, puanlar ve değerlendirmeler arasındaki uygunluk düzeyinde sunulur. Sağlanan metinde, uyumsuzluğun sorumlusu olarak tek bir ölçüt belirtilmemektedir; bu nedenle, objektif ölçütlerin geniş kategorisi, her ölçüt için bir yargı olarak okunmamalıdır.
En belirgin bulgu Yüksek Lisans temelli hakimlerle ilgilidir. Özete göre, bu jüri üyeleri sistematik olarak yapay zeka tarafından üretilen öyküleri tercih etti; bunların üslup özelliklerini, öngörülemezlik ve insan tarafından yazılan metinlerle ilişkili diğer niteliklere tercih etti. Kaynak bunu yazarların deneylerinin sonucu olarak sunuyor; her LLM jürisinin bu şekilde davrandığını veya sonucun tüm yaratıcı yazarlık için geçerli olduğunu ortaya koymaz. Bu nitelik, bulguyu rapor edilen karşılaştırmaya bağlı tutar. Aynı zamanda deneyde gözlemlenen tercihi, her iki kaynağın da edebi değeri hakkında özette yer almayan genel sonuçtan ayırır.
Kaynak ayrıntıları: arxiv.org ↗
Neden önemli?
Bulgular, yaratıcı kalitenin yalnızca otomatik puanlamayla güvenilir bir şekilde ölçülebileceği yönündeki yaygın varsayıma meydan okuyor. Değerlendirme sistemleri, insan okuyucuların değer verdiği nitelikleri kaçırırken yapay zeka tarafından üretilen yazıyla ilişkili stilistik sinyalleri ödüllendirirse, insanlar ve dil modelleri arasındaki karşılaştırmaları bozabilir.
Yaratıcılık genellikle bir puanla özetlenebilecek tek bir nitelik olarak değerlendiriliyor ancak makale bunu çok boyutlu ve öznel olarak tanımlıyor. Bildirilen sıfıra yakın korelasyonlar, bir metriğin, yaratıcı çalışmanın insan okuyucuların önemli olduğunu düşündüğü yönlerini yakalamadan bir sayı üretebileceğini öne sürüyor. Bu ayrım, modelleri karşılaştırmak, geliştirmeyi yönlendirmek veya oluşturulan içeriği değerlendirmek için otomatik değerlendirmeler kullanıldığında önemlidir. Bu aynı zamanda otomatik bir sonucun görünen kesinliğinin, sonucun okuyuculardan değerlendirmesi istenen nitelikleri yansıtıp yansıtmadığından ayrı olarak değerlendirilmesi gerektiği anlamına gelir.
Yapay zeka tarafından oluşturulan hikayelere yönelik bildirilen tercih, belirli bir ölçüm endişesini gündeme getiriyor. Bir Yüksek Lisans jürisi, tanınabilir üslup kalıplarını sürpriz veya öngörülemezlikten daha kolay bir şekilde ödüllendirirse, bir sistem, insan okuyucuların daha fazla değer verdiği yazılar ürettiği için değil, jürinin tercihleriyle eşleştiği için daha yaratıcı görünebilir. Kaynak, bir konuşlandırmayı veya belgelenmiş bir kurumsal kararı tanımlamıyor; dolayısıyla bunlar, bildirilen gerçek dünyadaki sonuçlardan ziyade, çalışmanın bulgularının pratik sonuçlarıdır. Bu nedenle endişe, özellikle puanı yaratıcı kalitenin doğrudan bir özeti olarak ele alındığında, değerlendirmenin yorumu nasıl şekillendirebileceğiyle ilgilidir.
Çalışma aynı zamanda dil modellerinin yaratıcı görevlerde insan performansına yaklaştığı veya bu performansı aştığı yönündeki iddialarla da alakalı. Otomatik değerlendiriciden alınan güçlü puan, eğer değerlendirici insan muhakemesi ile uyumlu değilse, mutlaka geniş kapsamlı yaratıcı üstünlüğün kanıtı değildir. Aynı zamanda kaynak, insanların güvenilir veya tarafsız yargıçlar olduğunu söylemiyor ve yapay zeka tarafından oluşturulan hikayelerin genel olarak daha az yaratıcı olduğunu göstermiyor. Değerlendirme yöntemleri arasında bir anlaşmazlık olduğunu bildiriyor. Bu anlaşmazlık, değerlendiricinin davranışının tarafsız bir arka plan yerine kanıtın bir parçası olarak ele alındığı karşılaştırmalı sonuçların daha dikkatli okunmasına yer bırakıyor.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
Which component of an AI application is the machine-learning model itself?
Bundan sonra ne izlenecek?
Makale bir ön baskıdır ve kaynak metin, değerlendiriciler, değerlendirme modelleri, istemler, istatistiksel yöntemler veya hikaye örneğinin boyutu ve bileşimi hakkında ayrıntılar sağlamaz. Takip çalışması, bildirilen uyumsuzluğun türler, diller, modeller ve bağımsız okuyucu grupları arasında geçerli olup olmadığını test etmelidir.
Asıl bilinmeyen, deneylerin ayrıntılı olarak nasıl yürütüldüğüdür. Sağlanan kaynak, kaç tane insan ve yapay zeka tarafından oluşturulan hikayenin değerlendirildiğini, yapay zeka hikayelerini hangi dil modellerinin ürettiğini, 11 yaratıcılık boyutunun nasıl tanımlandığını veya insan derecelendirmelerinin nasıl toplandığını belirtmiyor. Bu ayrıntılar, raporlanan sonuçların gücünü ve kapsamını değerlendirmek açısından önemlidir. Ayrıca okuyucuların, bildirilen karşılaştırmanın, sonuçların daha sonra yorumlanabileceği veya çoğaltılabileceği koşulları ne kadar yakından yansıttığını anlamalarına da yardımcı olacaktır.
Daha fazla inceleme, karşılaştırmada kullanılan nesnel ölçütleri ve Yüksek Lisans jürilerini incelemelidir. Özette bu kişilerin isimleri belirtilmez, yönlendirmeleri açıklanmaz veya jüri üyelerinin tekrarlanan değerlendirmeler yoluyla güvenilirlik açısından test edilip edilmediği belirtilmez. Sonuçlar, ölçüm seçimine, değerlendirme modeline, talimatlara, öykü uzunluğuna veya yazma stiline bağlı olabilir. Bu ayrıntılar olmadan, geniş kapsamlı bulgu bilgi vericidir ancak belirli bir değerlendirme düzenine bağlanması zordur. Kurulumun açıklığa kavuşturulması, genel bir sınırlamayı belirli araçlara veya talimatlara bağlı bir sonuçtan ayırmayı kolaylaştıracaktır.
Çoğaltma, bildirilen modelin WritingPrompts veri kümesinin ve kısa öykülerin ötesine geçip geçmediğini gösterecektir. Yararlı testler arasında diğer türler, diller, model aileleri, insan okuyucu kitleleri ve yaratıcı formatlar yer alır. Kaynak aynı zamanda gelişmiş değerlendirme yöntemlerinin insan yargılarını daha iyi yansıtıp yansıtamayacağına veya yaratıcılığın bazı yönlerinin tek bir otomatik puana karşı dirençli kalıp kalmayacağına da açıklık getiriyor. Bu açık sorular yorumlamanın bir sonraki aşamasını tanımlar: uyumsuzluğun ne kadar kalıcı olduğunu ve ne tür değerlendirmelerin bunu ele alabileceğini belirlemek.