Haberlere Geri Dön
YenilikAI Understanding brifing

Çalışma, otomatik yaratıcılık puanlarının, yüksek lisans hikayelerine ilişkin insanların yargılarından farklılık gösterebileceğini ortaya koyuyor

Yeni bir arXiv ön baskısı, otomatik ölçümlerin ve Yüksek Lisans jürilerinin, kısa öykülerdeki yaratıcılığa ilişkin insan değerlendirmelerini çoğu zaman eşleştirmede başarısız olduğunu ve jüri üyelerinin sistematik olarak yapay zeka tarafından oluşturulan yazma stillerini tercih ettiğini bildiriyor.

5 min readRead the primary source
Source-provided image accompanying Study finds automatic creativity scores can diverge from human judgments of LLM stories
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.23705
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Büyük Dil Modeli (LLM)
Metin oluşturmak ve analiz etmek için çok büyük metin toplulukları üzerinde eğitilmiş bir dil modeli.
Hassasiyet
Gerçekte doğru olan tahmin edilen pozitiflerin oranı.
Veri kümesi
Eğitim, doğrulama veya test için kullanılan yapılandırılmış veya yapılandırılmamış örneklerden oluşan bir koleksiyon.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

24 Ağustos'ta arXiv'ye gönderilen bir ön baskı, otomatik sistemlerin büyük dil modelleri tarafından oluşturulan öykülerdeki yaratıcılığı güvenilir bir şekilde değerlendirip değerlendiremeyeceğini inceliyor. Yazarlar, insan değerlendirmelerini LLM tabanlı hakimler tarafından üretilen objektif ölçümler ve değerlendirmelerle karşılaştırmaktadır.

“Büyük Dil Modellerinde Yaratıcılığın Otomatik Değerlendirilmesinin Sınırları” başlıklı makale, yaratıcılığın hesaplamalı ölçümleri ile insan muhakemesi arasındaki boşluğu araştırıyor. Yazarlar, insanlar tarafından yazılan hikayeler ve yapay zeka sistemleri tarafından oluşturulan hikayeler de dahil olmak üzere WritingPrompts veri kümesindeki kısa hikayeleri kullanıyor ve yaratıcılığın 11 boyutuna ilişkin insan değerlendirmelerini topluyor. Kaynak, değerlendirmeyi yapanların kimliğini belirtmiyor veya özetinde öykülerin sayısını belirtmiyor. Bu anlamda çalışmanın karşılaştırması, yaratıcılığın son tanımını bir başkasıyla değiştirmekle değil, farklı değerlendirme türleri arasındaki ilişkiyle ilgilidir. Özet, çalışmayı bir güvenilirlik ve uyum araştırması olarak çerçeveliyor.

Bu insan değerlendirmeleri, iki geniş otomatik değerlendirme sınıfıyla karşılaştırılır: nesnel ölçümler ve Hakim Olarak Yüksek Lisans sistemleri. Makale, otomatik sonuçlar ile insan değerlendirmeleri arasında "önemli bir uyumsuzluk" olduğunu bildiriyor. Ayrıca, yaygın olarak kullanılan otomatik ölçümlerin, hem insan tarafından yazılan hem de yapay zeka tarafından oluşturulan hikayeler için insan kararlarıyla sıfıra yakın korelasyon gösterdiğini de bildiriyor. Sonuç, puanlar ve değerlendirmeler arasındaki uygunluk düzeyinde sunulur. Sağlanan metinde, uyumsuzluğun sorumlusu olarak tek bir ölçüt belirtilmemektedir; bu nedenle, objektif ölçütlerin geniş kategorisi, her ölçüt için bir yargı olarak okunmamalıdır.

En belirgin bulgu Yüksek Lisans temelli hakimlerle ilgilidir. Özete göre, bu jüri üyeleri sistematik olarak yapay zeka tarafından üretilen öyküleri tercih etti; bunların üslup özelliklerini, öngörülemezlik ve insan tarafından yazılan metinlerle ilişkili diğer niteliklere tercih etti. Kaynak bunu yazarların deneylerinin sonucu olarak sunuyor; her LLM jürisinin bu şekilde davrandığını veya sonucun tüm yaratıcı yazarlık için geçerli olduğunu ortaya koymaz. Bu nitelik, bulguyu rapor edilen karşılaştırmaya bağlı tutar. Aynı zamanda deneyde gözlemlenen tercihi, her iki kaynağın da edebi değeri hakkında özette yer almayan genel sonuçtan ayırır.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

Bulgular, yaratıcı kalitenin yalnızca otomatik puanlamayla güvenilir bir şekilde ölçülebileceği yönündeki yaygın varsayıma meydan okuyor. Değerlendirme sistemleri, insan okuyucuların değer verdiği nitelikleri kaçırırken yapay zeka tarafından üretilen yazıyla ilişkili stilistik sinyalleri ödüllendirirse, insanlar ve dil modelleri arasındaki karşılaştırmaları bozabilir.

Yaratıcılık genellikle bir puanla özetlenebilecek tek bir nitelik olarak değerlendiriliyor ancak makale bunu çok boyutlu ve öznel olarak tanımlıyor. Bildirilen sıfıra yakın korelasyonlar, bir metriğin, yaratıcı çalışmanın insan okuyucuların önemli olduğunu düşündüğü yönlerini yakalamadan bir sayı üretebileceğini öne sürüyor. Bu ayrım, modelleri karşılaştırmak, geliştirmeyi yönlendirmek veya oluşturulan içeriği değerlendirmek için otomatik değerlendirmeler kullanıldığında önemlidir. Bu aynı zamanda otomatik bir sonucun görünen kesinliğinin, sonucun okuyuculardan değerlendirmesi istenen nitelikleri yansıtıp yansıtmadığından ayrı olarak değerlendirilmesi gerektiği anlamına gelir.

Yapay zeka tarafından oluşturulan hikayelere yönelik bildirilen tercih, belirli bir ölçüm endişesini gündeme getiriyor. Bir Yüksek Lisans jürisi, tanınabilir üslup kalıplarını sürpriz veya öngörülemezlikten daha kolay bir şekilde ödüllendirirse, bir sistem, insan okuyucuların daha fazla değer verdiği yazılar ürettiği için değil, jürinin tercihleriyle eşleştiği için daha yaratıcı görünebilir. Kaynak, bir konuşlandırmayı veya belgelenmiş bir kurumsal kararı tanımlamıyor; dolayısıyla bunlar, bildirilen gerçek dünyadaki sonuçlardan ziyade, çalışmanın bulgularının pratik sonuçlarıdır. Bu nedenle endişe, özellikle puanı yaratıcı kalitenin doğrudan bir özeti olarak ele alındığında, değerlendirmenin yorumu nasıl şekillendirebileceğiyle ilgilidir.

Çalışma aynı zamanda dil modellerinin yaratıcı görevlerde insan performansına yaklaştığı veya bu performansı aştığı yönündeki iddialarla da alakalı. Otomatik değerlendiriciden alınan güçlü puan, eğer değerlendirici insan muhakemesi ile uyumlu değilse, mutlaka geniş kapsamlı yaratıcı üstünlüğün kanıtı değildir. Aynı zamanda kaynak, insanların güvenilir veya tarafsız yargıçlar olduğunu söylemiyor ve yapay zeka tarafından oluşturulan hikayelerin genel olarak daha az yaratıcı olduğunu göstermiyor. Değerlendirme yöntemleri arasında bir anlaşmazlık olduğunu bildiriyor. Bu anlaşmazlık, değerlendiricinin davranışının tarafsız bir arka plan yerine kanıtın bir parçası olarak ele alındığı karşılaştırmalı sonuçların daha dikkatli okunmasına yer bırakıyor.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Makale bir ön baskıdır ve kaynak metin, değerlendiriciler, değerlendirme modelleri, istemler, istatistiksel yöntemler veya hikaye örneğinin boyutu ve bileşimi hakkında ayrıntılar sağlamaz. Takip çalışması, bildirilen uyumsuzluğun türler, diller, modeller ve bağımsız okuyucu grupları arasında geçerli olup olmadığını test etmelidir.

Asıl bilinmeyen, deneylerin ayrıntılı olarak nasıl yürütüldüğüdür. Sağlanan kaynak, kaç tane insan ve yapay zeka tarafından oluşturulan hikayenin değerlendirildiğini, yapay zeka hikayelerini hangi dil modellerinin ürettiğini, 11 yaratıcılık boyutunun nasıl tanımlandığını veya insan derecelendirmelerinin nasıl toplandığını belirtmiyor. Bu ayrıntılar, raporlanan sonuçların gücünü ve kapsamını değerlendirmek açısından önemlidir. Ayrıca okuyucuların, bildirilen karşılaştırmanın, sonuçların daha sonra yorumlanabileceği veya çoğaltılabileceği koşulları ne kadar yakından yansıttığını anlamalarına da yardımcı olacaktır.

Daha fazla inceleme, karşılaştırmada kullanılan nesnel ölçütleri ve Yüksek Lisans jürilerini incelemelidir. Özette bu kişilerin isimleri belirtilmez, yönlendirmeleri açıklanmaz veya jüri üyelerinin tekrarlanan değerlendirmeler yoluyla güvenilirlik açısından test edilip edilmediği belirtilmez. Sonuçlar, ölçüm seçimine, değerlendirme modeline, talimatlara, öykü uzunluğuna veya yazma stiline bağlı olabilir. Bu ayrıntılar olmadan, geniş kapsamlı bulgu bilgi vericidir ancak belirli bir değerlendirme düzenine bağlanması zordur. Kurulumun açıklığa kavuşturulması, genel bir sınırlamayı belirli araçlara veya talimatlara bağlı bir sonuçtan ayırmayı kolaylaştıracaktır.

Çoğaltma, bildirilen modelin WritingPrompts veri kümesinin ve kısa öykülerin ötesine geçip geçmediğini gösterecektir. Yararlı testler arasında diğer türler, diller, model aileleri, insan okuyucu kitleleri ve yaratıcı formatlar yer alır. Kaynak aynı zamanda gelişmiş değerlendirme yöntemlerinin insan yargılarını daha iyi yansıtıp yansıtamayacağına veya yaratıcılığın bazı yönlerinin tek bir otomatik puana karşı dirençli kalıp kalmayacağına da açıklık getiriyor. Bu açık sorular yorumlamanın bir sonraki aşamasını tanımlar: uyumsuzluğun ne kadar kalıcı olduğunu ve ne tür değerlendirmelerin bunu ele alabileceğini belirlemek.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıChatGPT ve LLM'lerYapay Zeka EtiğiYapay Zeka EğitimiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?