Ne oldu?
Tech Xplore, büyük dil modellerinin uzmanlara ne kadar tavsiye ettiğini değerlendirmek için Karmaşıklık Bilimi Merkezi'ne bağlı araştırmacılar tarafından geliştirilen bir kıyaslama olan LLMScholarBench'te rapor verdi. Raporda, karşılaştırmalı değerlendirmenin teknik kalite ve sosyal temsil ölçütleri genelinde 22 modeli test ettiği ve tavsiyelerin genellikle çok alıntı yapılan, kıdemli, erkek, ABD merkezli ve beyaz bilim insanlarının lehine olduğu tespit edildiği belirtiliyor. Geri getirmeyle artırılmış oluşturma, olgusal doğruluğu artırırken, yönlendirme temsili yönlendirebilirdi ancak iki hedef gerilim içinde kaldı.
Tech Xplore, Complexity Science Hub ile ilişkili araştırmacılar tarafından 22 modelden uzman önerilerini test etmek için geliştirilen LLMScholarBench hakkında rapor verdi: Gemini, GPT, Llama, Qwen, DeepSeek, Grok, Mistral ve Gemma dahil olmak üzere ailelerden 20 açık ağırlıklı ve iki özel model. Beş teknik ölçütü (olgusal doğruluk, tutarlılık, geçerlilik, retler ve yinelenen öneriler) ve dört sosyal ölçütü (bağlantılılık, bibliyometrik benzerlik, çeşitlilik ve denklik) ölçtü.
Araştırmacılar ilk olarak, en iyi beş ve en etkili 100 uzmana yönelik talepler de dahil olmak üzere beş fizik öneri görevinde altı açık ağırlıklı modeli değerlendirdi. Referans veritabanı, 1893 ile 2020 yılları arasında American Physical Society dergilerinde yayın yapan 450.000'den fazla bilim insanını içeriyordu. Tech Xplore, modellerin bu veritabanındaki tavsiyelerin yaklaşık %80'inde bilim adamlarının adını verdiğini, alan ve kıdem uyumsuzluklarının ise daha zor olduğunu söylüyor; Fizik-alt alan uyumsuzlukları ilk testte ortalama %40 civarındaydı.
Rapor demografik ve coğrafi çarpıklıkları açıklıyor. Kadınlar, alt alan ve döneme bağlı olarak referans kaydındaki araştırmacıların %14 ila %32'sini temsil ediyordu, ancak modeller genellikle daha az kadın öneriyor veya hiç kadın önermiyor. Asyalı akademisyenler en büyük demografik gruptu, ancak beyaz akademisyenler sıklıkla aşırı temsil edilirken, Siyah ve Latin araştırmacılar çoğunlukla yoktu. Öneriler, çok yayınlanmış ve alıntı yapılan akademisyenlere odaklandı ve daha küçük modeller, önerileri daha az sayıda ülkede kümelendirdi.
Tech Xplore, 0,63 ila 0,82 arasında gerçeklik puanı, 0,44 ila 0,69 arasında çeşitlilik puanı ve %54 ila %60 arasında eşlik puanı rapor ediyor. DeepSeek ve Gemini gerçeklik açısından en güçlüler arasında yer aldı, DeepSeek çeşitliliğe öncülük etti ve Gemma eşitliğe öncülük etti. 22 modeldeki dört müdahale, erişimle artırılmış üretimin teknik kaliteyi, özellikle doğruluğu iyileştirdiğini, hızlı mühendisliğin ise temsili iyileştirdiğini gösterdi; bunları birleştirmek yine de her önlemi aynı anda iyileştirmedi.
Daha ileri bir çalışma, belirtilen rolün, dilin veya coğrafi konumun altı akademik disiplindeki önerileri değiştirip değiştirmediğini inceledi. Konum sonuçları etkilerken dil ve rol etkilemedi. Daha yeni tescilli Gemini 2.5 Pro ve Flash modellerinin web erişimiyle yapılan testlerinin gerçek doğruluğu arttırdığı, ancak çeşitliliği ve eşitliği azalttığı bildirildi. Kaynak, LLMScholarBench'i kesin bir sıralamadan ziyade devam eden bir denetim aracı olarak sunuyor ve bazı modellerin araştırmadan bu yana güncellenmiş olabileceğini belirtiyor.
Kaynak ayrıntıları: techxplore.com ↗
Neden önemli?
Yapay zeka sistemleri, araştırmacılar, doktorlar ve avukatlar da dahil olmak üzere profesyonel fırsatlara sahip kişileri bulmak için giderek daha fazla kullanılıyor. Eğer tavsiyeler sürekli olarak zaten oldukça görünür olan kişileri tercih ederse, sistemler çıktılarını tarafsız olarak sunarken fırsatlara erişimi daraltabilir. Bulgular ayrıca öneri sistemleri için doğruluğun tek başına neden eksik bir ölçü olduğunu da gösteriyor: Bir liste gerçek uzmanları içerebilir ve yine de demografik ve coğrafi dengesizlikleri yeniden üretebilir veya yoğunlaştırabilir.
Uzman tavsiyesi bir eşik bekçiliği adımı olabilir: konferans organizatörleri açılış konuşmacıları bulabilir, işverenler aday havuzları oluşturabilir ve hastalar yüksek lisans yoluyla doktor arayabilir. Tech Xplore, araştırmacıların bu riskleri akademinin ötesinde gördüğünü bildiriyor. Yüksek görünürlüğe sahip kişileri tekrar tekrar adlandırmak, dikkati ve fırsatları aynı gruba yönlendirebilir, ancak daha az görünür olan nitelikli kişileri keşfedilmeden bırakabilir.
Bulgular, gerçekliği adaletten ayırıyor. Bir öneri, kişinin bu alanda var olması ve çalışması nedeniyle, ancak ilgili profesyonel popülasyonda mevcut olan grupları hariç tutarsa sosyal açıdan dengesiz olması nedeniyle fiili olarak geçerli olabilir. Raporun teknik kalite ve sosyal temsil arasındaki ayrımı, yalnızca isimlerin gerçek olup olmadığını veya alıntıların mevcut olup olmadığını kontrol etmekten daha kullanışlı bir çerçeve sunuyor.
Müdahale sonuçları, web aramasının öneri önyargısını çözdüğü varsayımını karmaşık hale getiriyor. Tech Xplore, erişimin gerçek doğruluğu artırdığını ancak daha yeni özel modellerin testlerinde çeşitliliği ve eşitliği azalttığını söylüyor. Araştırmacılar bu riski internette yeterince temsil edilmemeye bağlıyor; kaynak bunu bağımsız olarak belirlenmiş bir nedensel bulgu olarak değil, kendi yorumu olarak sunuyor. Bu nedenle bir sistemi harici olarak topraklamak, otomatik olarak bilgiyi temsil etmez.
Coğrafi etki uluslararası kullanıcılar için önemlidir. Bilim adamlarının tavsiye ettiği konum değişirse, bir sistem yalnızca uzmanlık yerine yerel uygunluk veya görünürlük hakkındaki varsayımları kodlayabilir. Kaynak, dil ve rolün bildirilen testlerde sonuçları değiştirmediğini ancak bunun diğer disiplinlerde, dillerde veya modellerde hiçbir zaman önemli olmadığını göstermediğini söylüyor. Sonuç, çalışmanın test edilen koşulları için geçerlidir.
Kaynak, herhangi bir modelin birinin işini, davetini veya fırsatını kaybetmesine neden olduğunu kanıtlamıyor. Ayrıca demografik atamaları, her puanın arkasındaki koşu sayısını veya belirsizlik hesaplamalarını belirlemek için yeterli metodolojik ayrıntıdan da yoksundur. Puanlar istemlere, model sürümlerine, erişim kaynaklarına ve örneklemeye göre değişebilir. Bu nedenle çalışmanın kamusal değeri, her dağıtımın aynı şekilde davrandığını kanıtlamak değil, ölçülebilir bir riski ortaya çıkarmak ve tekrarlanabilir bir denetim yapısı önermek.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
What is a common training objective for an autoregressive language model?
Bundan sonra ne izlenecek?
Kaynak, 2026 tarihli bir ACM SIGKDD yayınından ve iki arXiv çalışmasından bahsediyor, ancak bu birincil materyaller burada bağımsız olarak incelenmedi. Önemli açık sorular arasında, sonuçların yönlendirmelere, örneklemeye, model güncellemelerine ve demografik sınıflandırma yöntemlerine göre nasıl değiştiği ve karşılaştırma ölçütünün gerçek işe alım, kabul veya konferans seçim sistemlerindeki sonuçları tahmin edip etmediği yer alıyor. Gelecekteki değerlendirmeler, daha geniş referans verilerinin ve yapılandırılmış insan incelemesinin gerçekçiliği ve temsili birlikte geliştirip geliştiremeyeceğini test etmelidir.
Alıntı yapılan birincil araştırmanın bağımsız olarak incelenmesi birinci önceliktir. Tech Xplore, kıyaslama ve müdahaleye dayalı denetime ilişkin 2026 ACM SIGKDD belgesinin yanı sıra ilk denetim ve kişisel yönlendirme etkilerine ilişkin arXiv belgelerini tanımlar. Bu materyaller istemleri, model versiyonlarını, deneme sayımlarını, istatistiksel belirsizliği, demografik etiketleme prosedürlerini, referans popülasyonlarını, retleri ve kopyaları açıklığa kavuşturmalıdır. Bu ayrıntılar yalnızca ikincil rapordan çıkarılmamalıdır.
Araştırmacılar ve uygulayıcılar, LLMScholarBench bulgularının fiziğin ve açıklanan altı disiplinin ötesine geçip geçmediğini test etmelidir. APS yayın kayıtları, farklı yayın modellerine, coğrafi yapılara veya demografik verilere sahip alanları temsil etmeyebilir ve akademik yayıncılık dışında belgelenen uzmanlıkları kaçırabilir. Tıp, hukuk, mühendislik, kamu hizmeti ve vasıflı mesleklerin test edilmesi, riskin insanların halihazırda yapay zeka önerilerini kullandığı ortamlara genellenip genellenmediğini gösterecektir.
Model güncellemeleri ve erişim kaynakları sürekli izleme gerektirir. Rapor, değerlendirilen bazı modellerin değiştiğini söylüyor ve farklı sonuçlar dengesi sağlayan web erişimine sahip daha yeni Gemini testlerini açıklıyor. Tek bir çalıştırma geçerliliğini yitirebilir. Takip, zaman içindeki sürümleri karşılaştırmalı, alınan web kaynaklarını belgelemeli ve boyutlar arasında performansı değiştirmek yerine değişikliklerin doğruluğu ve gösterimi birlikte iyileştirip iyileştirmediğini ölçmelidir.
İnsanları tavsiye etmek için yapay zekayı kullanan kuruluşlar, şeffaf kriterlere, insan incelemesine ve atlandığında nitelikli kişilerin dikkate alınmasına yönelik bir yönteme ihtiyaç duymalıdır. İstemi, model sürümünü, alma ayarını ve çıktıyı kaydetmeli ve adların gerçek olup olmadığından daha fazlasını değerlendirmelidirler. Kaynak, ne düzenleyici bir gereklilik ne de onaylanmış bir sektör tepkisi bildiriyor; dolayısıyla bunlar, kıyaslama nedeniyle halihazırda benimsenmiş önlemler değil, risklerin önerdiği pratik önlemlerdir.
Daha fazla temsili verinin bildirilen dengelemenin üstesinden gelip gelemeyeceği henüz çözülmedi. Tech Xplore, ekibin daha geniş bir bilimsel bilgi tabanı oluşturmayı planladığını ancak bunun tamamlandığına veya kıyaslama performansını iyileştirdiğine dair hiçbir kanıt sunmadığını söylüyor. Gelecekteki sonuçlar, gerçekçilik, çeşitlilik ve eşitlik açısından tekrarlanabilir kazanımların yanı sıra, yalnızca kıyaslamayı optimize etmeden gerçekçi tavsiye görevlerinde kalıcılık göstermelidir.