Haberlere Geri Dön
YenilikAI Understanding brifing

Preprint, öğrenci katılımının, LLM sınıf konuşması ölçümlerinin doğrulanma şeklini yeniden şekillendirmesi gerektiğini söylüyor

Bir ön baskı, dört çok dilli sekizinci sınıf öğrencisinin, yetişkinlere yönelik açıklamaların ve standart puanların öğrencilerin kendi yorumlarını kaçırabileceğini öne sürerek matematik tartışmalarının Yüksek Lisans sınıflandırmalarına karşı çıktıklarını bildiriyor.

6 min readRead the primary source
Primary-source image accompanying Preprint says student participation should reshape how LLM measures of classroom talk are validated
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.23780
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Büyük Dil Modeli (LLM)
Metin oluşturmak ve analiz etmek için çok büyük metin toplulukları üzerinde eğitilmiş bir dil modeli.
Değerlendirme Seti
Eğitimden sonra model kalitesini ölçmek için kullanılan uzatılmış bir veri kümesi.
Ek açıklama
Makine öğrenimi modellerini eğitmek veya değerlendirmek için kullanılan, insan tarafından eklenen etiketler veya meta veriler.
Kendinizi test edinAI nedir? Sınav

Ne oldu?

Yeni bir arXiv ön baskısı, konuşma hareketleri, işbirliği ve ses eşitliği dahil olmak üzere öğrenci söylemini ölçmek için büyük dil modellerinin nasıl kullanıldığını inceliyor. Yazarlar, bu sistemleri yalnızca yetişkin uzman açıklamalarına ve uzun test setlerine göre değerlendirmenin, sınıf dilini bağlamından çıkarabileceğini ve deneyimleri ölçülen öğrencileri dışarıda bırakabileceğini öne sürüyor. Sekizinci sınıftaki bir matematik sınıfındaki çok dilli gençleri içeren bir vaka çalışmasında araştırmacılar, dört odak öğrenciyle katılımcı gözlemi, röportajları, odak gruplarını ve üye kontrollerini birleştirdi. Öğrencilerin kendi sınıf konuşmalarına ilişkin yorumlarının bazen Yüksek Lisans temelli ölçümlerle uyumlu olmadığını bildiriyorlar. Öğrenciler ayrıca hem modelin sınıflandırmalarına hem de ölçülen davranışları tanımlamak için kullanılan kodlama şemasına itiraz ettiler.

Makale, öğrenci konuşmasının yüksek lisans temelli ölçümlerine odaklanmaktadır. Yazarlara göre bu sistemler, konuşma hareketleri, işbirliği ve ses eşitliği gibi özellikleri belirlemek için sınıf konuşmalarının transkripsiyonlarını giderek daha fazla analiz ediyor. Yazarlar, transkripsiyonların genellikle yalnızca sözlü katkıları içerdiğini, bunun da çevredeki bağlamı ortadan kaldırabileceğini ve öğrenci dilinin yorumlanmasını zorlaştırabileceğini söylüyor.

Yazarlar iki yaygın doğrulama uygulamasını sorguluyor: Yüksek Lisans çıktılarının yetişkin uzmanlar tarafından oluşturulan ek açıklamalarla karşılaştırılması ve performansın uzatılmış veri kümeleri ve F1 puanlarıyla değerlendirilmesi. Bu prosedürlerin, sonuçta ortaya çıkan ölçümün öğretme ve öğrenme açısından anlamlı veya adil olduğunu göstermeden, yetişkinler tarafından tanımlanmış bir standartla uyum gösterebileceğini iddia ediyorlar. Makale bunu epistemik bir sorun olarak sunuyor: analiz edilen kişiler, sözlerinin ne anlama geldiğine karar vermekten dışlanabilir.

Örnek olay incelemesi için araştırma ekibi, sekizinci sınıftaki bir matematik sınıfındaki çok dilli gençleri inceledi. Özet, araştırmacıların katılımcı gözlemleri, röportajlar, odak grupları ve üye kontrolleri dahil olmak üzere etnografik odaklı birden fazla yöntem kullandığını söylüyor. Dört odak öğrenciyle çalıştılar ve sınıftaki konuşmaları yorumlama sürecinde bu öğrencileri araştırmacılarla ve Yüksek Lisans Uzmanlarıyla sohbete soktular.

Bildirilen bulgu, öğrencilerin kendi matematik konuşma deneyimlerine ilişkin yorumlarının her zaman Yüksek Lisans temelli ölçümlerle eşleşmediğidir. Öğrenciler yalnızca Yüksek Lisans tarafından oluşturulan bireysel sınıflandırmalara değil, aynı zamanda konuşmalarını ölçmek için kullanılan kodlama şemasına da itiraz ettiler. Kaynak, test edilen modeli veya modelleri tanımlamaz, sayısal performans sonuçları sağlamaz, tartışmalı sınıflandırmaları listelemez veya anlaşmazlıkların nihai olarak nasıl karara bağlandığını açıklamaz.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

Ön baskı, sınıftaki tartışmayı değerlendirmek için Yüksek Lisans'ı benimseyen okullar ve araştırmacılar için pratik bir soruyu gündeme getiriyor: Bir sistemin, tanımlaması gereken öğrencileri yanlış anlarken, yetişkin yorumcularla güçlü bir anlaşmaya varıp varamayacağı. Temel iddiası, özellikle dil ve ırkın sınıf iletişiminin nasıl yorumlanacağını şekillendirdiği durumlarda, öğrencilerin kendi konuşmaları hakkında bilgi üretmeye ve doğrulamaya katılmaları gerektiğidir. Kanıtlar tek bir sınıf ve dört odak öğrenciyle sınırlıdır ve makale inceleniyor olarak işaretlenmiştir. Bu nedenle, bildirilen yanlış hizalamaların ne kadar yaygın olduğunu veya gençlik merkezli doğrulamanın herhangi bir modelin doğruluğunu arttırıp artırmadığını belirlemez. Ancak eğitim amaçlı yapay zeka dağıtımları için somut bir yönetişim ve değerlendirme sorununu tanımlamaktadır.

Çalışma önemlidir çünkü Yüksek Lisans temelli sınıf analizi, eğitimcilerin katılımı ve etkileşimi nasıl anladıklarını etkileyebilir. Bir öğrencinin katkısını belirli bir konuşma hareketi olarak etiketleyen veya kimin sesinin temsil edildiğini değerlendiren bir ölçü, araştırma sonuçlarını, öğretim kararlarını veya sınıf eşitliğine ilişkin yargıları şekillendirebilir. Kategoriler öğrencilerin deneyimlerini yansıtmada başarısız olursa, görünürdeki kesinlik önemli bir yorumlama hatasını gizleyebilir.

Yazarların argümanı aynı zamanda dar bir doğrulama tanımına da meydan okuyor. Yetişkin uzmanlarla anlaşmak yararlı olabilir ancak yetişkinlerin açıklama sürecine dahil edilen varsayımları yeniden üretebilir. Benzer şekilde, uzun bir değerlendirme seti ve bir F1 puanı, etiketlerin sınıftaki konuşmanın sosyal ve dilsel bağlamını yansıttığını göstermeden etiketlerle tutarlılığı ölçebilir. Ön baskı bu ölçümlerin işe yaramaz olduğunu iddia etmiyor; tek başına yetersiz olduklarını savunur.

Çok dilli, ırksal ve dilsel olarak dışlanmış gençlere odaklanmak, konuyu özellikle önemli kılmaktadır. Kaynak, yetişkin araştırmacıların, uzman açıklamacıların ve yüksek lisans eğitimcilerinin öğrencilerin konuşmalarını anlamak için gereken tüm incelikleri sağlayamadığını söylüyor. Sistemin herhangi bir demografik grup için daha kötü performans gösterdiğini ortaya koymaz ve herhangi bir yaygınlık tahmini sunmaz. İlgili bulgu daha dar kapsamlıdır: bu durumda öğrenciler kendi yorumları ile sistemin ölçümleri arasında uyumsuzluklar tespit etmişlerdir.

Makalenin en somut anlamı usule ilişkindir. Yüksek Lisans temelli bir ölçümün sınıf etkileşimi hakkında anlamlı bir kanıt olarak değerlendirilmesinden önce öğrencilerin kategorileri tanımlama, sınıflandırmaları gözden geçirme ve yorumları sorgulama konusunda bir role ihtiyaçları olabilir. Bu yaklaşımın geniş ölçekte uygulanabilir olup olmadığı, ne kadar zaman gerektirdiği ve daha güvenilir eğitim kararları üretip üretmediği kaynak tarafından cevapsız kalıyor.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Bundan sonra ne izlenecek?

Bir sonraki anahtar soru, yazarların önerdiği yaklaşımın daha fazla sınıfta, yaş grubunda, dilde ve okul ortamında test edilip edilemeyeceğidir. Gelecekteki çalışmaların, öğrenci yorumlarının model çıktılarından ne zaman farklılaştığını, bu farklılıkların modeldeki hataları, kodlama şemasındaki sınırlamaları veya perspektifteki meşru farklılıkları yansıtıp yansıtmadığını ve araştırmacıların bunları nasıl çözmesi gerektiğini göstermesi gerekecektir. Yüksek Lisans temelli ölçümleri kullanan okullar ve satıcılar aynı zamanda neyin ölçüldüğünü, kategorileri kimin tanımladığını ve öğrencilerin sonuçlara itiraz edip edemeyeceğini de açıklamalıdır. Kaynak, bir ürün dağıtımını, belirli bir modele yönelik bir öneriyi, karşılaştırmalı bir kıyaslamayı veya öğretme ve öğrenme üzerinde ölçülen bir etkiyi bildirmiyor. Bu bilinmeyenler operasyonel performansla ilgili doğrudan çıkarımları sınırlıyor.

Çoğaltma bir sonraki en önemli adımdır. Bu vaka çalışması bir sekizinci sınıf matematik sınıfını ve dört odak öğrenciyi kapsadığından, benzer anlaşmazlıkların başka yerlerde ne sıklıkla meydana geldiğini gösteremez. Araştırmacıların daha geniş sonuçlara varmadan önce farklı konuları, yaş gruplarını, dilleri, sınıf kültürlerini ve öğrenci katılım biçimlerini incelemeleri gerekecektir.

Gelecekteki çalışmalar, kullanılan belirli Yüksek Lisans'ları, istemleri, transkriptleri, kodlama kategorilerini ve değerlendirme prosedürlerini rapor etmelidir. Aynı zamanda farklı anlaşmazlık türleri arasında da ayrım yapmalıdırlar: bir transkripsiyon sorunu, bir model hatası, aşırı geniş veya kültürel açıdan dar bir kategori ve bir gözlemcinin yorumu ile öğrencinin yaşadığı deneyim arasındaki meşru bir fark. Mevcut özet bu ayrımları yapmak için yeterli ayrıntıyı sağlamamaktadır.

Ayrıca gençleri dahil etmenin model performansını değiştirip değiştirmediği, kategorilerin geçerliliğini geliştirip geliştirmediği veya esas olarak tek bir doğru etikete indirgenemeyecek anlaşmazlıkları ortaya çıkarıp çıkarmadığı da bilinmiyor. Karşılaştırmalı araştırmalar, sınıflandırmalar ve eğitim kararları üzerindeki etkileri takip ederken, öğrenci görüşmeleri, odak grupları ve üye kontrollerini içeren süreçlere karşı yalnızca yetişkinlere yönelik doğrulamayı test edebilir.

Ön baskı inceleniyor olarak işaretlendi ve kaynak, hakem değerlendirmesi sonuçları, kurumsal benimseme veya sınıf uygulaması hakkında hiçbir bilgi vermiyor. Bu nedenle okuyucular, bulgularını öğrenci konuşmasına ilişkin tüm Yüksek Lisans ölçümlerinin güvenilmez olduğunun kanıtı olarak değil, bir argüman ve erken bir vaka çalışması olarak ele almalıdır. Acil kamu yararına olan soru, okulların ve geliştiricilerin öğrencilere sınıf deneyimlerine ilişkin yapay zeka tarafından oluşturulan yorumları incelemeleri ve bunlara itiraz etmeleri için anlamlı bir yol verip vermeyeceğidir.

İlgili kılavuzlar ve testler

AI nedir?ChatGPT ve LLM'lerYapay Zeka EtiğiYapay Zeka Modellerinin AçıklamasıBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?