Ne oldu?
Yeni bir arXiv ön baskısı, konuşma hareketleri, işbirliği ve ses eşitliği dahil olmak üzere öğrenci söylemini ölçmek için büyük dil modellerinin nasıl kullanıldığını inceliyor. Yazarlar, bu sistemleri yalnızca yetişkin uzman açıklamalarına ve uzun test setlerine göre değerlendirmenin, sınıf dilini bağlamından çıkarabileceğini ve deneyimleri ölçülen öğrencileri dışarıda bırakabileceğini öne sürüyor. Sekizinci sınıftaki bir matematik sınıfındaki çok dilli gençleri içeren bir vaka çalışmasında araştırmacılar, dört odak öğrenciyle katılımcı gözlemi, röportajları, odak gruplarını ve üye kontrollerini birleştirdi. Öğrencilerin kendi sınıf konuşmalarına ilişkin yorumlarının bazen Yüksek Lisans temelli ölçümlerle uyumlu olmadığını bildiriyorlar. Öğrenciler ayrıca hem modelin sınıflandırmalarına hem de ölçülen davranışları tanımlamak için kullanılan kodlama şemasına itiraz ettiler.
Makale, öğrenci konuşmasının yüksek lisans temelli ölçümlerine odaklanmaktadır. Yazarlara göre bu sistemler, konuşma hareketleri, işbirliği ve ses eşitliği gibi özellikleri belirlemek için sınıf konuşmalarının transkripsiyonlarını giderek daha fazla analiz ediyor. Yazarlar, transkripsiyonların genellikle yalnızca sözlü katkıları içerdiğini, bunun da çevredeki bağlamı ortadan kaldırabileceğini ve öğrenci dilinin yorumlanmasını zorlaştırabileceğini söylüyor.
Yazarlar iki yaygın doğrulama uygulamasını sorguluyor: Yüksek Lisans çıktılarının yetişkin uzmanlar tarafından oluşturulan ek açıklamalarla karşılaştırılması ve performansın uzatılmış veri kümeleri ve F1 puanlarıyla değerlendirilmesi. Bu prosedürlerin, sonuçta ortaya çıkan ölçümün öğretme ve öğrenme açısından anlamlı veya adil olduğunu göstermeden, yetişkinler tarafından tanımlanmış bir standartla uyum gösterebileceğini iddia ediyorlar. Makale bunu epistemik bir sorun olarak sunuyor: analiz edilen kişiler, sözlerinin ne anlama geldiğine karar vermekten dışlanabilir.
Örnek olay incelemesi için araştırma ekibi, sekizinci sınıftaki bir matematik sınıfındaki çok dilli gençleri inceledi. Özet, araştırmacıların katılımcı gözlemleri, röportajlar, odak grupları ve üye kontrolleri dahil olmak üzere etnografik odaklı birden fazla yöntem kullandığını söylüyor. Dört odak öğrenciyle çalıştılar ve sınıftaki konuşmaları yorumlama sürecinde bu öğrencileri araştırmacılarla ve Yüksek Lisans Uzmanlarıyla sohbete soktular.
Bildirilen bulgu, öğrencilerin kendi matematik konuşma deneyimlerine ilişkin yorumlarının her zaman Yüksek Lisans temelli ölçümlerle eşleşmediğidir. Öğrenciler yalnızca Yüksek Lisans tarafından oluşturulan bireysel sınıflandırmalara değil, aynı zamanda konuşmalarını ölçmek için kullanılan kodlama şemasına da itiraz ettiler. Kaynak, test edilen modeli veya modelleri tanımlamaz, sayısal performans sonuçları sağlamaz, tartışmalı sınıflandırmaları listelemez veya anlaşmazlıkların nihai olarak nasıl karara bağlandığını açıklamaz.
Kaynak ayrıntıları: arxiv.org ↗
Neden önemli?
Ön baskı, sınıftaki tartışmayı değerlendirmek için Yüksek Lisans'ı benimseyen okullar ve araştırmacılar için pratik bir soruyu gündeme getiriyor: Bir sistemin, tanımlaması gereken öğrencileri yanlış anlarken, yetişkin yorumcularla güçlü bir anlaşmaya varıp varamayacağı. Temel iddiası, özellikle dil ve ırkın sınıf iletişiminin nasıl yorumlanacağını şekillendirdiği durumlarda, öğrencilerin kendi konuşmaları hakkında bilgi üretmeye ve doğrulamaya katılmaları gerektiğidir. Kanıtlar tek bir sınıf ve dört odak öğrenciyle sınırlıdır ve makale inceleniyor olarak işaretlenmiştir. Bu nedenle, bildirilen yanlış hizalamaların ne kadar yaygın olduğunu veya gençlik merkezli doğrulamanın herhangi bir modelin doğruluğunu arttırıp artırmadığını belirlemez. Ancak eğitim amaçlı yapay zeka dağıtımları için somut bir yönetişim ve değerlendirme sorununu tanımlamaktadır.
Çalışma önemlidir çünkü Yüksek Lisans temelli sınıf analizi, eğitimcilerin katılımı ve etkileşimi nasıl anladıklarını etkileyebilir. Bir öğrencinin katkısını belirli bir konuşma hareketi olarak etiketleyen veya kimin sesinin temsil edildiğini değerlendiren bir ölçü, araştırma sonuçlarını, öğretim kararlarını veya sınıf eşitliğine ilişkin yargıları şekillendirebilir. Kategoriler öğrencilerin deneyimlerini yansıtmada başarısız olursa, görünürdeki kesinlik önemli bir yorumlama hatasını gizleyebilir.
Yazarların argümanı aynı zamanda dar bir doğrulama tanımına da meydan okuyor. Yetişkin uzmanlarla anlaşmak yararlı olabilir ancak yetişkinlerin açıklama sürecine dahil edilen varsayımları yeniden üretebilir. Benzer şekilde, uzun bir değerlendirme seti ve bir F1 puanı, etiketlerin sınıftaki konuşmanın sosyal ve dilsel bağlamını yansıttığını göstermeden etiketlerle tutarlılığı ölçebilir. Ön baskı bu ölçümlerin işe yaramaz olduğunu iddia etmiyor; tek başına yetersiz olduklarını savunur.
Çok dilli, ırksal ve dilsel olarak dışlanmış gençlere odaklanmak, konuyu özellikle önemli kılmaktadır. Kaynak, yetişkin araştırmacıların, uzman açıklamacıların ve yüksek lisans eğitimcilerinin öğrencilerin konuşmalarını anlamak için gereken tüm incelikleri sağlayamadığını söylüyor. Sistemin herhangi bir demografik grup için daha kötü performans gösterdiğini ortaya koymaz ve herhangi bir yaygınlık tahmini sunmaz. İlgili bulgu daha dar kapsamlıdır: bu durumda öğrenciler kendi yorumları ile sistemin ölçümleri arasında uyumsuzluklar tespit etmişlerdir.
Makalenin en somut anlamı usule ilişkindir. Yüksek Lisans temelli bir ölçümün sınıf etkileşimi hakkında anlamlı bir kanıt olarak değerlendirilmesinden önce öğrencilerin kategorileri tanımlama, sınıflandırmaları gözden geçirme ve yorumları sorgulama konusunda bir role ihtiyaçları olabilir. Bu yaklaşımın geniş ölçekte uygulanabilir olup olmadığı, ne kadar zaman gerektirdiği ve daha güvenilir eğitim kararları üretip üretmediği kaynak tarafından cevapsız kalıyor.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Bundan sonra ne izlenecek?
Bir sonraki anahtar soru, yazarların önerdiği yaklaşımın daha fazla sınıfta, yaş grubunda, dilde ve okul ortamında test edilip edilemeyeceğidir. Gelecekteki çalışmaların, öğrenci yorumlarının model çıktılarından ne zaman farklılaştığını, bu farklılıkların modeldeki hataları, kodlama şemasındaki sınırlamaları veya perspektifteki meşru farklılıkları yansıtıp yansıtmadığını ve araştırmacıların bunları nasıl çözmesi gerektiğini göstermesi gerekecektir. Yüksek Lisans temelli ölçümleri kullanan okullar ve satıcılar aynı zamanda neyin ölçüldüğünü, kategorileri kimin tanımladığını ve öğrencilerin sonuçlara itiraz edip edemeyeceğini de açıklamalıdır. Kaynak, bir ürün dağıtımını, belirli bir modele yönelik bir öneriyi, karşılaştırmalı bir kıyaslamayı veya öğretme ve öğrenme üzerinde ölçülen bir etkiyi bildirmiyor. Bu bilinmeyenler operasyonel performansla ilgili doğrudan çıkarımları sınırlıyor.
Çoğaltma bir sonraki en önemli adımdır. Bu vaka çalışması bir sekizinci sınıf matematik sınıfını ve dört odak öğrenciyi kapsadığından, benzer anlaşmazlıkların başka yerlerde ne sıklıkla meydana geldiğini gösteremez. Araştırmacıların daha geniş sonuçlara varmadan önce farklı konuları, yaş gruplarını, dilleri, sınıf kültürlerini ve öğrenci katılım biçimlerini incelemeleri gerekecektir.
Gelecekteki çalışmalar, kullanılan belirli Yüksek Lisans'ları, istemleri, transkriptleri, kodlama kategorilerini ve değerlendirme prosedürlerini rapor etmelidir. Aynı zamanda farklı anlaşmazlık türleri arasında da ayrım yapmalıdırlar: bir transkripsiyon sorunu, bir model hatası, aşırı geniş veya kültürel açıdan dar bir kategori ve bir gözlemcinin yorumu ile öğrencinin yaşadığı deneyim arasındaki meşru bir fark. Mevcut özet bu ayrımları yapmak için yeterli ayrıntıyı sağlamamaktadır.
Ayrıca gençleri dahil etmenin model performansını değiştirip değiştirmediği, kategorilerin geçerliliğini geliştirip geliştirmediği veya esas olarak tek bir doğru etikete indirgenemeyecek anlaşmazlıkları ortaya çıkarıp çıkarmadığı da bilinmiyor. Karşılaştırmalı araştırmalar, sınıflandırmalar ve eğitim kararları üzerindeki etkileri takip ederken, öğrenci görüşmeleri, odak grupları ve üye kontrollerini içeren süreçlere karşı yalnızca yetişkinlere yönelik doğrulamayı test edebilir.
Ön baskı inceleniyor olarak işaretlendi ve kaynak, hakem değerlendirmesi sonuçları, kurumsal benimseme veya sınıf uygulaması hakkında hiçbir bilgi vermiyor. Bu nedenle okuyucular, bulgularını öğrenci konuşmasına ilişkin tüm Yüksek Lisans ölçümlerinin güvenilmez olduğunun kanıtı olarak değil, bir argüman ve erken bir vaka çalışması olarak ele almalıdır. Acil kamu yararına olan soru, okulların ve geliştiricilerin öğrencilere sınıf deneyimlerine ilişkin yapay zeka tarafından oluşturulan yorumları incelemeleri ve bunlara itiraz etmeleri için anlamlı bir yol verip vermeyeceğidir.