Apa yang terjadi
Pracetak arXiv baru mengkaji bagaimana model bahasa besar digunakan untuk mengukur wacana siswa, termasuk gerakan bicara, kolaborasi, dan kesetaraan suara. Para penulis berpendapat bahwa mengevaluasi sistem ini hanya berdasarkan anotasi ahli dewasa dan rangkaian tes yang diadakan dapat menghilangkan bahasa kelas dari konteksnya dan mengecualikan siswa yang pengalamannya diukur. Dalam sebuah studi kasus yang melibatkan remaja multibahasa di salah satu kelas matematika kelas delapan, para peneliti menggabungkan observasi partisipan, wawancara, kelompok fokus dan pemeriksaan anggota dengan empat siswa fokus. Mereka melaporkan bahwa interpretasi siswa terhadap pembicaraan di kelas mereka terkadang tidak sejalan dengan langkah-langkah berbasis LLM. Para siswa juga menantang klasifikasi model dan skema pengkodean yang digunakan untuk mendefinisikan perilaku yang diukur.
Makalah ini berfokus pada ukuran pembicaraan siswa berbasis LLM. Menurut penulis, sistem ini semakin menganalisis transkripsi percakapan kelas untuk mengidentifikasi fitur-fitur seperti gerakan bicara, kolaborasi, dan kesetaraan suara. Para penulis mengatakan bahwa transkripsi umumnya hanya mencakup kontribusi verbal, yang dapat menghilangkan konteks di sekitarnya dan membuat bahasa siswa lebih sulit untuk ditafsirkan.
Penulis mempertanyakan dua praktik validasi yang umum: membandingkan keluaran LLM dengan anotasi yang dihasilkan oleh pakar dewasa, dan mengevaluasi kinerja dengan kumpulan data yang tersedia dan skor F1. Mereka berpendapat bahwa prosedur-prosedur ini mungkin menunjukkan kesesuaian dengan standar yang ditetapkan orang dewasa tanpa menunjukkan bahwa tindakan yang dihasilkan bermakna atau adil untuk proses belajar mengajar. Makalah ini menyajikan hal ini sebagai masalah epistemik: orang-orang yang dianalisis mungkin tidak dilibatkan dalam memutuskan apa arti kata-kata mereka.
Untuk studi kasusnya, tim peneliti meneliti remaja multibahasa di salah satu kelas matematika kelas delapan. Abstraknya mengatakan para peneliti menggunakan berbagai metode yang berorientasi etnografi, termasuk observasi partisipan, wawancara, kelompok fokus, dan pemeriksaan anggota. Mereka bekerja dengan empat siswa fokus dan menempatkan siswa tersebut dalam percakapan dengan peneliti dan LLM selama proses menafsirkan percakapan kelas.
Temuan yang dilaporkan adalah bahwa interpretasi siswa terhadap pengalaman matematika mereka sendiri tidak selalu sesuai dengan ukuran berbasis LLM. Para siswa tidak hanya berkompetisi dalam klasifikasi individu yang dihasilkan oleh LLM, tetapi juga skema pengkodean yang digunakan untuk mengukur pembicaraan mereka. Sumber tersebut tidak mengidentifikasi model atau model yang diuji, memberikan hasil kinerja numerik, mencantumkan klasifikasi yang disengketakan, atau menjelaskan bagaimana perbedaan pendapat pada akhirnya diputuskan.
Mengapa itu penting
Pracetak ini menimbulkan pertanyaan praktis bagi sekolah dan peneliti yang mengadopsi LLM untuk mengevaluasi diskusi kelas: apakah suatu sistem dapat mencapai kesepakatan yang kuat dengan anotator dewasa namun masih salah memahami siswa, sistem tersebut dimaksudkan untuk dijelaskan. Klaim utamanya adalah bahwa siswa harus berpartisipasi dalam menghasilkan dan memvalidasi pengetahuan tentang pembicaraan mereka sendiri, terutama ketika bahasa dan ras dapat membentuk bagaimana komunikasi kelas diinterpretasikan. Buktinya terbatas pada satu ruang kelas dan empat siswa fokus, dan makalah tersebut ditandai sebagai sedang ditinjau. Oleh karena itu, penelitian ini tidak menentukan seberapa luas ketidakselarasan yang dilaporkan atau apakah validasi yang berpusat pada remaja meningkatkan keakuratan model tertentu. Namun, hal ini mengidentifikasi masalah tata kelola dan evaluasi yang konkrit untuk penerapan AI di bidang pendidikan.
Studi ini penting karena analisis kelas berbasis LLM dapat mempengaruhi bagaimana pendidik memahami partisipasi dan interaksi. Suatu ukuran yang menyebut kontribusi siswa sebagai suatu gerakan pembicaraan tertentu atau mengevaluasi suara siapa yang terwakili dapat membentuk kesimpulan penelitian, keputusan pengajaran atau penilaian tentang kesetaraan kelas. Jika kategori-kategori tersebut gagal mencerminkan pengalaman siswa, ketepatan yang tampak dapat menyembunyikan kesalahan penafsiran substantif.
Argumen penulis juga menantang definisi validasi yang sempit. Kesepakatan dengan pakar dewasa dapat bermanfaat, namun hal ini dapat mereproduksi asumsi yang dibangun dalam proses anotasi orang dewasa. Demikian pula, serangkaian evaluasi yang dilakukan secara menyeluruh dan skor F1 dapat mengukur konsistensi label tanpa menunjukkan bahwa label tersebut menangkap konteks sosial dan linguistik pembicaraan di kelas. Pracetak tidak mengklaim bahwa metrik ini tidak berguna; ia berargumentasi bahwa mereka sendiri tidak cukup.
Fokus pada generasi muda yang multibahasa dan terpinggirkan secara ras dan bahasa menjadikan masalah ini sangat penting. Sumber tersebut mengatakan bahwa peneliti dewasa, ahli anotator, dan LLM tidak dapat memberikan semua nuansa yang diperlukan untuk memahami pembicaraan siswa. Laporan ini tidak menetapkan bahwa sistem tersebut berkinerja lebih buruk pada demografi tertentu, dan tidak memberikan perkiraan prevalensi. Temuan yang relevan lebih sempit: dalam kasus ini, siswa mengidentifikasi ketidaksesuaian antara penafsiran mereka sendiri dan ukuran sistem.
Implikasi paling nyata dari makalah ini adalah bersifat prosedural. Siswa mungkin memerlukan peran dalam menentukan kategori, meninjau klasifikasi dan menantang interpretasi sebelum ukuran berbasis LLM diperlakukan sebagai bukti yang berarti tentang interaksi kelas. Apakah pendekatan tersebut layak dilakukan dalam skala besar, berapa banyak waktu yang dibutuhkan, dan apakah pendekatan tersebut menghasilkan keputusan pendidikan yang lebih andal masih belum terjawab oleh sumbernya.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Apa yang harus ditonton selanjutnya
Pertanyaan kunci berikutnya adalah apakah pendekatan yang diusulkan penulis dapat diuji di lebih banyak ruang kelas, kelompok umur, bahasa, dan lingkungan sekolah. Penelitian di masa depan perlu menunjukkan kapan interpretasi siswa berbeda dari keluaran model, apakah perbedaan tersebut mencerminkan kesalahan dalam model, keterbatasan dalam skema pengkodean, atau perbedaan yang sah dalam perspektif, dan bagaimana peneliti harus menyelesaikannya. Sekolah dan vendor yang menggunakan pengukuran berbasis LLM juga harus memperjelas apa yang diukur, siapa yang menentukan kategori dan apakah siswa dapat menentang hasilnya. Sumber tersebut tidak melaporkan penerapan produk, rekomendasi untuk model tertentu, tolok ukur komparatif, atau dampak terukur pada pengajaran dan pembelajaran. Hal-hal yang tidak diketahui ini membatasi kesimpulan langsung mengenai kinerja operasional.
Replikasi adalah langkah terpenting berikutnya. Studi kasus ini melibatkan satu kelas matematika kelas delapan dan empat siswa fokus, sehingga studi kasus ini tidak dapat menunjukkan seberapa sering perselisihan serupa terjadi di tempat lain. Para peneliti perlu mengkaji berbagai mata pelajaran, kelompok umur, bahasa, budaya kelas dan bentuk partisipasi siswa sebelum menarik kesimpulan yang lebih luas.
Penelitian di masa depan harus melaporkan LLM spesifik, petunjuknya, transkrip, kategori pengkodean dan prosedur evaluasi yang digunakan. Mereka juga harus membedakan berbagai jenis ketidaksepakatan: masalah transkripsi, kesalahan model, kategori yang terlalu luas atau sempit secara budaya, dan perbedaan yang sah antara interpretasi pengamat dan pengalaman hidup siswa. Abstrak saat ini tidak memberikan rincian yang cukup untuk membuat perbedaan tersebut.
Juga tidak diketahui apakah melibatkan remaja dapat mengubah kinerja model, meningkatkan validitas kategori, atau hanya mengungkapkan ketidaksepakatan yang tidak dapat direduksi menjadi satu label yang benar. Penelitian komparatif dapat menguji validasi khusus orang dewasa terhadap proses yang mencakup wawancara siswa, kelompok fokus, dan pemeriksaan anggota, sambil melacak dampaknya terhadap klasifikasi dan keputusan pendidikan.
Pracetaknya ditandai sebagai sedang ditinjau, dan sumbernya tidak memberikan informasi tentang hasil tinjauan sejawat, adopsi kelembagaan, atau penerapan ruang kelas. Oleh karena itu, pembaca harus memperlakukan temuannya sebagai argumen dan studi kasus awal, bukan sebagai bukti bahwa semua ukuran pembicaraan siswa LLM tidak dapat diandalkan. Pertanyaan yang segera menarik perhatian publik adalah apakah sekolah dan pengembang akan memberikan siswa cara yang berarti untuk memeriksa dan menentang interpretasi yang dihasilkan AI terhadap pengalaman kelas mereka.