Ne oldu?
25 Ağustos'ta arXiv'ye gönderilen bir makale, çok turlu tanılama konuşmalarında büyük dil modellerini değerlendirmek için tasarlanmış bir veri kümesi olan MTDiag'ı tanıtıyor. Yazarlar, teşhisin etkileşimli ve artımlı olduğunu, mevcut değerlendirmelerin çoğunun ise statik soru cevaplama kriterlerine veya şablonlu diyaloglara dayandığını ileri sürmektedir. Kaynak, etkileşimler birden fazla dönüşe yayıldığında modellerin doğruluk ve güvenilirlik kaybı yaşayabileceğini söylüyor.
MTDiag, tıbbi dil modeli testindeki belirli bir zayıflığa yönelik bir değerlendirme kaynağı olarak sunulmaktadır: tek bir klinik soruyu yanıtlamak ile gelişen bir tanı alışverişini yönetmek arasındaki fark. Çok aşamalı bir karşılaşmada, sistemin yeni semptomları içermesi, daha önceki gerçekleri koruması, ayırıcı tanıyı gözden geçirmesi ve konuşma ilerledikçe güvenilirliğinin azalmasından kaçınması gerekir. Makalenin temel iddiası, statik soru cevaplama testlerinin bu davranışları yeterince ölçmediğidir.
Veri seti DDXPlus, MIMIC-IV ve yayınlanmış vaka raporlarından yararlanarak, acil servis vakalarının ve daha az yaygın veya atipik durumların belirtilen bir karışımını sunar. Kaynak, vaka sayısını, teşhislerin dağılımını, temsil edilen hasta popülasyonunu veya kesin dahil etme kriterlerini açıklamıyor. Bu ihmaller önemlidir çünkü klinik bir kıyaslamanın yararlılığı kısmen vakalarının gerçek dünya uygulamalarını ne kadar geniş bir şekilde temsil ettiğine bağlıdır.
Materyali kaynaklar arasında karşılaştırılabilir hale getirmek için yazarlar, vakaları UMLS kavram tanımlayıcılarına ve ICD-10 teşhis kodlarına bağlı kanonik bir şema halinde normalleştirdiklerini söylüyorlar. Daha sonra yapılandırılmış klinik kanıtları doğal dil diyaloğuna dönüştürmek için UserLM-8B tabanlı ifade oluşturma hattını kullanıyorlar. Makale, ortaya çıkan veri setinin doktorlar tarafından doğrulandığını söylüyor ancak sağlanan kaynak, kaç doktorun katıldığını, neleri incelediklerini, anlaşmazlıkların nasıl çözüldüğünü veya doğrulama kalitesinin nasıl ölçüldüğünü açıklamıyor.
Makale aynı zamanda çok turlu ayırıcı tanıda tanısal ajanlar olarak modelleri değerlendirmek için klinik bilgiye dayalı ölçümler önermektedir. Bu, tek bir doğruluk puanının ötesinde metodolojik bir genişlemedir. Ancak burada sağlanan kaynak, MTDiag'ın modeller arasındaki sıralamayı değiştirdiğini, klinik performansı tahmin ettiğini veya hasta sonuçlarını iyileştirdiğini gösteren sonuçları rapor etmemektedir. Geçerli kılınmış bir klinik sistemi değil, bir kıyaslama ve değerlendirme yaklaşımını tanımlar. Sağlanan açıklamada, bu bileşenler tek bir değerlendirme kaynağının parçaları olarak tanımlanmaktadır: kaynak vakalar normalleştirilir, kanıtlar ifadeler halinde sunulur ve modeller, bilgiye dayalı ölçümlerle birden fazla aşamada değerlendirilir. Hesap, bu bileşenlerin pratikte nasıl performans gösterdiğini, her birinin değerlendirmeye ne kadar katkıda bulunduğunu veya ortaya çıkan puanların raporlanan tasarımın ötesinde güvenilir olup olmadığını belirlemez.
Kaynak ayrıntıları: arxiv.org ↗
Neden önemli?
Yazarların çerçevelemesi doğruysa tıbbi yapay zeka değerlendirmeleri yalnızca izole yanıtları test ettiğinde eksik bir resim verebilir. Bir model, kısa sürede bir tanı koyabilir, ancak yeni bilgi geldiğinde gerekçesini güncellemede başarısız olabilir, daha önceki kanıtların izini kaybedebilir veya kararsız bir farklılığı iletebilir. Bunlar, devam eden bir değişim yoluyla klinisyenleri desteklemeyi amaçlayan herhangi bir sistem için pratik kaygılardır.
Proje, insanların tıbbi yüksek lisans performansını nasıl yorumlayabilecekleri konusundaki sonuçta ortaya çıkan boşluğu ele alıyor. Statik sorularda alınan yüksek puan, tek başına bir modelin gelişen bir klinik etkileşime güvenli bir şekilde katılabileceğini kanıtlamaz. Çok turlu test, sistemin değişen kanıtlara uygun şekilde yanıt verip vermediğinin değerlendirilmesine olanak tanır; bu, yazarlar tarafından açıklanan tanı yapısına daha yakındır.
Nadir ve atipik durumların yanı sıra ortak acil durum sunumlarının da dahil edilmesi, başarısızlıkların ayırt edilmesini kolaylaştırabilir. Tanıdık vakalarla sınırlı bir kıyaslama, güvenilirliği abartabilirken, yalnızca olağandışı durumlardan oluşan bir kıyaslama, rutin kullanımı yansıtmayabilir. MTDiag'ın belirttiği kombinasyon potansiyel olarak faydalıdır çünkü gerçek teşhis çalışması hem sık görülen sunumları hem de ilk açık açıklamaya uymayan vakaları içerir.
Önerilen ölçümler aynı zamanda dikkati nihai teşhisten teşhis sürecinin kalitesine de kaydırabilir. Özet, metrikleri isimlendirmediği veya formüllerini açıklamadığı için pratik değerleri henüz yalnızca bu kaynaktan değerlendirilemez. Prensip olarak bilgiye dayalı ölçümler, bir modelin klinik olarak ilgili kanıtları kullanıp kullanmadığını ve tutarlı bir farklılığı sürdürüp sürdürmediğini inceleyebilir ancak bu olasılık, sonuçlar ve dış değerlendirmeler elde edilene kadar yazarın iddiası olarak kalır.
Klinik dil modellerini değerlendiren araştırmacılar ve kuruluşlar için sürüm, etkileşimli koşullar altında sistemleri karşılaştırmak için ortak bir test formatı sağlayabilir. Kamusal değeri, burada verilmeyen ayrıntılara bağlıdır: veri kümesinin erişilebilirliği, dokümantasyonu, gizliliğin korunması, lisanslanması, tekrarlanabilirliği ve kurumlar ve uzmanlık alanları arasındaki performansı. Kaynaktaki hiçbir şey MTDiag'ın klinik uygulamaya hazır olduğunu veya ileriye dönük çalışmaların ve insan gözetiminin yerini alması gerektiğini kanıtlamıyor.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
Which component of an AI application is the machine-learning model itself?
Bundan sonra ne izlenecek?
Bir sonraki önemli kanıt, test edilen modeller, veri kümesinin boyutu ve bileşimi, kesin ölçümler ve herhangi bir çok turlu performans bozulmasının büyüklüğü de dahil olmak üzere makalenin tamamında rapor edilen deneyler olacaktır. Kıyaslamanın akıcılık veya kaynak materyallere aşinalık yerine klinik olarak anlamlı davranışı ölçüp ölçmediğini belirlemek için bağımsız çoğaltmaya ihtiyaç duyulacaktır.
MTDiag'ın statik kıyaslamalardan farklı sonuçlar üretip üretmediğini izleyin. En güçlü kanıt, izole sorular üzerinde benzer şekilde performans gösteren modellerin, sıralar arasında bilgiyi entegre etmek gerektiğinde farklılaştığını ve önerilen ölçümlerin anlamlı farklılıkları tanımladığını gösterecektir. Sağlanan kaynak bu karşılaştırmaları sağlamadığından belirli bir modelin performansı hakkında henüz bir iddiada bulunulamaz.
Veri kümesinin kaynağı ve yönetimi önemli olacaktır. MIMIC-IV klinik verileri içerirken, proje aynı zamanda yayınlanmış vaka raporlarını ve sentetik veya üretilmiş ifadeleri de kullanıyor. Belgede kimlik gizleme, izinler, lisanslama, dönüştürme prosedürleri ve oluşturulan diyaloğun yanıltıcı ifadeler veya yapaylıklar olmadan temeldeki klinik kanıtları koruyup korumadığı açıklığa kavuşturulmalıdır.
Dış geçerlilik başka bir açık sorudur. Sonuçlar dile, sağlık sistemine, uzmanlığa, klinisyenin iş akışına ve her seferinde mevcut olan bilgi miktarına göre değişebilir. Nadir vakalar tanısal kapsamı test edebilir ancak bunların tutarlı bir şekilde değerlendirilmesi de zor olabilir. Bağımsız klinisyenler, diyalog yapısının ve puanlama kurallarının, kıyaslama etrafında tasarlanmış yapay bir sıralama yerine gerçek karşılaşmaları yansıtıp yansıtmadığını değerlendirmelidir.
Son olarak MTDiag, LLM'nin hastalara teşhis koymanın güvenli olduğunun kanıtı olarak değil, bir değerlendirme kaynağı olarak ele alınmalıdır. Kaynak, ileriye dönük klinik testleri, klinisyen kararları üzerindeki etkileri, hasta sonuçlarını veya zararlı tavsiyelere karşı alınan önlemleri bildirmiyor. Anlamlı bilinmeyen, bu veri kümesindeki performansın pratikte daha güvenli, daha güvenilir davranışla ilişkili olup olmadığıdır; bu soru makalenin kendi kriterinin dışında doğrulama gerektiriyor.