เกิดอะไรขึ้น
นักวิจัยได้แนะนำ DRRG ซึ่งเป็นกรอบแบบจำลองภาษาขนาดใหญ่การแพร่กระจายแบบแยกส่วนสำหรับการสร้างรายงานรังสีวิทยาอัตโนมัติ แทนที่จะสร้างข้อความจากซ้ายไปขวาอย่างเคร่งครัด DRRG จะมาสก์และสร้างโทเค็นใหม่ซ้ำๆ เพื่อให้สามารถปรับปรุงรายงานในการวนซ้ำได้ ผู้เขียนรายงานผลลัพธ์ที่ได้รับการปรับปรุงในชุดข้อมูลรังสีวิทยาสองชุด แต่แหล่งที่มาคือการส่ง arXiv และไม่ได้กำหนดการใช้งานทางคลินิกหรือผลกระทบต่อการดูแลผู้ป่วย
บทความที่ส่งไปยัง arXiv เมื่อวันที่ 25 สิงหาคม นำเสนอ DRRG เป็นทางเลือกหนึ่งในการสร้างรายงานรังสีวิทยาแบบ autoregressive ผู้เขียนอธิบายถึงระบบการถดถอยอัตโนมัติแบบเดิมๆ ว่าเป็นการสร้างโทเค็นรายงานด้วยโทเค็น ซึ่งสามารถทำให้เกิดข้อผิดพลาดตั้งแต่เนิ่นๆ ในการเผยแพร่ และทำให้การแก้ไขเนื้อหาก่อนหน้านี้ทำได้ยาก DRRG ถือว่าการสร้างรายงานเป็นการ denoising โทเค็นมาสก์ซ้ำๆ แทน ในการตั้งค่านั้น โทเค็นสามารถกรอกและแก้ไขตามขั้นตอนต่อเนื่อง ซึ่งเป็นกระบวนการที่ผู้เขียนกล่าวว่ามีความสอดคล้องกับการปรับแต่งซ้ำที่เกี่ยวข้องกับการรายงานทางรังสีวิทยามากกว่า แหล่งที่มานำเสนอสิ่งนี้เป็นกรอบการวิจัย ไม่ใช่เป็นผลิตภัณฑ์ทางคลินิกที่นำไปใช้
DRRG รวมสององค์ประกอบที่มีจุดมุ่งหมายเพื่อทำให้กระบวนการสร้างมีความสำคัญทางคลินิกมากขึ้น ประการแรกคือหน้ากากเสริมที่คำนึงถึงหน่วยงานทางคลินิก ตามที่ผู้เขียนระบุ หน้ากากนี้เพิ่มความครอบคลุมในการกำกับดูแลโทเค็น ในขณะเดียวกันก็เน้นย้ำถึงหน่วยงานที่สำคัญทางคลินิกในรายงาน ประการที่สองคือโมดูลการปรับสภาพแนวคิดที่แทรกแนวคิดทางคลินิกที่ได้มาจากภาพลงในการแสดงภาพที่ใช้โดยระบบ ส่วนประกอบเหล่านี้ได้รับการออกแบบเพื่อเชื่อมโยงภาษาที่สร้างขึ้นกับการค้นพบที่ดึงมาจากภาพรังสีวิทยาที่เกี่ยวข้องอย่างใกล้ชิดยิ่งขึ้น แหล่งที่มาไม่ได้ให้รายละเอียดการดำเนินการทั้งหมด ผลการผ่าตัด หรือข้อกำหนดในการปฏิบัติงานในข้อความที่ให้มา
ผู้เขียนได้ฝึกอบรมและประเมิน DRRG บน MIMIC-CXR และ CheXpert Plus ใน MIMIC-CXR พวกเขารายงานคะแนน BLEU-4 ที่ 0.210, CheXpert-F1 ที่ 0.549, RadGraph-F1 ที่ 0.281, GREEN ที่ 0.360 และ RaTEScore ที่ 0.604 พวกเขากล่าวว่า DRRG มีประสิทธิภาพเหนือกว่าวิธีการเปรียบเทียบกับตัวชี้วัดที่รายงานส่วนใหญ่ แม้ว่าจะใช้ตัวถอดรหัสแบบจำลองภาษาที่เล็กกว่ามากก็ตาม
ใน CheXpert Plus รายงานฉบับนี้รายงานคะแนน BLEU-4 สูงสุด 0.119 และคะแนน CheXpert-F1 0.347 ในบรรดาวิธีการอื่นๆ ที่เปรียบเทียบกัน แหล่งที่มาไม่ได้ระบุระบบการเปรียบเทียบเหล่านั้นในบทคัดย่อที่ให้มา หรือกำหนดว่าความแตกต่างที่รายงานมีนัยสำคัญทางสถิติหรือไม่
ทำไมมันถึงสำคัญ
หากทำซ้ำ วิธีการนี้สามารถปรับปรุงวิธีที่ระบบ AI ร่างรายงานรังสีวิทยาโดยทำให้การแก้ไขเป็นส่วนหนึ่งของการสร้างมากกว่าที่จะคิดในภายหลัง ผลกำไรที่รายงานมีความเกี่ยวข้องเนื่องจากกรอบการทำงานมุ่งเน้นไปที่หน่วยงานทางคลินิกและแนวคิดที่ได้มาจากภาพ แต่แหล่งที่มาที่มีอยู่ไม่ได้แสดงให้เห็นว่าระบบปรับปรุงการตัดสินใจของนักรังสีวิทยา ลดภาระงานในทางปฏิบัติ หรือดำเนินการได้อย่างน่าเชื่อถือในโรงพยาบาลและประชากรผู้ป่วยหรือไม่
ความสำคัญหลักคือสถาปัตยกรรม: DRRG ใช้วิธีการสร้างที่สามารถแก้ไขข้อความระหว่างการผลิตกับงานที่คำนึงถึงความสอดคล้องของข้อเท็จจริง ผู้เขียนยืนยันว่ากระบวนการทำซ้ำแบบสองทิศทางนี้สามารถลดการแพร่กระจายข้อผิดพลาดที่เกี่ยวข้องกับการถอดรหัสจากซ้ายไปขวาอย่างเคร่งครัด การกล่าวอ้างดังกล่าวเป็นผลสืบเนื่องสำหรับ AI ทางการแพทย์ เนื่องจากรายงานไม่ได้เป็นเพียงร้อยแก้วที่คล่องแคล่วเท่านั้น จะต้องแสดงถึงการค้นพบภาพและหน่วยงานทางคลินิกอย่างถูกต้อง อย่างไรก็ตาม แหล่งที่มารายงานประสิทธิภาพของเกณฑ์มาตรฐาน แทนที่จะแสดงให้เห็นถึงการปรับปรุงในผลลัพธ์ของผู้ป่วย การตัดสินใจในการวินิจฉัย หรือภาระงานในแต่ละวันของนักรังสีวิทยา
ผลลัพธ์ที่รายงานชี้ให้เห็นว่ากรอบการทำงานอาจเสนอทิศทางที่เป็นประโยชน์สำหรับการวิจัยในการสร้างรายงานที่มีพื้นฐานทางคลินิก DRRG ไม่ได้พึ่งพาเฉพาะการสร้างภาษาทั่วไปตามรายงานเท่านั้น โดยเน้นย้ำถึงลักษณะทางคลินิกและเงื่อนไขในการแสดงภาพบนแนวคิดที่ได้มาจากภาพ ผู้เขียนยังรายงานประสิทธิภาพการแข่งขันด้วยตัวถอดรหัสที่เล็กกว่ามากบน MIMIC-CXR นั่นอาจมีความสำคัญสำหรับระบบที่ขนาดโมเดลและทรัพยากรการปรับใช้งานเป็นข้อจำกัด แต่แหล่งที่มาไม่ได้ให้การวัดเวลาแฝง การใช้หน่วยความจำ การใช้พลังงาน ต้นทุนการฝึกอบรมทั้งหมด หรือต้นทุนการให้บริการ ดังนั้นตัวถอดรหัสที่มีขนาดเล็กกว่าจึงไม่ควรถือเป็นการพิสูจน์ว่าระบบทางคลินิกมีราคาถูกกว่าหรือง่ายกว่า
บทความนี้จะประเมินตัวชี้วัดการสร้างรายงานที่กำหนดไว้หลายประการ รวมถึงการทับซ้อนของภาษา ฉลากโรค กราฟ และการวัดความสอดคล้องทางคลินิกอื่นๆ ที่มีชื่ออยู่ในบทคัดย่อ การใช้ทั้ง MIMIC-CXR และ CheXpert Plus ให้หลักฐานสำหรับชุดข้อมูลสองชุด และผู้เขียนรายงานผลลัพธ์ชั้นนำเกี่ยวกับมาตรการที่เลือกในแต่ละชุด อย่างไรก็ตาม ความเหนือกว่าของเกณฑ์มาตรฐานไม่ได้สร้างความน่าเชื่อถือทางคลินิกโดยทั่วไปด้วยตัวมันเอง
แหล่งที่มาที่ให้มาไม่ได้บอกว่าระบบจัดการกับสิ่งที่ค้นพบที่หายไป หลักฐานทางสายตาที่ขัดแย้งกัน สภาพที่หายาก รูปภาพที่ไม่ชัดเจน หรือการละเว้นที่สำคัญทางคลินิกอย่างไร นอกจากนี้ยังไม่ได้รายงานว่านักรังสีวิทยาตัดสินว่ารายงานที่สร้างขึ้นนั้นปลอดภัย มีประโยชน์ หรือดีกว่ารายงานที่จัดทำโดยระบบอื่นหรือไม่
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
ขั้นตอนถัดไปที่สำคัญคือการจำลองแบบอิสระ การประเมินโดยผู้ทรงคุณวุฒิ และการทดสอบนอกเหนือจากชุดข้อมูลที่รายงานทั้งสองชุด ผู้อ่านควรมองหาหลักฐานเกี่ยวกับประเภทข้อผิดพลาด ความเร็วในการอนุมาน ขนาดตัวถอดรหัสและข้อกำหนดในการประมวลผล การตรวจสอบโดยมนุษย์ และประสิทธิภาพในกรณีที่ผิดปกติหรือคลุมเครือ แหล่งที่มาไม่ได้รายงานการใช้งาน การทดสอบทางคลินิกในอนาคต การศึกษาของผู้อ่าน นัยสำคัญทางสถิติ หรือผลลัพธ์ด้านความปลอดภัย
ขั้นแรก การวิจัยควรได้รับการตรวจสอบผ่านการทำซ้ำโดยอิสระและการตีพิมพ์ที่สมบูรณ์ยิ่งขึ้น รายละเอียดที่สำคัญสำหรับการประเมินนั้น ได้แก่ เส้นพื้นฐานที่แน่นอน การแบ่งการทดสอบรถไฟ การประมวลผลล่วงหน้า ขนาดแบบจำลอง กำหนดการถอดรหัส และผลลัพธ์การระเหยสำหรับมาสก์เอนทิตีทางคลินิกและโมดูลการปรับสภาพแนวคิด แหล่งที่มาคือการส่ง arXiv และนำเสนอผลงานของผู้เขียนเอง วัสดุที่ให้มาไม่มีการตรวจสอบความถูกต้องโดยอิสระ งานในอนาคตควรชี้แจงว่าการปรับปรุงที่รายงานยังคงอยู่หลังจากการควบคุมการทดลองที่สอดคล้องกันหรือไม่ และจะยังคงอยู่ในการตั้งค่าเริ่มต้นและการประเมินแบบสุ่มหรือไม่
ประการที่สอง การประเมินควรตรวจสอบโหมดความล้มเหลวมากกว่าให้คะแนนเพียงอย่างเดียว หลักฐานการติดตามที่เป็นประโยชน์จะรวมถึงการวิเคราะห์แยกต่างหากของอาการประสาทหลอนที่มีนัยสำคัญทางคลินิก การค้นพบที่พลาด การปฏิเสธที่ไม่ถูกต้อง การระบุแหล่งที่มาทางกายวิภาคผิด และความขัดแย้งภายในรายงาน การทดสอบในสถาบันและกลุ่มผู้ป่วยเพิ่มเติมจะช่วยพิจารณาว่าวิธีการดังกล่าวครอบคลุมมากกว่า MIMIC-CXR และ CheXpert Plus หรือไม่ แหล่งที่มาไม่ได้ระบุการกระจายทางประชากรศาสตร์ ทางคลินิก หรือการถ่ายภาพของชุดข้อมูลเหล่านั้นในข้อความที่ให้มา ดังนั้นจึงไม่สามารถระบุได้ว่าประสิทธิภาพที่รายงานจะนำไปใช้ในวงกว้างเพียงใด
สุดท้ายนี้ การรับเลี้ยงบุตรบุญธรรมในทางปฏิบัติจะต้องมีหลักฐานเกี่ยวกับขั้นตอนการทำงานและการกำกับดูแล บทความนี้ไม่ได้รายงานการทดลองทางคลินิกในอนาคต การทดสอบโดยนักรังสีวิทยาในวงรอบ เวลาแฝงในการใช้งาน หรือผลกระทบของแบบร่างที่สร้างขึ้นต่อเวลาและความแม่นยำในการรายงาน นอกจากนี้ยังไม่ได้อธิบายถึงความพร้อมใช้งานในฐานะเครื่องมือทางคลินิก สถานะด้านกฎระเบียบ หรือการป้องกันในกรณีที่แนวคิดที่ได้มาจากภาพไม่สมบูรณ์หรือไม่ถูกต้อง
สิ่งที่ไม่ทราบเหล่านี้มีความสำคัญ: การเพิ่มเกณฑ์มาตรฐานที่รายงานแสดงผลการวิจัย แต่ไม่ได้แสดงให้เห็นว่า DRRG พร้อมที่จะแทนที่วิจารณญาณทางวิชาชีพหรือดำเนินการโดยไม่มีการตรวจสอบ