เกิดอะไรขึ้น
Microsoft Research ประกาศเปิดตัวโมเดลพื้นฐานทางพยาธิวิทยาแบบ open-weight สองรุ่น ได้แก่ GigaPath-Flash และ GigaTIME-Flash ซึ่งได้รับการออกแบบมาเพื่อให้การวิจัยโรคมะเร็งในวงกว้างสามารถนำไปปฏิบัติได้ด้วยการคำนวณมากขึ้น แบบจำลองนี้เป็นผลงานการวิจัยที่พัฒนาโดยมหาวิทยาลัยวอชิงตันและโพรวิเดนซ์
การวิจัย Microsoft กล่าวว่า GigaPath-Flash และ GigaTIME-Flash ขยายโมเดลทางพยาธิวิทยารุ่นก่อนๆ ที่เรียกว่า GigaPath และ GigaTIME GigaPath วิเคราะห์ภาพพยาธิวิทยาทั้งสไลด์ ในขณะที่ GigaTIME จำลองสภาพแวดล้อมจุลภาคของเนื้องอก และแปลรูปภาพ hematoxylin-and-eosin หรือ H&E ตามปกติเป็นแผนที่โปรตีโอมิกส์เชิงพื้นที่เสมือน แฟลชโมเดลใหม่มีจุดมุ่งหมายเพื่อจัดการกับต้นทุนการคำนวณของการใช้ระบบดังกล่าวซ้ำๆ กับกลุ่มประชากรตามรุ่นขนาดใหญ่ แทนที่จะแนะนำผลิตภัณฑ์ทางคลินิก ดังนั้นจุดมุ่งเน้นของพวกเขาจึงอยู่ที่ประสิทธิภาพของขั้นตอนการวิจัยและการเข้าถึงการวิเคราะห์ในวงกว้าง การเผยแพร่ยังคงเชื่อมโยงกับตระกูลรุ่นก่อนหน้าในขณะที่เปลี่ยนจำนวนการประมวลผลที่จำเป็นสำหรับการใช้งานซ้ำ
GigaPath-Flash รวมตัวเข้ารหัสไทล์ ViT-S 22 ล้านพารามิเตอร์เข้ากับตัวเข้ารหัสสไลด์ LongNet 21 ล้านพารามิเตอร์ Microsoft กล่าวว่าตัวเข้ารหัสไทล์ขนาดกะทัดรัดถูกกลั่นจากตัวเข้ารหัส GigaPath พันล้านพารามิเตอร์ดั้งเดิม ในขณะที่ตัวเข้ารหัสสไลด์ใช้ความสนใจแบบขยายซึ่งจะปรับขนาดเป็นเส้นตรงกับจำนวนไทล์รูปภาพ ในการวัดระดับต่อมลูกหมากของ PANDA และการวัดประเภทย่อยของเนื้องอกในสมองของ EBRAINS ที่อ้างถึงของแหล่งที่มา Microsoft รายงานว่า GigaPath-Flash มาภายใน 3% ของ GigaPath ดั้งเดิม ในขณะที่ใช้การคำนวณน้อยกว่าประมาณ 50 เท่า กล่าวอีกนัยหนึ่ง ผลลัพธ์ที่รายงานจะจับคู่โมเดลที่มีขนาดเล็กกว่ามากกับประสิทธิภาพที่ยังคงใกล้เคียงกับระบบก่อนหน้าในการทดสอบที่อ้างถึงเหล่านั้น การเปรียบเทียบนี้นำเสนอเป็นผลประสิทธิภาพจากการประเมินของ Microsoft ไม่ใช่การค้นพบที่กว้างขึ้นเกี่ยวกับงานด้านพยาธิวิทยาทุกอย่าง
GigaTIME-Flash แทนที่แกนหลัก GigaTIME ดั้งเดิมด้วยตัวเข้ารหัส GigaPath-Flash ViT-S และใช้ตัวถอดรหัสแบบ Convolutional น้ำหนักเบาสำหรับการแปล H&E-to-multiplex-immunofluorescence Microsoft รายงานว่าสามารถจับคู่หรือปรับปรุงกับโมเดลดั้งเดิมในชุดทดสอบและกลุ่มประชากรที่ยังไม่จำหน่าย 4 กลุ่ม ซึ่งครอบคลุมมะเร็งสมอง มะเร็งเต้านม มะเร็งลำไส้ใหญ่ และปอด ทั้งสองรุ่นเปิดตัวภายใต้ลิขสิทธิ์ Apache 2.0 โดยมีน้ำหนักและรหัสที่เผยแพร่ผ่าน Hugging Face ตามแหล่งที่มา สิ่งนี้ทำให้นักวิจัยมีส่วนประกอบที่ระบุไว้ซึ่งจำเป็นในการตรวจสอบและประเมินการเผยแพร่ในสภาพแวดล้อมของตนเอง การทดสอบแบบไม่กระจายที่รายงานทำให้การเปรียบเทียบกว้างขึ้นนอกเหนือจากชุดการทดสอบเดิม แต่ก็ไม่ได้ขจัดความจำเป็นในการประเมินเพิ่มเติม
รายละเอียดที่มา: microsoft.com ↗
ทำไมมันถึงสำคัญ
แบบจำลองดังกล่าวอาจทำให้นักวิจัยสามารถวิเคราะห์กลุ่มผู้ป่วยจำนวนมากขึ้น และทำการทดลองซ้ำได้มากขึ้นโดยใช้ข้อมูลทางพยาธิวิทยาที่มีอยู่ ซึ่งอาจขยายการศึกษาเกี่ยวกับชีววิทยาของโรค ตัวบ่งชี้ทางชีวภาพ สภาพแวดล้อมจุลภาคของเนื้องอก และผลลัพธ์ทางคลินิก แม้ว่าแบบจำลองจะไม่ได้รับการตรวจสอบสำหรับการดูแลผู้ป่วยก็ตาม
รูปภาพพยาธิวิทยาทั้งสไลด์อาจมีขนาดเกิน 1 กิกะพิกเซล และอาจต้องประมวลผลไทล์หลายพันไทล์ต่อสไลด์ แหล่งข่าวระบุว่าค่าใช้จ่ายมีข้อจำกัดเป็นพิเศษเมื่อนักวิจัยศึกษาผู้ป่วยหลายหมื่นรายและดึงข้อมูลคุณลักษณะซ้ำ การวิเคราะห์ทางสถิติ การทดสอบสมมติฐาน และการตรวจสอบความถูกต้องของกลุ่มย่อย ความต้องการด้านการประมวลผลและหน่วยความจำที่ต่ำลงอาจส่งผลต่อคำถามการวิจัยที่เป็นไปได้ ไม่ใช่แค่ความเร็วของการวิเคราะห์ที่มีอยู่เท่านั้น ขั้นตอนการทำงานที่สามารถทำซ้ำได้ในเชิงเศรษฐกิจมากขึ้นอาจทำให้การเปรียบเทียบที่ใหญ่กว่าและการตรวจสอบเพิ่มเติมมีประโยชน์มากขึ้นสำหรับกลุ่มการวิจัย ประโยชน์ที่เป็นไปได้ที่แหล่งที่มาอธิบายไว้จึงขึ้นอยู่กับขนาด การทำซ้ำ และความสามารถในการทำงานกับข้อมูลทางพยาธิวิทยาที่มีอยู่แล้ว
Microsoft ประมาณการว่าการสร้างข้อมูลมัลติเพล็กซ์อิมมูโนฟลูออเรสเซนต์เสมือนสำหรับ 1,000 สไลด์จะใช้เวลาประมาณ 2 ชั่วโมง GPU ด้วย GigaTIME-Flash เทียบกับ 7 ชั่วโมง GPU ด้วย GigaTIME บน NVIDIA A100 เดียว ภายใต้สมมติฐานรวมถึงประมาณ 10,000 แผ่นต่อสไลด์ สำหรับสไลด์ 100,000 ภาพ ค่าประมาณคือประมาณเจ็ดวันของ GPU เทียบกับ 30 วันของ GPU สำหรับหนึ่งล้านสไลด์ ประมาณ 70 วัน GPU เทียบกับ 300 วัน GPU สิ่งเหล่านี้เป็นการประมาณการตามแบบจำลอง ไม่ใช่การวัดอิสระ และแหล่งที่มากล่าวว่ารันไทม์จริงขึ้นอยู่กับขนาดสไลด์ ความละเอียดของการเรียงต่อกัน และฮาร์ดแวร์ ค่าประมาณแสดงให้เห็นว่าการประมวลผลต่อสไลด์จะมีความแตกต่างกันอย่างไรเมื่อกลุ่มประชากรตามรุ่นมีขนาดใหญ่ขึ้นมาก ยังคงควรอ่านเป็นการคำนวณสถานการณ์ที่เชื่อมโยงกับสมมติฐานที่ระบุไว้ แทนที่จะเป็นผลลัพธ์ที่รับประกันสำหรับการดำเนินการทุกครั้ง
ความสำคัญในทางปฏิบัติยังเชื่อมโยงกับการเปิดกว้างด้วย การเปิดตัว Apache 2.0 อาจช่วยให้กลุ่มนักวิชาการและกลุ่มวิจัยอื่นๆ ตรวจสอบ ปรับใช้ และประเมินแบบจำลองโดยไม่ต้องอาศัยบริการโฮสต์เพียงอย่างเดียว โดยขึ้นอยู่กับทรัพยากรด้านเทคนิคและการกำกับดูแลของกลุ่มเหล่านั้นเอง แต่ประสิทธิภาพไม่ได้สร้างความถูกต้องทางวิทยาศาสตร์ แหล่งข่าวระบุอย่างชัดเจนว่าแบบจำลองดังกล่าวเป็นการวิจัยที่เผยแพร่ในช่วงต้น ได้รับการทดสอบตามเกณฑ์มาตรฐานและกลุ่มประชากรตามรุ่นที่จำกัด และไม่ได้มีวัตถุประสงค์หรือตรวจสอบความถูกต้องสำหรับการวินิจฉัย การพยากรณ์โรค การเลือกการรักษา หรือการตัดสินใจด้านการดูแลผู้ป่วยอื่นๆ การเข้าถึงแบบเปิดสามารถขยายขอบเขตการตรวจสอบและการทดลองได้กว้างขึ้น แต่ไม่สามารถใช้แทนหลักฐานเกี่ยวกับความน่าเชื่อถือหรือประโยชน์ทางคลินิกได้ นัยสำคัญที่ได้รับการสนับสนุนมากที่สุดคือกลุ่มต่างๆ มากขึ้นอาจสามารถตรวจสอบเครื่องมือการวิจัยและขีดจำกัดของพวกเขาได้
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
คำถามหลักคือประสิทธิภาพและผลการปฏิบัติงานที่รายงานนั้นครอบคลุมสถาบัน เครื่องสแกน ประเภทเนื้อเยื่อ ประชากร และงานวิจัยมากกว่าหรือไม่ การประเมินที่เป็นอิสระและการตรวจสอบความถูกต้องทางคลินิกยังคงเป็นสิ่งจำเป็น และแหล่งที่มาไม่ได้กำหนดว่าแบบจำลองดังกล่าวช่วยปรับปรุงการตัดสินใจในการวินิจฉัย การพยากรณ์โรค หรือการรักษา
การจำลองแบบอิสระควรทดสอบการแลกเปลี่ยนระหว่างประสิทธิภาพและประสิทธิภาพที่รายงานภายใต้ฮาร์ดแวร์ ขนาดสไลด์ ไปป์ไลน์การประมวลผลล่วงหน้า และขนาดแบตช์ที่แตกต่างกัน นอกจากนี้ ควรตรวจสอบว่าแบบจำลองยังคงเชื่อถือได้สำหรับเครื่องสแกน สถาบัน การย้อมสี คุณภาพเนื้อเยื่อ ประเภทของมะเร็ง และประชากรผู้ป่วยหรือไม่ Microsoft เองกล่าวว่ายังคงจำเป็นต้องมีการตรวจสอบความถูกต้องในวงกว้าง ดังนั้นผลการวัดประสิทธิภาพที่รายงานควรถือเป็นการอ้างสิทธิ์จากผู้พัฒนาโมเดล แทนที่จะเป็นหลักฐานที่ตัดสิน การทดสอบดังกล่าวจะช่วยแยกผลลัพธ์ที่ขึ้นอยู่กับการตั้งค่าที่รายงานออกจากผลลัพธ์ที่สรุปในสภาพแวดล้อมการวิจัย นอกจากนี้ยังจะแสดงให้เห็นว่าความต้องการทรัพยากรที่ลดลงยังคงมีประโยชน์หรือไม่เมื่อเวิร์กโฟลว์การประมวลผลข้อมูลโดยรอบเปลี่ยนแปลงไป
นักวิจัยจะต้องพิจารณาด้วยว่าการเรียนรู้แบบเป็นตัวแทนที่ดีขึ้นแปลเป็นการค้นพบทางชีววิทยาที่เป็นประโยชน์หรือไม่ แหล่งที่มาชี้ไปที่การวิเคราะห์ก่อนหน้านี้ของ GigaTIME เกี่ยวกับผู้ป่วยโรคมะเร็งมากกว่า 14,000 ราย และความสัมพันธ์ที่มีนัยสำคัญทางสถิติมากกว่า 1,200 รายการระหว่างสถานะของเซลล์ภูมิคุ้มกันและตัวบ่งชี้ทางชีวภาพทางคลินิก แต่ไม่ได้แสดงให้เห็นว่าแบบจำลอง Flash ทำซ้ำความสัมพันธ์เหล่านั้นอย่างอิสระหรือสร้างการค้นพบที่ได้รับการตรวจสอบความถูกต้อง ความสัมพันธ์ทางสถิติในทำนองเดียวกันไม่ได้แสดงให้เห็นสาเหตุหรือประโยชน์ทางคลินิกเพียงอย่างเดียว คำถามที่เกี่ยวข้องคือโมเดลที่ใหม่กว่าสนับสนุนการค้นพบที่ยังคงมีความหมายหลังจากการวิเคราะห์อิสระและการตรวจสอบเพิ่มเติมหรือไม่ ประสิทธิภาพอาจทำให้การสืบสวนเหล่านั้นทำซ้ำได้ง่ายขึ้น แต่ไม่สามารถตอบคำถามที่เป็นหลักฐานเกี่ยวกับการค้นพบได้
สิ่งที่ไม่ทราบผลที่ตามมามากที่สุดคือประสิทธิภาพทางคลินิกขั้นปลายน้ำ แหล่งที่มาไม่ได้ให้ข้อมูลการทดลองทางคลินิกในอนาคต ข้อมูลการใช้งาน การวิเคราะห์ความแม่นยำในการวินิจฉัย หลักฐานผลการรักษา หรือการประเมินอันตรายของกลุ่มย่อยสำหรับโมเดล Flash ก่อนที่จะพิจารณาการใช้ทางคลินิก แหล่งข่าวกล่าวว่าจำเป็นต้องมีการตรวจสอบความถูกต้องหลายสถาบันและในอนาคตเพิ่มเติม จนกว่าจะถึงตอนนั้น ผลกระทบที่ได้รับการสนับสนุนที่ชัดเจนที่สุดคือการคำนวณ: ทำให้ขั้นตอนการวิจัยทางพยาธิวิทยาขนาดใหญ่บางขั้นตอนมีราคาถูกลงและสามารถทำซ้ำได้มากขึ้น การเคลื่อนไหวใดๆ จากเครื่องมือการวิจัยไปสู่การดูแลผู้ป่วยจะต้องมีหลักฐานที่นอกเหนือไปจากประสิทธิภาพและการเปรียบเทียบเกณฑ์มาตรฐานที่อธิบายไว้ที่นี่ ความแตกต่างระหว่างการเผยแพร่งานวิจัยเชิงปฏิบัติและระบบทางคลินิกที่ได้รับการตรวจสอบแล้วจึงยังคงเป็นหัวใจสำคัญในการตีความประกาศ