เกิดอะไรขึ้น
Korea Herald รายงานว่ากระทรวงวิทยาศาสตร์และ ICT ของเกาหลีใต้เปิดเผยคะแนนระยะที่สองโดยละเอียดสำหรับโครงการต้นแบบ Sovereign AI Foundation SK Telecom อยู่ในอันดับที่หนึ่งโดยรวมด้วยคะแนน 70.6 ตามมาด้วย Upstage ด้วยคะแนน 69.9, LG AI Research Institute ด้วยคะแนน 69 คะแนน และ Motif Technologies ด้วยคะแนน 65.8
Korea Herald รายงานว่ากระทรวงวิทยาศาสตร์และ ICT ของเกาหลีใต้เปิดเผยคะแนนโดยละเอียดจากระยะที่สองของโครงการต้นแบบ Sovereign AI Foundation เมื่อวันที่ 27 สิงหาคม รายงานดังกล่าวระบุว่ากระทรวงเปิดเผยผลลัพธ์หลังจาก Motif Technologies ซึ่งถูกกำจัดในระยะที่สอง ร้องขอและทีมที่ได้รับคัดเลือกอื่นๆ ยินยอม แหล่งข่าวอธิบายว่าโครงการนี้เป็นความพยายามในการพัฒนาขีดความสามารถของโมเดลพื้นฐานในประเทศและขยายระบบนิเวศ AI ของเกาหลีใต้ การเปิดเผยโดยละเอียดจะระบุผลลัพธ์โดยรวมของโครงการ และสถานการณ์ที่คะแนนเหล่านั้นถูกเผยแพร่ต่อสาธารณะหลังจากได้รับคำขอและยินยอม
จากรายงานของ The Korea Herald SK Telecom ได้รับคะแนนรวมสูงสุด 70.6 คะแนนจากเต็ม 100 คะแนน Upstage ได้คะแนน 69.9 คะแนน, LG AI Research Institute ได้คะแนน 69 คะแนน และ Motif Technologies ได้คะแนน 65.8 การประเมินรวมการประเมินเกณฑ์มาตรฐานมูลค่า 40 คะแนน การประเมินโดยผู้เชี่ยวชาญมูลค่า 35 คะแนน และการประเมินผู้ใช้มูลค่า 25 คะแนน ส่วนประกอบผู้ใช้ประกอบด้วยผู้ใช้มืออาชีพและสมาชิกของสาธารณะ ตัวเลขเหล่านี้จะอธิบายการประเมินแบบรวมที่ใช้สำหรับการจัดอันดับโดยรวม ไม่ใช่ผลลัพธ์จากหมวดหมู่การประเมินเพียงหมวดเดียว
รายงานระบุว่าส่วนเกณฑ์มาตรฐานดึง 25 คะแนนจากดัชนีปัญญาวิเคราะห์ประดิษฐ์ และ 15 คะแนนจากเกณฑ์มาตรฐานของ National Information Society Agency Motif Technologies ครองอันดับหนึ่งในส่วน AAII ด้วยคะแนน 11.9 คะแนน นำหน้า Upstage ที่ 9.4 คะแนน SK Telecom ที่ 8.8 และ LG AI Research Institute ที่ 7.8 ในเกณฑ์มาตรฐาน NIA ซึ่ง The Korea Herald กล่าวว่าครอบคลุมเจ็ดด้าน รวมถึงความสามารถและความน่าเชื่อถือในภาษาเกาหลีนั้น SK Telecom ได้คะแนน 13.4 และ Upstage 13.3 ตามมาด้วย LG AI Research Institute ที่ 12.8 และ Motif Technologies ที่ 12.7 ตัวเลของค์ประกอบแสดงให้เห็นว่าส่วนเกณฑ์มาตรฐานถูกแบ่งระหว่างแหล่งที่มาที่รายงานทั้งสองแห่งอย่างไร
รายละเอียดที่มา: koreaherald.com ↗
ทำไมมันถึงสำคัญ
ผลลัพธ์ดังกล่าวให้มุมมองสาธารณะว่าเกาหลีใต้เปรียบเทียบความพยายามของ AI ในประเทศกับเกณฑ์มาตรฐานระดับโลก ความสามารถทางภาษาเกาหลี ความน่าเชื่อถือ การตัดสินของผู้เชี่ยวชาญ และการใช้งานในโลกแห่งความเป็นจริงอย่างไร นอกจากนี้ยังแสดงให้เห็นว่าการจัดอันดับโดยรวมแตกต่างกันอย่างมากตามวิธีการประเมิน
ผลลัพธ์มีความสำคัญเนื่องจากทำให้การเปรียบเทียบโครงการ AI ของเกาหลีใต้ที่ได้รับการสนับสนุนจากรัฐบาลมีความเฉพาะเจาะจงมากกว่าการประกาศบริษัทที่เลือก บัญชีของ Korea Herald แสดงให้เห็นว่าทีมผู้นำโดยรวมไม่ใช่ทีมแรกในทุกองค์ประกอบ Motif เป็นผู้นำในหมวดหมู่เกณฑ์มาตรฐานระดับโลก, LG AI Research Institute เป็นผู้นำในการประเมินโดยผู้เชี่ยวชาญและการประเมินสาธารณะ ในขณะที่ SK Telecom เป็นผู้นำในการประเมินโดยผู้ใช้มืออาชีพ ผลลัพธ์โดยรวมจึงสะท้อนถึงการประเมินแบบรวมมากกว่าผลการวัดประสิทธิภาพเพียงรายการเดียว
การแพร่กระจายดังกล่าวแสดงให้เห็นว่าการออกแบบการประเมินผลสามารถกำหนดข้อสรุปเกี่ยวกับความสามารถของ AI ได้อย่างไร ประสิทธิภาพของแบบจำลองตามเกณฑ์มาตรฐานสากล ผลลัพธ์ในภาษาเกาหลีและความน่าเชื่อถือ การประเมินโดยผู้เชี่ยวชาญ และการใช้งานจริงอาจวัดคุณภาพที่แตกต่างกัน Korea Herald รายงานว่าผู้เชี่ยวชาญภายนอก 10 รายจากอุตสาหกรรม สถาบันการศึกษา และสถาบันวิจัยเข้าร่วมในการประเมินโดยผู้เชี่ยวชาญ ในขณะที่ผู้บริหารสตาร์ทอัพด้าน AI 49 รายเข้าร่วมในการประเมินผู้ใช้ระดับมืออาชีพ และมีประชาชนทั่วไป 185 คนเข้าร่วมในการประเมินโดยสาธารณะ หมวดหมู่และกลุ่มผู้เข้าร่วมที่แตกต่างกันช่วยอธิบายว่าทำไมผลลัพธ์ขององค์ประกอบจึงไม่สร้างการจัดอันดับที่เหมือนกัน
สำหรับกลยุทธ์ AI ของเกาหลีใต้ คะแนนดังกล่าวเป็นพื้นฐานในการตัดสินใจว่าระบบในประเทศใดที่ได้รับความสนใจอย่างต่อเนื่องภายใต้โครงการ Sovereign-AI กระทรวงบอกกับ The Korea Herald ว่าโครงการนี้ไม่ได้มีวัตถุประสงค์เพียงเพื่อจัดอันดับทีมหรือกำจัดผู้เข้าร่วม แต่เพื่อส่งเสริมการเติบโตเชิงคุณภาพและการขยายระบบนิเวศ AI ของประเทศ เป้าหมายดังกล่าวชี้ให้เห็นว่าคะแนนอาจใช้เป็นข้อมูลป้อนกลับสำหรับการพัฒนาแบบจำลองและการสร้างขีดความสามารถระดับชาติ ไม่เพียงแต่เป็นตารางการแข่งขันเท่านั้น รายงานไม่ได้ระบุว่าระบบที่ได้รับการประเมินสามารถใช้งานได้ในวงกว้างหรือไม่ เปรียบเทียบกับโมเดลชั้นนำระดับสากลอย่างไร หรือคะแนนคาดการณ์ประสิทธิภาพในการใช้งานในการปฏิบัติงานหรือไม่ คำถามที่ยังไม่มีคำตอบเหล่านี้จะจำกัดสิ่งที่สามารถสรุปได้จากการจัดอันดับเพียงอย่างเดียว
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
กระทรวงกล่าวว่าจะทบทวนคำคัดค้านของ Motif Technologies และทำการตัดสินใจขั้นสุดท้ายภายใน 15 วัน ตามรายงานของ The Korea Herald การพัฒนาที่สำคัญต่อไปคือผลลัพธ์ของการทบทวน การเปลี่ยนแปลงใดๆ ที่เกิดขึ้นกับทีมที่เข้าร่วมโครงการ และการแก้ไขเป้าหมายการประเมินในอีกหกเดือนข้างหน้า
การพัฒนาที่เกิดขึ้นทันทีที่สุดคือการตอบสนองของกระทรวงต่อการคัดค้านของ Motif Technologies Korea Herald รายงานว่า Motif เคยท้าทายผลลัพธ์ในระยะที่สองก่อนหน้านี้ และกระทรวงจะทบทวนข้อโต้แย้งภายใต้ขั้นตอนที่กำหนดไว้ โดยคาดว่าจะมีการตัดสินใจขั้นสุดท้ายภายใน 15 วัน แหล่งข่าวไม่ได้บอกว่า Motif ต้องการวิธีแก้ไขอะไร หรือการคัดค้านสามารถเปลี่ยนอันดับหรือผู้เข้าร่วมโครงการได้หรือไม่ ดังนั้นการทบทวนจึงเป็นจุดต่อไปที่ผลลัพธ์ในระยะที่สองที่รายงานจะได้รับการอัปเดตอย่างเป็นทางการ
กระทรวงยังกล่าวอีกว่าเป้าหมายการพัฒนาของโครงการจะได้รับการแก้ไขทุก ๆ หกเดือนในฐานะ "เป้าหมายที่เคลื่อนไหว" ซึ่งสะท้อนให้เห็นถึงความก้าวหน้าอย่างรวดเร็วของ AI ตามรายงานของ The Korea Herald การแก้ไขในอนาคตจึงอาจเปลี่ยนแปลงความสมดุลระหว่างประสิทธิภาพเกณฑ์มาตรฐาน การตรวจสอบโดยผู้เชี่ยวชาญ และประสบการณ์ผู้ใช้ รายงานระบุว่าเกณฑ์และวิธีการประเมินได้รับการสรุปขั้นสุดท้ายหลังจากการปรึกษาหารือล่วงหน้ากับทีมที่ได้รับคัดเลือก แต่ไม่มีคำถามในการทดสอบ เวอร์ชันแบบจำลอง ข้อมูลการฝึกอบรม กฎการให้คะแนน หรือความคิดเห็นของผู้ประเมินรายบุคคล การละเว้นเหล่านั้นจะทิ้งรายละเอียดที่สำคัญไว้สำหรับการรายงานในภายหลังหรือการแก้ไขในอนาคต
ผู้อ่านควรดูหลักฐานว่าการประเมินเหล่านี้นำไปใช้ในที่สาธารณะหรือเชิงพาณิชย์หรือไม่ รายงานของ Korea Herald ให้คะแนนและจำนวนการมีส่วนร่วม แต่ไม่ได้ตรวจสอบข้อมูลพื้นฐานของกระทรวงหรือประเมินแบบจำลองอย่างเป็นอิสระ นอกจากนี้ยังไม่ได้ระบุข้อผูกพันในการปรับใช้ ต้นทุน การทดสอบความปลอดภัย ทรัพยากรการประมวลผล เงื่อนไขสิทธิ์การใช้งาน หรือเงื่อนไขการเข้าถึง รายละเอียดเหล่านี้จะมีความสำคัญในการตัดสินว่าโครงการนี้แสดงถึงขีดความสามารถของ AI อธิปไตยที่คงทนหรือเป็นแบบฝึกหัดการประเมินผลของรัฐบาลเป็นหลัก คะแนนจะสร้างการเปรียบเทียบที่รายงาน ในขณะที่การใช้งานจริงจะต้องมีหลักฐานนอกเหนือจากผลการประเมิน