เกิดอะไรขึ้น
นักวิจัยได้แนะนำ FaithSieve ซึ่งเป็นกรอบการทำงานสำหรับการประเมินการพิสูจน์ทางคณิตศาสตร์ในภาษาธรรมชาติที่สร้างโดยแบบจำลองภาษาขนาดใหญ่ โดยแยกขั้นตอนการพิสูจน์แบบกว้างๆ ออกเป็นหน่วยการให้เหตุผลในท้องถิ่น แยกภาระผูกพันในการพิสูจน์แบบพิมพ์ และใช้การตรวจสอบอย่างเป็นทางการแบบ Lean เมื่อการให้คะแนนการจัดตำแหน่งเชิงความหมายบ่งชี้ว่าข้อความที่เป็นทางการจะรักษาบริบท วัตถุ และรูปแบบตรรกะของการอ้างสิทธิ์ดั้งเดิม ในชุดข้อมูลที่ได้รับการตรวจสอบโดยผู้เชี่ยวชาญจำนวน 2 ชุด ผู้เขียนรายงานว่า FaithSieve ได้ปรับปรุงการแปลข้อผิดพลาดครั้งแรกอย่างแม่นยำเหนือเส้นฐานการตัดสินโดยตรง
การพิมพ์ล่วงหน้าซึ่งส่งไปยัง arXiv เมื่อวันที่ 26 สิงหาคม นำเสนอ FaithSieve เป็นการตอบสนองต่อปัญหาการประเมินเฉพาะ แบบจำลองภาษาขนาดใหญ่สามารถสร้างการพิสูจน์ทางคณิตศาสตร์แบบหลายขั้นตอนที่ยาวได้ แต่ผู้ประเมินอาจประสบปัญหาในการระบุจุดแรกที่การให้เหตุผลไม่ถูกต้อง ผู้เขียนยืนยันว่าแนวทางที่มีอยู่มักจะอาศัยการตัดสินด้วยภาษาธรรมชาติตามแบบจำลอง ซึ่งอาจพลาดช่องว่างในท้องถิ่นได้ แม้ว่าพวกเขาจะมอบหมายการประเมินที่น่าพอใจในวงกว้างก็ตาม ดังนั้นวัตถุประสงค์ที่ระบุไว้จึงแคบกว่าการตัดสินหลักฐานทั้งหมดว่าถูกต้องหรือไม่ถูกต้อง: คือการทำให้ตำแหน่งของความล้มเหลวเริ่มแรกมองเห็นได้ชัดเจนยิ่งขึ้นภายในหลักฐาน
FaithSieve แบ่งขั้นตอนการพิสูจน์หยาบออกเป็นหน่วยการให้เหตุผลที่มีขนาดเล็กลง และเปลี่ยนหน่วยเหล่านั้นให้เป็นข้อผูกพันในการพิสูจน์แบบพิมพ์ จากนั้นจะใช้ตัวแทนการประเมินอย่างเป็นทางการกับลีน ซึ่งเป็นระบบพิสูจน์ทฤษฎีบท เพื่อตรวจสอบภาระผูกพันที่เกิดขึ้น กรอบงานไม่ได้ถือว่าการตรวจสอบแบบลีนที่ประสบความสำเร็จนั้นเพียงพอด้วยตัวมันเอง ในทางกลับกัน การตรวจสอบความถูกต้องอย่างเป็นทางการจะถูกควบคุมด้วยคะแนนการจัดตำแหน่งเชิงความหมายที่มีจุดประสงค์เพื่อพิจารณาว่าข้อความที่เป็นทางการยังคงรักษาบริบทของการพิสูจน์ต้นฉบับ วัตถุทางคณิตศาสตร์ และรูปแบบเชิงตรรกะหรือไม่ การสั่งซื้อดังกล่าวจะรักษาความแตกต่างระหว่างการตรวจสอบข้อผูกพันที่เป็นทางการและการตัดสินใจว่าข้อผูกพันนั้นเป็นตัวแทนที่เพียงพอของหน่วยนอกระบบหรือไม่
ผู้เขียนรายงานผลลัพธ์ของชุดข้อมูลที่ได้รับการตรวจสอบโดยผู้เชี่ยวชาญสองชุด ได้แก่ ProofLoc-Olympiad มีปัญหา 350 ปัญหา ในขณะที่ ProofLoc-University มีปัญหา 200 ปัญหาครอบคลุมหกโดเมนขั้นสูง ด้วยแกนหลัก GPT-5.4 ทำให้ FaithSieve มีความแม่นยำแม่นยำถึง 81.43% ในการค้นหาข้อผิดพลาดแรกในชุด Olympiad เทียบกับ 72.29% สำหรับการตัดสินโดยตรง ในเกณฑ์มาตรฐานของมหาวิทยาลัย สูงถึง 84.5% เทียบกับ 75.0% สำหรับผู้ตัดสินโดยตรง สิ่งเหล่านี้เป็นการอ้างสิทธิ์ในการพิมพ์ล่วงหน้า ไม่ใช่ผลลัพธ์ที่จัดทำขึ้นโดยอิสระ การเปรียบเทียบจะถูกนำเสนอเป็นการประเมินการแปลเป็นภาษาท้องถิ่น แทนที่จะเป็นหลักฐานว่าการพิสูจน์หรือการทำให้เป็นทางการทุกรายการนั้นถูกต้อง
ทำไมมันถึงสำคัญ
งานนี้ได้กล่าวถึงจุดอ่อนในทางปฏิบัติในการประเมินการให้เหตุผลของ AI: การพิสูจน์สามารถดูโน้มน้าวใจได้ในขณะที่มีข้อผิดพลาดในท้องถิ่นในช่วงต้น และบางครั้งผู้พิสูจน์อย่างเป็นทางการสามารถตรวจสอบข้อความที่ไม่ได้เป็นตัวแทนของข้อโต้แย้งดั้งเดิมอย่างซื่อสัตย์ ผู้ประเมินที่แม่นยำยิ่งขึ้นสามารถช่วยให้นักวิจัย นักการศึกษา และนักพัฒนาระบุได้ว่าการใช้เหตุผลทางคณิตศาสตร์ล้มเหลวตรงไหน แทนที่จะอาศัยเพียงการตัดสินความถูกต้องโดยรวมเพียงข้อเดียว ผลลัพธ์ที่รายงานมีแนวโน้มดี แต่มาจากการพิมพ์ล่วงหน้าที่โพสต์ใหม่ และไม่ได้สร้างประสิทธิภาพในการเขียนทางคณิตศาสตร์ทั้งหมดหรือระบบ AI ที่ปรับใช้
ความสำคัญหลักคือระเบียบวิธี การตรวจสอบว่าหลักฐานทั้งหมดสามารถถูกทำให้เป็นทางการได้หรือไม่นั้นไม่เหมือนกับการพิจารณาว่าแต่ละขั้นตอนที่ไม่เป็นทางการนั้นถูกต้องหรือไม่ ผู้พิสูจน์ที่เป็นทางการอาจตรวจสอบเป้าหมายที่กว้างเกินไป หรือข้อความที่เป็นทางการโดยอัตโนมัติอาจเบี่ยงเบนไปจากสิ่งที่หลักฐานดั้งเดิมอ้างสิทธิ์จริง การผสมผสานระหว่างการสลายตัวเฉพาะที่และ semantic gating ของ FaithSieve ได้รับการออกแบบมาเพื่อลดโหมดความล้มเหลวทั้งสองโหมดดังกล่าว ผลประโยชน์ที่ตั้งใจไว้คือการเชื่อมโยงอย่างระมัดระวังมากขึ้นระหว่างข้อความในการพิสูจน์และการตรวจสอบอย่างเป็นทางการที่ใช้ในการประเมิน
สำหรับนักพัฒนาระบบ AI ทางคณิตศาสตร์ การแปลข้อผิดพลาดครั้งแรกสามารถทำได้มากกว่าคะแนนผ่านหรือไม่ผ่านเพียงครั้งเดียว การรู้ว่าจุดใดที่การหยุดพักครั้งแรกสามารถสนับสนุนการฝึกอบรมแบบกำหนดเป้าหมาย การดีบักที่ดีขึ้น และการเปรียบเทียบที่ให้ข้อมูลมากขึ้นระหว่างโมเดลต่างๆ นอกจากนี้ยังอาจทำให้การประเมินง่ายขึ้นในการตรวจสอบ เนื่องจากข้อผูกพันอย่างเป็นทางการสามารถให้หลักฐานที่เชื่อมโยงกับหน่วยการให้เหตุผลส่วนบุคคล แทนที่จะอาศัยการตัดสินร้อยแก้วของผู้ประเมินทั้งหมด ซึ่งอาจทำให้การตรวจสอบข้อขัดแย้งของแต่ละบุคคลง่ายขึ้น ขณะเดียวกันก็เหลือวิจารณญาณที่กว้างขึ้นเกี่ยวกับหลักฐานฉบับเต็ม
ช่องว่างที่รายงานเกี่ยวกับการตัดสินโดยตรงนั้นมีขนาดใหญ่พอที่จะสังเกตได้ในทางปฏิบัติในการทดสอบเหล่านี้: คะแนน 9.14 เปอร์เซ็นต์สำหรับเกณฑ์มาตรฐาน Olympiad และ 9.5 คะแนนสำหรับเกณฑ์มาตรฐานของมหาวิทยาลัย อย่างไรก็ตาม หลักฐานยังจำกัดอยู่เพียงการทดลองของงานวิจัยเท่านั้น แหล่งที่มาไม่ได้ให้ข้อมูลเพียงพอที่จะประเมินคุณภาพคำอธิบายประกอบ ความไม่แน่นอนทางสถิติ กรณีความล้มเหลว รันไทม์ ต้นทุน ความไวต่อแกนหลัก GPT-5.4 หรือประสิทธิภาพเทียบกับนักคณิตศาสตร์ที่เป็นมนุษย์ การละเว้นเหล่านี้มีความสำคัญเนื่องจากจะส่งผลต่อวิธีการตีความผลลัพธ์เชิงตัวเลขและวิธีที่ผู้อื่นสามารถทำซ้ำการเปรียบเทียบได้อย่างง่ายดาย
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
คำถามสำคัญคือ FaithSieve กล่าวถึงภาพรวมที่เหนือกว่าเกณฑ์มาตรฐานทั้งสองหรือไม่ ประตูการจัดแนวความหมายปฏิเสธการจัดรูปแบบที่ทำให้เข้าใจผิดบ่อยแค่ไหน และกระบวนการประเมินต้องใช้ความเชี่ยวชาญของมนุษย์หรือการคำนวณมากน้อยเพียงใด การตรวจสอบเพิ่มเติมควรตรวจสอบการสร้างเกณฑ์มาตรฐาน ประเภทข้อผิดพลาด การตั้งค่าแบบจำลองและการตัดสิน และการเปรียบเทียบกับวิธีการตรวจสอบการพิสูจน์อื่นๆ แหล่งที่มาไม่ได้ระบุว่า FaithSieve พิสูจน์ข้อโต้แย้งที่ไม่เป็นทางการว่าถูกต้อง แทนที่นักคณิตศาสตร์ หรือป้องกันการใช้เหตุผลแบบหลอนประสาททุกรูปแบบ
ประเด็นแรกสำหรับการติดตามผลคือลักษณะทั่วไป เกณฑ์มาตรฐานได้รับการอธิบายว่าผ่านการตรวจสอบโดยผู้เชี่ยวชาญและครอบคลุมปัญหาของโอลิมปิกบวกกับโดเมนระดับมหาวิทยาลัยขั้นสูงอีก 6 โดเมน แต่แหล่งที่มาไม่ได้ระบุการผสมผสานโดเมนทั้งหมด สไตล์ภาษา รูปแบบการพิสูจน์ หรือการกระจายของข้อผิดพลาด ผลลัพธ์อาจเปลี่ยนแปลงได้สำหรับการพิสูจน์ที่มีโครงสร้างน้อยกว่า เขตข้อมูลทางคณิตศาสตร์ที่แตกต่างกัน แบบจำลองที่อ่อนแอหรือแข็งแกร่งกว่า หรืออาร์กิวเมนต์ที่ขึ้นอยู่กับคำจำกัดความที่ไม่แสดงได้อย่างง่ายดายในระบบที่เป็นทางการ คำอธิบายที่มีอยู่จึงสนับสนุนผลลัพธ์การวัดประสิทธิภาพ แต่ไม่ใช่ข้อสรุปว่าพฤติกรรมเดียวกันนี้จะคงอยู่ในทุกการตั้งค่า
นักวิจัยควรตรวจสอบระยะการจัดตำแหน่งความหมายด้วย วัตถุประสงค์เป็นสิ่งสำคัญเนื่องจากการพิสูจน์อย่างเป็นทางการจะมีประโยชน์เฉพาะเมื่อสอดคล้องกับการกล่าวอ้างอย่างไม่เป็นทางการที่กำลังได้รับการประเมิน บทคัดย่อรายงานว่า FaithSieve ใช้คะแนนการจัดตำแหน่ง แต่ไม่ได้ระบุการสอบเทียบคะแนน การเลือกเกณฑ์ อัตราข้อผิดพลาด หรือการพิจารณาการจัดตำแหน่งโดยมนุษย์ แบบจำลอง หรือขั้นตอนอื่นใด รายละเอียดเหล่านั้นจะกำหนดว่ากรอบงานหลีกเลี่ยงการตรวจสอบข้อความที่ไม่ถูกต้องได้อย่างน่าเชื่อถือเพียงใด หากไม่มีการวัดเหล่านี้ ประตูจะเป็นองค์ประกอบสำคัญที่ได้รับการอธิบาย ซึ่งประสิทธิภาพยังคงเป็นคำถามเชิงประจักษ์ที่เปิดกว้าง
สุดท้ายนี้ การใช้งานจริงจะขึ้นอยู่กับความถูกต้องแม่นยำมากกว่า งานในอนาคตควรรายงานว่าต้องใช้เวลาและการคำนวณมากเพียงใดในการแยกย่อยการพิสูจน์ สร้างข้อผูกพันอย่างเป็นทางการ และดำเนินการตรวจสอบแบบ Lean รวมถึงวิธีที่ระบบจัดการกับการทำให้เป็นทางการที่ล้มเหลวและร้อยแก้วที่ไม่ชัดเจน แหล่งข่าวยังไม่ทราบว่า FaithSieve สามารถประเมินข้อพิสูจน์ในกระบวนการการศึกษาหรือการวิจัยจริงได้หรือไม่ หลักฐานดังกล่าวสามารถเข้าใจได้สำหรับผู้ที่ไม่ใช่ผู้เชี่ยวชาญหรือไม่ และการปรับปรุงยังคงมีอยู่หรือไม่เมื่อผู้เขียนเกณฑ์มาตรฐาน แบบจำลอง และผู้ประเมินมีการเปลี่ยนแปลงหรือไม่ คำถามเหล่านี้เกี่ยวข้องกับประโยชน์ของกรอบการทำงานในทางปฏิบัติ และไม่เปลี่ยนแปลงการเปรียบเทียบเกณฑ์มาตรฐานที่รายงาน