กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

การศึกษาคณิตศาสตร์ที่ใช้ AI ช่วยกระชับขอบเขตของค่าคงที่ที่มีมายาวนาน

กรณีศึกษารายงานว่าระบบการวิจัย AI ช่วยปรับปรุงขอบเขตของค่าคงที่ Grothendieck ในขณะที่ผู้เขียนเน้นย้ำว่านักวิจัยที่เป็นมนุษย์เลือกจุดสำคัญและตรวจสอบเฉพาะผลลัพธ์ระดับทฤษฎีอย่างอิสระเท่านั้น

6 min readRead the primary source
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
Long-horizon AI mathematics case study on arXiv
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.11195
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

API (อินเทอร์เฟซการเขียนโปรแกรมแอปพลิเคชัน)
วิธีการที่มีโครงสร้างสำหรับระบบซอฟต์แวร์หนึ่งในการส่งคำขอและรับการตอบกลับจากอีกระบบหนึ่ง
หน่วยความจำ (หน่วยความจำตัวแทน)
บริบทที่จัดเก็บไว้ซึ่งตัวแทน AI ใช้ในขั้นตอนหรือเซสชันเพื่อปรับปรุงความต่อเนื่อง
เกณฑ์มาตรฐาน
การทดสอบหรือชุดข้อมูลที่เป็นมาตรฐานที่ใช้ในการวัดและเปรียบเทียบประสิทธิภาพของโมเดล
ทดสอบตัวเองแบบทดสอบตัวแทน AI

เกิดอะไรขึ้น

กรณีศึกษา arXiv ใหม่อธิบายว่าระบบการวิจัย AI ช่วยให้นักคณิตศาสตร์ปรับปรุงขอบเขตที่ทราบของค่าคงที่ Grothendieck ซึ่งเป็นปัญหาเปิดที่เกิดขึ้นตั้งแต่ปี 1953 ได้อย่างไร บทความนี้นำเสนอทั้งผลลัพธ์ทางคณิตศาสตร์และบันทึกโดยละเอียดว่าระบบทำงานได้ดีตรงไหน ที่ที่ผู้คนต้องควบคุมมัน และการกล่าวอ้างใดที่ยังคงได้รับการตรวจสอบด้วยเครื่องจักรมากกว่าที่จะตรวจสอบโดยมนุษย์

ค่าคงที่ของ Grothendieck จะวัดช่องว่างระหว่างปัญหาการหาค่าเหมาะที่สุดแบบผสมผสานแบบยากกับการผ่อนคลายแบบกึ่งแน่นอนที่ดึงง่ายกว่า ผู้เขียนรายงานช่วงเวลาใหม่ด้วยขอบเขตล่าง 6pi/11 ประมาณ 1.7135 และขอบเขตบนประมาณ 1.7818 กระดาษคณิตศาสตร์ที่แสดงร่วมจะจัดเตรียมการพิสูจน์ ผลลัพธ์ขอบเขตล่างมีความโดดเด่นเนื่องจากไม่ได้สร้างอินสแตนซ์ที่ยาก มันกลับกลายเป็นสิ่งกีดขวางที่ใช้กับแผนการปัดเศษที่เกี่ยวข้องกัน

ระบบการวิจัยเชื่อมโยงแบบจำลองการให้เหตุผลเข้ากับตัวแทนการเข้ารหัส เอกสารระบุว่าการรันใช้ GPT-5.5-Pro ​​และใหม่กว่า GPT-5.6-Sol สำหรับการให้เหตุผล, Claude Code พร้อม Opus และ Fable 5 ในภายหลังสำหรับการดำเนินการ และโหนด GPU สี่ตัวสำหรับการค้นหาเชิงตัวเลข เซสชันดำเนินการต่อเนื่องผ่านไฟล์ การถอดเสียง บันทึกการทดลอง และบทสรุปที่บันทึกการกล่าวอ้างที่ได้รับการพิสูจน์แล้ว มีการสนับสนุนเชิงตัวเลข การคาดเดา หรือการวิเคราะห์พฤติกรรม แทนที่จะอาศัยบริบทเดียวที่ไม่หยุดชะงัก

การดำเนินการครอบคลุมเซสชันการวิจัยประมาณ 240 เซสชัน ตั้งแต่วันที่ 16 มิถุนายน ถึง 24 กรกฎาคม โดยมีการเรียกแบบจำลองการให้เหตุผล 2,091 ครั้ง และโทเค็นประมาณ 152 ล้านโทเค็น ในราคาประมาณ 5,400 ดอลลาร์สหรัฐฯ คำสั่งของมนุษย์ประมาณ 40 ฉบับชี้นำงานนี้ เมื่อการค้นหาขอบเขตบนหมดลง ผู้ปฏิบัติงานรับรู้ว่าความล้มเหลวซ้ำๆ อาจบ่งชี้ถึงสิ่งกีดขวางทั่วไป และเปลี่ยนเส้นทางระบบไปยังอาร์กิวเมนต์ขอบเขตล่าง บทความนี้อธิบายว่าการเปลี่ยนแปลงทิศทางการวิจัยนั้นเป็นการแทรกแซงของมนุษย์ ไม่ใช่การตัดสินใจโดยอิสระ

ระบบได้สร้างการปรับเฟรมใหม่จากส่วนกลางและการพิสูจน์ขอบเขตล่างของ 6pi/11 โดยสมบูรณ์ ซึ่งผู้เขียนได้แก้ไขและตรวจสอบอย่างอิสระ นอกจากนี้ ยังสร้างผู้สมัครที่เป็นตัวเลขที่แข็งแกร่งทั้งบนและล่างซึ่งผ่านโปรโตคอลการตรวจสอบภายใน แต่ผู้เขียนไม่ได้ตรวจสอบใบรับรองเหล่านั้นอย่างอิสระและไม่ได้ระบุว่าเป็นทฤษฎีบท บทความนี้จึงแยกผลลัพธ์ทางคณิตศาสตร์ที่ได้รับการตรวจสอบแล้วออกจากผลลัพธ์ของการเก็งกำไรหรือการทดสอบด้วยเครื่องจักรของระบบ

รายละเอียดที่มา: Long-horizon AI mathematics case study on arXiv ↗

ทำไมมันถึงสำคัญ

การศึกษานี้นำเสนอหลักฐานที่เป็นรูปธรรมอย่างผิดปกติเกี่ยวกับ AI ที่ใช้ในโครงการวิจัย แทนที่จะเป็นงานวัดประสิทธิภาพเพียงงานเดียว การค้นพบที่สำคัญที่สุดคือการแบ่งงาน: ระบบมีความแข็งแกร่งในการดำเนินการทางเทคนิค ในขณะที่นักวิจัยที่เป็นมนุษย์ยังคงรับผิดชอบในการกำหนดวาระการประชุม การตัดสิน และการตรวจสอบขั้นสุดท้าย

การวิจัยในขอบเขตระยะยาวเป็นเรื่องยากสำหรับระบบ AI เนื่องจากวัตถุประสงค์สามารถเปลี่ยนแปลงได้เมื่อแนวทางที่ล้มเหลวสะสม ผู้ทำงานร่วมกันที่เป็นประโยชน์จะต้องรักษาสิ่งที่พยายามแล้ว แยกความแตกต่างทางตันออกจากแนวคิดที่ยังไม่ได้รับการแก้ไข และตัดสินใจว่าเมื่อใดคำถามใหม่จะมีคุณค่ามากกว่าการเพิ่มประสิทธิภาพในท้องถิ่นอื่นๆ หน่วยความจำตามไฟล์ของผู้เขียนและป้ายกำกับการอ้างสิทธิ์เป็นความพยายามที่จะทำให้สถานะการวิจัยนั้นมองเห็นและตรวจสอบได้ แทนที่จะปล่อยให้การตอบสนองอย่างคล่องแคล่วยืนหยัดเพื่อความก้าวหน้า

การค้นพบขอบเขตล่างแสดงให้เห็นว่าเหตุใดการตัดสินใจของมนุษย์จึงยังคงมีความสำคัญ แม้ว่าตัวแทนจะสามารถดำเนินการทางคณิตศาสตร์ได้ก็ตาม ผู้ปฏิบัติงานสังเกตเห็นว่าความพยายามในการก่อสร้างหลายครั้งล้มเหลวในลักษณะเดียวกัน และให้แนวคิดหลัก: พิสูจน์สิ่งกีดขวางซ้ำ ๆ จากนั้นระบบก็ช่วยจัดทำและรับรองข้อโต้แย้ง ลำดับนั้นใกล้เคียงกับการสำรวจภายใต้การดูแลมากกว่านักคณิตศาสตร์เครื่องจักรอิสระ และความแตกต่างมีความสำคัญเมื่ออธิบายว่าหลักฐานสนับสนุนอะไร

การตรวจสอบโดยอิสระเป็นช่องทางในการปลดล็อกผลลัพธ์ กรณีศึกษากล่าวว่าขอบเขตล่างได้รับการตรวจสอบโดยผู้เขียนและหลักฐานที่สมบูรณ์ปรากฏในเอกสารร่วม ไม่ได้บอกว่าทุกหมายเลขที่ผลิตระหว่างการวิ่งนั้นถูกต้อง การแยกการกล่าวอ้างระดับทฤษฎีบท ผู้สมัครที่ทดสอบด้วยเครื่องจักร และสมมติฐานออกจากกัน ช่วยให้ผู้อ่านประเมินการมีส่วนร่วมได้โดยไม่ต้องยอมรับความเชื่อมั่นภายในของระบบ AI ว่าเป็นข้อพิสูจน์ทางคณิตศาสตร์

สำหรับองค์กรวิจัย บทเรียนเชิงปฏิบัติคือการปฏิบัติ ระบบ AI สามารถค้นหาวรรณกรรม เขียนโค้ด ทำการทดลอง รักษาความพยายามที่ล้มเหลว และเสนอการเปลี่ยนแปลง แต่ขั้นตอนการทำงานโดยรอบจำเป็นต้องมีแหล่งที่มา การคำนวณที่ทำซ้ำได้ จุดตรวจสอบของมนุษย์ที่ชัดเจน และวิธีการสร้างใหม่ว่าทำไมทีมถึงเปลี่ยนทิศทาง ต้นทุนและการคำนวณที่รายงานยังแสดงให้เห็นชัดเจนว่าความสามารถในขอบเขตระยะไกลไม่ได้เป็นเพียงคำถามเกี่ยวกับโมเดลอัจฉริยะเท่านั้น ขึ้นอยู่กับการนั่งร้าน เวลา และการกำกับดูแลอย่างต่อเนื่อง

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

จะดูอะไรต่อไป.

คำถามต่อไปคือรูปแบบการทำงานร่วมกันนี้ครอบคลุมมากกว่าปัญหาและทีมเดียวหรือไม่ และนักวิจัยอิสระสามารถสร้างผลลัพธ์ที่ตรวจสอบแล้วในขณะที่ประเมินต้นทุนและความน่าเชื่อถือของมนุษย์และ AI แต่ละคนได้หรือไม่

การจำลองควรทดสอบโดเมนทางคณิตศาสตร์ ประเภทปัญหา และระบบการวิจัยอื่นๆ ด้วยหน่วยความจำและการออกแบบเครื่องมือที่แตกต่างกัน ปัญหาของ Grothendieck มาพร้อมกับกรอบการทำงานที่มนุษย์สร้างขึ้นจำนวนมาก บันทึกสะสม เครื่องมือในการรับรอง และคำสั่งของผู้สมัคร โครงสร้างก่อนหน้านี้ช่วยในการดำเนินการ ดังนั้นการศึกษาในอนาคตควรรายงานว่าสถานะการวิจัยได้รับการจัดหาล่วงหน้ามากน้อยเพียงใด และผลลัพธ์จะเปลี่ยนแปลงไปอย่างไรเมื่อระบบต้องกำหนดปัญหาเอง

นักวิจัยควรเปรียบเทียบการดำเนินการทางเทคนิคกับการตัดสินการวิจัยโดยใช้มาตรการในอนาคต ตัวชี้วัดที่มีประโยชน์อาจรวมถึงคุณภาพของทิศทางที่เลือก เวลาที่จะละทิ้งเส้นทางที่ล้มเหลว อัตราการเรียกร้องที่ไม่ได้รับการสนับสนุน จำนวนการแทรกแซงของมนุษย์ และสัดส่วนของผลลัพธ์ที่รอดจากการตรวจสอบโดยอิสระ กรณีศึกษาที่สวยงามสามารถแสดงให้เห็นว่าเกิดอะไรขึ้น แต่จำเป็นต้องมีการเปรียบเทียบแบบควบคุมเพื่อประเมินว่าเมื่อใดที่ผู้ทำงานร่วมกันของ AI ปรับปรุงกระบวนการ แทนที่จะเพิ่มการตรวจสอบอีกชั้นหนึ่ง

ขอบเขตระหว่างการตรวจสอบเครื่องจักรและการตรวจสอบโดยมนุษย์สมควรได้รับความสนใจอย่างต่อเนื่อง เลขคณิตแบบช่วง ตัวช่วยพิสูจน์ การทดสอบ และการตรวจสอบฝ่ายตรงข้ามสามารถตรวจพบข้อผิดพลาดได้มากมาย แต่ใบรับรองอาจยังคงเข้ารหัสเป้าหมายที่ไม่ถูกต้องหรือขึ้นอยู่กับสมมติฐานที่ไม่เคยถูกท้าทาย งานติดตามผลควรเผยแพร่สิ่งประดิษฐ์ที่สมบูรณ์ เรียกใช้ขอบเขตที่แข็งแกร่งที่สุดที่ยังไม่ผ่านการตรวจสอบอีกครั้ง และทำให้ผลลัพธ์ที่ล้มเหลวหรือถูกถอนออกนั้นมองเห็นได้ว่าเป็นงานที่ประสบความสำเร็จ

สุดท้ายนี้ เวอร์ชันของโมเดล ข้อความแจ้ง คำสั่งบังคับเลี้ยว โค้ด การคำนวณ และการถอดเสียงควรได้รับการเก็บรักษาไว้ในกรณีที่ใบอนุญาตและความเป็นส่วนตัวอนุญาต บทความในปัจจุบันมีคุณค่าส่วนหนึ่งเนื่องจากรายงานเงื่อนไขเหล่านั้นและอธิบายจุดอ่อนของระบบ รวมถึงการเป็นตัวแทนของรัฐวิจัยที่เปราะบางและอิสระในการตัดสินที่จำกัด จนกว่าทีมอื่นๆ จะสร้างรูปแบบขึ้นมาใหม่ นี่เป็นหลักฐานที่ชัดเจนของความก้าวหน้าทางคณิตศาสตร์ที่ได้รับความช่วยเหลือจาก AI ไม่ใช่ข้อพิสูจน์ว่าระบบ AI สามารถทำการวิจัยปลายเปิดได้อย่างอิสระ

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

ตัวแทนเอไออธิบายโมเดล AIการฝึกอบรมเอไอการประเมิน LLMทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?