กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

แชทบอทฟรีพบวิธีแก้ปัญหาแบบ Six-Die ในเวลาประมาณ 13 นาที

นักวิทยาศาสตร์ใหม่รายงานว่าแชทบอตฟรีสร้างโครงสร้างแบบ 6-die ที่ถูกต้องทางคณิตศาสตร์ ซึ่งนักวิจัยตรวจสอบ แม้ว่าการออกแบบจะใช้งานไม่ได้และวิธีการของแบบจำลองยังไม่ทราบ

4 min readRead the original reporting
Source-provided image accompanying A free chatbot found a six-die solution in about 13 minutes
การรายงานที่มีการระบุแหล่งที่มาแหล่งที่มาบันทึกไว้
สำนักพิมพ์
newscientist.com
ลิงค์แหล่งที่มา
newscientist.comhttps://www.newscientist.com/article/2587148-i-made-a-free-ai-chatbot-solve-a-decade-long-maths-problem-in-13-minutes/
ประเภทแหล่งที่มา
การรายงานโดยสำนักข่าว — ไม่ใช่เอกสารของบุคคลที่หนึ่ง

สิ่งที่เราไม่สามารถยืนยันได้อย่างอิสระ: การอ้างสิทธิ์นี้มาจากร้านที่มีชื่อ เราไม่ได้ตรวจสอบกับเอกสารของบุคคลที่หนึ่ง (newscientist.com)

บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

พรอมต์
คำแนะนำการป้อนข้อมูลและบริบทที่มีให้กับโมเดลกำเนิด
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

Matthew Sparkes นักข่าวนักวิทยาศาสตร์หน้าใหม่กล่าวว่า ChatGPT ได้สร้างแนวทางแก้ไขปัญหาลูกเต๋าสำหรับผู้เล่นหกคนหลังจากใช้เวลาให้เหตุผลประมาณ 13 นาที นักวิจัย Eric Harshbarger ตรวจสอบตัวเลขและพบว่าถูกต้อง โครงสร้างใช้ลูกเต๋า 720 หน้า 5 ลูกและลูกเต๋า 20 ด้าน 1 ลูก ทำให้ถูกต้องตามหลักคณิตศาสตร์แต่ทำไม่ได้

นักวิทยาศาสตร์ใหม่รายงานว่า Sparkes ขอให้ ChatGPT เวอร์ชันฟรีค้นหาลูกเต๋าหกลูกสำหรับผู้เล่นหกคน เพื่อให้ทุกลูกเต๋ามีโอกาสชนะเท่ากัน และไม่มีการโยนใดเลยที่จะส่งผลให้เสมอกัน คำขอดังกล่าวเป็นไปตามความพยายามที่ยาวนานนับทศวรรษของนักคณิตศาสตร์ในการสร้างชุดแม่พิมพ์ห้าชิ้นที่เทียบเคียงได้ Sparkes กล่าวว่าแชทบอตให้คำตอบหลังจากผ่านไปประมาณ 13 นาที โดยทำตามคำแนะนำที่ชัดเจนสองครั้ง Harshbarger นักวิจัยจากมหาวิทยาลัยออเบิร์นที่เกี่ยวข้องกับงานที่มีแม่พิมพ์ 5 ชิ้น ได้ตรวจสอบโครงสร้างเชิงตัวเลขและบอกกับ New Scientist ว่าถูกต้อง

โครงสร้างที่รายงานไม่ใช่ผลิตภัณฑ์ที่รู้จักกันดีหรือเป็นผลิตภัณฑ์เกมที่ใช้งานได้จริง ลูกเต๋าห้าลูกมี 720 ด้าน และลูกเต๋าที่หกมี 20 ด้าน นักวิทยาศาสตร์ใหม่กล่าวว่า Harshbarger และผู้ร่วมงานได้ปรับผลลัพธ์ของลูกเต๋าห้าลูกให้กลายเป็นโครงสร้างลูกเต๋าหกลูกเต๋า ซึ่งลูกเต๋าทุกลูกมี 360 ด้าน เว็บไซต์ของนักวิจัยยังมีวิธีแก้ปัญหาห้าลูกเต๋าและวิธีการขยายวิธีแก้ปัญหาไปยังลูกเต๋ามากขึ้น New Scientist กล่าวว่าการค้นหาไม่พบร่องรอยของคำตอบหกลูกเต๋าที่แน่นอน แต่ผู้เข้าร่วมไม่สามารถระบุได้ว่าแชทบอตระบุตำแหน่งส่วนประกอบสาธารณะเหล่านั้นและทำงานให้เสร็จหรือสร้างวิธีแก้ปัญหาโดยอิสระหรือไม่

รายละเอียดที่มา: newscientist.com ↗

ทำไมมันถึงสำคัญ

รายงานนี้นำเสนอตัวอย่างที่เป็นรูปธรรมและการตรวจสอบโดยอิสระของระบบ AI เอนกประสงค์ที่รวมข้อมูลทางคณิตศาสตร์เข้ากับโซลูชันที่ถูกต้อง ไม่ได้พิสูจน์ว่าแบบจำลองนี้สร้างแนวคิดทางคณิตศาสตร์ใหม่ หรือสามารถแก้ปัญหาที่ยากขึ้นได้อย่างน่าเชื่อถือโดยปราศจากการควบคุมดูแลของมนุษย์ ความหมายเชิงปฏิบัติก็คือแชทบอทอาจช่วยให้นักวิจัยสร้างโครงสร้างผู้สมัครได้ ในขณะที่ผู้คนยังต้องตรวจสอบและตัดสินว่าพวกมันมีประโยชน์หรือไม่

นี่เป็นการสาธิตความสามารถที่มีประโยชน์ เนื่องจากแชทบอตดูเหมือนจะเชื่อมโยงโครงสร้างทางคณิตศาสตร์ที่มีอยู่กับวิธีการเหนี่ยวนำที่รู้จัก และให้ส่วนขยายที่ถูกต้องเป็นภาษาอังกฤษธรรมดา การตรวจสอบเชิงตัวเลขของ Harshbarger เป็นหลักฐานที่มีความหมายว่าคำตอบไม่ได้เป็นเพียงผลลัพธ์ที่ไม่ต่อเนื่องกันเท่านั้น แต่ยังไม่เหมือนกับการพิสูจน์อย่างเป็นทางการหรือการประเมินที่มีการควบคุมในปัญหาต่างๆ มากมาย

รายงานยังแสดงขอบเขตของผลลัพธ์ด้วย คำตอบนั้นน่าอึดอัดใจและใช้งานไม่ได้จริง และแหล่งที่มาไม่ได้ให้การทดสอบกระบวนการให้เหตุผลของแชทบอทโดยอิสระ นักวิทยาศาสตร์ใหม่อ้างคำพูดของ Sébastien Bubeck จาก OpenAI ที่ทำนายความก้าวหน้าอย่างต่อเนื่อง แต่นั่นเป็นมุมมองของผู้เชี่ยวชาญมากกว่าหลักฐานจากการทดลองนี้ บทความนี้กล่าวว่าระบบปัจจุบันสามารถค้นหาวิธีแก้ไขหรือตัวอย่างแย้งของปัญหาที่มีอยู่ แต่ไม่ได้แสดงให้เห็นถึงการสร้างแนวคิดหรือสาขาทางคณิตศาสตร์ใหม่ๆ

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

คำถามสำคัญที่ยังไม่ได้รับคำตอบคือ สามารถทำซ้ำผลลัพธ์ได้โดยอิสระหรือไม่ มีหลักฐานและใบรับรองผลการเรียนฉบับสมบูรณ์หรือไม่ และคำตอบนั้นมาจากเนื้อหาที่เผยแพร่ทางออนไลน์แล้วมากน้อยเพียงใด บทความนี้อธิบายว่าแชทบอตเป็นแบบฟรี แต่ไม่ได้ระบุรุ่น เวอร์ชัน ขีดจำกัดการใช้งานที่แน่ชัด หรือความสามารถดังกล่าวสามารถใช้ได้ในวงกว้างหรือไม่

การประเมินที่แข็งแกร่งยิ่งขึ้นจะต้องอาศัยหลักฐานที่ตอบกลับทันที การตรวจสอบโครงสร้างอย่างเป็นทางการ และการทดสอบโดยนักคณิตศาสตร์ที่ไม่ทราบคำตอบที่คาดหวัง นอกจากนี้ ยังช่วยพิจารณาว่าโมเดลนั้นใช้เว็บไซต์ของนักวิจัยหรือไม่ ต้องการการแจ้งเตือนมากน้อยเพียงใด และผลลัพธ์สามารถทำซ้ำได้ด้วยการเข้าถึงแบบฟรีๆ เดียวกันหรือไม่

คำถามที่กว้างขึ้นคือว่า AI สามารถสรุปจากส่วนผสมทางคณิตศาสตร์ที่ทราบไปจนถึงปัญหาใหม่อย่างแท้จริงได้หรือไม่ แทนที่จะแก้ปัญหารูปแบบต่างๆ ที่มีวิธีการที่เกี่ยวข้องออนไลน์อยู่แล้ว จนกว่าจะแสดงให้เห็น รายงานนี้สนับสนุนการใช้แชทบอทอย่างระมัดระวังในฐานะผู้ช่วยในการสร้างและตรวจสอบแนวคิดของผู้สมัคร ไม่ใช่เพื่อแทนที่การพิสูจน์ การตัดสิน หรือผลงานทางคณิตศาสตร์

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIหม้อแปลงไฟฟ้าอนาคตของ AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?