คู่มือบริษัท

OpenAI o1 และ o3 อธิบายแบบจำลองการใช้เหตุผล

OpenAI o1 และ o3 เป็นแบบจำลองการให้เหตุผลที่ใช้การประมวลผลเวลาทดสอบเพิ่มเติมเพื่อแก้ไขปัญหาหลายขั้นตอนในวิชาคณิตศาสตร์ วิทยาศาสตร์ และการเขียนโค้ด ก่อนที่จะตอบ

อ่าน 2 นาทีอัปเดตล่าสุด

เจาะลึก

เปิดตัวในช่วงปลายปี 2024 o1 เป็นโมเดลแรกของ OpenAI ที่ได้รับการฝึกฝนให้ 'คิด' ก่อนที่จะตอบสนองด้วยการสร้างห่วงโซ่ความคิดภายในอันยาวนาน ต่างจาก GPT-4o ที่จะตอบทันที o1 ใช้เวลาเพียงไม่กี่วินาทีในการให้เหตุผล สำรวจแนวทางต่างๆ จับข้อผิดพลาดของตัวเอง และย้อนรอย สิ่งนี้ขับเคลื่อนโดยการเรียนรู้แบบเสริมกำลังขนาดใหญ่ที่ให้รางวัลแก่การใช้เหตุผลที่ถูกต้อง ไม่ใช่แค่ข้อความที่น่าเชื่อถือเท่านั้น o3 ซึ่งแสดงตัวอย่างในเดือนธันวาคม พ.ศ. 2567 และเปิดตัวในปี พ.ศ. 2568 ได้ก้าวไปอีกขั้น: โดยได้คะแนนประมาณ 87.5% จากเกณฑ์มาตรฐานการให้เหตุผลเชิงนามธรรมของ ARC-AGI และไปถึงระดับการเขียนโปรแกรมที่แข่งขันได้ซึ่งทัดเทียมกับผู้เขียนโค้ดชั้นนำที่เป็นมนุษย์ ข้อเสียที่ต้องแลกคือต้นทุนและเวลาแฝง เนื่องจากการใช้ 'การคิด' ในการประมวลผลมากขึ้น ณ เวลาอนุมานจะช่วยปรับปรุงคำตอบได้โดยตรง

ข้อมูลเชิงลึกทางเทคนิค

แนวคิดหลักคือการปรับขนาดการคำนวณเวลาอนุมาน (เวลาทดสอบ) แทนที่จะสร้างโมเดลให้ใหญ่ขึ้นในระหว่างการฝึกเท่านั้น o1 และ o3 จะได้รับการฝึกผ่านการเรียนรู้แบบเสริมเพื่อสร้างห่วงโซ่ความคิดภายในที่ยาว จากนั้นจึงอนุญาตให้ใช้การคำนวณจำนวนตัวแปรต่อการสืบค้น โดยทั่วไปแล้ว โทเค็นการคิดที่มากขึ้นจะให้คำตอบที่ดีกว่าสำหรับปัญหายากๆ OpenAI ซ่อนการติดตามการให้เหตุผลดิบจากผู้ใช้ โดยแสดงเพียงข้อมูลสรุป ส่วนหนึ่งเพื่อปกป้องเทคนิคและป้องกันการกลั่นกรองโดยคู่แข่ง

ผลกระทบเชิงกลยุทธ์

กลยุทธ์ของผู้ขาย

โรดแมปของผู้จำหน่ายมีอิทธิพลต่อฟีเจอร์ที่ทีมของคุณสามารถสร้างได้ต่อไป

ต้นทุนและงบประมาณ

ข้อกำหนดทางการค้าและตัวเลือกการใช้งานส่งผลต่อต้นทุนและความเสี่ยงในระยะยาว

ความเสี่ยงและความปลอดภัย

สิ่งจูงใจของบริษัทจะกำหนดค่าเริ่มต้นของผลิตภัณฑ์ ท่าทางที่ปลอดภัย และความเปิดกว้าง

อธิบายอนาคตของ OpenAI o1 และ o3 โมเดลการใช้เหตุผล

โมเดลการใช้เหตุผลกำลังเปลี่ยนรูปแบบใหม่: คู่แข่งอย่าง DeepSeek-R1, โหมดการคิด Gemini ของ Google และการคิดแบบขยายของ Anthropic ต่างก็ใช้วิธีคำนวณเวลาทดสอบที่คล้ายกัน คาดหวังการหมุน 'ความพยายาม' เพื่อให้ผู้ใช้แลกเปลี่ยนความเร็วกับความลึก ระบบตัวแทนที่ให้เหตุผลในขั้นตอนการใช้เครื่องมือจำนวนมาก และการให้เหตุผลรวมอยู่ในเครื่องมือหลายรูปแบบและทางวิทยาศาสตร์ พรมแดนกำลังทำให้สิ่งนี้ถูกกว่า เร็วขึ้น และเชื่อถือได้มากขึ้น ขณะเดียวกันก็รักษาห่วงโซ่ความคิดที่ยาวเหยียดอย่างซื่อสัตย์และปราศจากข้อผิดพลาดเล็กๆ น้อยๆ

การใช้งานจริงในโลกแห่งความเป็นจริง

การแก้ปัญหาทางคณิตศาสตร์ระดับการแข่งขัน (AIME, IMO-style) โดยการทำงานผ่านการพิสูจน์หลายขั้นตอน

การดีบักและการเขียนโค้ดที่ซับซ้อน ดำเนินการได้เกือบระดับสูงสุดของมนุษย์ในการแข่งขันการเขียนโปรแกรมแบบแข่งขัน

ช่วยให้นักวิจัยให้เหตุผลผ่านคำถามทางฟิสิกส์ เคมี และชีววิทยาในระดับบัณฑิตศึกษา

ขับเคลื่อนเวิร์กโฟลว์ตัวแทนที่วางแผน เรียกใช้เครื่องมือ ตรวจสอบผลลัพธ์ และแก้ไขตัวเองในหลายขั้นตอน

ความเสี่ยงและรั้ว

การประกาศเปิดตัวอาจแซงหน้าความเสถียรในขั้นตอนการทำงานจริง

การกำหนดราคา API หรือการเปลี่ยนแปลงนโยบายสามารถทำลายสมมติฐานได้ในชั่วข้ามคืน

การพึ่งพาผู้ขายรายเดียวจะเพิ่มค่าใช้จ่ายในการล็อคอินและการย้ายข้อมูล

แผนงานการดำเนินงาน

1

ประเมินผู้ให้บริการโดยใช้งานและชุดข้อมูลของคุณเอง

2

ตรวจสอบความเป็นส่วนตัว ความปลอดภัย และข้อกำหนดทางกฎหมายก่อนรวมระบบ

3

รักษาแผนสำรองสำหรับรุ่นหรือผู้จำหน่าย

4

ตรวจสอบบันทึกประจำรุ่นเพื่อให้การเปลี่ยนแปลงแผนงานไม่ทำให้ทีมแปลกใจ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the OpenAI o1 and o3 Reasoning Models Explained quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is OpenAI o1 and o3 Reasoning Models Explained?

OpenAI o1 และ o3 เป็นแบบจำลองการให้เหตุผลที่ใช้การประมวลผลเวลาทดสอบเพิ่มเติมเพื่อแก้ไขปัญหาหลายขั้นตอนในวิชาคณิตศาสตร์ วิทยาศาสตร์ และการเขียนโค้ด ก่อนที่จะตอบ

อะไรคือความแตกต่างด้านพฤติกรรมหลักระหว่าง o1/o3 และโมเดลมาตรฐาน เช่น GPT-4o?

o1 และ o3 สร้างห่วงโซ่ความคิดภายในที่ยาวก่อนที่จะให้คำตอบสุดท้าย แทนที่จะตอบสนองทันที

เทคนิคการฝึกอะไรเป็นหัวใจสำคัญของการสอน o1 ให้มีเหตุผลดี?

o1 ได้รับการฝึกอบรมเกี่ยวกับการเรียนรู้แบบเสริมกำลังที่ให้รางวัลแก่ขั้นตอนการใช้เหตุผลอย่างมีประสิทธิผล ไม่ใช่แค่ข้อความที่ฟังดูน่าเชื่อถือเท่านั้น

'การปรับขนาดการประมวลผลเวลาอนุมาน' มีความหมายอย่างไรสำหรับโมเดลเหล่านี้

ข้อมูลเชิงลึกที่สำคัญคือการปล่อยให้โมเดล 'คิด' นานขึ้นในเวลาตอบ ไม่ใช่แค่ทำให้ใหญ่ขึ้นระหว่างการฝึกเท่านั้น แต่ยังช่วยเพิ่มประสิทธิภาพในการแก้ไขปัญหายากๆ

เกณฑ์มาตรฐานใดที่ o3 มีคะแนนประมาณ 87.5% ซึ่งบ่งบอกถึงการให้เหตุผลเชิงนามธรรมที่ชัดเจน

คะแนนสูงสุดของ o3 ในเกณฑ์มาตรฐานการให้เหตุผลเชิงนามธรรมของ ARC-AGI คือผลลัพธ์พาดหัวที่แสดงให้เห็นถึงความสามารถในการให้เหตุผล

เหตุใด OpenAI จึงซ่อนการติดตามเหตุผลดิบจากผู้ใช้

OpenAI แสดงเพียงบทสรุปของห่วงโซ่ความคิด ส่วนหนึ่งเพื่อปกป้องวิธีการและป้องกันไม่ให้คู่แข่งลอกเลียนแบบ