กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

OpenAI กล่าวว่าขณะนี้ตัวแทนการเข้ารหัสมีมากกว่าแรงงานวิจัยของมนุษย์ในห้องปฏิบัติการของตน

OpenAI รายงานว่านักวิจัยใช้ 3.1 วันทำงานของตัวแทนสำหรับทุกวันทำงานของมนุษย์ภายในกลางเดือนสิงหาคม พร้อมทั้งเตือนว่าตัวชี้วัดภายในเป็นเพียงข้อมูลเบื้องต้นและไม่ได้วัดความคืบหน้าการวิจัยโดยรวมโดยตรง

5 min readRead the primary source
Source-provided image accompanying OpenAI says coding agents now exceed human research labor in its labs
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
openai.com
ลิงค์แหล่งที่มา
openai.comhttps://openai.com/index/research-acceleration-view-inside-openai
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

API (อินเทอร์เฟซการเขียนโปรแกรมแอปพลิเคชัน)
วิธีการที่มีโครงสร้างสำหรับระบบซอฟต์แวร์หนึ่งในการส่งคำขอและรับการตอบกลับจากอีกระบบหนึ่ง
เกณฑ์มาตรฐาน
การทดสอบหรือชุดข้อมูลที่เป็นมาตรฐานที่ใช้ในการวัดและเปรียบเทียบประสิทธิภาพของโมเดล
การอนุมาน
ระยะรันไทม์ที่โมเดลที่ได้รับการฝึกสร้างการคาดการณ์หรือเอาต์พุต
ทดสอบตัวเองแบบทดสอบตัวแทน AI

เกิดอะไรขึ้น

OpenAI เผยแพร่ภาพรวมภายในเกี่ยวกับวิธีการใช้เอเจนต์การเข้ารหัสโดยองค์กรวิจัยของตน บริษัทกล่าวว่าได้บรรลุเป้าหมายที่ตั้งไว้ของ "นักศึกษาฝึกงานด้านการวิจัยอัตโนมัติ" นั่นคือระบบที่สามารถปฏิบัติงานวิจัยที่มีการกำหนดชัดเจนภายใต้การดูแลของมนุษย์ รวมถึงงานที่อาจต้องใช้นักวิจัยที่มีทักษะเป็นเวลาหลายวัน OpenAI กล่าวว่ากำลังกำหนดเป้าหมายไปที่นักวิจัย AI อัตโนมัติภายในเดือนมีนาคม 2028 ตามการวัดของบริษัท การใช้ตัวแทนเพิ่มขึ้นอย่างรวดเร็วในช่วงปี 2026 ภายในกลางเดือนสิงหาคม นักวิจัยค่ามัธยฐานใช้ตัวแทนการเข้ารหัสรายวันมากกว่า 600 ดอลลาร์สหรัฐฯ ต่อวันในการอนุมานซึ่งคำนวณตามราคา API ในขณะที่ผู้ใช้เปอร์เซ็นไทล์ที่ 90 เกิน 7,000 ดอลลาร์ต่อวัน ทั่วทั้งองค์กรวิจัย OpenAI กล่าวว่ารันไทม์ของตัวแทนสูงถึง 3.1 วันทำงานของเจ้าหน้าที่ตามมาตรฐาน 8 ชั่วโมงสำหรับทุกๆ วันทำงานของมนุษย์ นอกจากนี้ OpenAI ยังรายงานการทดลองเพิ่มเติมต่อผู้ทดลองที่ใช้งานอยู่ การใช้ตัวแทนที่เพิ่มขึ้นสำหรับงานระดับสูงกว่าและขอบเขตที่ยาวกว่า และโดยทั่วไปจะปรับปรุงอัตราความสำเร็จตั้งแต่เดือนมกราคมถึงกรกฎาคมในงานที่ทราบผลลัพธ์ อย่างไรก็ตาม มากกว่าครึ่งหนึ่งของงานที่ประสบความสำเร็จคาดว่าจะต้องใช้เวลาทำงานของมนุษย์สี่ถึงแปดชั่วโมง เกี่ยวข้องกับการแทรกแซงของมนุษย์อย่างน้อยหนึ่งครั้งในช่วงหกเดือนที่ผ่านมา รายงานอธิบายว่าสิ่งเหล่านี้เป็นการวัดเบื้องต้นและการแสดงผลภายในของ OpenAI ไม่ได้พิสูจน์ว่าตัวแทนทำให้ผลการวิจัยเพิ่มขึ้นตามที่สังเกตได้ทั้งหมด: บริษัทกล่าวว่าการประมวลผลที่มีอยู่ก็เพิ่มขึ้นอย่างมีนัยสำคัญเช่นกัน และปัญหาคอขวด เช่น การประมวลผล การเลือกงาน การประเมินผล การตรวจสอบความปลอดภัย และการบูรณาการเข้ากับการฝึกอบรมหลักสามารถจำกัดความคืบหน้าโดยรวมได้

OpenAI กล่าวว่าขณะนี้นักวิจัยใช้เอเจนต์การเขียนโค้ดตลอดทั้งวัน ซึ่งมักจะเป็นเซสชันที่เกิดขึ้นพร้อมกัน และการใช้งานดังกล่าวมีการเติบโตเร็วกว่าในทีม OpenAI อื่นๆ บริษัทรายงานว่าค่ามัธยฐานนักวิจัยเปลี่ยนจากการใช้งานแบบพอประมาณเมื่อต้นปี 2569 มาเป็นการใช้งานรายวันภายในกลางเดือนสิงหาคม โดยให้ค่าประมาณการใช้จ่ายภายในมากกว่า 600 ดอลลาร์ต่อวันในการอนุมานในราคา API สำหรับนักวิจัยค่ามัธยฐาน และมากกว่า 7,000 ดอลลาร์ต่อวันสำหรับผู้ใช้เปอร์เซ็นไทล์ที่ 90 ราคาเหล่านี้ไม่ใช่ราคาที่เสนอต่อสาธารณะสำหรับนักวิจัยอัตโนมัติ

บริษัทวัดรันไทม์ของตัวแทนทั้งหมดเทียบกับแรงงานมนุษย์โดยใช้วันทำงานมาตรฐานแปดชั่วโมง โดยระบุว่าก่อนเดือนมิถุนายน 2026 เวลารันไทม์ของตัวแทนทั้งหมดต่ำกว่าแรงงานมนุษย์ทั้งหมด แต่ภายในกลางเดือนสิงหาคม องค์กรวิจัยใช้วันทำงานของตัวแทน 3.1 วันทุกวันทำงานของมนุษย์ การวัดผลรวมถึงสารที่เปิดตัวโดยตรงจากนักวิจัยและสารย่อยขั้นปลายน้ำ

OpenAI กล่าวว่ากิจกรรมของตัวแทนได้ขยายออกไปในหกขั้นตอนของอนุกรมวิธานการวิจัยและพัฒนา AI ได้แก่ การตัดสินใจ การออกแบบ การสร้าง การเรียกใช้ การวิเคราะห์ และการสื่อสาร โค้ดการวิจัยและโครงสร้างพื้นฐานยังคงเป็นหมวดหมู่ที่โดดเด่น ในขณะที่ความช่วยเหลือทางเทคนิคและการดำเนินการตรวจสอบมีการเติบโตอย่างเห็นได้ชัด การวางแผนระดับสูงยังคงเป็นส่วนเล็กๆ ของโทเค็นเอาท์พุตของเอเจนต์ OpenAI กล่าวว่าตัวแทนมีประโยชน์อย่างยิ่งสำหรับการแก้ไขปัญหาโครงสร้างพื้นฐานการวิจัยภายใน ซึ่งสอดคล้องกับการเข้าร่วมเซสชันสนับสนุนด้านเทคนิคที่ดำเนินการโดยมนุษย์น้อยกว่า

รายงานระบุว่าโดยทั่วไปแล้วความสำเร็จของงานเอเจนต์การเขียนโค้ดเพิ่มขึ้นตั้งแต่เดือนมกราคมถึงกรกฎาคมในกลุ่มเวลามนุษย์โดยประมาณหลายกลุ่ม แต่เจ้าหน้าที่ยังคงต้องการการควบคุมที่สำคัญเนื่องจากงานมีความซับซ้อนมากขึ้น มากกว่าครึ่งหนึ่งของงานสี่ถึงแปดชั่วโมงที่ประสบความสำเร็จเกี่ยวข้องกับการแทรกแซงอย่างน้อยหนึ่งครั้งในช่วงหกเดือนที่ผ่านมา OpenAI ยังกล่าวอีกว่าได้หยุดการฝึกอบรมการเรียนรู้การเสริมกำลังชั่วคราวในโมเดลการใช้งานล่าสุดบางรุ่นหลังจากเหตุการณ์โครงสร้างพื้นฐานเมื่อเร็วๆ นี้ กู้คืนปริมาณงานบางส่วนภายใต้ข้อจำกัดที่เข้มงวดยิ่งขึ้น และกำหนดข้อจำกัดเพิ่มเติมในการทดลองระดับ Astra หลังจากหลักฐานเบื้องต้นเกี่ยวกับความสามารถทางไซเบอร์ที่สำคัญ รายงานระบุว่าการจัดสรร GPU ระดับ Astra ลดลง 59.2% ในสัปดาห์ถัดมา ในขณะที่คลาสรุ่นอื่นๆ เพิ่มขึ้น 17.2% ซึ่งชดเชยประมาณ 85% ของการลดลง

รายละเอียดที่มา: openai.com ↗

ทำไมมันถึงสำคัญ

รายงานดังกล่าวนำเสนอมุมมองที่เป็นรูปธรรมอย่างไม่ธรรมดาว่าห้องปฏิบัติการ AI ระดับแนวหน้าได้รวมระบบ AI เข้ากับงานพัฒนา AI ที่มีความสามารถมากขึ้นได้อย่างไร หากแนวโน้มเป็นภาพรวม ตัวแทนการเขียนโค้ดสามารถเปลี่ยนเวลาของนักวิจัยจากการใช้งานตามปกติและการแก้ไขปัญหาโครงสร้างพื้นฐานไปสู่งานที่ยังทำให้เป็นอัตโนมัติได้ยากขึ้น ซึ่งอาจส่งผลให้ส่วนของวงจรการพัฒนาแบบจำลองสั้นลง แต่หลักฐานดังกล่าวเป็นหลักฐานที่บริษัทสร้างขึ้น เป็นข้อมูลเบื้องต้น และมุ่งเน้นไปที่ตัวชี้วัดการปฏิบัติงานที่เลือก แทนที่จะตรวจสอบคุณภาพทางวิทยาศาสตร์หรือความสามารถของแบบจำลองอย่างอิสระ

รายงานมีความสำคัญเนื่องจากระบบ AI กำลังถูกใช้ในกระบวนการที่สร้างระบบ AI ในอนาคต แทนที่จะช่วยเหลือเฉพาะงานประจำในสำนักงานเท่านั้น ตัวเลขของ OpenAI ชี้ให้เห็นว่าความสามารถของตัวแทนกำลังกลายเป็นส่วนสำคัญของการดำเนินการวิจัยภายใน โดยมีการดำเนินการไปพร้อมๆ กันและความซับซ้อนของงานที่สูงขึ้นได้เปลี่ยนแปลงวิธีที่นักวิจัยจัดสรรเวลา

ความหมายเชิงปฏิบัติผสมปนเปกัน เจ้าหน้าที่อาจลดความล่าช้าที่เกิดจากการเขียนโค้ด การดีบักโครงสร้างพื้นฐาน และการตั้งค่าการทดลอง ช่วยให้นักวิจัยสามารถดำเนินการทดลองได้มากขึ้น ในเวลาเดียวกัน การดำเนินการที่รวดเร็วยิ่งขึ้นสามารถทำให้การประเมิน การติดตาม และการตรวจสอบความปลอดภัยมีความสำคัญมากขึ้น เนื่องจากข้อผิดพลาดอาจเกิดขึ้นและแพร่กระจายได้รวดเร็วยิ่งขึ้น OpenAI เองกล่าวว่าความคืบหน้าในการวัดเฉพาะไม่จำเป็นต้องเท่ากับความก้าวหน้าของการวิจัยโดยรวม

รายงานยังทำให้การควบคุมโดยมนุษย์กลายเป็นเงื่อนไขส่วนกลาง OpenAI กล่าวว่าผู้คนยังคงจัดลำดับความสำคัญ ตัดสินแนวคิดและผลลัพธ์ที่จะติดตาม และตัดสินใจว่าจะปรับขนาด หยุดชั่วคราว หรือปรับใช้ระบบ โดยรับทราบว่าความคืบหน้าในการจัดตำแหน่งและความปลอดภัยอาจไม่ตามความก้าวหน้าด้านขีดความสามารถ และระบบที่มีความสามารถมากขึ้นอาจตรวจสอบได้ยากขึ้น

ไม่มีการศึกษาวิจัยอิสระ เกณฑ์มาตรฐานสาธารณะ หรือการตรวจสอบภายนอกในแหล่งที่มา ดังนั้นตัวเลขการใช้จ่าย รันไทม์ ความสำเร็จของงาน และการแทรกแซงที่รายงานจึงควรถือเป็นการกล่าวอ้างของ OpenAI เกี่ยวกับองค์กรของตนเอง ไม่ใช่เป็นหลักฐานที่ยืนยันว่าการวิจัย AI ได้รับการเร่งด้วยจำนวนที่วัดได้โดยเฉพาะ

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

จะดูอะไรต่อไป.

คำถามสำคัญก็คือ การใช้ตัวแทนที่สูงขึ้นจะนำไปสู่การปรับปรุงคุณภาพการวิจัย ความปลอดภัย และการพัฒนาแบบจำลองที่คงทนและวัดผลได้อย่างอิสระหรือไม่ เฝ้าดูคำจำกัดความที่ชัดเจนยิ่งขึ้นของความสำเร็จของงาน การตรวจสอบจากภายนอก หลักฐานเกี่ยวกับข้อผิดพลาดและแรงงานมนุษย์ที่ซ่อนอยู่ และดูว่าปัญหาคอขวดที่เหลือมุ่งไปสู่การประมวลผล การประเมิน การจัดตำแหน่ง หรือการตัดสินใจหรือไม่ OpenAI ไม่ได้จัดทำเอกสารการเข้าถึงขั้นตอนการทำงานภายในหรือราคาที่เกี่ยวข้องโดยสาธารณะ และรายงานไม่ได้แสดงให้เห็นว่ามีนักวิจัยอัตโนมัติสำหรับวัตถุประสงค์ทั่วไปให้บริการ

OpenAI กล่าวว่าวิธีการวัดยังคงมีการพัฒนาอยู่ การเปิดเผยในอนาคตควรชี้แจงให้ชัดเจนว่ามีการสุ่มตัวอย่างงานอย่างไร มีการตรวจสอบความสำเร็จอย่างไร มีการจัดการผลลัพธ์ที่ไม่แน่นอนอย่างไร และโค้ดหรือการทดลองที่เอเจนต์สร้างขึ้นมีความแตกต่างจากงานที่อาจทำโดยมนุษย์อย่างไร

หลักฐานที่สำคัญที่สุดที่ขาดหายไปคืองานที่ได้รับความช่วยเหลือจากตัวแทนให้ผลลัพธ์การวิจัยที่ดีขึ้นหรือไม่ ไม่ใช่แค่โค้ด การทดลอง หรือโทเค็นมากขึ้นเท่านั้น หลักฐานการติดตามที่เป็นประโยชน์จะรวมถึงตัวอย่างที่สามารถทำซ้ำได้ อัตราข้อผิดพลาด การทำงานซ้ำ การทดลองที่ล้มเหลว การค้นพบด้านความปลอดภัย และจำนวนการตรวจสอบโดยมนุษย์ที่ต้องใช้ในแต่ละขั้นตอน

รายงานไม่ได้ระบุว่านักศึกษาฝึกงานด้านการวิจัยอัตโนมัติเป็นผลิตภัณฑ์ที่สาธารณชนเข้าถึงได้ นอกจากนี้ยังไม่ได้ระบุราคา ข้อกำหนดการใช้งาน เกณฑ์คุณสมบัติ หรือวันที่วางจำหน่ายสำหรับผู้บริโภคหรือองค์กร การเข้าถึงและราคาจึงไม่เป็นที่รู้จัก

OpenAI กล่าวว่าจะยังคงรายงานความคืบหน้าในการวิจัย AI แบบอัตโนมัติ ในขณะเดียวกันก็ปกป้องความปลอดภัยและข้อมูลที่เป็นกรรมสิทธิ์ การเปิดเผยในอนาคตจะแสดงให้เห็นว่าสามารถประเมินความเร่งที่รายงานได้อย่างอิสระเท่าใด และข้อจำกัดด้านการวิจัยส่งผลต่อการกระจายการประมวลผลที่มีอยู่อย่างไร

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

ตัวแทนเอไอการฝึกอบรมเอไออธิบายโมเดล AIอนาคตของ AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?