เกิดอะไรขึ้น
OpenAI เผยแพร่ภาพรวมภายในเกี่ยวกับวิธีการใช้เอเจนต์การเข้ารหัสโดยองค์กรวิจัยของตน บริษัทกล่าวว่าได้บรรลุเป้าหมายที่ตั้งไว้ของ "นักศึกษาฝึกงานด้านการวิจัยอัตโนมัติ" นั่นคือระบบที่สามารถปฏิบัติงานวิจัยที่มีการกำหนดชัดเจนภายใต้การดูแลของมนุษย์ รวมถึงงานที่อาจต้องใช้นักวิจัยที่มีทักษะเป็นเวลาหลายวัน OpenAI กล่าวว่ากำลังกำหนดเป้าหมายไปที่นักวิจัย AI อัตโนมัติภายในเดือนมีนาคม 2028 ตามการวัดของบริษัท การใช้ตัวแทนเพิ่มขึ้นอย่างรวดเร็วในช่วงปี 2026 ภายในกลางเดือนสิงหาคม นักวิจัยค่ามัธยฐานใช้ตัวแทนการเข้ารหัสรายวันมากกว่า 600 ดอลลาร์สหรัฐฯ ต่อวันในการอนุมานซึ่งคำนวณตามราคา API ในขณะที่ผู้ใช้เปอร์เซ็นไทล์ที่ 90 เกิน 7,000 ดอลลาร์ต่อวัน ทั่วทั้งองค์กรวิจัย OpenAI กล่าวว่ารันไทม์ของตัวแทนสูงถึง 3.1 วันทำงานของเจ้าหน้าที่ตามมาตรฐาน 8 ชั่วโมงสำหรับทุกๆ วันทำงานของมนุษย์ นอกจากนี้ OpenAI ยังรายงานการทดลองเพิ่มเติมต่อผู้ทดลองที่ใช้งานอยู่ การใช้ตัวแทนที่เพิ่มขึ้นสำหรับงานระดับสูงกว่าและขอบเขตที่ยาวกว่า และโดยทั่วไปจะปรับปรุงอัตราความสำเร็จตั้งแต่เดือนมกราคมถึงกรกฎาคมในงานที่ทราบผลลัพธ์ อย่างไรก็ตาม มากกว่าครึ่งหนึ่งของงานที่ประสบความสำเร็จคาดว่าจะต้องใช้เวลาทำงานของมนุษย์สี่ถึงแปดชั่วโมง เกี่ยวข้องกับการแทรกแซงของมนุษย์อย่างน้อยหนึ่งครั้งในช่วงหกเดือนที่ผ่านมา รายงานอธิบายว่าสิ่งเหล่านี้เป็นการวัดเบื้องต้นและการแสดงผลภายในของ OpenAI ไม่ได้พิสูจน์ว่าตัวแทนทำให้ผลการวิจัยเพิ่มขึ้นตามที่สังเกตได้ทั้งหมด: บริษัทกล่าวว่าการประมวลผลที่มีอยู่ก็เพิ่มขึ้นอย่างมีนัยสำคัญเช่นกัน และปัญหาคอขวด เช่น การประมวลผล การเลือกงาน การประเมินผล การตรวจสอบความปลอดภัย และการบูรณาการเข้ากับการฝึกอบรมหลักสามารถจำกัดความคืบหน้าโดยรวมได้
OpenAI กล่าวว่าขณะนี้นักวิจัยใช้เอเจนต์การเขียนโค้ดตลอดทั้งวัน ซึ่งมักจะเป็นเซสชันที่เกิดขึ้นพร้อมกัน และการใช้งานดังกล่าวมีการเติบโตเร็วกว่าในทีม OpenAI อื่นๆ บริษัทรายงานว่าค่ามัธยฐานนักวิจัยเปลี่ยนจากการใช้งานแบบพอประมาณเมื่อต้นปี 2569 มาเป็นการใช้งานรายวันภายในกลางเดือนสิงหาคม โดยให้ค่าประมาณการใช้จ่ายภายในมากกว่า 600 ดอลลาร์ต่อวันในการอนุมานในราคา API สำหรับนักวิจัยค่ามัธยฐาน และมากกว่า 7,000 ดอลลาร์ต่อวันสำหรับผู้ใช้เปอร์เซ็นไทล์ที่ 90 ราคาเหล่านี้ไม่ใช่ราคาที่เสนอต่อสาธารณะสำหรับนักวิจัยอัตโนมัติ
บริษัทวัดรันไทม์ของตัวแทนทั้งหมดเทียบกับแรงงานมนุษย์โดยใช้วันทำงานมาตรฐานแปดชั่วโมง โดยระบุว่าก่อนเดือนมิถุนายน 2026 เวลารันไทม์ของตัวแทนทั้งหมดต่ำกว่าแรงงานมนุษย์ทั้งหมด แต่ภายในกลางเดือนสิงหาคม องค์กรวิจัยใช้วันทำงานของตัวแทน 3.1 วันทุกวันทำงานของมนุษย์ การวัดผลรวมถึงสารที่เปิดตัวโดยตรงจากนักวิจัยและสารย่อยขั้นปลายน้ำ
OpenAI กล่าวว่ากิจกรรมของตัวแทนได้ขยายออกไปในหกขั้นตอนของอนุกรมวิธานการวิจัยและพัฒนา AI ได้แก่ การตัดสินใจ การออกแบบ การสร้าง การเรียกใช้ การวิเคราะห์ และการสื่อสาร โค้ดการวิจัยและโครงสร้างพื้นฐานยังคงเป็นหมวดหมู่ที่โดดเด่น ในขณะที่ความช่วยเหลือทางเทคนิคและการดำเนินการตรวจสอบมีการเติบโตอย่างเห็นได้ชัด การวางแผนระดับสูงยังคงเป็นส่วนเล็กๆ ของโทเค็นเอาท์พุตของเอเจนต์ OpenAI กล่าวว่าตัวแทนมีประโยชน์อย่างยิ่งสำหรับการแก้ไขปัญหาโครงสร้างพื้นฐานการวิจัยภายใน ซึ่งสอดคล้องกับการเข้าร่วมเซสชันสนับสนุนด้านเทคนิคที่ดำเนินการโดยมนุษย์น้อยกว่า
รายงานระบุว่าโดยทั่วไปแล้วความสำเร็จของงานเอเจนต์การเขียนโค้ดเพิ่มขึ้นตั้งแต่เดือนมกราคมถึงกรกฎาคมในกลุ่มเวลามนุษย์โดยประมาณหลายกลุ่ม แต่เจ้าหน้าที่ยังคงต้องการการควบคุมที่สำคัญเนื่องจากงานมีความซับซ้อนมากขึ้น มากกว่าครึ่งหนึ่งของงานสี่ถึงแปดชั่วโมงที่ประสบความสำเร็จเกี่ยวข้องกับการแทรกแซงอย่างน้อยหนึ่งครั้งในช่วงหกเดือนที่ผ่านมา OpenAI ยังกล่าวอีกว่าได้หยุดการฝึกอบรมการเรียนรู้การเสริมกำลังชั่วคราวในโมเดลการใช้งานล่าสุดบางรุ่นหลังจากเหตุการณ์โครงสร้างพื้นฐานเมื่อเร็วๆ นี้ กู้คืนปริมาณงานบางส่วนภายใต้ข้อจำกัดที่เข้มงวดยิ่งขึ้น และกำหนดข้อจำกัดเพิ่มเติมในการทดลองระดับ Astra หลังจากหลักฐานเบื้องต้นเกี่ยวกับความสามารถทางไซเบอร์ที่สำคัญ รายงานระบุว่าการจัดสรร GPU ระดับ Astra ลดลง 59.2% ในสัปดาห์ถัดมา ในขณะที่คลาสรุ่นอื่นๆ เพิ่มขึ้น 17.2% ซึ่งชดเชยประมาณ 85% ของการลดลง
ทำไมมันถึงสำคัญ
รายงานดังกล่าวนำเสนอมุมมองที่เป็นรูปธรรมอย่างไม่ธรรมดาว่าห้องปฏิบัติการ AI ระดับแนวหน้าได้รวมระบบ AI เข้ากับงานพัฒนา AI ที่มีความสามารถมากขึ้นได้อย่างไร หากแนวโน้มเป็นภาพรวม ตัวแทนการเขียนโค้ดสามารถเปลี่ยนเวลาของนักวิจัยจากการใช้งานตามปกติและการแก้ไขปัญหาโครงสร้างพื้นฐานไปสู่งานที่ยังทำให้เป็นอัตโนมัติได้ยากขึ้น ซึ่งอาจส่งผลให้ส่วนของวงจรการพัฒนาแบบจำลองสั้นลง แต่หลักฐานดังกล่าวเป็นหลักฐานที่บริษัทสร้างขึ้น เป็นข้อมูลเบื้องต้น และมุ่งเน้นไปที่ตัวชี้วัดการปฏิบัติงานที่เลือก แทนที่จะตรวจสอบคุณภาพทางวิทยาศาสตร์หรือความสามารถของแบบจำลองอย่างอิสระ
รายงานมีความสำคัญเนื่องจากระบบ AI กำลังถูกใช้ในกระบวนการที่สร้างระบบ AI ในอนาคต แทนที่จะช่วยเหลือเฉพาะงานประจำในสำนักงานเท่านั้น ตัวเลขของ OpenAI ชี้ให้เห็นว่าความสามารถของตัวแทนกำลังกลายเป็นส่วนสำคัญของการดำเนินการวิจัยภายใน โดยมีการดำเนินการไปพร้อมๆ กันและความซับซ้อนของงานที่สูงขึ้นได้เปลี่ยนแปลงวิธีที่นักวิจัยจัดสรรเวลา
ความหมายเชิงปฏิบัติผสมปนเปกัน เจ้าหน้าที่อาจลดความล่าช้าที่เกิดจากการเขียนโค้ด การดีบักโครงสร้างพื้นฐาน และการตั้งค่าการทดลอง ช่วยให้นักวิจัยสามารถดำเนินการทดลองได้มากขึ้น ในเวลาเดียวกัน การดำเนินการที่รวดเร็วยิ่งขึ้นสามารถทำให้การประเมิน การติดตาม และการตรวจสอบความปลอดภัยมีความสำคัญมากขึ้น เนื่องจากข้อผิดพลาดอาจเกิดขึ้นและแพร่กระจายได้รวดเร็วยิ่งขึ้น OpenAI เองกล่าวว่าความคืบหน้าในการวัดเฉพาะไม่จำเป็นต้องเท่ากับความก้าวหน้าของการวิจัยโดยรวม
รายงานยังทำให้การควบคุมโดยมนุษย์กลายเป็นเงื่อนไขส่วนกลาง OpenAI กล่าวว่าผู้คนยังคงจัดลำดับความสำคัญ ตัดสินแนวคิดและผลลัพธ์ที่จะติดตาม และตัดสินใจว่าจะปรับขนาด หยุดชั่วคราว หรือปรับใช้ระบบ โดยรับทราบว่าความคืบหน้าในการจัดตำแหน่งและความปลอดภัยอาจไม่ตามความก้าวหน้าด้านขีดความสามารถ และระบบที่มีความสามารถมากขึ้นอาจตรวจสอบได้ยากขึ้น
ไม่มีการศึกษาวิจัยอิสระ เกณฑ์มาตรฐานสาธารณะ หรือการตรวจสอบภายนอกในแหล่งที่มา ดังนั้นตัวเลขการใช้จ่าย รันไทม์ ความสำเร็จของงาน และการแทรกแซงที่รายงานจึงควรถือเป็นการกล่าวอ้างของ OpenAI เกี่ยวกับองค์กรของตนเอง ไม่ใช่เป็นหลักฐานที่ยืนยันว่าการวิจัย AI ได้รับการเร่งด้วยจำนวนที่วัดได้โดยเฉพาะ
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
จะดูอะไรต่อไป.
คำถามสำคัญก็คือ การใช้ตัวแทนที่สูงขึ้นจะนำไปสู่การปรับปรุงคุณภาพการวิจัย ความปลอดภัย และการพัฒนาแบบจำลองที่คงทนและวัดผลได้อย่างอิสระหรือไม่ เฝ้าดูคำจำกัดความที่ชัดเจนยิ่งขึ้นของความสำเร็จของงาน การตรวจสอบจากภายนอก หลักฐานเกี่ยวกับข้อผิดพลาดและแรงงานมนุษย์ที่ซ่อนอยู่ และดูว่าปัญหาคอขวดที่เหลือมุ่งไปสู่การประมวลผล การประเมิน การจัดตำแหน่ง หรือการตัดสินใจหรือไม่ OpenAI ไม่ได้จัดทำเอกสารการเข้าถึงขั้นตอนการทำงานภายในหรือราคาที่เกี่ยวข้องโดยสาธารณะ และรายงานไม่ได้แสดงให้เห็นว่ามีนักวิจัยอัตโนมัติสำหรับวัตถุประสงค์ทั่วไปให้บริการ
OpenAI กล่าวว่าวิธีการวัดยังคงมีการพัฒนาอยู่ การเปิดเผยในอนาคตควรชี้แจงให้ชัดเจนว่ามีการสุ่มตัวอย่างงานอย่างไร มีการตรวจสอบความสำเร็จอย่างไร มีการจัดการผลลัพธ์ที่ไม่แน่นอนอย่างไร และโค้ดหรือการทดลองที่เอเจนต์สร้างขึ้นมีความแตกต่างจากงานที่อาจทำโดยมนุษย์อย่างไร
หลักฐานที่สำคัญที่สุดที่ขาดหายไปคืองานที่ได้รับความช่วยเหลือจากตัวแทนให้ผลลัพธ์การวิจัยที่ดีขึ้นหรือไม่ ไม่ใช่แค่โค้ด การทดลอง หรือโทเค็นมากขึ้นเท่านั้น หลักฐานการติดตามที่เป็นประโยชน์จะรวมถึงตัวอย่างที่สามารถทำซ้ำได้ อัตราข้อผิดพลาด การทำงานซ้ำ การทดลองที่ล้มเหลว การค้นพบด้านความปลอดภัย และจำนวนการตรวจสอบโดยมนุษย์ที่ต้องใช้ในแต่ละขั้นตอน
รายงานไม่ได้ระบุว่านักศึกษาฝึกงานด้านการวิจัยอัตโนมัติเป็นผลิตภัณฑ์ที่สาธารณชนเข้าถึงได้ นอกจากนี้ยังไม่ได้ระบุราคา ข้อกำหนดการใช้งาน เกณฑ์คุณสมบัติ หรือวันที่วางจำหน่ายสำหรับผู้บริโภคหรือองค์กร การเข้าถึงและราคาจึงไม่เป็นที่รู้จัก
OpenAI กล่าวว่าจะยังคงรายงานความคืบหน้าในการวิจัย AI แบบอัตโนมัติ ในขณะเดียวกันก็ปกป้องความปลอดภัยและข้อมูลที่เป็นกรรมสิทธิ์ การเปิดเผยในอนาคตจะแสดงให้เห็นว่าสามารถประเมินความเร่งที่รายงานได้อย่างอิสระเท่าใด และข้อจำกัดด้านการวิจัยส่งผลต่อการกระจายการประมวลผลที่มีอยู่อย่างไร