GPT-4 และ GPT-4o
GPT-4 (2023) คือโมเดลต่อเนื่องขนาดใหญ่ที่ก้าวหน้าของ OpenAI ซึ่งสามารถรับรูปภาพและข้อความได้ และ GPT-4o (2024) ทำให้เร็วขึ้น ถูกกว่า และสามารถจัดการเสียง การมองเห็น และข้อความได้ในรุ่นเดียว
ภาพรวม
Together they defined the modern era of ChatGPT.
เจาะลึก
GPT-4 ซึ่งเปิดตัวในเดือนมีนาคม 2023 เป็นการก้าวกระโดดครั้งใหญ่เหนือ GPT-3.5 โดยได้คะแนนในเปอร์เซ็นไทล์สูงสุดในการสอบ เช่น การทดสอบแบบแท่งและการทดสอบ AP จัดการกับข้อความแจ้งที่ยาวกว่ามาก และอาจให้เหตุผลเกี่ยวกับรูปภาพได้ ต่อมา GPT-4 Turbo ได้เพิ่มหน้าต่างบริบทโทเค็น 128,000 และราคาที่ถูกกว่า ในเดือนพฤษภาคมปี 2024 OpenAI เปิดตัว GPT-4o โดยที่ 'o' ย่อมาจาก 'omni' ซึ่งเป็นโมเดลเดียวที่ได้รับการฝึกตั้งแต่ต้นจนจบทั้งข้อความ เสียง และการมองเห็น โหมดเสียงก่อนหน้านี้เชื่อมโยงสามรุ่นแยกกัน (คำพูดเป็นข้อความจากนั้น GPT จากนั้นข้อความเป็นคำพูด) เพิ่มความล่าช้า GPT-4o ประมวลผลเสียงโดยตรง ทำให้การสนทนาแบบเกือบจะเรียลไทม์มีโทนเสียงทางอารมณ์และสามารถถูกรบกวนได้ นอกจากนี้ยังเร็วกว่าประมาณสองเท่าและมีค่าใช้จ่ายครึ่งหนึ่งของ GPT-4 Turbo ผ่าน API และ OpenAI ทำให้ผู้ใช้ ChatGPT ฟรีใช้งานได้ ซึ่งขยายการเข้าถึงได้กว้างขึ้นอย่างมาก
ข้อมูลเชิงลึกทางเทคนิค
ทั้งสองรุ่นเป็นโมเดล Transformer ที่ใช้ตัวถอดรหัสเท่านั้น ซึ่งได้รับการฝึกฝนให้คาดการณ์โทเค็นถัดไป จากนั้นจึงปรับปรุงด้วยการเรียนรู้แบบเสริมแรงจากผลตอบรับของมนุษย์ (RLHF) เพื่อปฏิบัติตามคำแนะนำและประพฤติตัวอย่างปลอดภัย ความก้าวหน้าที่สำคัญใน GPT-4o คือความหลากหลายตั้งแต่ต้นทางถึงปลายทาง แทนที่จะกำหนดเส้นทางคำพูดผ่านโมเดลการถอดเสียงและการสังเคราะห์ที่แยกจากกัน เครือข่ายหนึ่งจะนำเข้าและปล่อยโทเค็นเสียงโดยตรง โดยคงโทนเสียง จังหวะเวลา และสัญญาณที่ไม่ใช่คำพูด ในขณะเดียวกันก็ลดเวลาแฝงลงเหลือเพียงความเร็วการสนทนาโดยประมาณ (ไม่กี่ร้อยมิลลิวินาที)
ผลกระทบเชิงกลยุทธ์
กลยุทธ์ของผู้ขาย
โรดแมปของผู้จำหน่ายมีอิทธิพลต่อฟีเจอร์ที่ทีมของคุณสามารถสร้างได้ต่อไป
ต้นทุนและงบประมาณ
ข้อกำหนดทางการค้าและตัวเลือกการใช้งานส่งผลต่อต้นทุนและความเสี่ยงในระยะยาว
ความเสี่ยงและความปลอดภัย
สิ่งจูงใจของบริษัทจะกำหนดค่าเริ่มต้นของผลิตภัณฑ์ ท่าทางที่ปลอดภัย และความเปิดกว้าง
อนาคตของ GPT-4 และ GPT-4o
GPT-4o ตั้งค่าเทมเพลตสำหรับผู้ช่วยหลายรูปแบบแบบเรียลไทม์ที่ลื่นไหล และผู้สืบทอดของ OpenAI กำลังผลักดันไปสู่การใช้เหตุผลเพิ่มเติม (แบบจำลอง 'การคิด' ของซีรีส์ o ที่พิจารณาก่อนตอบ) บริบทที่ยาวขึ้น และการใช้เครื่องมือเชิงตัวแทน คาดว่าจะมีต้นทุนที่ลดลง การโต้ตอบด้วยเสียงและวิดีโอแบบเรียลไทม์ที่สมบูรณ์ยิ่งขึ้น การผสานรวมแอปและอุปกรณ์ที่เข้มงวดยิ่งขึ้น และรุ่นที่สลับระหว่างการตอบสนองที่รวดเร็วและการให้เหตุผลที่ช้าและระมัดระวังอย่างลื่นไหล ขึ้นอยู่กับความยากของงาน การผลิตหลายรูปแบบซึ่งสร้างภาพและเสียงโดยธรรมชาติจะขยายตัวต่อไป
การใช้งานจริงในโลกแห่งความเป็นจริง
มีการสนทนาแบบเกือบจะเรียลไทม์ด้วยโหมดเสียงขั้นสูงของ ChatGPT รวมถึงการขัดจังหวะระหว่างประโยค
อัพโหลดภาพสิ่งของในตู้เย็นและขอให้ GPT-4o แนะนำสูตรอาหาร
วางสัญญาทางกฎหมายที่ยาวนานลงในหน้าต่างบริบทโทเค็น 128,000 เพื่อการสรุปและระบุความเสี่ยง
การใช้ความสามารถในการมองเห็นเพื่ออ่านและอธิบายแผนภูมิ บันทึกย่อที่เขียนด้วยลายมือ หรือภาพหน้าจอของข้อความแสดงข้อผิดพลาด
ความเสี่ยงและรั้ว
การประกาศเปิดตัวอาจแซงหน้าความเสถียรในขั้นตอนการทำงานจริง
การกำหนดราคา API หรือการเปลี่ยนแปลงนโยบายสามารถทำลายสมมติฐานได้ในชั่วข้ามคืน
การพึ่งพาผู้ขายรายเดียวจะเพิ่มค่าใช้จ่ายในการล็อคอินและการย้ายข้อมูล
แผนงานการดำเนินงาน
ประเมินผู้ให้บริการโดยใช้งานและชุดข้อมูลของคุณเอง
ตรวจสอบความเป็นส่วนตัว ความปลอดภัย และข้อกำหนดทางกฎหมายก่อนรวมระบบ
รักษาแผนสำรองสำหรับรุ่นหรือผู้จำหน่าย
ตรวจสอบบันทึกประจำรุ่นเพื่อให้การเปลี่ยนแปลงแผนงานไม่ทำให้ทีมแปลกใจ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPT-4 and GPT-4o quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
OpenAI GPT-4.5 และ GPT-5
คำถามที่พบบ่อย
What is GPT-4 and GPT-4o?
GPT-4 (2023) คือโมเดลต่อเนื่องขนาดใหญ่ที่ก้าวหน้าของ OpenAI ซึ่งสามารถรับรูปภาพและข้อความได้ และ GPT-4o (2024) ทำให้เร็วขึ้น ถูกกว่า และสามารถจัดการเสียง การมองเห็น และข้อความได้ในรุ่นเดียว พวกเขาช่วยกันกำหนดยุคสมัยใหม่ของ ChatGPT
'o' ใน GPT-4o ย่อมาจากอะไร
'o' ย่อมาจาก 'omni' ซึ่งสะท้อนให้เห็นว่า GPT-4o เป็นรูปแบบเดียวที่จัดการข้อความ เสียง และการมองเห็นร่วมกัน
เหตุใดโหมดเสียงของ GPT-4o จึงเร็วกว่าฟีเจอร์เสียงก่อนหน้าของ GPT-4
โหมดเสียงก่อนหน้านี้เชื่อมโยงสามรุ่นแยกกัน ทำให้เกิดความล่าช้า GPT-4o จัดการเสียงจากต้นทางถึงปลายทางในเครือข่ายเดียว โดยลดความหน่วงให้เหลือความเร็วที่แทบจะเป็นการสนทนา
GPT-4 แนะนำประเภทอินพุตใหม่หลักๆ อะไรมากกว่า GPT-3.5 เมื่อเปิดตัว
GPT-4 เป็นโมเดลต่อเนื่องหลายรูปแบบขนาดใหญ่ที่สามารถรับอินพุตรูปภาพได้นอกเหนือจากข้อความ ความสามารถ GPT-3.5 ยังขาดอยู่
GPT-4 Turbo มีขนาดหน้าต่างบริบทเท่าใด
GPT-4 Turbo ขยายหน้าต่างบริบทเป็นโทเค็น 128,000 รายการ ทำให้สามารถเอกสารและการสนทนาได้นานขึ้นมาก
เทคนิคการฝึกใดที่ใช้ในการทำให้ GPT-4 และ GPT-4o ปฏิบัติตามคำแนะนำและประพฤติตัวอย่างปลอดภัย
หลังจากการฝึกอบรมโทเค็นถัดไป โมเดลจะได้รับการปรับปรุงด้วย RLHF โดยใช้ความชอบของมนุษย์เพื่อกำหนดพฤติกรรมที่เป็นประโยชน์และปลอดภัยตามคำแนะนำ