GPT-4 và GPT-4o
GPT-4 (2023) là mẫu đa phương thức lớn mang tính đột phá của OpenAI có thể chấp nhận hình ảnh cũng như văn bản và GPT-4o (2024) đã làm cho mẫu này nhanh hơn, rẻ hơn và có khả năng xử lý âm thanh, hình ảnh và văn bản vốn có trong một mẫu duy nhất.
Tổng quan
Together they defined the modern era of ChatGPT.
Lặn sâu
GPT-4, được phát hành vào tháng 3 năm 2023, là một bước nhảy vọt lớn so với GPT-3.5: nó đạt điểm cao nhất trong các bài kiểm tra như bài kiểm tra thanh và AP, xử lý các lời nhắc dài hơn nhiều và có thể suy luận về hình ảnh. GPT-4 Turbo sau đó đã thêm cửa sổ ngữ cảnh 128k mã thông báo và giá rẻ hơn. Vào tháng 5 năm 2024, OpenAI đã giới thiệu GPT-4o, trong đó 'o' là viết tắt của 'omni', một mô hình duy nhất được đào tạo toàn diện về văn bản, âm thanh và hình ảnh. Chế độ giọng nói trước đó đã liên kết ba mô hình riêng biệt (chuyển giọng nói thành văn bản, sau đó là GPT, sau đó chuyển văn bản thành giọng nói), thêm độ trễ; GPT-4o xử lý âm thanh trực tiếp, cho phép cuộc trò chuyện bằng giọng nói gần như theo thời gian thực với tông màu cảm xúc và khả năng bị gián đoạn. Nó cũng nhanh gấp đôi và có giá chỉ bằng một nửa so với GPT-4 Turbo thông qua API và OpenAI cung cấp cho người dùng ChatGPT miễn phí, mở rộng quyền truy cập đáng kể.
Hiểu biết kỹ thuật
Cả hai đều là mô hình Transformer chỉ có bộ giải mã được đào tạo để dự đoán mã thông báo tiếp theo, sau đó được tinh chỉnh bằng phương pháp học tăng cường từ phản hồi của con người (RLHF) để làm theo hướng dẫn và hành xử an toàn. Cải tiến quan trọng trong GPT-4o là tính đa phương thức từ đầu đến cuối: thay vì định tuyến giọng nói thông qua các mô hình sao chép và tổng hợp riêng biệt, một mạng sẽ tiếp thu và phát trực tiếp mã thông báo âm thanh, duy trì âm sắc, thời gian và tín hiệu phi ngôn ngữ trong khi giảm độ trễ xuống tốc độ đàm thoại gần đúng (vài trăm mili giây).
Tác động chiến lược
Chiến lược nhà cung cấp
Lộ trình của nhà cung cấp ảnh hưởng đến những tính năng mà nhóm của bạn có thể xây dựng tiếp theo.
Chi phí và ngân sách
Các điều khoản thương mại và các lựa chọn triển khai ảnh hưởng đến chi phí và rủi ro dài hạn.
Rủi ro và an toàn
Các biện pháp khuyến khích của công ty định hình các tình trạng vỡ nợ của sản phẩm, trạng thái an toàn và tính cởi mở.
Tương lai của GPT-4 và GPT-4o
GPT-4o thiết lập khuôn mẫu cho các trợ lý đa phương thức linh hoạt, theo thời gian thực và những người kế nhiệm của OpenAI đang tiến sâu hơn vào lý luận (các mô hình 'suy nghĩ' của chuỗi o đã cân nhắc trước khi trả lời), bối cảnh dài hơn và việc sử dụng công cụ tác nhân. Mong đợi chi phí thấp hơn, tương tác thoại và video theo thời gian thực phong phú hơn, tích hợp ứng dụng và thiết bị chặt chẽ hơn cũng như các mô hình chuyển đổi linh hoạt giữa phản hồi nhanh và lý luận chậm, cẩn thận tùy thuộc vào độ khó của nhiệm vụ. Việc tạo đa phương thức, tạo ra hình ảnh và âm thanh nguyên bản, sẽ tiếp tục mở rộng.
Triển khai trong thế giới thực
Có cuộc trò chuyện bằng giọng nói gần như theo thời gian thực với Chế độ giọng nói nâng cao của ChatGPT, bao gồm cả việc ngắt quãng cuộc trò chuyện giữa câu
Tải lên ảnh nội dung trong tủ lạnh và yêu cầu GPT-4o gợi ý công thức nấu ăn
Dán hợp đồng pháp lý dài vào cửa sổ ngữ cảnh 128k mã thông báo để tóm tắt và phát hiện rủi ro
Sử dụng khả năng thị giác để đọc và giải thích biểu đồ, ghi chú viết tay hoặc ảnh chụp màn hình của thông báo lỗi
Rủi ro & lan can
Thông báo ra mắt có thể vượt xa sự ổn định trong quy trình sản xuất thực tế.
Việc định giá API hoặc thay đổi chính sách có thể phá vỡ các giả định chỉ sau một đêm.
Sự phụ thuộc vào một nhà cung cấp làm tăng chi phí khóa và di chuyển.
Lộ trình thực hiện
Đánh giá các nhà cung cấp bằng cách sử dụng các nhiệm vụ và bộ dữ liệu của riêng bạn.
Xem lại các điều khoản về quyền riêng tư, bảo mật và pháp lý trước khi tích hợp.
Duy trì kế hoạch dự phòng giữa các mô hình hoặc nhà cung cấp.
Theo dõi ghi chú phát hành để những thay đổi về lộ trình không gây ngạc nhiên cho các nhóm.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPT-4 and GPT-4o quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
OpenAI GPT-4.5 và GPT-5
Câu hỏi thường gặp
What is GPT-4 and GPT-4o?
GPT-4 (2023) là mẫu đa phương thức lớn mang tính đột phá của OpenAI có thể chấp nhận hình ảnh cũng như văn bản và GPT-4o (2024) đã làm cho mẫu này nhanh hơn, rẻ hơn và có khả năng xử lý âm thanh, hình ảnh và văn bản vốn có trong một mẫu duy nhất. Họ cùng nhau xác định kỷ nguyên hiện đại của ChatGPT.
Chữ 'o' trong GPT-4o có nghĩa là gì?
Chữ 'o' là viết tắt của 'omni', phản ánh rằng GPT-4o là một mô hình duy nhất xử lý văn bản, âm thanh và hình ảnh cùng nhau.
Tại sao chế độ giọng nói của GPT-4o lại nhanh hơn tính năng giọng nói trước đó của GPT-4?
Chế độ giọng nói trước đó đã xâu chuỗi ba mô hình riêng biệt, thêm độ trễ. GPT-4o xử lý âm thanh từ đầu đến cuối trong một mạng duy nhất, giảm độ trễ xuống tốc độ gần như hội thoại.
GPT-4 đã giới thiệu loại đầu vào mới quan trọng nào so với GPT-3.5 khi ra mắt?
GPT-4 là một mẫu đa phương thức lớn có thể chấp nhận đầu vào hình ảnh ngoài văn bản, một khả năng mà GPT-3.5 còn thiếu.
GPT-4 Turbo cung cấp kích thước cửa sổ ngữ cảnh nào?
GPT-4 Turbo đã mở rộng cửa sổ ngữ cảnh lên 128 nghìn mã thông báo, cho phép tài liệu và cuộc hội thoại dài hơn nhiều.
Kỹ thuật huấn luyện nào được sử dụng để khiến GPT-4 và GPT-4o tuân theo hướng dẫn và hành xử an toàn?
Sau khi đào tạo trước mã thông báo tiếp theo, các mô hình được tinh chỉnh bằng RLHF, sử dụng tùy chọn của con người để định hình hành vi làm theo hướng dẫn an toàn, hữu ích.