HƯỚNG DẪN AI về ngôn ngữ

Mô hình ngôn ngữ

Mô hình hóa ngôn ngữ là nhiệm vụ có vẻ đơn giản nhằm dự đoán từ hoặc mã thông báo nào sẽ xuất hiện tiếp theo, dựa trên văn bản cho đến thời điểm hiện tại.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

This single objective, scaled up massively, is what produces today's powerful chatbots and writing assistants.

Lặn sâu

Về cốt lõi, một mô hình ngôn ngữ gán xác suất cho các chuỗi văn bản. Với lời nhắc 'Thủ đô của Pháp là', nó ước tính khả năng xảy ra của mỗi mã thông báo tiếp theo và 'Paris' sẽ đạt điểm cao. Các mô hình ngôn ngữ ban đầu là các n-gram thống kê chỉ đếm tần suất xuất hiện của các chuỗi từ, nhưng chúng gặp khó khăn với ngữ cảnh dài và các cụm từ không nhìn thấy được. Các mô hình ngôn ngữ thần kinh đã thay thế việc đếm bằng các cách biểu diễn đã học và kiến ​​trúc biến đổi từ năm 2017 cho phép các mô hình xử lý các đoạn văn bản dài một cách hiệu quả. Các mô hình ngôn ngữ lớn hiện đại như dòng GPT được đào tạo trên kho văn bản khổng lồ với một mục tiêu: dự đoán mã thông báo tiếp theo. Đáng chú ý, làm tốt điều này buộc mô hình phải tiếp thu ngữ pháp, sự kiện, mô hình lập luận và phong cách, bởi vì việc dự đoán văn bản một cách chính xác đòi hỏi phải hiểu nó. Quá trình tạo hoạt động bằng cách liên tục dự đoán mã thông báo tiếp theo và cung cấp lại mã thông báo đó.

Hiểu biết kỹ thuật

Hầu hết các mô hình ngôn ngữ hiện đại đều có tính tự hồi quy: chúng tính xác suất của một câu thành tích của các xác suất của mã thông báo tiếp theo, dự đoán từng mã thông báo tại một thời điểm từ trái sang phải. Quá trình đào tạo giảm thiểu sự mất mát entropy chéo, giúp ích cho việc gán xác suất cao cho mã thông báo thực tế tiếp theo trong văn bản đào tạo. Quá trình này tự giám sát, các nhãn không có trong văn bản nên không cần có chú thích của con người. Tại thời điểm tạo, các chiến lược lấy mẫu như nhiệt độ, top-k và top-p (hạt nhân) kiểm soát sự cân bằng giữa đầu ra có thể dự đoán được và đầu ra sáng tạo.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của mô hình ngôn ngữ

Dự đoán về mã thông báo tiếp theo đã được chứng minh là có sức mạnh đáng kinh ngạc và luật mở rộng quy mô cho thấy các mô hình lớn hơn và nhiều dữ liệu hơn tiếp tục cải thiện khả năng, mặc dù tốc độ tăng đang chậm lại và dữ liệu chất lượng cao đang trở nên khan hiếm. Biên giới đang chuyển sang lý luận, cửa sổ ngữ cảnh dài hơn và các phương pháp sau đào tạo như học tăng cường từ phản hồi của con người nhằm định hình hành vi sau khi mô hình cơ sở được xây dựng. Mong đợi sự kết hợp liên tục của mô hình ngôn ngữ với các công cụ, khả năng truy xuất và đầu vào đa phương thức, trong khi mục tiêu cơ bản là dự đoán mã thông báo tiếp theo vẫn là nền tảng cho mọi thứ khác được xây dựng dựa trên đó.

Triển khai trong thế giới thực

Tự động hoàn thành trong bàn phím điện thoại hoặc email gợi ý từ tiếp theo khi bạn nhập

Một chatbot như ChatGPT tạo ra câu trả lời trôi chảy bằng cách liên tục dự đoán mã thông báo tiếp theo

Các trình soạn thảo mã như GitHub Copilot dự đoán dòng mã tiếp theo từ bối cảnh xung quanh

Hệ thống nhận dạng giọng nói sử dụng mô hình ngôn ngữ để chọn phiên âm hợp lý nhất trong số các tùy chọn có âm tương tự

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Language Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mô hình ngôn ngữ đeo mặt nạ

Câu hỏi thường gặp

What is Language Modeling?

Mô hình hóa ngôn ngữ là nhiệm vụ có vẻ đơn giản nhằm dự đoán từ hoặc mã thông báo nào sẽ xuất hiện tiếp theo, dựa trên văn bản cho đến thời điểm hiện tại. Mục tiêu duy nhất này, được nhân rộng quy mô lớn, là yếu tố tạo ra các chatbot và trợ lý soạn thảo mạnh mẽ ngày nay.

Nhiệm vụ cốt lõi mà một mô hình ngôn ngữ thực hiện là gì?

Một mô hình ngôn ngữ ước tính xác suất của điều xảy ra tiếp theo trong một chuỗi và quá trình tạo hoạt động bằng cách liên tục dự đoán và thêm mã thông báo tiếp theo.

Hạn chế chính của các mô hình ngôn ngữ n-gram ban đầu là gì?

Các mô hình N-gram dựa vào việc đếm các chuỗi từ ngắn, do đó, chúng xử lý ngữ cảnh tầm xa kém và không xử lý được các cụm từ mà chúng chưa từng thấy.

Tại sao đào tạo mô hình ngôn ngữ được gọi là 'tự giám sát'?

Mã thông báo tiếp theo chính xác đã có trong văn bản, do đó, mô hình sẽ tạo các mục tiêu riêng mà không cần chú thích thủ công.

'Tự hồi quy' có ý nghĩa gì đối với một mô hình ngôn ngữ?

Các mô hình tự hồi quy tạo ra từng mã thông báo văn bản, điều chỉnh từng dự đoán mới về mọi thứ được tạo cho đến nay.

Hàm mất mát nào thường được sử dụng để huấn luyện mô hình ngôn ngữ?

Quá trình đào tạo giảm thiểu entropy chéo, khen thưởng mô hình vì đã gán xác suất cao cho mã thông báo thực tế tiếp theo được quan sát trong văn bản đào tạo.