HƯỚNG DẪN AI về ngôn ngữ

Đào tạo trước ELECTRA

ELECTRA là một cách hiệu quả hơn để huấn luyện trước các mô hình ngôn ngữ bằng cách dạy chúng phát hiện các từ giả thay vì đoán các từ ẩn.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matches BERT's quality using a fraction of the compute.

Lặn sâu

ELECTRA (Học hiệu quả bộ mã hóa giúp phân loại chính xác các thay thế mã thông báo), được giới thiệu bởi Google và Stanford vào năm 2020, thay thế nhiệm vụ lập mô hình ngôn ngữ đeo mặt nạ của BERT bằng 'phát hiện mã thông báo được thay thế'. Một mạng máy phát điện nhỏ hoán đổi một số từ trong câu để có những từ thay thế hợp lý và mô hình chính (bộ phân biệt đối xử) học cách quyết định, đối với mỗi mã thông báo, cho dù đó là bản gốc hay được thay thế. Bởi vì mô hình đào tạo trên tất cả các mã thông báo thay vì chỉ ~ 15% mà BERT che dấu, nên nó học nhanh hơn nhiều. ELECTRA-Small được báo cáo là hoạt động tốt hơn GPT có quy mô tương đương được đào tạo với khả năng tính toán cao hơn 30 lần và ELECTRA-Large cạnh tranh với RoBERTa và XLNet trên tiêu chuẩn GLUE trong khi sử dụng khoảng một phần tư số lượng tính toán.

Hiểu biết kỹ thuật

Hai máy biến áp cùng nhau huấn luyện. Trình tạo mô hình hóa ngôn ngữ đeo mặt nạ và đề xuất mã thông báo thay thế; bộ phân biệt đối xử thực hiện phân loại nhị phân (thực so với thay thế) trên mọi vị trí. Điều quan trọng là tổn thất được tính toán trên tất cả các mã thông báo, không chỉ các mã bị che, mang lại tín hiệu học tập dày đặc hơn. Hai phần nhúng mã thông báo chia sẻ, trình tạo được giữ ở kích thước nhỏ (thường bằng một phần tư đến một nửa kích thước của bộ phân biệt đối xử) và sau khi đào tạo trước, bộ tạo sẽ bị loại bỏ - chỉ bộ phân biệt đối xử được tinh chỉnh xuôi dòng.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của đào tạo trước ELECTRA

Ý tưởng phát hiện mã thông báo thay thế của ELECTRA đã ảnh hưởng đến các bộ mã hóa hiệu quả sau này như DeBERTa-v3, kết hợp nó với sự chú ý được giải quyết để mang lại kết quả hiện đại. Khi các tổ chức quan tâm nhiều hơn đến chi phí đào tạo và lượng khí thải carbon, các mục tiêu đào tạo trước có tính phân biệt nhằm thu thập tín hiệu từ mọi mã thông báo vẫn hấp dẫn để xây dựng các bộ mã hóa nhỏ gọn, mạnh mẽ. Mong đợi cách tiếp cận này sẽ tiếp tục cung cấp thông tin cho các mô hình nhỏ, nhanh để tìm kiếm, phân loại và truy xuất trên thiết bị trong đó các mô hình tổng hợp khổng lồ là quá mức cần thiết.

Triển khai trong thế giới thực

Cung cấp khả năng phân loại văn bản và phân tích cảm xúc nhanh chóng khi cần một bộ mã hóa nhỏ gọn, chính xác

Đóng vai trò là xương sống cho hệ thống xếp hạng tài liệu và mức độ liên quan của tìm kiếm

Tinh chỉnh ELECTRA-Small cho các tác vụ NLP trên thiết bị hoặc có độ trễ thấp với khả năng tính toán hạn chế

Hoạt động như một bộ mã hóa cơ sở mạnh mẽ để nhận dạng thực thể được đặt tên và các tiêu chuẩn trả lời câu hỏi như SQuAD và GLUE

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ELECTRA Pretraining quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mô hình hoán vị XLNet

Câu hỏi thường gặp

What is ELECTRA Pretraining?

ELECTRA là một cách hiệu quả hơn để huấn luyện trước các mô hình ngôn ngữ bằng cách dạy chúng phát hiện các từ giả thay vì đoán các từ ẩn. Nó phù hợp với chất lượng của BERT khi sử dụng một phần nhỏ tính toán.

ELECTRA sử dụng nhiệm vụ đào tạo trước nào thay vì lập mô hình ngôn ngữ ẩn?

ELECTRA đào tạo mô hình để phát hiện mã thông báo nào đã được thay thế bằng trình tạo thay vì dự đoán các từ bị che giấu.

Tại sao ELECTRA tính toán hiệu quả hơn BERT?

Trình phân biệt đối xử phân loại mọi mã thông báo là thực hoặc được thay thế, do đó, mô hình học từ 100% vị trí thay vì chỉ tập hợp con bị che.

Mạng máy phát điện nhỏ có vai trò gì trong ELECTRA?

Trình tạo thực hiện mô hình hóa ngôn ngữ đeo mặt nạ và cung cấp mã thông báo giả thực tế, tạo nhiệm vụ cho người phân biệt đối xử.

Điều gì xảy ra với máy phát điện sau khi quá trình đào tạo trước hoàn tất?

Chỉ có bộ phân biệt được giữ lại và tinh chỉnh cho các tác vụ tiếp theo; máy phát điện bị vứt đi.

ELECTRA được phát triển chủ yếu bởi các nhà nghiên cứu từ tổ chức nào?

ELECTRA được giới thiệu vào năm 2020 bởi các nhà nghiên cứu tại Google và Đại học Stanford.