HƯỚNG DẪN KỸ THUẬT

Số liệu đánh giá ROUGE và BLEU

ROUGE và BLEU là các số liệu tự động phù hợp để so sánh văn bản do máy tạo với các tham chiếu do con người tạo ra.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

BLEU được xây dựng để dịch thuật và dựa vào sự chính xác; ROUGE được xây dựng để tóm tắt và dựa vào khả năng ghi nhớ.

Lặn sâu

Cả hai số liệu đều đo lường sự trùng lặp n-gram giữa văn bản ứng viên và một hoặc nhiều văn bản tham chiếu, nhưng chúng nhấn mạnh các hướng khác nhau. BLEU (Nghiên cứu đánh giá song ngữ) tính toán độ chính xác n-gram đã sửa đổi (thường từ 1 đến 4 gram), nhân chúng về mặt hình học và áp dụng hình phạt ngắn gọn để hệ thống không thể tính điểm bằng cách tạo ra kết quả rất ngắn. Thay vào đó, ROUGE (Nghiên cứu sinh định hướng thu hồi để đánh giá Gisting) ưu tiên thu hồi: ROUGE-N tính n-gram chồng chéo, ROUGE-L sử dụng chuỗi con chung dài nhất để thưởng cho các kết quả trùng khớp theo thứ tự mà không yêu cầu sự liền kề. BLEU hỏi 'những gì hệ thống nói là đúng bao nhiêu?' trong khi ROUGE hỏi 'hệ thống đã thu thập được bao nhiêu tham chiếu?'. Cả hai đều rẻ tiền và có thể tái sử dụng nhưng chỉ thấy các từ chồng chéo lên bề mặt, thiếu cách diễn giải và ý nghĩa.

Hiểu biết kỹ thuật

Độ chính xác đã được sửa đổi của BLEU sẽ cắt từng số n-gram ứng viên thành số lượng tối đa của nó trong bất kỳ tham chiếu nào, ngăn chặn việc lặp lại trò chơi; hình phạt ngắn gọn sẽ có hiệu lực khi đầu ra ngắn hơn tham chiếu. Chuỗi tiếp theo chung dài nhất của ROUGE-L nắm bắt cấu trúc cấp độ câu và thứ tự từ trong khi vẫn cho phép các khoảng trống và ROUGE thường báo cáo F1 kết hợp độ chính xác và thu hồi.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của các thước đo đánh giá ROUGE và BLEU

Bởi vì số liệu n-gram thưởng cho các kết quả khớp từ chính xác, nên chúng đánh giá thấp các cách diễn giải hợp lệ và viết lại trôi chảy, một vấn đề ngày càng gia tăng khi kết quả đầu ra LLM phân kỳ từ vựng với các tham chiếu. Các số liệu dựa trên việc nhúng như BERTScore và các số liệu đã học như BLEURT và COMET, cùng với việc đánh giá LLM với tư cách là giám khảo, ngày càng bổ sung hoặc thay thế chúng. Tuy nhiên, ROUGE và BLEU vẫn tồn tại như những đường cơ sở nhanh chóng, minh bạch được báo cáo trong hầu hết các bài báo.

Triển khai trong thế giới thực

Các nhà nghiên cứu dịch máy báo cáo điểm BLEU trên điểm chuẩn WMT để so sánh chất lượng hệ thống

Các bài viết tóm tắt báo cáo ROUGE-1, ROUGE-2 và ROUGE-L trên tập dữ liệu CNN/DailyMail

Nhóm kỹ thuật theo dõi BLEU trong CI để phát hiện hồi quy khi tinh chỉnh mô hình dịch thuật

Một sản phẩm tóm tắt sử dụng ROUGE-L như một công cụ kiểm tra tự động giá rẻ trước khi chạy đánh giá con người tốn kém hơn

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ROUGE and BLEU Evaluation Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Thăm dò tuyến tính và đánh giá tính năng đông lạnh

Câu hỏi thường gặp

Chỉ số Đánh giá ROUGE và BLEU là gì?

ROUGE và BLEU là các số liệu tự động phù hợp để so sánh văn bản do máy tạo với các tham chiếu do con người tạo ra. BLEU được xây dựng để dịch thuật và dựa vào độ chính xác; ROUGE được xây dựng để tóm tắt và dựa vào việc thu hồi.

Số liệu nào ban đầu được thiết kế cho dịch máy và nhấn mạnh độ chính xác?

BLEU được tạo ra để dịch và dựa trên độ chính xác n-gram đã được sửa đổi với mức phạt ngắn gọn.

ROUGE chủ yếu hướng tới điều gì?

ROUGE là viết tắt của Nghiên cứu theo định hướng thu hồi để đánh giá ý chính và nhấn mạnh mức độ tham chiếu được nắm bắt.

Hình phạt ngắn gọn của BLEU ngăn cản điều gì?

Hình phạt ngắn gọn làm giảm BLEU khi ứng viên ngắn hơn tham chiếu, ngăn hệ thống tăng độ chính xác với đầu ra ngắn gọn.

ROUGE-L đo lường những gì?

ROUGE-L sử dụng dãy con chung dài nhất, thưởng cho các trận đấu theo thứ tự đồng thời cho phép các khoảng trống.

Hạn chế chung chính của cả BLEU và ROUGE là gì?

Cả hai đều dựa vào việc so khớp từ/n-gram chính xác, do đó, chúng đánh giá thấp các cách diễn giải hợp lệ khác biệt về mặt từ vựng với tham chiếu.