Chuyện gì đã xảy ra
Một bài báo arXiv giới thiệu J-Miner, một phương pháp khai thác kiến thức quyết định dành riêng cho nhiệm vụ từ các bộ phân loại mô hình ngôn ngữ được tinh chỉnh và mã hóa nó thành các quy tắc thực thi. Các tác giả báo cáo độ chính xác hành vi cao qua nhiều nhiệm vụ phân loại, nhưng bản ghi được cung cấp không xác định các nhiệm vụ, bộ dữ liệu, quy trình đánh giá hoặc xác thực độc lập.
J-Miner được trình bày trong bản ghi arXiv được cung cấp dưới dạng phương pháp trích xuất kiến thức quyết định theo nhiệm vụ cụ thể từ mô hình ngôn ngữ đã được tinh chỉnh dưới dạng trình phân loại văn bản. Các tác giả bắt đầu với một hạn chế của các bộ phân loại chuyên biệt này: mặc dù chúng có thể thực hiện các phán đoán phức tạp nhưng chúng thường chỉ hiển thị các nhãn cuối cùng của chúng. J-Miner cố gắng trình bày một phần kiến thức về quyết định đã học dưới dạng trình bày rõ ràng, có thể thực thi được. Nguồn mô tả đây là kiến thức ở cấp độ phân loại có thể được kiểm tra, xác thực và sử dụng lại ngoài trình phân loại ban đầu. Nó không mô tả kết quả như một bản tường trình đầy đủ về mọi quy trình nội bộ tạo ra một dự đoán riêng lẻ.
Phương thức này hoạt động dựa trên các tín hiệu bên trong thay vì chỉ dựa vào các từ được trình bày ở đầu vào. Theo bản tóm tắt, J-Miner khai thác các khái niệm được đặt tên ở cấp độ văn bản bằng cách tổng hợp các tín hiệu nội bộ phù hợp với từ vựng trên các lớp và vị trí mã thông báo. Sau đó, nó sử dụng các dự đoán của chính bộ phân loại để tìm hiểu các quy tắc quyết định thực thi đối với các khái niệm đó. Quá trình kết quả được mô tả như là chắt lọc các kết quả đọc nội bộ cục bộ thành một biểu diễn tri thức rõ ràng. Về mặt thực tế, bài báo đang cố gắng biến bằng chứng phân tán bên trong một bộ phân loại được tinh chỉnh thành một cấu trúc quy tắc có thể được chạy và kiểm tra riêng biệt. Nguồn không cung cấp cú pháp quy tắc, kho khái niệm, ví dụ về các quy tắc riêng lẻ hoặc đủ chi tiết kỹ thuật để đánh giá mức độ cần thiết của con người để diễn giải chúng.
Các tác giả báo cáo kết quả qua nhiều nhiệm vụ phân loại. Các quy tắc J-Miner tái tạo tới 98,3% các quyết định được đưa ra bởi các bộ phân loại nguồn và bài báo cho biết chúng đạt được độ chính xác hành vi cao hơn từ 6,0 đến 29,5 điểm phần trăm so với các quy tắc nhỏ gọn tương đương được học trực tiếp từ các từ đầu vào. Bài báo cũng báo cáo rằng kiến thức quyết định được trích xuất sẽ chuyển sang các mô hình sinh viên độc lập nhẹ. Những sinh viên đó sử dụng số lượng tham số nhiều hơn khoảng 1/24 so với bộ phân loại nguồn, trong khi vẫn giữ được 99,8% độ chính xác nhiệm vụ trung bình của bộ phân loại nguồn.
Những số liệu này là những tuyên bố trong bản gửi arXiv: bản ghi không xác định tổ hợp nhiệm vụ, cỡ mẫu, điều kiện so sánh chính xác, phân bổ lỗi hoặc liệu số liệu cao nhất áp dụng rộng rãi hay chỉ cho các nhiệm vụ cụ thể.
Tại sao nó quan trọng
Nếu được nhân rộng một cách độc lập, cách tiếp cận này có thể giúp các bộ phân loại mô hình ngôn ngữ chuyên dụng dễ dàng kiểm tra, xác thực và tái sử dụng hơn. Nó cũng gợi ý rằng một số hành vi của nhiệm vụ cụ thể có thể được chuyển sang các mô hình nhỏ hơn nhiều mà không làm giảm đáng kể độ chính xác trung bình được báo cáo. Các phát hiện không chứng minh được rằng các quy tắc được trích xuất giải thích đầy đủ hành vi của mô hình hoặc đã sẵn sàng để triển khai.
Nghiên cứu giải quyết một vấn đề hệ quả đối với việc sử dụng các mô hình ngôn ngữ chuyên ngành. Một bộ phân loại có thể chính xác trong khi tiết lộ rất ít về bằng chứng đằng sau nhãn của nó, điều này khiến việc kiểm tra, xác nhận hoặc điều chỉnh trở nên khó khăn hơn. Cách trình bày được đề xuất của J-Miner có thể cung cấp đối tượng cụ thể hơn cho các hoạt động đó: thay vì chỉ kiểm tra đầu ra của mô hình, người đánh giá có thể kiểm tra các khái niệm được đặt tên và quy tắc thực thi mà phương thức đó đã trích xuất. Khả năng đó phù hợp trực tiếp với các mục tiêu đã nêu của bài báo, nhưng nguồn được cung cấp sẽ thiết lập phương pháp và các thử nghiệm được báo cáo của nó chứ không phải là triển khai đã được chứng minh trong môi trường đặt cược cao.
Việc giảm tham số được báo cáo có thể quan trọng đối với khả năng di động và kiểm soát hoạt động nếu nó vượt quá các thử nghiệm. Một mô hình sinh viên sử dụng khoảng 1/24 số lượng tham số có thể dễ dàng chạy, đánh giá hoặc cập nhật hơn so với bộ phân loại được tinh chỉnh ban đầu. Nguồn này cũng tuyên bố rằng sinh viên giữ lại 99,8% độ chính xác nhiệm vụ trung bình của bộ phân loại nguồn, cho thấy rằng biểu diễn được trích xuất có thể bảo toàn phần lớn hành vi nhiệm vụ trong một triển khai nhỏ hơn. Kết quả đó không nên được coi là bằng chứng về độ tin cậy như nhau: độ chính xác trung bình có thể che giấu kết quả học tập không đồng đều giữa các lớp, nhóm học sinh, ví dụ và loại lỗi, đồng thời phần tóm tắt không cho biết liệu học sinh có mắc lại các lỗi giống nhau hay chỉ đơn thuần đạt được điểm tổng hợp tương tự.
Đóng góp tiềm năng quan trọng nhất là về mặt khái niệm cũng như thực tiễn. Kết quả của J-Miner cho thấy hành vi hữu ích của một nhiệm vụ cụ thể có thể được thể hiện đủ rõ ràng để thực thi bên ngoài mô hình đã thu được nó. Nếu được xác nhận, điều đó có thể hỗ trợ các hình thức kiểm tra mô hình, chuyển giao kiến thức và theo dõi thay đổi hẹp hơn. Nhưng việc so sánh các quyết định của bộ phân loại không giống như việc chứng minh rằng các khái niệm được trích xuất là nguyên nhân thực sự hoặc đầy đủ của các quyết định đó. Bài báo cho biết phân tích của nó tìm ra các khái niệm phản ánh bằng chứng ngữ nghĩa nội tại liên quan đến các quyết định nhiệm vụ; hồ sơ được cung cấp không chứng minh được tính đầy đủ về nguyên nhân, khả năng chống lại các mối tương quan sai lệch hoặc liệu một người có thể hiểu các quy tắc một cách đáng tin cậy mà không cần công cụ chuyên dụng hay không. Những hạn chế đó khiến phát hiện này nằm trong phạm trù nghiên cứu hơn là làm cho nó trở thành bằng chứng về khả năng diễn giải đã được giải quyết.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
In AI, what are a model's "parameters"?
Xem gì tiếp theo
Toàn bộ bài viết cần làm rõ các bộ dữ liệu, đường cơ sở, định dạng quy tắc, phân chia đánh giá, chi phí trích xuất và các trường hợp thất bại đằng sau kết quả được báo cáo. Cần có sự sao chép độc lập, cùng với các thử nghiệm theo sự thay đổi phân phối và trên các đầu vào không giống như dữ liệu huấn luyện. Vẫn chưa biết liệu J-Miner có khái quát hóa ngoài cài đặt phân loại văn bản được báo cáo hay có mã và mô hình có sẵn công khai hay không.
Ưu tiên xác minh đầu tiên là thiết kế đánh giá đầy đủ. Bản ghi được cung cấp không đặt tên cho các nhiệm vụ phân loại hoặc bộ dữ liệu, mô tả các mô hình nguồn, chỉ định cách chọn các khái niệm hoặc giải thích cách tính toán độ chính xác của hành vi và độ chính xác của nhiệm vụ. Người đọc nên tìm kiếm các quy trình đào tạo, xác nhận và kiểm tra; số lượng và loại nhãn; kích thước và độ phức tạp của các quy tắc được trích xuất; và các đường cơ sở chính xác được sử dụng để so sánh từ đầu vào. Mức tối đa được báo cáo là 98,3% và phạm vi từ 6,0 đến 29,5 điểm phần trăm cần bối cảnh đó trước khi chúng có thể được so sánh giữa các nhiệm vụ hoặc được coi là đại diện.
Các thử nghiệm về độ chắc chắn và khả năng diễn giải sẽ xác định mức độ tin cậy thực tế mà phương pháp này xứng đáng được nhận. Bằng chứng tiếp theo hữu ích sẽ bao gồm các bản sao độc lập, đánh giá dữ liệu mới và phân tích các lỗi thay vì chỉ có độ chính xác tổng hợp. Nguồn không báo cáo cách J-Miner hoạt động khi ngôn ngữ thay đổi, khi các ví dụ nằm ngoài phân phối đào tạo hoặc khi tín hiệu rõ ràng của bộ phân loại phản ánh mối tương quan giả. Nó cũng không cho biết liệu các khái niệm được đặt tên có còn ổn định trên các phiên bản mô hình, hạt giống ngẫu nhiên, nhiệm vụ hoặc tập dữ liệu huấn luyện hay không. Một hệ thống quy tắc mô phỏng chặt chẽ một bộ phân loại trên tập đánh giá của nó vẫn có thể dễ vỡ hoặc khó diễn giải trong các điều kiện khác.
Phạm vi của yêu cầu cũng cần được thử nghiệm. Bài viết được cung cấp liên quan đến các bộ phân loại mô hình ngôn ngữ được tinh chỉnh và chuyển các báo cáo đến các sinh viên độc lập nhẹ để tái tạo và thực hiện cách trình bày từ văn bản thô. Nó không thiết lập khả năng ứng dụng cho các mô hình thế hệ mở, đa phương thức, hệ thống quyết định trực tuyến hoặc quy trình sản xuất. Hồ sơ cũng không đề cập đến mã công khai, điểm kiểm tra mô hình, cấp phép, độ trễ suy luận, chi phí trích xuất hoặc quy trình bảo trì. Những chi tiết đó sẽ xác định liệu J-Miner chủ yếu là một thử nghiệm về khả năng diễn giải, một phương pháp nén các bộ phân loại hay một công cụ hữu dụng cho các tổ chức cần hệ thống quyết định di động và có thể kiểm tra được.