Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Bài báo HIRA báo cáo việc đánh giá có chọn lọc của con người đã cải thiện việc phân loại tài liệu AI trong cài đặt được quy định

Bản in trước arXiv mới mô tả HIRA, một hệ thống phân loại AI dựa trên truy xuất giúp định tuyến các tài liệu không chắc chắn đến mô hình ngôn ngữ địa phương hoặc người đánh giá. Các tác giả báo cáo điểm Macro-F1 cao hơn đồng thời giảm số lượng tài liệu cần con người chỉnh sửa và số lượng lệnh gọi mô hình ngôn ngữ.

5 min readRead the primary source
Source-page capture accompanying HIRA paper reports selective human review improved AI document classification in regulated settings
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.21792
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Phân loại
Nhiệm vụ trong đó mô hình gán đầu vào cho một hoặc nhiều danh mục được xác định trước.
OCR (Nhận dạng ký tự quang học)
Công nghệ chuyển đổi văn bản trong hình ảnh hoặc quét thành văn bản có thể đọc được bằng máy.
Mô hình ngôn ngữ lớn (LLM)
Một mô hình ngôn ngữ được đào tạo trên kho văn bản lớn để tạo và phân tích văn bản.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

Bản in trước arXiv giới thiệu HIRA, một hệ thống AI tại chỗ, không cần đào tạo để phân loại tài liệu trong các ngành được quản lý. Nó kết hợp truy xuất từ ​​khóa từ văn bản OCR, nhúng văn bản dày đặc và trình bày ở cấp độ hình ảnh, sau đó sử dụng mô hình ngôn ngữ được lưu trữ cục bộ để xác minh các trường hợp không chắc chắn trước khi chuyển chúng cho người đánh giá. Các tác giả báo cáo kết quả trên một tập hợp tài chính thương mại tư nhân gồm 80 loại và tiêu chuẩn Thuốc lá-3482 đã được hiệu chỉnh.

Bài viết mô tả HIRA như một tầng tăng cường truy xuất tại chỗ, không cần đào tạo để phân loại tài liệu. Giai đoạn đầu tiên của nó kết hợp ba tín hiệu: tìm kiếm BM25 trên văn bản OCR, nhúng văn bản dày đặc và biểu diễn ở cấp độ hình ảnh. Các tín hiệu này được kết hợp bằng cách sử dụng phản ứng tổng hợp xếp hạng đối ứng có trọng số được hiệu chỉnh xác thực. Hệ thống phân loại tài liệu trực tiếp khi độ tin cậy truy xuất cao. Các tài liệu được đánh giá là không chắc chắn hoặc dễ gây nhầm lẫn về mặt trực quan sẽ được chuyển đến trình xác minh mô hình ngôn ngữ lớn được lưu trữ cục bộ, nơi nhận văn bản OCR, các ví dụ được truy xuất, mô tả nhãn và các thuật ngữ liên quan đến khả năng gây nhầm lẫn. Nếu người xác minh vẫn không chắc chắn, tài liệu sẽ được gửi đến người đánh giá.

Các tác giả nói rằng những chỉnh sửa của con người được giữ lại dưới dạng các ví dụ truy xuất có trọng số biên thay vì được sử dụng để cập nhật các tham số mô hình. Những chỉnh sửa đó cũng cập nhật biểu đồ nhầm lẫn được làm mịn bằng Dirichlet, nhằm mục đích giúp phân tầng xử lý sự mơ hồ về phân loại định kỳ. Về mặt thực tế, thiết kế được báo cáo chuyển sự thích ứng từ đào tạo lại mô hình sang cập nhật bộ nhớ truy xuất của hệ thống và thể hiện những nhầm lẫn phổ biến của nó. Nguồn trình bày đây là một cách để giải quyết các nhãn khởi đầu hạn chế và khả năng đánh giá khan hiếm trong quá trình triển khai theo quy định, nhưng bản tóm tắt không cung cấp đủ chi tiết để đánh giá gánh nặng triển khai hoặc quy trình quản trị.

Trên kho tài liệu thương mại-tài chính loại 80 tư nhân, bài báo báo cáo việc xử lý luồng sản xuất 30.233 tài liệu trong khi yêu cầu con người chỉnh sửa đối với 1.945 tài liệu, tương đương 6,4% luồng. Nó báo cáo rằng Macro-F1 đã tăng từ 0,6218 lên 0,8548. Trên điểm chuẩn Tobacco-3482 đã sửa, HIRA được báo cáo đã đạt được Macro-F1 là 0,9423 khi sử dụng trình xác minh DeepSeek-R1-Distill-Qwen-32B được lưu trữ cục bộ. Bài báo cho biết con số này cao hơn 17,4 điểm phần trăm so với đường cơ sở của mô hình ngôn ngữ không được bắn, trong khi trình xác minh được gọi cho khoảng 40% tài liệu và tổng số lệnh gọi mô hình ngôn ngữ đã giảm khoảng 60%. Nguồn xác định tác phẩm là phiên bản arXiv được gửi vào ngày 22 tháng 8 năm 2026 và liệt kê CIKM 2026 trong nhận xét của mình; nó không mô tả trạng thái đánh giá ngang hàng hoặc xác nhận bên ngoài.

Chi tiết nguồn: arxiv.org ↗

Tại sao nó quan trọng

Bài viết đề cập đến một vấn đề triển khai thực tế: các tổ chức được quản lý có thể có nhãn hạn chế, việc di chuyển dữ liệu bị hạn chế, người đánh giá khan hiếm và quy trình quản trị mô hình tốn kém. Kết quả được báo cáo của nó cho thấy bộ nhớ truy xuất và phản hồi có chọn lọc của con người có thể cải thiện việc phân loại mà không cần thay đổi trọng số mô hình nhiều lần. Các phát hiện vẫn là tuyên bố từ bản in trước của arXiv và không chứng minh rằng HIRA sẽ hoạt động tương tự trên các tổ chức, loại tài liệu hoặc điều kiện hoạt động khác.

Ý nghĩa thực tế trọng tâm là các tổ chức có thể không cần gửi mọi tài liệu thông qua mô hình ngôn ngữ lớn hoặc đào tạo lại bộ phân loại nhiều lần để cải thiện hiệu suất trong các trường hợp dài. Theo báo cáo của HIRA, tầng dự trữ sẽ tốn kém hơn hoặc có nhiều bước xem xét chuyên sâu hơn đối với các tài liệu có vẻ khó khăn. Nếu kết quả khái quát hóa, điều đó có thể làm giảm lượng tài liệu nhạy cảm được mô hình ngôn ngữ xử lý, hạn chế hàng đợi của người đánh giá và giúp việc ghi lại cải tiến gia tăng trở nên dễ dàng hơn. Đó là những tác động tiềm tàng của thiết kế được báo cáo, chứ không phải kết quả được thiết lập độc lập.

Cấu trúc con người trong vòng lặp cũng rất quan trọng đối với trách nhiệm giải trình. Hệ thống không coi mô hình ngôn ngữ là cơ quan có thẩm quyền cuối cùng trong mọi trường hợp không chắc chắn: các trường hợp chưa được giải quyết sẽ được chuyển sang đánh giá của con người và những chỉnh sửa đó trở thành một phần của bộ nhớ truy xuất. Trên nhóm Thuốc lá-3482, bài báo báo cáo rằng 518 chỉnh sửa của con người, chiếm 24,8% tổng số, là đủ để HIRA khớp với một oracle nhóm được gắn nhãn đầy đủ trong đó tất cả 2.086 tài liệu được lập chỉ mục bằng nhãn sự thật. Kết quả này cho thấy rằng phản hồi có chọn lọc có thể mang lại nhiều giá trị cho việc ghi nhãn hoàn chỉnh trong thử nghiệm đó, mặc dù việc so sánh phụ thuộc vào thiết lập đánh giá và tiên tri đã chọn của bài báo.

Công việc này phù hợp với các cài đặt được quy định vì các tác giả thiết kế rõ ràng xung quanh nơi lưu trữ dữ liệu và lưu trữ cục bộ. Trình xác minh cục bộ có thể thực hiện một số thỏa thuận triển khai dễ dàng hơn so với việc gửi tài liệu đến một dịch vụ bên ngoài, nhưng nguồn không thiết lập sự tuân thủ pháp lý, tính bảo mật, hiệu quả kiểm soát truy cập hoặc khả năng chống rò rỉ dữ liệu. Nó cũng không cho thấy rằng hệ thống đã loại bỏ được những sai sót hoặc sai sót trong phân loại. Macro-F1 tóm tắt hiệu suất giữa các lớp, do đó, bản thân nó không tiết lộ danh mục tài liệu nào còn yếu, liệu các lớp hiếm có cải thiện hay không hoặc liệu các lỗi có gây ra hậu quả không đồng đều hay không. Những hạn chế đó rất quan trọng khi việc phân loại ảnh hưởng đến quá trình xử lý tài chính, đánh giá tuân thủ hoặc các quy trình công việc mang tính hệ quả khác.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Bước tiếp theo quan trọng nhất là thử nghiệm độc lập trên các bộ sưu tập tài liệu được quản lý bổ sung, với báo cáo rõ ràng hơn về lỗi, độ trễ, chi phí vận hành, kiểm soát quyền riêng tư và khối lượng công việc của người đánh giá. Nguồn không tiết lộ toàn bộ thiết kế hệ thống, sự phân bổ nhãn và lỗi hoặc hiệu suất thay đổi như thế nào khi tài liệu khác với các ví dụ được lưu trữ trong bộ nhớ truy xuất. Nó cũng không xác định liệu phương pháp này có được triển khai trong môi trường sản xuất được quản lý ngoài luồng sản xuất được báo cáo hay không.

Việc sao chép độc lập sẽ kiểm tra xem liệu lợi nhuận được báo cáo có tồn tại bên ngoài dòng tài chính thương mại tư nhân của tác giả và tiêu chuẩn Thuốc lá-3482 đã được sửa chữa hay không. Các biến quan trọng bao gồm chất lượng tài liệu, lỗi OCR, mất cân bằng lớp, thay đổi mẫu tài liệu, tài liệu đa ngôn ngữ và các danh mục chưa từng thấy trước đây. Nguồn không cho biết có bao nhiêu ví dụ có sẵn trước khi bắt đầu phản hồi, dữ liệu xác thực được tách ra khỏi nhóm truy xuất như thế nào hoặc liệu bất kỳ rò rỉ thông tin nào có thể ảnh hưởng đến kết quả điểm chuẩn hay không. Những chi tiết đó sẽ cần thiết để đánh giá mức độ áp dụng của các con số.

Báo cáo hoạt động là một câu hỏi mở khác. Bản tóm tắt đưa ra tỷ lệ tài liệu được gửi để chỉnh sửa bởi con người và mức giảm các cuộc gọi mô hình ngôn ngữ, nhưng nó không cung cấp độ trễ từ đầu đến cuối, yêu cầu tính toán, tốc độ tăng trưởng lưu trữ, thời gian đánh giá cho mỗi trường hợp hoặc tổng chi phí. Nó cũng không so sánh tầng với các hệ thống truy xuất đơn giản hơn, các bộ phân loại được giám sát thông thường hoặc các mô hình ngôn ngữ địa phương thay thế. Bởi vì HIRA lưu trữ các sửa đổi dưới dạng mẫu truy xuất nên các đánh giá trong tương lai nên kiểm tra xem liệu các lỗi ban đầu hoặc nhãn sai lệch có thể được hiển thị và củng cố nhiều lần hay không cũng như cách quản trị viên loại bỏ các ví dụ lỗi thời hoặc không chính xác.

Tuyên bố quản trị của bài báo cũng cần thử nghiệm thực tế. Việc triển khai theo quy định sẽ cần có hồ sơ về bằng chứng nào hỗ trợ cho từng phân loại, lý do tài liệu được chuyển lên cấp cao hơn, người xác minh trả lời gì và việc điều chỉnh của con người đã thay đổi các quyết định sau này như thế nào. Nguồn tin cho biết HIRA sử dụng độ tin cậy, các thuật ngữ dành riêng cho sự nhầm lẫn và dự phòng đánh giá của con người, nhưng nó không nêu rõ cách chọn ngưỡng tin cậy, tần suất người đánh giá ghi đè hệ thống hoặc điều gì xảy ra khi bằng chứng truy xuất xung đột với người xác minh. Cho đến khi những câu hỏi đó được trả lời và kết quả được nhân rộng, kết luận được hỗ trợ mạnh mẽ nhất vẫn còn hạn chế: bản in trước này báo cáo một cấu trúc đánh giá có chọn lọc đầy hứa hẹn và kết quả đáng kể trên hai cài đặt đánh giá đã nêu, không phải là một giải pháp chung đã được chứng minh để phân loại tài liệu được quản lý.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIĐào tạo AIĐạo đức AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?