Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Điểm chuẩn mới phát hiện các tác nhân AI chặn sai công việc được phê duyệt 28% thời gian

Bản in trước giới thiệu SteerBench-Work, một bài kiểm tra 106 kịch bản về thời điểm tác nhân AI quyết định hành động hoặc tạm dừng để xem xét. Trên 30 điều kiện mô hình, các tác giả báo cáo rằng việc giữ sai tác phẩm đã được xử lý phổ biến hơn khoảng 28 lần so với việc cho phép sai tác phẩm không an toàn.

7 min readRead the primary source
Source-provided image accompanying New Benchmark Finds AI Agents Wrongly Block Approved Work 28% of the Time
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.12654
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Điểm chuẩn
Một bài kiểm tra hoặc tập dữ liệu được tiêu chuẩn hóa dùng để đo lường và so sánh hiệu suất của mô hình.
Tính toán thời gian suy luận
Lượng năng lượng xử lý tiêu thụ trong khi tạo ra mỗi phản hồi.
Con người trong vòng lặp
Quy trình làm việc trong đó con người xem xét, hướng dẫn hoặc ghi đè kết quả đầu ra của AI.
Tự kiểm traCâu đố về đại lý AI

Chuyện gì đã xảy ra

Các nhà nghiên cứu Oguz Serdar và Cuneyt Mertayak đã đăng một bản in trước mô tả SteerBench-Work, một chuẩn mực cho quyết định trước khi cam kết "tiến hành hoặc giữ" trong các tác nhân AI tại nơi làm việc. Họ báo cáo rằng trên 30 điều kiện của mô hình, các mô hình được ủy quyền sai, làm việc có bằng chứng rõ ràng trên 28,1% cơ hội và cho phép làm việc không an toàn một cách sai lầm trên 1,0%.

Hai nhà nghiên cứu, Oguz Serdar và Cuneyt Mertayak, đã đăng bản in trước lên arXiv vào ngày 12 tháng 8 năm 2026 giới thiệu SteerBench-Work, một điểm chuẩn được xây dựng xung quanh một quyết định duy nhất trong quy trình làm việc dài hạn của tác nhân AI: thực hiện một hành động hay giữ nó để xem xét con người hoặc chính sách. Các tác giả gọi đây là quyết định chỉ đạo và đặt nó ở ranh giới hành động - điểm ngay trước khi đại lý gửi email, hợp nhất yêu cầu kéo hoặc chuyển khoản thanh toán. Điểm chuẩn không cho biết liệu một tổng đài viên có thể hoàn thành nhiệm vụ hay không. Nó tính điểm liệu tác nhân có vượt qua hoặc giữ đúng ranh giới đó hay không.

Bản phát hành được mô tả trong bản tóm tắt có nhãn v2026-05 và chứa 106 kịch bản bao gồm các hoạt động của nhà phát triển, dịch vụ khách hàng, tài chính, pháp lý, y tế, nhân sự và bảo mật. Các kịch bản được neo trong các sự cố công cộng. Mỗi cái được ghép nối với cái mà các tác giả gọi là tấm gương đảo ngược bằng chứng - một phiên bản của cùng một tình huống trong đó bằng chứng cơ bản chỉ ra hướng khác - cùng với các biện pháp kiểm soát hiệu chuẩn. Các nhãn được phân chia gần như đồng đều giữa tiếp tục và giữ, điều mà các tác giả cho là có chủ ý: nó đưa ra hai hướng lỗi gần như có cùng số cơ hội xảy ra, do đó, một mô hình không thể đạt điểm cao chỉ bằng cách mặc định thận trọng. Trong mỗi mục, một mô hình được hiển thị một hành động được đề xuất và bằng chứng sẵn có, đồng thời trả về quyết định cổng.

Trên 30 điều kiện mô hình, các tác giả báo cáo rằng các lỗi gần như xảy ra hoàn toàn theo một hướng. Các mô hình được ủy quyền sai, có bằng chứng rõ ràng thực hiện 28,1% cơ hội, trong khi cho phép thực hiện sai công việc không an toàn trên 1,0%. Theo bản tóm tắt, loại khó nhất là cái mà các tác giả gọi là cam kết giải quyết rủi ro: các trường hợp kích hoạt rủi ro thực sự được kích hoạt nhưng bằng chứng đã được ký hoặc có cấu trúc đã loại bỏ nó và câu trả lời đúng là tiếp tục. Hiệu suất cũng có sự khác biệt rõ rệt giữa các sự cố nổi tiếng và tấm gương của chúng - 98,5% đối với chính các sự cố so với 63,8% đối với các phiên bản đảo ngược bằng chứng.

Các tác giả rút ra sự khác biệt sâu hơn giữa khả năng chung và hiệu chuẩn lái. Họ viết, các mô hình có khả năng cao hơn thường từ chối quá mức ở ranh giới cam kết và lý do bổ sung có thể sửa chữa một cổng yếu trong khi để lại một cổng đã được hiệu chỉnh phẳng. Bản tóm tắt trỏ đến bảng xếp hạng công khai nhưng trang nguồn hiển thị địa chỉ dưới dạng phần giữ chỗ thay vì liên kết đang hoạt động.

Một số điều không được thiết lập bởi các tài liệu có sẵn ở đây. Bản tóm tắt không nêu tên các mô hình được thử nghiệm, không xác định những gì được coi là "điều kiện mô hình" riêng biệt trong số 30 mô hình và không đưa ra phân tích theo từng miền hoặc từng mô hình. Nó không mô tả ai đã viết nhãn sự thật hoặc cách giải quyết những bất đồng và nhãn phiên bản v2026-05 không được giải thích về ngày nộp hồ sơ vào tháng 8. Đây là bản in lại phiên bản một mà không có dấu hiệu đánh giá ngang hàng và không có số liệu nào được sao chép độc lập.

Chi tiết nguồn: arxiv.org

Tại sao nó quan trọng

Hầu hết các thử nghiệm an toàn của tác nhân đều đo lường xem liệu mô hình có chặn các hành động có hại hay không. Công việc này đo lường cả hai hướng lỗi và phát hiện ra lỗi chủ yếu là do chặn quá mức, gây ra chi phí vận hành thực tế và có thể đẩy con người vào tình trạng phải dập cao su. Các con số đến từ một bản in trước chưa được xem xét và chưa được xác minh độc lập.

Các tác nhân AI ngày càng được triển khai để thực hiện các hành động thay vì chỉ tạo ra văn bản và thời điểm mà một đề xuất trở thành tác động không thể đảo ngược chính là nơi rủi ro thực sự xảy ra. Rất nhiều công việc bảo mật đại lý đã xuất bản đặt ra một câu hỏi - liệu thương hiệu có từ chối điều nguy hiểm không? - và một hệ thống từ chối mọi thứ sẽ đạt điểm hoàn hảo cho câu hỏi đó trong khi lại vô dụng. Bằng cách cân bằng các nhãn tiến hành và giữ và báo cáo cả hai tỷ lệ lỗi, điểm chuẩn này đo lường sự cân bằng thay vì một bên của nó.

Nếu sự bất đối xứng được báo cáo khái quát hóa thì vấn đề thực tế trong việc triển khai tác nhân doanh nghiệp có thể gần với tình trạng chặn quá mức hơn là hành động chạy trốn. Việc giữ sai không được miễn phí. Mỗi một tuyến đường hoạt động trở lại với một người, điều này làm xói mòn trường hợp hiệu quả để tự động hóa nhiệm vụ và tăng thêm độ trễ cho các quy trình như giải quyết yêu cầu hoặc xem xét mã mà bản thân sự chậm trễ đã phải trả giá. Ngoài ra còn có một rủi ro tinh vi hơn: hàng đợi đánh giá chứa đầy những leo thang không cần thiết sẽ huấn luyện người đánh giá phê duyệt nhanh chóng, điều này làm suy yếu sự giám sát của con người mà cơ chế lưu giữ tồn tại để cung cấp. Hiệu ứng xuôi dòng đó là một suy luận hợp lý từ quá trình thiết lập, không phải là thứ mà điểm chuẩn đo lường.

Khoảng cách giữa 98,5% về các sự cố nổi tiếng và 63,8% về những tấm gương đảo ngược bằng chứng của họ là kết quả đáng xem xét kỹ lưỡng nhất. Nó nhất quán với các mô hình nhận dạng hình dạng của một sai sót được ghi chép rõ ràng và phản hồi lại sự nhận biết đó hơn là đọc các bằng chứng trước mặt chúng. Nếu cách đọc đó được giữ nguyên, thì cách người mua nên giải thích điểm an toàn của đại lý nói chung sẽ phức tạp: một mô hình có thể trông đáng tin cậy trong các tình huống giống với những câu chuyện cảnh báo đã được công bố trong khi xử lý kém cùng một tình huống mang tính cấu trúc khi các sự kiện được sắp xếp lại. Danh mục "cam kết giải quyết rủi ro" của tác giả kiểm tra chính xác điều này - bằng chứng tồn tại cho thấy rủi ro đã được kích hoạt và mô hình phải thực sự xử lý nó.

Những phát hiện này cũng liên quan đến cách viết các yêu cầu của con người trong vòng lặp. Các chính sách bắt buộc phải xem xét các danh mục hành động coi cổng là mặc định an toàn. Công việc này cho thấy cổng có tỷ lệ lỗi riêng, theo hướng chặn công việc đã được dọn dẹp và tỷ lệ đó phải được đo thay vì giả định là gần bằng 0.

Cân nhắc tất cả những điều này: điểm chuẩn đánh giá một phán đoán trước khi cam kết dựa trên một gói bằng chứng được tuyển chọn, chứ không phải một tác nhân vận hành một vòng lặp công cụ thực sự với thông tin không đầy đủ mà nó phải tự thu thập. Việc triển khai thực sự cũng nằm sau các hệ thống cấp phép và bối cảnh tổ chức mà các kịch bản không thể thể hiện đầy đủ. Liệu 106 kịch bản được xây dựng, dù được cố định cẩn thận đến đâu, việc dự đoán hành vi trong sản xuất vẫn là một câu hỏi mở và những tuyên bố ở đây là của riêng các tác giả.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Agents Quiz

What is the most accurate way to describe what AI Agents can do today?

Xem gì tiếp theo

Liệu toàn bộ bài báo, tập dữ liệu và bảng xếp hạng có xác định được các mô hình được thử nghiệm hay không; liệu các nhóm độc lập có tái tạo được khoảng cách từ chối quá mức hay không; liệu các kết quả phản chiếu ngược bằng chứng có giữ vững như một dấu hiệu của sự khớp mẫu hay không; và liệu người mua và cơ quan quản lý có bắt đầu coi việc nắm giữ sai như một thất bại được đo lường thay vì một mặc định an toàn hay không.

Điều ngay lập tức nhất để tìm kiếm là tiết lộ. Toàn bộ bài báo, bất kỳ tập dữ liệu hoặc mã nào được phát hành và bảng xếp hạng, các tài liệu tham khảo tóm tắt sẽ cho biết mô hình nào đã được kiểm tra, cách tạo ra 30 điều kiện và cách phân bổ con số 28,1% trên các mô hình và miền. Một con số tổng hợp bao gồm 30 điều kiện có thể che giấu sự khác biệt lớn và câu hỏi thực tế đối với bất kỳ ai chọn mô hình là hệ thống nào nằm ở đầu nào của phạm vi đó.

Sự sao chép độc lập quan trọng hơn con số tiêu đề. Theo dõi các nhóm khác đang chạy các kịch bản, để xem xét kỹ lưỡng các nhãn thực tế cơ bản về các trường hợp "cam kết được giải quyết rủi ro" khó nhất và để biết liệu khoảng cách giữa sự cố và gương có vượt qua được thử nghiệm của những người không xây dựng điểm chuẩn hay không. Khoảng trống đó là tuyên bố có tính hệ quả nhất của bài báo, và nó cũng là lỗ hổng phụ thuộc nhiều nhất vào cách chế tạo những chiếc gương.

Cũng đáng theo dõi là liệu việc chuyển khung một bước hay không. Một mô hình được yêu cầu thực hiện một hành động được đề xuất với bằng chứng được cung cấp sẽ ở vị trí khác với một tác nhân đang thực hiện nhiệm vụ phải quyết định nên thu thập bằng chứng nào trước khi thực hiện. Công việc tiếp theo là đặt các kịch bản tương tự bên trong vòng lặp tác nhân đầy đủ sẽ kiểm tra xem liệu hiệu chuẩn được đo ở đây có dự đoán được hành vi thực tế hay không.

Về mặt áp dụng, câu hỏi đặt ra là liệu tỷ lệ giữ sai có được đưa vào thẻ mua sắm và thẻ hệ thống cùng với tỷ lệ từ chối hay không và liệu các nhà phát triển mô hình có bắt đầu điều chỉnh để hiệu chỉnh ở ranh giới hành động thay vì chỉ thận trọng hay không. Tuyên bố của các tác giả rằng lý luận bổ sung giúp các cổng yếu nhưng chưa được hiệu chỉnh, nếu được xác nhận, sẽ đi ngược lại giả định rằng việc tính toán nhiều thời gian suy luận hơn sẽ cải thiện khả năng phán đoán liên quan đến an toàn một cách đáng tin cậy.

Cuối cùng, xem phiên bản. Một điểm chuẩn được gắn nhãn v2026-05 và được neo giữ trong các sự cố công cộng phải đối mặt với vấn đề ô nhiễm khi các kịch bản của nó được lưu hành và các mô hình trong tương lai sẽ tập luyện dựa trên chúng. Cách các tác giả làm mới bộ dữ liệu - và liệu hiệu suất phản chiếu có cải thiện thông qua mức tăng lý luận thực sự hay thông qua mức độ hiển thị hay không - sẽ quyết định xem các con số có ý nghĩa như ngày nay trong bao lâu.

Hướng dẫn và câu hỏi liên quan

Đại lý AIĐạo đức AIGiải thích về mô hình AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôi
Tìm thấy điều này hữu ích?