Quay lại Tin tức
sản phẩmAI Understanding tóm tắt

Anthropic Cho biết dự phòng sinh học trong Fable 5 đã giảm 85%

Anthropic cho biết bộ phân loại an toàn được đào tạo lại đã giảm khoảng 85% các dự phòng liên quan đến sinh học, cho phép nhiều truy vấn về sức khỏe và giáo dục hơn trong khi vẫn hạn chế nghiên cứu sử dụng kép.

5 min readRead the primary source
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
Anthropic's Fable 5 biology safeguards announcement
Liên kết nguồn
anthropic.comhttps://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

API (Giao diện lập trình ứng dụng)
Một cách có cấu trúc để một hệ thống phần mềm gửi yêu cầu và nhận phản hồi từ hệ thống khác.
Bộ đánh giá
Một tập dữ liệu được giữ lại được sử dụng để đo lường chất lượng mô hình sau khi đào tạo.
Trình phân loại
Một mô hình được thiết kế đặc biệt cho nhiệm vụ phân loại.
Tự kiểm traCâu đố về an toàn AI

Chuyện gì đã xảy ra

Anthropic đã cập nhật Claude các biện pháp bảo vệ sinh học của Fable 5 vào ngày 7 tháng 8, thu hẹp bộ phân loại đã định tuyến lại hầu hết mọi truy vấn sinh học sang một mô hình kém khả năng sinh học hơn.

Khi trình phân loại gắn cờ một yêu cầu, Anthropic sẽ chuyển yêu cầu đó từ Fable 5 đến Opus 5. Công ty cho biết Opus 5 vẫn có khả năng sử dụng thông thường nhưng cung cấp ít trợ giúp vận hành hơn về sinh học nâng cao, làm giảm giá trị của hệ thống đối với những người đang theo đuổi công việc có hại.

Anthropic cho biết họ đã viết lại cấu trúc của trình phân loại, thu thập phản hồi từ các chuyên gia bên trong và bên ngoài, tạo dữ liệu đào tạo mới, đào tạo lại trình phân loại và kiểm tra xem nó vẫn thường kích hoạt các yêu cầu nghiên cứu có mục đích sử dụng kép và có hại. Trong thử nghiệm của công ty, bản cập nhật đã giảm khoảng 85% các dự phòng liên quan đến sinh học trên các sản phẩm của công ty.

The change follows a deliberately conservative launch posture. Anthropic says Fable 5 initially routed almost every biology request to Opus 5 because the company preferred a broad safety boundary while it learned where benign health and education questions were being caught. The August update narrows that boundary through a separate instead of changing the model's underlying biology capability. That makes the release a policy-and-routing change, not evidence that Fable 5 has become a clinically validated biology assistant.

Sự thay đổi này nhằm mục đích cho phép Fable 5 trả lời nhiều câu hỏi về sức khỏe, lâm sàng và giáo dục hàng ngày hơn. Anthropic cho biết quyền truy cập thông thường vẫn dành cho các lĩnh vực sử dụng kép bao gồm virus học, chất độc học và thiết kế phân tử, vì vậy mô hình này vẫn chưa sẵn có thông qua con đường đó cho nghiên cứu sinh học chuyên nghiệp hoặc phát triển thuốc.

Chi tiết nguồn: Anthropic's Fable 5 biology safeguards announcement ↗

Tại sao nó quan trọng

Bản cập nhật này là một thử nghiệm thực tế để xem liệu các biện pháp bảo vệ theo mô hình biên giới có thể trở nên chính xác hơn mà không cần phải lựa chọn giữa tiếp cận rộng rãi và từ chối rộng rãi hay không.

Bộ lọc thô có thể giảm rủi ro nhanh chóng nhưng cũng có thể chặn sinh viên, bệnh nhân, nhà giáo dục và chuyên gia chăm sóc sức khỏe có câu hỏi sử dụng ngôn ngữ kỹ thuật giống như nghiên cứu nhạy cảm. Anthropic đã chọn điểm khởi đầu thận trọng đó khi phát hành Fable 5, sau đó sử dụng chính sách chi tiết hơn và các ví dụ đào tạo mới để vượt qua ranh giới cho các yêu cầu vô hại.

Trải nghiệm người dùng thay đổi tùy theo sản phẩm vì sinh học chỉ là một nguyên nhân dẫn đến dự phòng. Anthropic ước tính rằng tổng số dự phòng thuộc mọi loại sẽ giảm khoảng 67% trên Claude.ai, 55% trong Cowork, 17% trong Claude Code và 7% trên Nền tảng Claude. Đó là những phép đo của công ty, không phải kết quả kiểm toán độc lập.

Cơ chế này cũng có vấn đề: một yêu cầu được gắn cờ sẽ được định tuyến lại thay vì được Fable 5 trả lời. Điều đó duy trì quyền truy cập vào mô hình chung trong khi giữ lại khả năng Anthropic được xem là đáng lo ngại nhất, nhưng nó không chứng minh rằng mọi câu trả lời về sức khỏe được phép đều chính xác hoặc phù hợp cho một quyết định lâm sàng.

For organizations, the practical question is how the boundary behaves across contexts. A student asking for a plain-language explanation, a clinician checking terminology, and a researcher requesting an experimental protocol may use overlapping words while presenting very different risk. Anthropic's routing approach can preserve a safer general answer for the first two cases, but only if the recognizes intent, conversation history, and requested operational detail without turning a legitimate professional workflow into an opaque denial.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Kiểm tra khái niệm tương tác+10 Points
AI Safety Quiz

What is 'specification gaming' in AI systems?

Xem gì tiếp theo

Theo dõi bằng chứng cho thấy tỷ lệ dự phòng thấp hơn tương ứng với khả năng phát hiện mạnh mẽ các yêu cầu thực sự nguy hiểm, cộng với các quy tắc rõ ràng về quyền truy cập nghiên cứu đáng tin cậy.

Anthropic đã không công bố bộ đánh giá, tỷ lệ âm tính giả hoặc bản sao độc lập kèm theo thông báo này. Công ty cho biết các kết quả dương tính giả sẽ vẫn còn và các bộ phân loại cũng phải chịu được các nỗ lực bẻ khóa, vì vậy con số 85% đo lường ít dự phòng hơn thay vì đánh đổi hoàn toàn về an toàn.

Thông tin tiết lộ hữu ích tiếp theo sẽ cho thấy hiệu quả của các phiên bản, ngôn ngữ, cuộc trò chuyện nhiều lượt và quy trình làm việc được hỗ trợ bởi công cụ. Các nhà nghiên cứu cũng cần biết tần suất một yêu cầu có hại vượt qua ranh giới mới và tốc độ cập nhật bộ phân loại khi các đường vòng mới xuất hiện.

Anthropic cho biết họ đang phát triển các lộ trình truy cập đáng tin cậy cho các khả năng sinh học tiên tiến. Độ tin cậy của họ sẽ phụ thuộc vào người đủ điều kiện, biện pháp giám sát và bảo vệ quyền riêng tư nào được áp dụng, cách xem xét sự cố và liệu các nhà nghiên cứu hợp pháp có thể thách thức một hạn chế không chính xác hay không.

The next disclosure should also explain how the is evaluated after deployment. A lower fallback rate can be achieved by reducing false positives, by shifting difficult cases to another model, or by missing more harmful requests; those outcomes have very different safety meanings. Useful reporting would include false-positive and false-negative estimates by request type, performance under multi-turn escalation and paraphrase, language coverage, handling of tool calls, and the process for updating the boundary after a jailbreak or an incident.

The user-facing promise should be tested with the same care as the safety boundary. Anthropic says the update should help with everyday health, clinical, and educational questions, but a lower fallback rate does not establish medical accuracy, appropriate triage, or suitability for professional decisions. Independent reviewers should sample allowed answers for unsupported certainty, missing safety advice, and harmful procedural detail, while also checking whether the fallback model communicates its limits clearly. The strongest evidence would compare matched requests before and after the change and publish enough anonymized examples for outside researchers to understand both the gains and the new failure modes.

That evidence should be reported separately for consumer chat, coding, agentic workflows, and the API because the same boundary may carry different tools, context windows, and user expectations in each product. A single blended fallback percentage can hide a meaningful regression in one surface behind improvement in another. Publishing the denominator, confidence intervals, and product-level counts would make the result useful to educators, clinicians, developers, and safety researchers rather than only to readers comparing one headline number.

Hướng dẫn và câu hỏi liên quan

An toàn AIGiải thích về mô hình AIĐạo đức AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?