Kembali ke Berita
ProdukAI Understanding pengarahan

Anthropic Mengatakan Fabel 5 Kemunduran Biologi Turun 85%

Anthropic mengatakan pengklasifikasi keselamatan yang telah dilatih ulang mengurangi kesalahan terkait biologi sekitar 85%, sehingga memungkinkan lebih banyak pertanyaan mengenai kesehatan dan pendidikan sekaligus membatasi penelitian penggunaan ganda.

5 min readRead the primary source
Dokumen sumber utamaSumber direkam
Penerbit
Anthropic's Fable 5 biology safeguards announcement
Tautan sumber
anthropic.comhttps://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

API (Antarmuka Pemrograman Aplikasi)
Cara terstruktur bagi satu sistem perangkat lunak untuk mengirim permintaan dan menerima tanggapan dari sistem lain.
Kumpulan Evaluasi
Kumpulan data yang digunakan untuk mengukur kualitas model setelah pelatihan.
Pengklasifikasi
Model yang dirancang khusus untuk tugas klasifikasi.
Uji diri Anda sendiriKuis Keamanan AI

Apa yang terjadi

Anthropic memperbarui perlindungan biologi Claude Fabel 5 pada tanggal 7 Agustus, mempersempit pengklasifikasi yang telah mengalihkan hampir setiap kueri biologi ke model yang kurang mampu secara biologis.

Saat pengklasifikasi menandai permintaan, Anthropic merutekannya dari Fable 5 ke Opus 5. Perusahaan mengatakan Opus 5 tetap mampu untuk penggunaan umum tetapi memberikan lebih sedikit bantuan operasional pada biologi tingkat lanjut, sehingga mengurangi nilai sistem bagi seseorang yang melakukan pekerjaan berbahaya.

Anthropic mengatakan pihaknya menulis ulang konstitusi pengklasifikasi, mengumpulkan masukan dari pakar internal dan eksternal, membuat data pelatihan baru, melatih ulang pengklasifikasi, dan memeriksa apakah pengklasifikasi tersebut secara umum masih memicu permintaan penelitian yang berbahaya dan penggunaan ganda. Dalam pengujian yang dilakukan perusahaan, pembaruan ini mengurangi kesalahan terkait biologi sekitar 85% di seluruh produknya.

The change follows a deliberately conservative launch posture. Anthropic says Fable 5 initially routed almost every biology request to Opus 5 because the company preferred a broad safety boundary while it learned where benign health and education questions were being caught. The August update narrows that boundary through a separate instead of changing the model's underlying biology capability. That makes the release a policy-and-routing change, not evidence that Fable 5 has become a clinically validated biology assistant.

Perubahan ini dimaksudkan agar Fable 5 menjawab lebih banyak pertanyaan kesehatan, klinis, dan pendidikan sehari-hari. Anthropic mengatakan akses biasa masih terbatas pada bidang penggunaan ganda termasuk virologi, toksikologi, dan desain molekuler, sehingga model tersebut belum tersedia melalui jalur tersebut untuk penelitian biologi profesional atau pengembangan obat.

Detail sumber: Anthropic's Fable 5 biology safeguards announcement ↗

Mengapa itu penting

Pembaruan ini merupakan ujian praktis apakah upaya perlindungan model perbatasan dapat menjadi lebih tepat tanpa hanya memilih antara akses yang luas dan penolakan yang luas.

Filter kasar dapat mengurangi risiko dengan cepat, namun juga dapat memblokir pelajar, pasien, pendidik, dan profesional kesehatan yang pertanyaannya menggunakan bahasa teknis yang sama dengan penelitian sensitif. Anthropic memilih titik awal konservatif tersebut ketika merilis Fabel 5, lalu menggunakan kebijakan yang lebih rinci dan contoh pelatihan baru untuk memindahkan batasan bagi permintaan yang tidak berbahaya.

Perubahan pengalaman pengguna berbeda-beda menurut produk karena biologi hanyalah salah satu penyebab fallback. Anthropic memperkirakan bahwa total semua jenis fallback akan turun sekitar 67% di Claude.ai, 55% di Cowork, 17% di Kode Claude, dan 7% di Platform Claude. Itu adalah pengukuran perusahaan, bukan hasil audit independen.

Mekanismenya juga penting: permintaan yang ditandai akan dialihkan, bukan dijawab oleh Fabel 5. Hal ini mempertahankan akses ke model umum sambil menahan kemampuan yang dianggap paling mengkhawatirkan oleh Anthropic, namun tidak menetapkan bahwa setiap jawaban kesehatan yang diizinkan adalah akurat atau sesuai untuk keputusan klinis.

For organizations, the practical question is how the boundary behaves across contexts. A student asking for a plain-language explanation, a clinician checking terminology, and a researcher requesting an experimental protocol may use overlapping words while presenting very different risk. Anthropic's routing approach can preserve a safer general answer for the first two cases, but only if the recognizes intent, conversation history, and requested operational detail without turning a legitimate professional workflow into an opaque denial.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Pemeriksaan Konsep Interaktif+10 Points
AI Safety Quiz

What is 'specification gaming' in AI systems?

Apa yang harus ditonton selanjutnya

Perhatikan bukti bahwa tingkat fallback yang lebih rendah diimbangi dengan deteksi yang kuat atas permintaan yang benar-benar berbahaya, ditambah aturan yang jelas untuk akses penelitian yang tepercaya.

Anthropic tidak mempublikasikan kumpulan evaluasi, tingkat negatif palsu, atau replikasi independen dengan pengumuman ini. Perusahaan mengatakan hasil positif palsu akan tetap ada dan pengklasifikasi juga harus tahan terhadap upaya jailbreak, sehingga angka 85% mengukur lebih sedikit fallback daripada pengorbanan keamanan penuh.

Pengungkapan berguna berikutnya akan menunjukkan kinerja di seluruh parafrase, bahasa, percakapan multi-turn, dan alur kerja yang mendukung alat. Peneliti juga perlu mengetahui seberapa sering permintaan berbahaya melewati batas baru dan seberapa cepat pengklasifikasi diperbarui ketika bypass baru muncul.

Anthropic mengatakan pihaknya sedang mengembangkan jalur akses tepercaya untuk kemampuan biologi terdepan. Kredibilitas mereka akan bergantung pada siapa yang memenuhi syarat, pemantauan dan perlindungan privasi apa yang berlaku, bagaimana insiden ditinjau, dan apakah peneliti yang sah dapat menentang pembatasan yang salah.

The next disclosure should also explain how the is evaluated after deployment. A lower fallback rate can be achieved by reducing false positives, by shifting difficult cases to another model, or by missing more harmful requests; those outcomes have very different safety meanings. Useful reporting would include false-positive and false-negative estimates by request type, performance under multi-turn escalation and paraphrase, language coverage, handling of tool calls, and the process for updating the boundary after a jailbreak or an incident.

The user-facing promise should be tested with the same care as the safety boundary. Anthropic says the update should help with everyday health, clinical, and educational questions, but a lower fallback rate does not establish medical accuracy, appropriate triage, or suitability for professional decisions. Independent reviewers should sample allowed answers for unsupported certainty, missing safety advice, and harmful procedural detail, while also checking whether the fallback model communicates its limits clearly. The strongest evidence would compare matched requests before and after the change and publish enough anonymized examples for outside researchers to understand both the gains and the new failure modes.

That evidence should be reported separately for consumer chat, coding, agentic workflows, and the API because the same boundary may carry different tools, context windows, and user expectations in each product. A single blended fallback percentage can hide a meaningful regression in one surface behind improvement in another. Publishing the denominator, confidence intervals, and product-level counts would make the result useful to educators, clinicians, developers, and safety researchers rather than only to readers comparing one headline number.

Panduan & kuis terkait

Keamanan AIModel AI DijelaskanEtika AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI
Apakah ini berguna?