Voltar às notícias
ProdutoInstruções AI Understanding

Anthropic diz que os substitutos da biologia da Fábula 5 caíram 85%

Anthropic afirma que um classificador de segurança retreinado reduziu as falhas relacionadas à biologia em cerca de 85%, permitindo mais consultas de saúde e educação, ao mesmo tempo que manteve restritas as pesquisas de dupla utilização.

5 min readRead the primary source
Documento de origem primáriaFonte registrada
Editora
Anthropic's Fable 5 biology safeguards announcement
Link da fonte
anthropic.comhttps://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

API (Interface de Programação de Aplicativo)
Uma maneira estruturada de um sistema de software enviar solicitações e receber respostas de outro sistema.
Conjunto de avaliação
Um conjunto de dados mantido usado para medir a qualidade do modelo após o treinamento.
Classificador
Um modelo projetado especificamente para tarefas de classificação.
Teste você mesmoQuestionário de segurança de IA

O que aconteceu

Anthropic atualizou as salvaguardas biológicas de Claude Fable 5 em 7 de agosto, restringindo um classificador que redirecionou quase todas as consultas biológicas para um modelo menos capaz biologicamente.

Quando o classificador sinaliza uma solicitação, Anthropic a encaminha do Fable 5 para o Opus 5. A empresa diz que o Opus 5 permanece capaz para uso geral, mas fornece menos ajuda operacional em biologia avançada, reduzindo o valor do sistema para alguém que realiza trabalhos prejudiciais.

Anthropic diz que reescreveu a constituição do classificador, reuniu feedback de especialistas internos e externos, criou novos dados de treinamento, treinou novamente o classificador e verificou se ele ainda era geralmente acionado em solicitações de pesquisa prejudiciais e de uso duplo. Nos testes da empresa, a atualização reduziu as falhas relacionadas à biologia em cerca de 85% em seus produtos.

A mudança segue uma postura de lançamento deliberadamente conservadora. Anthropic diz que a Fable 5 inicialmente encaminhou quase todas as solicitações de biologia para o Opus 5 porque a empresa preferia um amplo limite de segurança enquanto aprendia onde questões benignas de saúde e educação estavam sendo detectadas. A atualização de agosto estreita essa fronteira por meio de um classificador separado, em vez de alterar a capacidade biológica subjacente do modelo. Isso torna o lançamento uma mudança de política e roteamento, e não uma evidência de que Fable 5 se tornou um assistente de biologia clinicamente validado.

A mudança visa permitir que o Fable 5 responda a mais questões cotidianas de saúde, clínicas e educacionais. Anthropic afirma que o acesso normal ainda depende de áreas de dupla utilização, incluindo virologia, toxicologia e design molecular, pelo que o modelo ainda não está disponível através desse caminho para investigação profissional em biologia ou desenvolvimento de medicamentos.

Detalhes da fonte: Anthropic's Fable 5 biology safeguards announcement ↗

Por que isso importa

A atualização é um teste prático para saber se as salvaguardas do modelo fronteiriço podem tornar-se mais precisas sem simplesmente escolher entre amplo acesso e ampla recusa.

Um filtro grosseiro pode reduzir o risco rapidamente, mas também pode bloquear estudantes, pacientes, educadores e profissionais de saúde cujas perguntas utilizem a mesma linguagem técnica da investigação sensível. Anthropic escolheu esse ponto de partida conservador quando lançou o Fable 5, depois usou uma política mais detalhada e novos exemplos de treinamento para mover os limites para solicitações benignas.

A mudança na experiência do usuário difere de acordo com o produto porque a biologia é apenas uma das causas do substituto. Anthropic estima que o total de substitutos de todos os tipos cairá cerca de 67% em Claude.ai, 55% em Cowork, 17% em Claude Código e 7% na plataforma Claude. Estas são medições da empresa e não resultados de auditorias independentes.

O mecanismo também é importante: uma solicitação sinalizada é redirecionada em vez de respondida pela Fábula 5. Isso preserva o acesso a um modelo geral, ao mesmo tempo que retém a capacidade que Anthropic considera mais preocupante, mas não estabelece que todas as respostas de saúde permitidas sejam precisas ou apropriadas para uma decisão clínica.

Para as organizações, a questão prática é como a fronteira se comporta entre os contextos. Um estudante que solicita uma explicação em linguagem simples, um médico que verifica a terminologia e um pesquisador que solicita um protocolo experimental podem usar palavras sobrepostas e apresentar riscos muito diferentes. A abordagem de roteamento de Anthropic pode preservar uma resposta geral mais segura para os dois primeiros casos, mas somente se o classificador reconhecer a intenção, o histórico de conversas e os detalhes operacionais solicitados, sem transformar um fluxo de trabalho profissional legítimo em uma negação opaca.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Verificação de conceito interativo+10 Points
AI Safety Quiz

What is 'specification gaming' in AI systems?

O que assistir a seguir

Fique atento a evidências de que a menor taxa de fallback é acompanhada por uma forte detecção de solicitações genuinamente perigosas, além de regras claras para acesso confiável à pesquisa.

Anthropic não publicou o conjunto de avaliação, uma taxa de falso-negativo ou uma replicação independente com este anúncio. A empresa afirma que os falsos positivos permanecerão e que os classificadores também devem resistir às tentativas de jailbreak, de modo que o número de 85% mede menos falhas em vez da compensação total de segurança.

As próximas divulgações úteis mostrariam o desempenho em paráfrases, idiomas, conversas múltiplas e fluxos de trabalho habilitados para ferramentas. Os pesquisadores também precisam saber com que frequência uma solicitação prejudicial cruza o novo limite e com que rapidez o classificador é atualizado quando novos desvios aparecem.

Anthropic afirma que está desenvolvendo caminhos de acesso confiável para capacidades de biologia de fronteira. A sua credibilidade dependerá de quem se qualifica, das proteções de monitorização e privacidade aplicáveis, da forma como os incidentes são analisados ​​e se os investigadores legítimos podem contestar uma restrição incorreta.

A próxima divulgação também deverá explicar como o classificador é avaliado após a implantação. Uma taxa de recurso mais baixa pode ser alcançada reduzindo os falsos positivos, transferindo casos difíceis para outro modelo ou ignorando pedidos mais prejudiciais; esses resultados têm significados de segurança muito diferentes. Relatórios úteis incluiriam estimativas de falsos positivos e falsos negativos por tipo de solicitação, desempenho sob escalonamento e paráfrase multiturno, cobertura de idioma, tratamento de chamadas de ferramentas e o processo de atualização do limite após um jailbreak ou incidente.

A promessa voltada para o usuário deve ser testada com o mesmo cuidado que o limite de segurança. Anthropic diz que a atualização deve ajudar com questões diárias de saúde, clínicas e educacionais, mas uma taxa de reserva mais baixa não estabelece precisão médica, triagem apropriada ou adequação para decisões profissionais. Os revisores independentes devem fazer amostras de respostas permitidas para certezas não suportadas, falta de conselhos de segurança e detalhes processuais prejudiciais, ao mesmo tempo que verificam se o modelo alternativo comunica claramente os seus limites. A evidência mais forte compararia as solicitações correspondidas antes e depois da mudança do classificador e publicaria exemplos anonimizados suficientes para que pesquisadores externos pudessem compreender tanto os ganhos quanto os novos modos de falha.

Essa evidência deve ser relatada separadamente para chat do consumidor, codificação, fluxos de trabalho de agente e API porque o mesmo limite do classificador pode conter ferramentas, janelas de contexto e expectativas do usuário diferentes em cada produto. Uma única porcentagem combinada de fallback pode ocultar uma regressão significativa em uma superfície atrás de uma melhoria em outra. A publicação do denominador, dos intervalos de confiança e das contagens em nível de produto tornaria o resultado útil para educadores, médicos, desenvolvedores e pesquisadores de segurança, em vez de apenas para leitores que comparam um número de título.

Guias e questionários relacionados

Segurança de IAModelos de IA explicadosÉtica da IATeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?