Voltar às notícias
ProdutoAI Understanding briefing

Anthropic diz que os substitutos da biologia da Fábula 5 caíram 85%

Anthropic afirma que um classificador de segurança retreinado reduziu as falhas relacionadas à biologia em cerca de 85%, permitindo mais consultas de saúde e educação, ao mesmo tempo que manteve restritas as pesquisas de dupla utilização.

Por 4 min read
A clinician and biology student examine benign samples passing through a transparent screening boundary while higher-risk laboratory equipment remains secured behind glass.
A versão curta

Anthropic afirma que um classificador de segurança retreinado reduziu as falhas relacionadas à biologia em cerca de 85%, permitindo mais consultas de saúde e educação, ao mesmo tempo que manteve restritas as pesquisas de dupla utilização.

O que aconteceu

Anthropic atualizou as salvaguardas biológicas de Claude Fable 5 em 7 de agosto, restringindo um classificador que redirecionou quase todas as consultas biológicas para um modelo menos capaz biologicamente.

Quando o classificador sinaliza uma solicitação, Anthropic a encaminha do Fable 5 para o Opus 5. A empresa diz que o Opus 5 permanece capaz para uso geral, mas fornece menos ajuda operacional em biologia avançada, reduzindo o valor do sistema para alguém que realiza trabalhos prejudiciais.

Anthropic diz que reescreveu a constituição do classificador, reuniu feedback de especialistas internos e externos, criou novos dados de treinamento, treinou novamente o classificador e verificou se ele ainda era geralmente acionado em solicitações de pesquisa prejudiciais e de uso duplo. Nos testes da empresa, a atualização reduziu as falhas relacionadas à biologia em cerca de 85% em seus produtos.

A mudança visa permitir que o Fable 5 responda a mais questões cotidianas de saúde, clínicas e educacionais. Anthropic afirma que o acesso normal ainda depende de áreas de dupla utilização, incluindo virologia, toxicologia e design molecular, pelo que o modelo ainda não está disponível através desse caminho para investigação profissional em biologia ou desenvolvimento de medicamentos.

Leia a fonte primária: Anthropic's Fable 5 biology safeguards announcement

Por que isso importa

A atualização é um teste prático para saber se as salvaguardas do modelo fronteiriço podem tornar-se mais precisas sem simplesmente escolher entre amplo acesso e ampla recusa.

Um filtro grosseiro pode reduzir o risco rapidamente, mas também pode bloquear estudantes, pacientes, educadores e profissionais de saúde cujas perguntas utilizem a mesma linguagem técnica da investigação sensível. Anthropic escolheu esse ponto de partida conservador quando lançou o Fable 5, depois usou uma política mais detalhada e novos exemplos de treinamento para mover os limites para solicitações benignas.

A mudança na experiência do usuário difere de acordo com o produto porque a biologia é apenas uma das causas do substituto. Anthropic estima que o total de substitutos de todos os tipos cairá cerca de 67% em Claude.ai, 55% em Cowork, 17% em Claude Código e 7% na plataforma Claude. Estas são medições da empresa e não resultados de auditorias independentes.

O mecanismo também é importante: uma solicitação sinalizada é redirecionada em vez de respondida pela Fábula 5. Isso preserva o acesso a um modelo geral, ao mesmo tempo que retém a capacidade que Anthropic considera mais preocupante, mas não estabelece que todas as respostas de saúde permitidas sejam precisas ou apropriadas para uma decisão clínica.

O que assistir a seguir

Fique atento a evidências de que a menor taxa de fallback é acompanhada por uma forte detecção de solicitações genuinamente perigosas, além de regras claras para acesso confiável à pesquisa.

Anthropic não publicou o conjunto de avaliação, uma taxa de falso-negativo ou uma replicação independente com este anúncio. A empresa afirma que os falsos positivos permanecerão e que os classificadores também devem resistir às tentativas de jailbreak, de modo que o número de 85% mede menos falhas em vez da compensação total de segurança.

As próximas divulgações úteis mostrariam o desempenho em paráfrases, idiomas, conversas múltiplas e fluxos de trabalho habilitados para ferramentas. Os pesquisadores também precisam saber com que frequência uma solicitação prejudicial cruza o novo limite e com que rapidez o classificador é atualizado quando novos desvios aparecem.

Anthropic afirma que está desenvolvendo caminhos de acesso confiável para capacidades de biologia de fronteira. A sua credibilidade dependerá de quem se qualifica, das proteções de monitorização e privacidade aplicáveis, da forma como os incidentes são analisados ​​e se os investigadores legítimos podem contestar uma restrição incorreta.

Guias e questionários relacionados

Achou isso útil?
O Briefing Mensal

Obtenha as histórias de IA que realmente importam.

Um pequeno e-mail por mês — o que mudou na IA, por que isso é importante, além de ferramentas e guias que valem seu tempo.

Gratuito · Sem spam · Cancele a inscrição com um clique