O que aconteceu
Anthropic atualizou as salvaguardas biológicas de Claude Fable 5 em 7 de agosto, restringindo um classificador que redirecionou quase todas as consultas biológicas para um modelo menos capaz biologicamente.
Quando o classificador sinaliza uma solicitação, Anthropic a encaminha do Fable 5 para o Opus 5. A empresa diz que o Opus 5 permanece capaz para uso geral, mas fornece menos ajuda operacional em biologia avançada, reduzindo o valor do sistema para alguém que realiza trabalhos prejudiciais.
Anthropic diz que reescreveu a constituição do classificador, reuniu feedback de especialistas internos e externos, criou novos dados de treinamento, treinou novamente o classificador e verificou se ele ainda era geralmente acionado em solicitações de pesquisa prejudiciais e de uso duplo. Nos testes da empresa, a atualização reduziu as falhas relacionadas à biologia em cerca de 85% em seus produtos.
A mudança visa permitir que o Fable 5 responda a mais questões cotidianas de saúde, clínicas e educacionais. Anthropic afirma que o acesso normal ainda depende de áreas de dupla utilização, incluindo virologia, toxicologia e design molecular, pelo que o modelo ainda não está disponível através desse caminho para investigação profissional em biologia ou desenvolvimento de medicamentos.
Leia a fonte primária: Anthropic's Fable 5 biology safeguards announcement ↗
Por que isso importa
A atualização é um teste prático para saber se as salvaguardas do modelo fronteiriço podem tornar-se mais precisas sem simplesmente escolher entre amplo acesso e ampla recusa.
Um filtro grosseiro pode reduzir o risco rapidamente, mas também pode bloquear estudantes, pacientes, educadores e profissionais de saúde cujas perguntas utilizem a mesma linguagem técnica da investigação sensível. Anthropic escolheu esse ponto de partida conservador quando lançou o Fable 5, depois usou uma política mais detalhada e novos exemplos de treinamento para mover os limites para solicitações benignas.
A mudança na experiência do usuário difere de acordo com o produto porque a biologia é apenas uma das causas do substituto. Anthropic estima que o total de substitutos de todos os tipos cairá cerca de 67% em Claude.ai, 55% em Cowork, 17% em Claude Código e 7% na plataforma Claude. Estas são medições da empresa e não resultados de auditorias independentes.
O mecanismo também é importante: uma solicitação sinalizada é redirecionada em vez de respondida pela Fábula 5. Isso preserva o acesso a um modelo geral, ao mesmo tempo que retém a capacidade que Anthropic considera mais preocupante, mas não estabelece que todas as respostas de saúde permitidas sejam precisas ou apropriadas para uma decisão clínica.
O que assistir a seguir
Fique atento a evidências de que a menor taxa de fallback é acompanhada por uma forte detecção de solicitações genuinamente perigosas, além de regras claras para acesso confiável à pesquisa.
Anthropic não publicou o conjunto de avaliação, uma taxa de falso-negativo ou uma replicação independente com este anúncio. A empresa afirma que os falsos positivos permanecerão e que os classificadores também devem resistir às tentativas de jailbreak, de modo que o número de 85% mede menos falhas em vez da compensação total de segurança.
As próximas divulgações úteis mostrariam o desempenho em paráfrases, idiomas, conversas múltiplas e fluxos de trabalho habilitados para ferramentas. Os pesquisadores também precisam saber com que frequência uma solicitação prejudicial cruza o novo limite e com que rapidez o classificador é atualizado quando novos desvios aparecem.
Anthropic afirma que está desenvolvendo caminhos de acesso confiável para capacidades de biologia de fronteira. A sua credibilidade dependerá de quem se qualifica, das proteções de monitorização e privacidade aplicáveis, da forma como os incidentes são analisados e se os investigadores legítimos podem contestar uma restrição incorreta.


