Volver a Noticias
ProductoAI Understanding sesión informativa

Anthropic dice que las reservas biológicas de Fable 5 cayeron un 85%

Anthropic dice que un clasificador de seguridad recapacitado redujo los retrocesos relacionados con la biología en aproximadamente un 85 %, lo que permitió más consultas sobre salud y educación y, al mismo tiempo, mantuvo restringida la investigación de doble uso.

Por 4 min read
A clinician and biology student examine benign samples passing through a transparent screening boundary while higher-risk laboratory equipment remains secured behind glass.
La versión corta

Anthropic dice que un clasificador de seguridad recapacitado redujo los retrocesos relacionados con la biología en aproximadamente un 85 %, lo que permitió más consultas sobre salud y educación y, al mismo tiempo, mantuvo restringida la investigación de doble uso.

que paso

Anthropic actualizó Claude las salvaguardias biológicas de Fable 5 el 7 de agosto, reduciendo un clasificador que había redirigido casi todas las consultas biológicas a un modelo con menor capacidad biológica.

Cuando el clasificador marca una solicitud, Anthropic la enruta de Fable 5 a Opus 5. La compañía dice que Opus 5 sigue siendo apto para uso general, pero proporciona menos ayuda operativa en biología avanzada, lo que reduce el valor del sistema para alguien que realiza un trabajo dañino.

Anthropic dice que reescribió la constitución del clasificador, recopiló comentarios de expertos internos y externos, creó nuevos datos de entrenamiento, volvió a entrenar al clasificador y verificó que, en general, todavía se activaba ante solicitudes de investigación dañinas y de doble uso. En las pruebas de la empresa, la actualización redujo los fallos relacionados con la biología en aproximadamente un 85 % en todos sus productos.

El cambio tiene como objetivo permitir que Fable 5 responda más preguntas cotidianas sobre salud, clínicas y educativas. Anthropic dice que el acceso ordinario aún recae en áreas de doble uso, incluidas virología, toxicología y diseño molecular, por lo que el modelo aún no está disponible a través de esa vía para la investigación en biología profesional o el desarrollo de fármacos.

Lea la fuente principal: Anthropic's Fable 5 biology safeguards announcement

Por qué es importante

La actualización es una prueba práctica de si las salvaguardias del modelo de frontera pueden volverse más precisas sin simplemente elegir entre un acceso amplio y un rechazo amplio.

Un filtro grueso puede reducir el riesgo rápidamente, pero también puede bloquear a estudiantes, pacientes, educadores y profesionales de la salud cuyas preguntas utilizan el mismo lenguaje técnico que la investigación sensible. Anthropic eligió ese punto de partida conservador cuando lanzó Fable 5, luego utilizó una política más detallada y nuevos ejemplos de capacitación para mover el límite de las solicitudes benignas.

El cambio en la experiencia del usuario difiere según el producto porque la biología es solo una de las causas del retroceso. Anthropic estima que el total de respaldos de todo tipo disminuirá aproximadamente un 67 % en Claude.ai, un 55 % en Cowork, un 17 % en Claude Code y un 7 % en la plataforma Claude. Esas son mediciones de la empresa, no resultados de auditorías independientes.

El mecanismo también importa: Fable 5 redirige una solicitud marcada en lugar de responderla. Eso preserva el acceso a un modelo general mientras retiene la capacidad que Anthropic considera más preocupante, pero no establece que cada respuesta de salud permitida sea precisa o apropiada para una decisión clínica.

Qué ver a continuación

Esté atento a la evidencia de que la tasa de respaldo más baja va acompañada de una sólida detección de solicitudes genuinamente peligrosas, además de reglas claras para el acceso confiable a la investigación.

Anthropic no publicó el conjunto de evaluaciones, una tasa de falsos negativos ni una replicación independiente con este anuncio. La compañía dice que seguirán existiendo falsos positivos y que los clasificadores también deben resistir los intentos de fuga, por lo que la cifra del 85% mide menos retrocesos en lugar de toda la compensación de seguridad.

Las próximas revelaciones útiles mostrarían el rendimiento en paráfrasis, idiomas, conversaciones de varios turnos y flujos de trabajo habilitados por herramientas. Los investigadores también necesitan saber con qué frecuencia una solicitud dañina cruza el nuevo límite y con qué rapidez se actualiza el clasificador cuando aparecen nuevas omisiones.

Anthropic dice que está desarrollando vías de acceso confiables para capacidades de biología de vanguardia. Su credibilidad dependerá de quién califica, qué protecciones de privacidad y monitoreo se aplican, cómo se revisan los incidentes y si los investigadores legítimos pueden cuestionar una restricción incorrecta.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe mensual

Obtenga las historias de IA que realmente importan.

Un breve correo electrónico al mes: qué cambió en la IA, por qué es importante, además de las herramientas y guías que valen la pena.

Gratis · Sin spam · Darse de baja en un clic