Volver a Noticias
InnovaciónAI Understanding sesión informativa

Un estudio encuentra que los archivos de instrucciones de codificación de IA son más del triple

Un análisis de 1.867 repositorios encuentra que los archivos de instrucciones de los agentes acumularon reglas mucho más rápido de lo que los mantenedores las eliminaron, mientras que los comentarios racionales redujeron drásticamente el crecimiento excesivo en las pruebas controladas.

Por 6 min read
A software maintainer compares a towering pile of accumulated blank instruction cards with a compact, organized card system that preserves context.
La versión corta

Un análisis de 1.867 repositorios encuentra que los archivos de instrucciones de los agentes acumularon reglas mucho más rápido de lo que los mantenedores las eliminaron, mientras que los comentarios racionales redujeron drásticamente el crecimiento excesivo en las pruebas controladas.

que paso

Una nueva preimpresión publicada el 11 de agosto nombra un modo de falla observado en los repositorios de codificación agente como "recuerdo catastrófico": los archivos de instrucciones del proyecto siguen acumulando reglas porque agregar una precaución es barato, mientras que eliminar de manera segura una regla antigua se vuelve más difícil después de que desaparece su fundamento original.

Los investigadores reunieron 247.694 tiempos de vida de instrucciones y 299.440 transiciones de compromiso a compromiso de 1.867 repositorios públicos que contenían archivos como CLAUDE.md. Realizaron un seguimiento de las directivas individuales a través de ediciones e informaron que los archivos crecieron un 226% durante su vida útil observada, agregando un promedio de 4,9 instrucciones netas por confirmación de modificación. El estudio trata esas cifras como evidencia de una acumulación persistente en su muestra, no como una prueba de que cada instrucción fue innecesaria o de que todos los proyectos de codificación agente se comportan de la misma manera.

El mecanismo central del artículo es la evidencia asimétrica. Un mantenedor o agente codificador puede agregar una nueva instrucción después de un error sin reconstruir cada interacción entre las reglas ya presentes. La eliminación posterior es más arriesgada: una vez que el fracaso que lo motivó y el contexto circundante han desaparecido, eliminar una directiva puede requerir verificar si aún evita una regresión bajo muchas combinaciones de las directivas restantes. En los datos del repositorio, el riesgo de eliminación estimado disminuyó a medida que una instrucción envejecía, con una pendiente de riesgo logarítmico informada de -0,032 por confirmación.

Para probar una posible solución, los autores crearon tareas de seguimiento de instrucciones invirtiendo las restricciones IFEval, luego compararon indicaciones que contenían reglas simples con indicaciones que también conservaban comentarios breves que explicaban por qué existía cada regla. En su configuración controlada, las indicaciones no comentadas acumularon un 211,3 % de exceso de instrucciones, mientras que las indicaciones comentadas terminaron con un exceso del 1,4 %. Los comentarios no eran comandos adicionales para el modelo; eran de procedencia compacta destinada a hacer auditables las decisiones de eliminación posteriores.

El equipo también evaluó si indicaciones más pequeñas y mejor documentadas ayudaban a los agentes a seguir las instrucciones. En su punto de referencia derivado de WildIFEval, el documento reporta ganancias de hasta 23,1 puntos porcentuales cuando se preservaron los fundamentos y se pudieron eliminar las reglas obsoletas. Esos resultados son afirmaciones de una preimpresión recientemente publicada y no revisada por pares. El trabajo no establece que los comentarios por sí solos mejorarán cada agente de codificación, repositorio, lenguaje o flujo de trabajo de producción.

Lea la fuente principal: Catastrophic remembering research paper on arXiv

Por qué es importante

Los archivos de instrucciones a nivel de repositorio se están convirtiendo en memoria operativa duradera para los agentes de codificación, por lo que el crecimiento descontrolado puede aumentar los costos simbólicos, preservar restricciones obsoletas y hacer que las reglas que rigen los cambios automatizados de código sean más difíciles de entender para las personas.

El riesgo práctico no es simplemente un expediente largo. Cada instrucción compite por la atención de un modelo y puede interactuar con reglas más nuevas, descripciones de herramientas, contexto de código y la solicitud del usuario. Una directiva escrita para evitar una falla histórica puede volverse irrelevante después de que cambia la base del código, entrar en conflicto con una política más nueva o restringir excesivamente el trabajo no relacionado. Si nadie puede reconstruir por qué existe, la opción local más segura suele ser retenerlo, lo que traslada los costos de limpieza a compromisos futuros.

Ese patrón importa más allá de CLAUDE.md. Los equipos almacenan cada vez más convenciones, límites de seguridad, comandos de prueba, decisiones arquitectónicas y precauciones de implementación en una guía de proyectos legible por máquina. Estos archivos pueden mejorar la coherencia y reducir los errores repetidos, pero también se convierten en una superficie de gobernanza: las personas deberían poder identificar quién introdujo una regla consecuente, qué evidencia la justificó y qué condición permitiría retirarla. Un comentario justificativo es una versión ligera de esa pista de auditoría.

El resultado sugiere un principio de diseño útil para la memoria de los agentes: recordar debe incluir las condiciones para el olvido. En lugar de registrar sólo "hacer siempre X", un sistema puede preservar la falla observada, el alcance de la regla, el componente o prueba relevante y un activador de revisión. Eso no automatiza la eliminación, pero le da a un mantenedor posterior evidencia para decidir si la restricción todavía protege la corrección o simplemente refleja un entorno antiguo.

También existe un ángulo de interés público a medida que los agentes codificadores tocan software de mayor trascendencia. Las instrucciones privadas acumuladas pueden moldear silenciosamente las decisiones de seguridad, el comportamiento de accesibilidad, el manejo de datos o la forma en que un agente responde a las fallas. Los archivos más pequeños no son automáticamente más seguros y una limpieza agresiva podría eliminar una protección vital. El resultado útil es la trazabilidad: menos reglas inexplicables, propiedad explícita y prácticas de revisión que permiten a los humanos cuestionar tanto las adiciones como las eliminaciones.

Qué ver a continuación

La siguiente prueba es la replicación independiente entre idiomas, organizaciones, productos de agentes y repositorios de mayor duración, seguida de pruebas prospectivas que miden si la limpieza documentada mejora la calidad del código sin eliminar salvaguardas importantes.

La muestra observacional tiene límites de selección. Los repositorios públicos que confirman archivos de instrucciones de agentes pueden diferir de las bases de código de empresas privadas, y el historial del repositorio no puede revelar todas las discusiones o incidentes fuera de la plataforma que motivaron una regla. El crecimiento también puede ser racional cuando un proyecto se expande. Los análisis futuros deberían separar la cobertura útil de nuevos componentes de las instrucciones duplicadas, contradictorias u obsoletas e informar cómo varían los resultados según la antigüedad, el tamaño, el idioma, el número de contribuyentes y la plataforma del agente del repositorio.

Los experimentos controlados necesitan una validación más amplia. Las tareas se derivaron de puntos de referencia de seguimiento de instrucciones en lugar de meses de mantenimiento de software en vivo, y la línea de coincidencia del artículo se verificó en una muestra de 50 transiciones. Un autor produjo la anotación manual utilizada en parte de la validación. El estudio no cubrió archivos de instrucciones que no estuvieran en inglés y no barrió todos los umbrales utilizados para decidir cuándo un cambio contaba como una reescritura en lugar de una continuación de una instrucción.

Los comentarios pueden preservar fundamentos incorrectos tan fácilmente como los correctos. Por lo tanto, los equipos deben probar la procedencia estructurada frente a alternativas como problemas vinculados, pruebas de regresión fallidas, fechas de vencimiento, campos de propiedad o verificaciones automatizadas que señalen directivas duplicadas y conflictivas. El flujo de trabajo más seguro propondría eliminaciones, mostraría la evidencia y las pruebas afectadas y requeriría una revisión de las reglas de alto impacto en lugar de permitir que un agente elimine las instrucciones únicamente para guardar tokens.

La evidencia de seguimiento útil mediría los resultados de un extremo a otro: tamaño del mensaje, cumplimiento de las instrucciones, éxito de la tarea, regresiones, tiempo de revisión y número de reglas restauradas después de la eliminación. Los investigadores también deberían probar si los modelos realmente utilizan comentarios racionales según lo previsto o, en ocasiones, los confunden con requisitos adicionales. Hasta que lleguen esos resultados, el recuerdo catastrófico es una descripción bien respaldada del conjunto de datos y experimentos de los autores, no una ley universal o una razón para borrar por completo la orientación de proyectos maduros.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe mensual

Obtenga las historias de IA que realmente importan.

Un breve correo electrónico al mes: qué cambió en la IA, por qué es importante, además de las herramientas y guías que valen la pena.

Gratis · Sin spam · Darse de baja en un clic