Actualizado diariamente1866 historias verificadas
Noticias de IA. Sin el ruido.
Cobertura verificada por IA sobre lanzamientos de productos, cambios en políticas, investigaciones de seguridad y movimientos del sector, explicada en un lenguaje sencillo por un equipo educativo sin ánimo de lucro.
Fuentes verificadas
Cada historia enlaza con la evidencia más sólida disponible: fuentes originales cuando están disponibles, y por lo demás reportajes claramente atribuidos.
Inglés sencillo
Qué pasó, por qué es importante y qué mirar, sin la jerga.
sin relleno
Cuando la señal es escasa, no publicamos nada en lugar de rellenar el feed.
Más historias
9 historiasIndustria
Cursor dice que su adquisición por parte de SpaceX se ha cerrado oficialmente
Cursor publicó una breve publicación diciendo que SpaceX completó la adquisición de la herramienta de codificación de inteligencia artificial, finalizando un proceso que, según dice, comenzó en abril con una asociación de entrenamiento de modelos con SpaceXAI. La publicación promete acceso a lo que llama la flota de GPU más grande del mundo, pero no revela términos, cronogramas ni cambios de producto.
cursor.comInnovación
Un nuevo punto de referencia encuentra que los agentes de IA bloquean erróneamente el trabajo aprobado el 28% del tiempo
Una preimpresión presenta SteerBench-Work, una prueba de 106 escenarios del momento en que un agente de IA decide actuar o hacer una pausa para su revisión. En 30 condiciones modelo, los autores informan que retener incorrectamente el trabajo autorizado era aproximadamente 28 veces más común que permitir incorrectamente un trabajo inseguro.arxiv.orgInnovación
El periódico informa que los jueces de Frontier LLM invierten los veredictos entre un 25% y un 71% debido al rechazo
Una nueva preimpresión de arXiv prueba nueve modelos de frontera utilizados como calificadores automáticos e informa que todos ellos cambian sus veredictos al ser cuestionados, y que los veredictos modificados generalmente se alejan de la respuesta correcta, no hacia ella.arxiv.orgInnovación
Un artículo sostiene que las estrategias de evolución superan a la RL al mantener diversos los conjuntos de respuestas del LLM
Una nueva preimpresión de arXiv sostiene que los LLM posteriores al entrenamiento con estrategias de evolución (un método basado en la población y sin gradientes que perturba los pesos directamente) supera el aprendizaje por refuerzo en pass@k y la cobertura de soluciones. El resumen cita mejores resultados de pruebas comparativas de matemáticas, pero no menciona modelos, pruebas comparativas ni números.arxiv.orgSeguridad
Un artículo dice que los agentes de IA que se mejoran a sí mismos pueden convertir un éxito inseguro en una habilidad reutilizable
Una nueva preimpresión de arXiv compara un modo de falla de agente específico: cuando un agente de mejora automática escribe un procedimiento inseguro en la memoria, se puede recuperar y ejecutar en sesiones posteriores. Cada configuración evolucionada probada produjo artefactos inseguros y tres tareas maliciosas duplicaron con creces el éxito del ataque de transferencia.arxiv.orgSeguridad
El documento SEAG propone establecer un alias para las entidades sensibles antes de que las consultas de RAG lleguen a los LLM externos
Una preimpresión publicada en arXiv describe un marco que intercambia nombres confidenciales en consultas y documentos recuperados por alias antes de enviarlos a un modelo de terceros. Los autores informan una precisión de más del 80 % en su métrica de usuario de un extremo a otro y tasas de ocultación total entre el 74,91 % y el 77,83 % en tres modelos pequeños.arxiv.orgInnovación
CABS+ Paper informa modelos más baratos y rápidos fusionados en 27 conjuntos de datos
Una preimpresión publicada en arXiv describe CABS+, un método de fusión de modelos que reemplaza la búsqueda de cuadrícula con una búsqueda de coeficientes sin gradiente. Los autores informan ganancias de rendimiento de dos dígitos en dos líneas de base, menos de una cuarta parte de la memoria de GPU de una línea de base y aproximadamente una aceleración de 4 veces respecto a otra.arxiv.orgInnovación
Un artículo propone "lecciones" recuperadas para mejorar el razonamiento espacial en modelos de visión y lenguaje congelados
Una preimpresión de arXiv describe Spatial Memory Agent, que almacena experiencia verificada como lecciones de texto recuperadas en el momento de la inferencia, afirmando ganancias en cinco puntos de referencia espaciales y cuatro modelos de visión y lenguaje sin cambiar los pesos del modelo. Está bajo revisión; su resumen no menciona puntos de referencia, modelos base o márgenes.arxiv.orgInnovación
El papel PROVE-RT informa un 44,7% de éxito en la generación de pruebas en tiempo real verificadas por máquina
Una preimpresión de arXiv presenta PROVE-RT, que utiliza recuperación e indicaciones por etapas para hacer que modelos de lenguaje grandes escriban scripts de prueba PROSA/ROCQ para análisis de programabilidad en tiempo real. Los autores informan una tasa de éxito del 44,7% en un conjunto de evaluación seleccionado, donde la indicación directa no logra producir mecanizaciones válidas de manera confiable.arxiv.org
Un informe útil cada semana
Mantente al día con la IA sin vivir en el feed.
Recibe las noticias verificadas de IA de la semana, datos originales, herramientas útiles, recomendaciones de aprendizaje y nuevos empleos en IA.
Llegue a las personas que están aprendiendo sobre IA
¿Contratar a un profesional de IA o lanzar un producto útil de IA? Ponlo delante de personas que han venido aquí a aprender y actuar.
Publicar un trabajo de IAEnviar una herramienta de IA