Volver a Noticias
ProductoAI Understanding sesión informativa

DeepSeek publica el modelo Flash V4 experimental con capacidades de visión

DeepSeek ha publicado DeepSeek-V4-Flash-Vision-Exp, un modelo multimodal experimental que agrega módulos visuales a su arquitectura V4-Flash e informa un rendimiento mejorado en varios puntos de referencia de agentes visuales.

5 min readRead the primary source
Source-provided image accompanying DeepSeek publishes experimental V4 Flash model with vision capabilities
Documento de fuente primariaFuente registrada
Editor
huggingface.co
Enlace fuente
huggingface.cohttps://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Tipo de fuente
Documento principal: un anuncio oficial, documento, archivo o página propia que leemos directamente.
ContextoEntiende esto en 60 segundos

Empieza aquí

Términos clave

Memoria (memoria del agente)
Contexto almacenado que un agente de IA utiliza en todos los pasos o sesiones para mejorar la continuidad.
Decodificación especulativa
Un método de aceleración de inferencia en el que un modelo borrador pequeño propone tokens que un modelo más grande verifica en paralelo.
Modelo multimodal
Un modelo que puede procesar o generar múltiples tipos de datos, como texto, imagen y audio.
Ponte a pruebaModelos de IA explicados cuestionario

que paso

DeepSeek publicó DeepSeek-V4-Flash-Vision-Exp en Hugging Face como su primer modelo multimodal experimental de la familia DeepSeek-V4. La tarjeta modelo dice que agrega módulos visuales y capacitación continua a la arquitectura DeepSeek-V4-Flash, con ganancias reportadas en tareas de agentes multimodales mientras mantiene un rendimiento comparable en tareas de agentes de solo texto.

El registro Hugging Face identifica DeepSeek-V4-Flash-Vision-Exp como un modelo de imagen de texto a texto que utiliza Transformers. Su tarjeta de modelo lo describe como el primer modelo multimodal experimental de DeepSeek en la familia V4. El diseño declarado combina la arquitectura DeepSeek-V4-Flash con módulos visuales y capacitación continua destinada a desbloquear capacidades de comprensión visual. El repositorio fue creado el 31 de agosto de 2026 y el registro muestra una actualización posterior el 1 de septiembre.

La tarjeta modelo informa mejoras con respecto a DeepSeek-V4-Flash-0731 en varias evaluaciones de agentes multimodales. Muestra una puntuación ApexBench Pass@1 de 36,5 frente a 26,2 para el modelo anterior, una puntuación del último examen de agentes de 27,3 frente a 25,2, una puntuación de Chartografía de 64,3 y una puntuación ZeroBench Pass@5 de 35,0. La tarjeta también compara el nuevo modelo con Opus-4.8, que figura en 39,4 en ApexBench, 25,7 en el último examen de agentes, 65,0 en Chartografía y 34,0 en ZeroBench.

Para tareas de agente de texto, la tarjeta modelo informa 83,9 en Terminal Bench 2.1, 57,7 en NL2Repo, 75,3 en Cybergym, 59,3 en DeepSWE, 75,9 en Toolathlon-Verified, 63,6 en DSBench-Hard y 25,7 en AutomationBench Public. La tarjeta dice que el nuevo modelo mantiene un rendimiento de agente de solo texto comparable al de DeepSeek-V4-Flash-0731, al tiempo que señala que el modelo anterior ignoró elementos multimodales en las entradas de ApexBench y del último examen de los agentes.

El repositorio incluye archivos de tokenizador, referencias de codificación de indicaciones y una implementación de inferencia mínima PyTorch que cubre el codificador y alineador de visión, la atención de DFlash, componentes de combinación de expertos, hiperconexiones y la ruta de avance de DSpark. La tarjeta modelo proporciona instrucciones para Transformers, vLLM, Docker, SGLang y Docker Model Runner. Su ejemplo SGLang especifica el paralelismo tensorial de cuatro y la decodificación especulativa DSpark. Los metadatos visibles enumeran 305 mil millones de parámetros y el repositorio tiene licencia del MIT.

Detalles de la fuente: huggingface.co ↗

Por qué es importante

El lanzamiento brinda a investigadores y desarrolladores acceso a un modelo grande con licencia del MIT diseñado para interacción de imágenes y texto y flujos de trabajo de agentes. Su utilidad práctica sigue siendo incierta porque las evaluaciones informadas provienen de la tarjeta modelo, están marcadas como no verificadas y el modelo no lo implementa un proveedor de inferencias.

Esta versión es importante porque la visión es el propósito directo del modelo y no una característica incidental. La tarjeta modelo posiciona DeepSeek-V4-Flash-Vision-Exp para capacidades de agente multimodal, es decir, tareas que requieren un sistema de inteligencia artificial para interpretar entradas visuales junto con el lenguaje y actuar dentro de un marco de evaluación. Esto amplía el tipo de entrada que la familia V4-Flash está destinada a manejar, aunque la fuente no establece qué tan bien se desempeña el modelo en productos comunes o entornos de alto riesgo.

El repositorio hace que el modelo sea potencialmente útil para los desarrolladores que quieran inspeccionar, adaptar o ejecutar un sistema multimodal experimental. La licencia del MIT, las referencias de codificación de indicaciones, los archivos tokenizadores, el código de inferencia y los ejemplos proporcionan más material de implementación que un anuncio de producto por sí solo. Al mismo tiempo, la fuente dice que los fragmentos de modelo grandes se describen mediante un índice y no están duplicados dentro del código fuente utilizado para ensamblar el repositorio. El tamaño del modelo y la configuración SGLang de múltiples GPU indicada indican que la implementación puede ser exigente, pero la fuente no proporciona costos reales de hardware, latencia o requisitos de memoria.

Los resultados informados sugieren una compensación particular: DeepSeek afirma obtener ganancias sustanciales en los puntos de referencia de agentes multimodales sin renunciar a un rendimiento comparable de los agentes de texto. Esas afirmaciones deben tratarse como resultados de tarjetas modelo y no como hechos establecidos de forma independiente. Los registros de evaluación identifican la tarjeta modelo como su fuente y marcan los resultados como no verificados. Las comparaciones también son incompletas en algunos lugares: algunas puntuaciones multimodales de modelos anteriores están marcadas con una nota que explica que el modelo ignoró elementos visuales, mientras que algunas celdas de referencia no contienen resultados de modelos anteriores.

Por tanto, el impacto público depende de la verificación y la usabilidad. Si pruebas independientes confirman las ganancias reportadas de los agentes visuales y la implementación puede ser realizada por más investigadores, el lanzamiento podría ampliar el acceso a un modelo abierto capaz de experimentar con imágenes y texto. La fuente no establece la procedencia de los datos de capacitación, evaluaciones de seguridad, comportamiento de rechazo, protecciones de privacidad, soporte comercial o idoneidad para decisiones importantes. Esas omisiones limitan lo que se puede concluir responsablemente a partir de la liberación únicamente.

Interactive Mechanism

Mecanismo interactivo: cómo funciona realmente

Explore la tecnología subyacente detrás de este desarrollo de forma interactiva.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Verificación interactiva del concepto+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Qué ver a continuación

Las preguntas principales son si las evaluaciones independientes reproducen los resultados de DeepSeek, cuánto hardware e ingeniería requiere el modelo en la práctica y si la implementación experimental del repositorio se vuelve más fácil de implementar. Los usuarios también deben buscar información más completa sobre datos, pruebas de seguridad y rendimiento fuera de los puntos de referencia enumerados.

La disponibilidad es una cuestión práctica inmediata. La página Hugging Face dice que ningún proveedor de inferencia implementa el modelo y la instantánea de origen muestra cero descargas. En cambio, los usuarios son dirigidos a rutas locales o autoadministradas, como Transformers, vLLM, SGLang, Docker y Docker Model Runner. Las actualizaciones futuras pueden aclarar si el acceso alojado estará disponible, si la ruta de inferencia mínima está completa y qué configuraciones de hardware son realistas más allá del ejemplo del tensor paralelo cuatro.

La replicación independiente debería centrarse en las afirmaciones multimodales y en comparaciones justas con el modelo anterior. Los evaluadores deberán tener en cuenta la nota de la fuente de que DeepSeek-V4-Flash-0731 ignoró elementos visuales en dos pruebas enumeradas. También deben examinar el estado no verificado de los resultados de la tarjeta modelo, informar las indicaciones exactas y la configuración del arnés, y probar si el rendimiento se mantiene en imágenes, idiomas, tareas y casos de falla no representados en la tabla publicada.

El estado experimental de la versión justifica la atención a los cambios de ingeniería. El repositorio separa el formato de mensajes de la inferencia PyTorch, admite bloques de contenido JSON de estilo OpenAI y notación de texto compacto, y conversión de puntos de control de documentos. Las actualizaciones de esos componentes podrían afectar la reproducibilidad y la implementación. La fuente no dice qué tan estables son las interfaces, con qué frecuencia cambiarán los pesos o el código, o si todas las rutas de servicio documentadas admiten las funciones de visión por igual.

La información sobre seguridad y gobernanza es otra gran incógnita. La fuente describe la arquitectura, el uso, los puntos de referencia y las licencias, pero no proporciona pruebas de seguridad ni limitaciones para la comprensión de las imágenes. Antes de utilizar el modelo con imágenes confidenciales o flujos de trabajo importantes, las organizaciones necesitarían evidencia sobre el manejo de datos, errores visuales, seguridad, resistencia al uso indebido y supervisión humana. Ninguna de esas propiedades se puede inferir de las puntuaciones de referencia o de la licencia del MIT.

Guías y cuestionarios relacionados

Modelos de IA explicadosAgentes de IAChatGPT y LLMEntrenamiento de IAPon a prueba lo que sabes: prueba un cuestionario gratuito sobre IABusque un término de IA en nuestro glosarioSiga el rastreador de lanzamientos de modelos de IA
¿Encontró esto útil?