Вернуться к новостям
ПродуктAI Understanding брифинг

DeepSeek публикует экспериментальную модель V4 Flash с возможностями машинного зрения

DeepSeek опубликовал DeepSeek-V4-Flash-Vision-Exp, экспериментальную мультимодальную модель, которая добавляет визуальные модули к своей архитектуре V4-Flash и сообщает об улучшении производительности в нескольких тестах визуальных агентов.

5 min readRead the primary source
Source-provided image accompanying DeepSeek publishes experimental V4 Flash model with vision capabilities
ПервоисточникИсточник записан
Издатель
huggingface.co
Ссылка на источник
huggingface.cohttps://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Память (Память агента)
Сохраненный контекст, который агент ИИ использует на этапах или сеансах для улучшения непрерывности.
Спекулятивное декодирование
Метод ускорения вывода, при котором небольшая черновая модель предлагает токены, которые параллельно проверяет более крупная модель.
Мультимодальная модель
Модель, которая может обрабатывать или генерировать несколько типов данных, таких как текст, изображение и аудио.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

DeepSeek опубликовал DeepSeek-V4-Flash-Vision-Exp на Hugging Face как свою первую экспериментальную мультимодальную модель в семействе DeepSeek-V4. В карточке модели говорится, что к архитектуре DeepSeek-V4-Flash добавляются визуальные модули и продолжается обучение, при этом сообщается о преимуществах при выполнении мультимодальных задач агента при сохранении сопоставимой производительности при выполнении только текстовых задач агента.

Запись Hugging Face идентифицирует DeepSeek-V4-Flash-Vision-Exp как модель преобразования текста в текст с использованием преобразователей. В карточке модели он описан как первая экспериментальная мультимодальная модель DeepSeek в семействе V4. Заявленная конструкция сочетает в себе архитектуру DeepSeek-V4-Flash с визуальными модулями и постоянным обучением, направленным на раскрытие возможностей визуального понимания. Репозиторий был создан 31 августа 2026 года, а в записи указано последующее обновление 1 сентября.

В карточке модели сообщается об улучшениях по сравнению с DeepSeek-V4-Flash-0731 в нескольких оценках мультимодального агента. В нем указан балл ApexBench Pass@1 36,5 против 26,2 для более ранней модели, результат последнего экзамена агентов 27,3 против 25,2, балл Chartography 64,3 и балл ZeroBench Pass@5 35,0. Карта также сравнивает новую модель с Opus-4.8, который имеет рейтинг 39,4 на ApexBench, 25,7 на Agents’ Last Exam, 65,0 на Chartography и 34,0 на ZeroBench.

Для задач текстового агента карта модели сообщает 83,9 на Terminal Bench 2.1, 57,7 на NL2Repo, 75,3 на Cybergym, 59,3 на DeepSWE, 75,9 на Toolathlon-Verified, 63,6 на DSBench-Hard и 25,7 на AutomationBench Public. В карточке говорится, что новая модель обеспечивает сопоставимую производительность текстового агента с DeepSeek-V4-Flash-0731, при этом отмечается, что более ранняя модель игнорировала мультимодальные элементы во входных данных ApexBench и Last Exam агентов.

Репозиторий включает файлы токенизатора, ссылки на кодирование подсказок и минимальную реализацию вывода PyTorch, охватывающую видеокодер и выравниватель, внимание DFlash, смешанные экспертные компоненты, Hyper-Connections и прямой путь DSpark. На карточке модели приведены инструкции для Transformers, vLLM, Docker, SGLang и Docker Model Runner. Его пример SGLang определяет тензорный параллелизм четырех и спекулятивное декодирование DSpark. Видимые метаданные содержат 305 миллиардов параметров, а хранилище лицензировано MIT.

Подробности об источнике: huggingface.co ↗

Почему это важно

Релиз предоставляет исследователям и разработчикам доступ к большой модели, лицензированной MIT, предназначенной для взаимодействия изображений и текста и рабочих процессов агентов. Его практическая полезность остается неопределенной, поскольку сообщаемые оценки взяты из карты модели и помечены как непроверенные, а модель не используется поставщиком логических выводов.

Этот выпуск важен, поскольку видение — это прямая цель модели, а не второстепенная функция. В карточке модели DeepSeek-V4-Flash-Vision-Exp представлены возможности мультимодального агента, то есть задачи, которые требуют, чтобы система искусственного интеллекта интерпретировала визуальные входные данные наряду с языком и действовала в рамках системы оценки. Это расширяет тип ввода, который предназначено для семейства V4-Flash, хотя источник не уточняет, насколько хорошо модель работает в обычных продуктах или в сложных условиях.

Репозиторий делает модель потенциально полезной для разработчиков, которые хотят проверить, адаптировать или запустить экспериментальную мультимодальную систему. Лицензия MIT, ссылки на кодирование подсказок, файлы токенизаторов, код вывода и примеры предоставляют больше материалов по реализации, чем просто анонс продукта. При этом источник утверждает, что крупные шарды модели описываются индексом и не дублируются внутри исходной проверки, используемой для сборки репозитория. Размер модели и указанная конфигурация SGLang с несколькими графическими процессорами указывают на то, что развертывание может быть трудоемким, но источник не предоставляет фактические затраты на оборудование, задержку или требования к памяти.

Сообщенные результаты предполагают особый компромисс: DeepSeek заявляет о существенном выигрыше в тестах мультимодальных агентов, не отказываясь при этом от сопоставимой производительности текстового агента. Эти утверждения следует рассматривать как результаты модельной карты, а не как независимо установленные факты. Записи оценки идентифицируют карточку модели как источник и отмечают результаты как непроверенные. Сравнения также местами неполны: некоторые мультимодальные оценки более ранних моделей отмечены примечанием, объясняющим, что модель игнорировала визуальные элементы, тогда как некоторые контрольные ячейки не содержат результатов более ранней модели.

Таким образом, общественное воздействие зависит от проверки и удобства использования. Если независимые тесты подтвердят заявленные преимущества визуального агента и его реализацию смогут реализовать другие исследователи, релиз может расширить доступ к функциональной открытой модели для экспериментов с изображениями и текстом. Источник не устанавливает происхождение данных обучения, оценки безопасности, отказное поведение, защиту конфиденциальности, коммерческую поддержку или пригодность для принятия последующих решений. Эти упущения ограничивают то, что можно сделать ответственный вывод только на основе этого релиза.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Основные вопросы заключаются в том, воспроизводят ли независимые оценки результаты DeepSeek, сколько аппаратного и инженерного обеспечения модель требует на практике и становится ли легче развертывать экспериментальную реализацию репозитория. Пользователям также следует искать более полную информацию о данных, тестах на безопасность и производительности за пределами перечисленных тестов.

Доступность — это непосредственный практический вопрос. На странице Hugging Face указано, что модель не развернута ни одним поставщиком логических выводов, а исходный снимок показывает нулевую загрузку. Вместо этого пользователи направляются к локальным или самоуправляемым маршрутам, таким как Transformers, vLLM, SGLang, Docker и Docker Model Runner. Будущие обновления могут уточнить, станет ли доступен хостинговый доступ, завершен ли минимальный путь вывода и какие конфигурации оборудования реалистичны за пределами примера с тензорно-параллельным четырьмя.

Независимая репликация должна быть сосредоточена на мультимодальных утверждениях и на справедливом сравнении с предыдущей моделью. Оценщикам необходимо будет принять во внимание примечание источника о том, что DeepSeek-V4-Flash-0731 игнорировал визуальные элементы в двух перечисленных тестах. Им также следует проверить непроверенный статус результатов карты модели, сообщить точные подсказки и настройки проводки, а также проверить, сохраняется ли производительность при работе с изображениями, языками, задачами и случаями сбоев, не представленными в опубликованной таблице.

Экспериментальный статус релиза требует внимания к инженерным изменениям. Репозиторий отделяет форматирование подсказок от вывода PyTorch, поддерживает как блоки контента JSON в стиле OpenAI, так и компактную текстовую нотацию, а также преобразование контрольных точек документов. Обновления этих компонентов могут повлиять на воспроизводимость и развертывание. Источник не сообщает, насколько стабильны интерфейсы, как часто будут меняться веса или код, а также все ли задокументированные пути обслуживания в равной степени поддерживают функции видения.

Информация о безопасности и управлении является еще одним важным неизвестным. Источник описывает архитектуру, использование, тесты и лицензирование, но не обеспечивает тестирование безопасности или ограничения для понимания изображения. Прежде чем использовать модель с конфиденциальными изображениями или последующими рабочими процессами, организациям потребуются данные об обработке данных, визуальных ошибках, безопасности, устойчивости к неправильному использованию и человеческом надзоре. Ни одно из этих свойств не может быть выведено из результатов тестов или лицензии MIT.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаИИ-агентыChatGPT и LLMОбучение искусственному интеллектуПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?