Quay lại Tin tức
sản phẩmAI Understanding tóm tắt

DeepSeek xuất bản mẫu Flash V4 thử nghiệm với khả năng thị giác

DeepSeek đã xuất bản DeepSeek-V4-Flash-Vision-Exp, một mô hình đa phương thức thử nghiệm bổ sung các mô-đun trực quan vào kiến trúc V4-Flash của nó và báo cáo hiệu suất được cải thiện trên một số điểm chuẩn của tác nhân trực quan.

5 min readRead the primary source
Source-provided image accompanying DeepSeek publishes experimental V4 Flash model with vision capabilities
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
huggingface.co
Liên kết nguồn
huggingface.cohttps://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Bộ nhớ (Bộ nhớ tác nhân)
Bối cảnh được lưu trữ mà tác nhân AI sử dụng qua các bước hoặc phiên để cải thiện tính liên tục.
Giải mã suy đoán
Một phương pháp tăng tốc suy luận trong đó một mô hình dự thảo nhỏ đề xuất các mã thông báo mà một mô hình lớn hơn sẽ xác minh song song.
Mô hình đa phương thức
Một mô hình có thể xử lý hoặc tạo ra nhiều loại dữ liệu như văn bản, hình ảnh và âm thanh.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

DeepSeek đã xuất bản DeepSeek-V4-Flash-Vision-Exp trên Hugging Face làm mô hình đa phương thức thử nghiệm đầu tiên trong dòng DeepSeek-V4. Thẻ mô hình cho biết nó bổ sung các mô-đun trực quan và tiếp tục đào tạo cho kiến ​​trúc DeepSeek-V4-Flash, với mức tăng được báo cáo về các tác vụ tác nhân đa phương thức trong khi vẫn duy trì hiệu suất tương đương đối với các tác vụ tác nhân chỉ có văn bản.

Bản ghi Hugging Face xác định DeepSeek-V4-Flash-Vision-Exp là mô hình chuyển văn bản thành văn bản bằng cách sử dụng Transformers. Thẻ mô hình của nó mô tả nó là mô hình đa phương thức thử nghiệm đầu tiên của DeepSeek trong dòng V4. Thiết kế đã nêu kết hợp kiến ​​trúc DeepSeek-V4-Flash với các mô-đun trực quan và đào tạo liên tục nhằm mở khóa khả năng hiểu thị giác. Kho lưu trữ được tạo vào ngày 31 tháng 8 năm 2026 và bản ghi hiển thị bản cập nhật tiếp theo vào ngày 1 tháng 9.

Thẻ mô hình báo cáo các cải tiến so với DeepSeek-V4-Flash-0731 trên một số đánh giá tác nhân đa phương thức. Nó liệt kê điểm ApexBench Pass@1 là 36,5 so với 26,2 đối với mô hình trước đó, điểm Bài kiểm tra cuối cùng của Đại lý là 27,3 so với 25,2, điểm Biểu đồ là 64,3 và điểm ZeroBench Pass@5 là 35,0. Thẻ cũng so sánh mô hình mới với Opus-4.8, được liệt kê ở mức 39,4 trên ApexBench, 25,7 trong Bài kiểm tra cuối cùng của Đại lý, 65,0 trên Chartography và 34,0 trên ZeroBench.

Đối với các tác vụ tác nhân văn bản, thẻ mẫu báo cáo 83,9 trên Terminal Bench 2.1, 57,7 trên NL2Repo, 75,3 trên Cybergym, 59,3 trên DeepSWE, 75,9 trên Toolathlon-Được xác minh, 63,6 trên DSBench-Hard và 25,7 trên AutomationBench Public. Thẻ cho biết mô hình mới duy trì hiệu suất của tác nhân chỉ có văn bản tương đương với DeepSeek-V4-Flash-0731, đồng thời lưu ý rằng mô hình trước đó đã bỏ qua các yếu tố đa phương thức trong đầu vào ApexBench và Bài kiểm tra cuối cùng của tác nhân.

Kho lưu trữ bao gồm các tệp mã thông báo, tham chiếu mã hóa lời nhắc và triển khai suy luận PyTorch tối thiểu bao gồm bộ mã hóa và căn chỉnh tầm nhìn, chú ý DFlash, các thành phần hỗn hợp chuyên gia, Siêu kết nối và đường dẫn chuyển tiếp DSpark. Thẻ mô hình cung cấp hướng dẫn cho Transformers, vLLM, Docker, SGLang và Docker Model Runner. Ví dụ SGLang của nó chỉ định tính song song tensor của bốn và giải mã suy đoán DSpark. Siêu dữ liệu hiển thị liệt kê 305 tỷ tham số và kho lưu trữ được cấp phép theo MIT.

Chi tiết nguồn: huggingface.co ↗

Tại sao nó quan trọng

Bản phát hành này cung cấp cho các nhà nghiên cứu và nhà phát triển quyền truy cập vào một mô hình lớn được MIT cấp phép được thiết kế cho quy trình làm việc của tác nhân và tương tác hình ảnh và văn bản. Tính hữu dụng thực tế của nó vẫn chưa chắc chắn vì các đánh giá được báo cáo là từ thẻ mô hình, được đánh dấu là chưa được xác minh và mô hình không được nhà cung cấp suy luận triển khai.

Bản phát hành này rất có ý nghĩa vì tầm nhìn là mục đích trực tiếp của mô hình chứ không phải là một tính năng ngẫu nhiên. Thẻ mô hình định vị DeepSeek-V4-Flash-Vision-Exp cho các khả năng của tác nhân đa phương thức, nghĩa là các nhiệm vụ yêu cầu hệ thống AI diễn giải đầu vào trực quan cùng với ngôn ngữ và hành động trong khung đánh giá. Điều đó mở rộng loại đầu vào mà dòng V4-Flash dự định xử lý, mặc dù nguồn không xác định được mô hình hoạt động tốt như thế nào trong các sản phẩm thông thường hoặc cài đặt đặt cược cao.

Kho lưu trữ làm cho mô hình trở nên hữu ích cho các nhà phát triển muốn kiểm tra, điều chỉnh hoặc chạy một hệ thống đa phương thức thử nghiệm. Giấy phép MIT, tài liệu tham khảo mã hóa nhanh, tệp mã thông báo, mã suy luận và ví dụ cung cấp nhiều tài liệu triển khai hơn là chỉ thông báo về sản phẩm. Đồng thời, nguồn cho biết các phân đoạn mô hình lớn được mô tả bằng một chỉ mục và không bị trùng lặp bên trong kiểm tra nguồn được sử dụng để tập hợp kho lưu trữ. Kích thước của mô hình và cấu hình SGLang đa GPU được liệt kê cho thấy rằng việc triển khai có thể đòi hỏi khắt khe nhưng nguồn không cung cấp chi phí phần cứng, độ trễ hoặc yêu cầu bộ nhớ thực tế.

Các kết quả được báo cáo cho thấy một sự cân bằng cụ thể: DeepSeek tuyên bố đạt được lợi ích đáng kể trên các điểm chuẩn của tác nhân đa phương thức mà không từ bỏ hiệu suất của tác nhân văn bản tương đương. Những tuyên bố đó nên được coi là kết quả của thẻ mẫu hơn là sự thật được thiết lập độc lập. Bản ghi đánh giá xác định thẻ mẫu là nguồn của chúng và đánh dấu kết quả là chưa được xác minh. Việc so sánh cũng chưa đầy đủ ở một số chỗ: một số điểm đa phương thức của mô hình trước đó được đánh dấu bằng ghi chú giải thích rằng mô hình đã bỏ qua các yếu tố hình ảnh, trong khi một số ô điểm chuẩn không chứa kết quả của mô hình trước đó.

Do đó, tác động của công chúng phụ thuộc vào việc xác minh và khả năng sử dụng. Nếu các thử nghiệm độc lập xác nhận mức tăng tác nhân thị giác được báo cáo và việc triển khai có thể được thực hiện bởi nhiều nhà nghiên cứu hơn, thì việc phát hành có thể mở rộng quyền truy cập vào một mô hình mở có khả năng để thử nghiệm hình ảnh và văn bản. Nguồn không thiết lập nguồn gốc dữ liệu đào tạo, đánh giá an toàn, hành vi từ chối, bảo vệ quyền riêng tư, hỗ trợ thương mại hoặc sự phù hợp cho các quyết định tiếp theo. Những thiếu sót đó sẽ hạn chế những gì có thể được kết luận một cách có trách nhiệm chỉ từ việc phát hành.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Các câu hỏi chính là liệu các đánh giá độc lập có tái tạo các kết quả của DeepSeek hay không, mô hình yêu cầu bao nhiêu phần cứng và kỹ thuật trong thực tế và liệu việc triển khai thử nghiệm của kho lưu trữ có trở nên dễ triển khai hơn hay không. Người dùng cũng nên tìm kiếm thông tin đầy đủ hơn về dữ liệu, kiểm tra an toàn và hiệu suất ngoài các tiêu chuẩn được liệt kê.

Sự sẵn có là một câu hỏi thực tế ngay lập tức. Trang Hugging Face cho biết mô hình này không được triển khai bởi bất kỳ nhà cung cấp suy luận nào và ảnh chụp nhanh nguồn hiển thị không có lượt tải xuống nào. Thay vào đó, người dùng được hướng tới các tuyến cục bộ hoặc tự quản lý như Transformers, vLLM, SGLang, Docker và Docker Model Runner. Các bản cập nhật trong tương lai có thể làm rõ liệu quyền truy cập được lưu trữ có khả dụng hay không, liệu đường dẫn suy luận tối thiểu đã hoàn tất hay chưa và cấu hình phần cứng nào là thực tế ngoài ví dụ tensor-song song-bốn.

Việc nhân rộng độc lập nên tập trung vào các tuyên bố đa phương thức và so sánh công bằng với mô hình trước đó. Người đánh giá sẽ cần tính đến ghi chú của nguồn rằng DeepSeek-V4-Flash-0731 đã bỏ qua các yếu tố hình ảnh trong hai thử nghiệm được liệt kê. Họ cũng nên kiểm tra trạng thái chưa được xác minh của kết quả thẻ mô hình, báo cáo lời nhắc chính xác và cài đặt khai thác, đồng thời kiểm tra xem hiệu suất có được duy trì trên các hình ảnh, ngôn ngữ, tác vụ và trường hợp lỗi không được biểu thị trong bảng đã xuất bản hay không.

Trạng thái thử nghiệm của bản phát hành đảm bảo sự chú ý đến những thay đổi kỹ thuật. Kho lưu trữ tách định dạng nhắc nhở khỏi suy luận PyTorch, hỗ trợ cả khối nội dung JSON kiểu OpenAI và ký hiệu văn bản nhỏ gọn cũng như chuyển đổi điểm kiểm tra tài liệu. Các bản cập nhật cho các thành phần đó có thể ảnh hưởng đến khả năng tái tạo và triển khai. Nguồn không cho biết mức độ ổn định của các giao diện, tần suất trọng số hoặc mã sẽ thay đổi hoặc liệu tất cả các đường dẫn phân phát được ghi lại có hỗ trợ các tính năng tầm nhìn như nhau hay không.

Thông tin về an toàn và quản trị cũng là một ẩn số lớn khác. Nguồn mô tả kiến ​​trúc, cách sử dụng, điểm chuẩn và cấp phép nhưng không cung cấp thử nghiệm an toàn hoặc giới hạn cho việc hiểu hình ảnh. Trước khi sử dụng mô hình có hình ảnh nhạy cảm hoặc quy trình làm việc tiếp theo, các tổ chức sẽ cần bằng chứng về việc xử lý dữ liệu, lỗi hình ảnh, bảo mật, khả năng chống lạm dụng và giám sát của con người. Không có thuộc tính nào trong số đó có thể được suy ra từ điểm chuẩn hoặc giấy phép MIT.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIĐại lý AIChatGPT & LLMĐào tạo AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?