Kembali ke Berita
produkAI Understanding taklimat

DeepSeek menerbitkan model V4 Flash percubaan dengan keupayaan penglihatan

DeepSeek telah menerbitkan DeepSeek-V4-Flash-Vision-Exp, model multimodal eksperimen yang menambahkan modul visual pada seni bina V4-Flash dan melaporkan prestasi yang lebih baik pada beberapa penanda aras ejen visual.

5 min readRead the primary source
Source-provided image accompanying DeepSeek publishes experimental V4 Flash model with vision capabilities
Dokumen sumber utamaSumber direkodkan
Penerbit
huggingface.co
Pautan sumber
huggingface.cohttps://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Penyahkodan Spekulatif
Kaedah pecutan inferens di mana model draf kecil mencadangkan token yang disahkan oleh model yang lebih besar secara selari.
Model Multimodal
Model yang boleh memproses atau menjana berbilang jenis data seperti teks, imej dan audio.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

DeepSeek menerbitkan DeepSeek-V4-Flash-Vision-Exp pada Hugging Face sebagai model multimodal percubaan pertamanya dalam keluarga DeepSeek-V4. Kad model mengatakan ia menambah modul visual dan latihan berterusan kepada seni bina DeepSeek-V4-Flash, dengan keuntungan yang dilaporkan pada tugas ejen multimodal sambil mengekalkan prestasi yang setanding pada tugas ejen teks sahaja.

Rekod Hugging Face mengenal pasti DeepSeek-V4-Flash-Vision-Exp sebagai model imej-teks-ke-teks menggunakan Transformers. Kad modelnya menggambarkannya sebagai model multimodal eksperimen pertama DeepSeek dalam keluarga V4. Reka bentuk yang dinyatakan menggabungkan seni bina DeepSeek-V4-Flash dengan modul visual dan latihan berterusan bertujuan untuk membuka kunci keupayaan pemahaman visual. Repositori telah dibuat pada 31 Ogos 2026, dan rekod menunjukkan kemas kini seterusnya pada 1 September.

Kad model melaporkan penambahbaikan berbanding DeepSeek-V4-Flash-0731 pada beberapa penilaian ejen multimodal. Ia menyenaraikan skor ApexBench Pass@1 36.5 berbanding 26.2 untuk model terdahulu, skor Peperiksaan Terakhir Ejen 27.3 berbanding 25.2, skor Cartografi 64.3 dan skor ZeroBench Pass@5 35.0. Kad itu juga membandingkan model baharu dengan Opus-4.8, yang disenaraikan pada 39.4 pada ApexBench, 25.7 pada Peperiksaan Terakhir Ejen, 65.0 pada Chartography, dan 34.0 pada ZeroBench.

Untuk tugasan ejen teks, kad model melaporkan 83.9 pada Terminal Bench 2.1, 57.7 pada NL2Repo, 75.3 pada Cybergym, 59.3 pada DeepSWE, 75.9 pada Toolathlon-Verified, 63.6 pada DSBench-Hard dan 25.7 pada AutomationBench. Kad itu mengatakan model baharu itu mengekalkan prestasi ejen teks sahaja yang setanding dengan DeepSeek-V4-Flash-0731, sambil menyatakan bahawa model terdahulu mengabaikan elemen multimodal dalam input ApexBench dan Peperiksaan Terakhir Ejen.

Repositori termasuk fail tokenizer, rujukan pengekodan segera dan pelaksanaan inferens PyTorch yang minimum meliputi pengekod dan penjajar penglihatan, perhatian DFlash, komponen campuran pakar, Hyper-Connections dan laluan hadapan DSpark. Kad model menyediakan arahan untuk Transformers, vLLM, Docker, SGLang dan Docker Model Runner. Contoh SGLangnya menentukan selari tensor empat dan penyahkodan spekulatif DSpark. Metadata yang boleh dilihat menyenaraikan 305 bilion parameter, dan repositori dilesenkan di bawah MIT.

Butiran sumber: huggingface.co ↗

Mengapa ia penting

Keluaran ini memberikan penyelidik dan pembangun akses kepada model besar berlesen MIT yang direka untuk interaksi imej-dan-teks dan aliran kerja ejen. Kegunaan praktikalnya masih tidak pasti kerana penilaian yang dilaporkan adalah daripada kad model, ditandakan sebagai tidak disahkan dan model tidak digunakan oleh penyedia inferens.

Keluaran ini penting kerana penglihatan adalah tujuan langsung model dan bukannya ciri sampingan. Kad model meletakkan DeepSeek-V4-Flash-Vision-Exp untuk keupayaan ejen pelbagai mod, yang bermaksud tugas yang memerlukan sistem AI untuk mentafsir input visual bersama bahasa dan bertindak dalam rangka kerja penilaian. Itu mengembangkan jenis input yang ingin dikendalikan oleh keluarga V4-Flash, walaupun sumbernya tidak menentukan prestasi model dalam produk biasa atau tetapan berkepentingan tinggi.

Repositori menjadikan model itu berpotensi berguna kepada pembangun yang ingin memeriksa, menyesuaikan atau menjalankan sistem multimodal eksperimen. Lesen MIT, rujukan pengekodan segera, fail tokenizer, kod inferens dan contoh menyediakan lebih banyak bahan pelaksanaan daripada pengumuman produk sahaja. Pada masa yang sama, sumber mengatakan serpihan model besar diterangkan oleh indeks dan tidak diduplikasi di dalam daftar keluar sumber yang digunakan untuk memasang repositori. Saiz model dan konfigurasi SGLang berbilang GPU yang disenaraikan menunjukkan bahawa penggunaan mungkin memerlukan, tetapi sumbernya tidak memberikan kos perkakasan sebenar, kependaman atau keperluan memori.

Keputusan yang dilaporkan mencadangkan pertukaran tertentu: DeepSeek menuntut keuntungan besar pada penanda aras ejen multimodal tanpa melepaskan prestasi ejen teks yang setanding. Tuntutan tersebut harus dianggap sebagai keputusan kad model dan bukannya fakta yang ditubuhkan secara bebas. Rekod penilaian mengenal pasti kad model sebagai sumbernya dan menandakan keputusan sebagai tidak disahkan. Perbandingan juga tidak lengkap di beberapa tempat: beberapa skor terdahulu ditandakan dengan nota yang menerangkan bahawa model mengabaikan elemen visual, manakala beberapa sel penanda aras tidak mengandungi hasil model terdahulu.

Oleh itu, kesan awam bergantung pada pengesahan dan kebolehgunaan. Jika ujian bebas mengesahkan keuntungan ejen visual yang dilaporkan dan pelaksanaan boleh dijalankan oleh lebih ramai penyelidik, keluaran itu boleh meluaskan akses kepada model terbuka yang mampu untuk eksperimen imej dan teks. Sumber tidak menetapkan asal data latihan, penilaian keselamatan, tingkah laku penolakan, perlindungan privasi, sokongan komersial atau kesesuaian untuk keputusan berbangkit. Peninggalan tersebut mengehadkan apa yang boleh disimpulkan secara bertanggungjawab daripada keluaran sahaja.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Soalan utama ialah sama ada penilaian bebas menghasilkan semula keputusan DeepSeek, berapa banyak perkakasan dan kejuruteraan model yang diperlukan dalam amalan, dan sama ada pelaksanaan percubaan repositori menjadi lebih mudah untuk digunakan. Pengguna juga harus mencari maklumat yang lebih lengkap tentang data, ujian keselamatan dan prestasi di luar penanda aras yang disenaraikan.

Ketersediaan adalah soalan praktikal segera. Halaman Hugging Face mengatakan model itu tidak digunakan oleh mana-mana penyedia inferens dan petikan sumber menunjukkan muat turun sifar. Pengguna sebaliknya diarahkan ke laluan tempatan atau diurus sendiri seperti Transformers, vLLM, SGLang, Docker dan Docker Model Runner. Kemas kini masa hadapan mungkin menjelaskan sama ada akses yang dihoskan tersedia, sama ada laluan inferens minimum telah lengkap dan konfigurasi perkakasan yang realistik di luar contoh tensor-selari-empat.

Replikasi bebas harus menumpukan pada tuntutan multimodal dan pada perbandingan yang saksama dengan model terdahulu. Penilai perlu mengambil kira nota sumber bahawa DeepSeek-V4-Flash-0731 mengabaikan elemen visual dalam dua ujian tersenarai. Mereka juga harus memeriksa status keputusan kad model yang tidak disahkan, melaporkan gesaan yang tepat dan tetapan memanfaatkan, dan menguji sama ada prestasi bertahan merentas imej, bahasa, tugasan dan kes kegagalan yang tidak diwakili oleh jadual yang diterbitkan.

Status percubaan keluaran memerlukan perhatian kepada perubahan kejuruteraan. Repositori memisahkan pemformatan segera daripada inferens PyTorch, menyokong kedua-dua blok kandungan JSON gaya OpenAI dan notasi teks padat, dan penukaran titik pemeriksaan dokumen. Kemas kini kepada komponen tersebut boleh menjejaskan kebolehulangan dan penggunaan. Sumber tidak menyatakan sejauh mana antara muka stabil, kekerapan pemberat atau kod akan berubah atau sama ada semua laluan penyajian yang didokumenkan menyokong ciri penglihatan secara sama rata.

Maklumat keselamatan dan tadbir urus adalah satu lagi maklumat utama yang tidak diketahui. Sumber menerangkan seni bina, penggunaan, penanda aras dan pelesenan tetapi tidak menyediakan ujian keselamatan atau pengehadan untuk pemahaman imej. Sebelum menggunakan model dengan imej sensitif atau aliran kerja berbangkit, organisasi memerlukan bukti tentang pengendalian data, ralat visual, keselamatan, rintangan penyalahgunaan dan pengawasan manusia. Tiada satu pun daripada sifat tersebut boleh disimpulkan daripada markah penanda aras atau lesen MIT.

Panduan & kuiz berkaitan

Model AI DiterangkanEjen AIChatGPT & LLMLatihan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?