Apa yang terjadi
DeepSeek menerbitkan DeepSeek-V4-Flash-Vision-Exp di Hugging Face sebagai model multimodal eksperimental pertama dalam keluarga DeepSeek-V4. Kartu model tersebut mengatakan bahwa ia menambahkan modul visual dan pelatihan lanjutan ke arsitektur DeepSeek-V4-Flash, dengan peningkatan yang dilaporkan pada tugas agen multimodal sambil mempertahankan kinerja yang sebanding pada tugas agen hanya teks.
Catatan Hugging Face mengidentifikasi DeepSeek-V4-Flash-Vision-Exp sebagai model gambar-teks-ke-teks menggunakan Transformers. Kartu modelnya menggambarkannya sebagai model multimodal eksperimental pertama DeepSeek dalam keluarga V4. Desain yang disebutkan menggabungkan arsitektur DeepSeek-V4-Flash dengan modul visual dan pelatihan berkelanjutan yang dimaksudkan untuk membuka kemampuan pemahaman visual. Repositori dibuat pada tanggal 31 Agustus 2026, dan catatan menunjukkan pembaruan berikutnya pada tanggal 1 September.
Kartu model melaporkan peningkatan dibandingkan DeepSeek-V4-Flash-0731 pada beberapa evaluasi agen multimodal. Ini mencantumkan skor ApexBench Pass@1 sebesar 36,5 versus 26,2 untuk model sebelumnya, skor Ujian Terakhir Agen sebesar 27,3 versus 25,2, skor Chartography sebesar 64,3, dan skor ZeroBench Pass@5 sebesar 35,0. Kartu tersebut juga membandingkan model baru dengan Opus-4.8, yang tercantum pada 39,4 di ApexBench, 25,7 pada Ujian Terakhir Agen, 65,0 di Chartography, dan 34,0 di ZeroBench.
Untuk tugas agen teks, kartu model melaporkan 83,9 pada Terminal Bench 2.1, 57,7 pada NL2Repo, 75,3 pada Cybergym, 59,3 pada DeepSWE, 75,9 pada Toolathlon-Terverifikasi, 63,6 pada DSBench-Hard, dan 25,7 pada AutomationBench Public. Kartu tersebut mengatakan bahwa model baru ini mempertahankan kinerja agen hanya teks yang sebanding dengan DeepSeek-V4-Flash-0731, sambil mencatat bahwa model sebelumnya mengabaikan elemen multimodal dalam masukan ApexBench dan Ujian Terakhir Agen.
Repositori mencakup file tokenizer, referensi pengkodean cepat, dan implementasi inferensi PyTorch minimal yang mencakup encoder dan penyelaras visi, perhatian DFlash, komponen campuran ahli, Hyper-Connections, dan jalur penerusan DSpark. Kartu model memberikan instruksi untuk Transformers, vLLM, Docker, SGLang, dan Docker Model Runner. Contoh SGLangnya menentukan paralelisme tensor empat dan decoding spekulatif DSpark. Metadata yang terlihat mencantumkan 305 miliar parameter, dan repositori dilisensikan di bawah MIT.
Detail sumber: huggingface.co ↗
Mengapa itu penting
Rilis ini memberikan peneliti dan pengembang akses ke model besar berlisensi MIT yang dirancang untuk interaksi gambar dan teks serta alur kerja agen. Kegunaan praktisnya masih belum pasti karena evaluasi yang dilaporkan berasal dari kartu model, ditandai belum terverifikasi, dan model tersebut tidak diterapkan oleh penyedia inferensi.
Rilis ini penting karena visi adalah tujuan langsung dari model, bukan fitur insidental. Kartu model memposisikan DeepSeek-V4-Flash-Vision-Exp untuk kemampuan agen multimodal, yang berarti tugas yang memerlukan sistem AI untuk menafsirkan masukan visual bersama dengan bahasa dan bertindak dalam kerangka evaluasi. Hal ini memperluas jenis input yang ingin ditangani oleh keluarga V4-Flash, meskipun sumbernya tidak menentukan seberapa baik kinerja model dalam produk biasa atau pengaturan berisiko tinggi.
Repositori membuat model tersebut berpotensi berguna bagi pengembang yang ingin memeriksa, mengadaptasi, atau menjalankan sistem multimodal eksperimental. Lisensi MIT, referensi pengkodean cepat, file tokenizer, kode inferensi, dan contoh memberikan lebih banyak materi implementasi daripada pengumuman produk saja. Pada saat yang sama, sumber mengatakan pecahan model besar dijelaskan oleh indeks dan tidak diduplikasi di dalam checkout sumber yang digunakan untuk merakit repositori. Ukuran model dan konfigurasi multi-GPU SGLang yang tercantum menunjukkan bahwa penerapannya mungkin sulit, namun sumbernya tidak memberikan biaya perangkat keras, latensi, atau kebutuhan memori yang sebenarnya.
Hasil yang dilaporkan menunjukkan trade-off tertentu: DeepSeek mengklaim keuntungan besar pada tolok ukur agen multimodal tanpa mengorbankan kinerja agen teks yang sebanding. Klaim-klaim tersebut harus diperlakukan sebagai hasil dari sebuah contoh dan bukan sebagai fakta yang ditetapkan secara independen. Catatan evaluasi mengidentifikasi kartu model sebagai sumbernya dan menandai hasilnya sebagai belum diverifikasi. Perbandingan juga tidak lengkap di beberapa tempat: beberapa skor sebelumnya ditandai dengan catatan yang menjelaskan bahwa model mengabaikan elemen visual, sementara beberapa sel benchmark tidak berisi hasil model sebelumnya.
Oleh karena itu, dampaknya terhadap publik bergantung pada verifikasi dan kegunaan. Jika pengujian independen mengkonfirmasi keuntungan agen visual yang dilaporkan dan penerapannya dapat dijalankan oleh lebih banyak peneliti, rilis ini dapat memperluas akses ke model terbuka yang mumpuni untuk eksperimen gambar dan teks. Sumber tidak menetapkan asal data pelatihan, evaluasi keselamatan, perilaku penolakan, perlindungan privasi, dukungan komersial, atau kesesuaian untuk keputusan penting. Kelalaian tersebut membatasi apa yang dapat disimpulkan secara bertanggung jawab hanya dari rilis tersebut.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Apa yang harus ditonton selanjutnya
Pertanyaan utamanya adalah apakah evaluasi independen mereproduksi hasil DeepSeek, berapa banyak perangkat keras dan rekayasa yang dibutuhkan model dalam praktiknya, dan apakah implementasi eksperimental repositori menjadi lebih mudah untuk diterapkan. Pengguna juga harus mencari informasi yang lebih lengkap tentang data, pengujian keamanan, dan kinerja di luar tolok ukur yang tercantum.
Ketersediaan adalah pertanyaan praktis yang mendesak. Halaman Hugging Face menyatakan bahwa model tidak diterapkan oleh penyedia inferensi mana pun, dan cuplikan sumber menunjukkan nol unduhan. Pengguna malah diarahkan ke rute lokal atau yang dikelola sendiri seperti Transformers, vLLM, SGLang, Docker, dan Docker Model Runner. Pembaruan di masa mendatang dapat memperjelas apakah akses yang dihosting telah tersedia, apakah jalur inferensi minimal telah selesai, dan konfigurasi perangkat keras apa yang realistis di luar contoh tensor-paralel-empat.
Replikasi independen harus fokus pada klaim multimodal dan perbandingan yang adil dengan model sebelumnya. Evaluator harus mempertimbangkan catatan sumber bahwa DeepSeek-V4-Flash-0731 mengabaikan elemen visual dalam dua pengujian yang terdaftar. Mereka juga harus memeriksa status hasil kartu model yang belum diverifikasi, melaporkan perintah yang tepat dan pengaturan harness, dan menguji apakah kinerja berlaku di seluruh gambar, bahasa, tugas, dan kasus kegagalan yang tidak diwakili oleh tabel yang dipublikasikan.
Status eksperimental rilis ini memerlukan perhatian terhadap perubahan teknis. Repositori memisahkan pemformatan cepat dari inferensi PyTorch, mendukung blok konten JSON gaya OpenAI dan notasi teks ringkas, serta konversi pos pemeriksaan dokumen. Pembaruan pada komponen tersebut dapat memengaruhi reproduktifitas dan penerapan. Sumber tersebut tidak menyebutkan seberapa stabil antarmuka tersebut, seberapa sering bobot atau kode akan berubah, atau apakah semua jalur penyajian yang terdokumentasi mendukung fitur vision secara setara.
Informasi keselamatan dan tata kelola juga merupakan hal yang belum diketahui. Sumber ini menjelaskan arsitektur, penggunaan, tolok ukur, dan perizinan tetapi tidak memberikan pengujian keamanan atau batasan untuk pemahaman gambar. Sebelum menggunakan model dengan gambar sensitif atau alur kerja konsekuensial, organisasi memerlukan bukti tentang penanganan data, kesalahan visual, keamanan, resistensi penyalahgunaan, dan pengawasan manusia. Tak satu pun dari properti tersebut dapat disimpulkan dari skor benchmark atau lisensi MIT.