Kembali ke Berita
produkAI Understanding taklimat

llama.cpp 0.3.0 menambah sokongan dot3-note multimodal dan pemisahan tensor DeepSeek 4

Projek llama.cpp mengeluarkan versi 0.3.0 dengan sokongan untuk model penglihatan-dan-audio dots3-note, pengendalian pemisahan tensor DeepSeek 4 baharu, ramalan berbilang token GLM-4.5-Air dan kemas kini merentas bahagian belakang inferens dan antara muka webnya.

5 min readRead the primary source
Screenshot of ggml-org’s official llama.cpp v0.3.0 release notes on GitHub, showing its dots3-note and DeepSeek 4 changes. Source-page capture, not a photograph.
Dokumen sumber utamaSumber direkodkan
Penerbit
github.com
Pautan sumber
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.3.0
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Model Sumber Terbuka
Model yang dikeluarkan dengan pemberat awam atau kod untuk pemeriksaan, penyesuaian dan penggunaan semula.
Model Multimodal
Model yang boleh memproses atau menjana berbilang jenis data seperti teks, imej dan audio.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Projek llama.cpp mengeluarkan versi 0.3.0 pada 25 Ogos, menurut halaman keluaran GitHubnya. Kemas kini menambah sokongan untuk model multimodal dots3-note, termasuk jenis cache nilai kunci DSA-ISWA baharu dan menambah pengendalian penglihatan dan audio untuk model tersebut. Ia juga memperkenalkan mod tensor-split untuk DeepSeek 4, membetulkan rollback berbilang jujukan, dan menambah sokongan ramalan berbilang token untuk GLM-4.5-Air.

Halaman GitHub mengenal pasti v0.3.0 sebagai keluaran terbaharu repositori llama.cpp awam dan merekodkan keluaran pada 10:22 pada 25 Ogos. Keluaran dibentangkan sebagai kemas kini versi yang besar dan bukannya tampung penyelenggaraan kecil. Perubahan utamanya melibatkan cara perisian menyokong dan melaksanakan model AI, termasuk model multimodal baharu, ciri inferens khusus model, selari tensor dan perubahan pada komponen kongsi yang digunakan oleh pelayan dan alatan lain. Penambahan model yang paling menonjol ialah dots3-note. Nota keluaran mengatakan llama.cpp menambahkan model bersama-sama dengan jenis cache nilai kunci DSA-ISWA baharu. Mereka secara berasingan menyenaraikan sokongan untuk penglihatan dan audio dots3-note, imej WebP melalui ffmpeg dan algoritma ubah saiz tepat Bantal. Nota itu juga mengatakan pemuatan video telah ditetapkan apabila atom moov fail muncul pada penghujungnya. Perubahan ini menunjukkan bahawa projek itu melangkaui pelaksanaan model berorientasikan teks kepada set input media yang lebih luas, walaupun sumbernya tidak menerangkan keupayaan model atau aplikasi yang dimaksudkan.

Untuk DeepSeek 4, versi 0.3.0 menambah mod tensor-split melalui pilihan "-sm tensor" dan membetulkan rollback apabila berbilang jujukan aktif. Keluaran itu juga melaporkan pembetulan kepada perambatan keadaan tensor-split untuk pelaksanaan selari tensor. Secara berasingan, GLM-4.5-Air menerima sokongan ramalan berbilang token, manakala bailingmoe3 menerima sokongan DSpark. Ini ialah perubahan peringkat pelaksanaan yang mempengaruhi cara model tertentu boleh dilaksanakan, diselaraskan atau dipercepatkan; keluaran itu tidak mendakwa bahawa mereka meningkatkan kualiti model.

Kemas kini juga menaikkan komponen ggml kepada v0.22.0. Nota tersebut menerangkan sokongan tensor-split dalam bahagian belakang meta berbilang hujung belakang ggml, perambatan keadaan belahan yang dipertingkatkan, Sumber logam setiap operasi dengan kompilasi selari dan pembetulan yang menjadikan ggml_clamp sebagai operasi bukan di tempat yang betul. Perubahan tambahan meliputi operasi baharu, kernel Q2_K SYCL, gabungan bias gabungan pakar OpenCL dan pembetulan merentas CUDA, Metal, SYCL, Vulkan, OpenCL dan WebGPU. Pelayan memperoleh pembolehubah persekitaran untuk meluaskan perbezaan slot-debug, dan antara muka web memperoleh navigasi sembang tab.

Butiran sumber: github.com ↗

Mengapa ia penting

Keluaran ini memperluaskan rangkaian model AI dan jenis input yang disokong oleh pelaksanaan sumber terbuka yang digunakan secara meluas sambil menangani masalah memori, selari dan bahagian belakang yang terlibat dalam menjalankan model yang lebih besar atau lebih kompleks. Kesan praktikal akan bergantung pada perkakasan, fail model, konfigurasi binaan dan bahagian belakang khusus yang digunakan.

Kepentingan praktikal ialah timbunan pelaksanaan model sumber terbuka menambah sokongan untuk seni bina dan modaliti model yang lebih pelbagai dalam keluaran yang sama. Bagi pembangun dan penyelidik yang menggunakan llama.cpp, sokongan untuk penglihatan dan input audio dots3-note boleh mengurangkan keperluan untuk mengekalkan laluan pelaksanaan yang berasingan bagi input tersebut. Nota keluaran menetapkan kehadiran sokongan, tetapi mereka tidak menentukan seberapa lengkap, pantas atau boleh dipercayai pada perkakasan tertentu.

Pemisahan tensor adalah penting kerana ia melibatkan cara beban kerja atau keadaan model diedarkan merentas peranti. Perubahan DeepSeek 4 boleh menjadikan perisian lebih boleh digunakan untuk orang yang pengiraan tersedia dibahagikan merentas berbilang peranti, manakala pembetulan balik mungkin penting untuk beban kerja yang mengekalkan lebih daripada satu urutan aktif. Itu adalah faedah operasi yang munasabah berdasarkan perubahan yang disenaraikan, bukan hasil yang diukur: sumber tidak membekalkan daya pemprosesan, memori, kependaman atau perbandingan kadar kegagalan terhadap versi 0.2.0.

Perubahan ggml meluaskan jangkauan keluaran merentas bahagian belakang perkakasan. Penyusunan selari untuk sumber Metal mungkin menjejaskan masa binaan, manakala keadaan pemisahan meta-backend berfungsi dan pembetulan untuk CUDA, SYCL, Vulkan, OpenCL dan WebGPU menangani lapisan mudah alih yang menghubungkan model kepada pelbagai jenis perkakasan. Keluaran itu juga menyenaraikan perubahan unjuran Mamba2 yang bertujuan untuk menghantar GEMM dan bukannya GEMV, tetapi ia tidak mengukur sebarang keuntungan prestasi. Oleh itu, pengguna harus menganggap nota sebagai log perubahan pelaksanaan, bukan sebagai laporan penanda aras.

Keluaran itu penting kepada ekosistem AI yang lebih luas kerana sokongan model dibentuk bukan sahaja oleh pencipta model tetapi juga oleh lapisan perisian yang menjadikan model boleh dilaksanakan pada sistem yang berbeza. Menambah model atau modaliti boleh mempengaruhi projek yang praktikal untuk penempatan tempatan atau khusus. Namun, perkara yang tidak diketahui bermakna kekal: sumber tidak menyatakan lesen atau syarat pengedaran untuk dots3-note, berat model yang diperlukan, sistem pengendalian yang disokong, minimum perkakasan, format audio dan video yang disokong di luar pembetulan yang disenaraikan atau sama ada semua ciri tersedia dalam aset setiap malam.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Nota keluaran tidak menyediakan penanda aras bebas, keperluan perkakasan, matriks keserasian atau bukti penggunaan pengeluaran. Susulan utama ialah sama ada pengguna melaporkan prestasi yang boleh dipercayai untuk laluan penglihatan dan audio dots3-note, pemisahan tensor DeepSeek 4 merentasi peranti dan bahagian belakang CUDA, Metal, SYCL, Vulkan, OpenCL dan WebGPU yang dikemas kini.

Titik pengesahan pertama ialah liputan berfungsi untuk dots3-note. Nota keluaran menamakan penglihatan dan sokongan audio, penyahkodan WebP, pembetulan pemuatan video dan tingkah laku ubah saiz, tetapi ia tidak termasuk contoh ujian atau jadual input yang disokong. Ujian bebas harus menentukan format yang berfungsi, cara prapemprosesan mempengaruhi hasil, sama ada audio dan penglihatan boleh digabungkan, dan sama ada tingkah laku konsisten merentas bahagian belakang yang disokong. Sehingga itu, "sokongan" harus difahami sebagai tuntutan pelaksanaan peringkat projek dan bukannya bukti kesediaan pengeluaran.

Isu kedua ialah kesan dunia sebenar pemisahan tensor DeepSeek 4. Pengguna perlu menentukan sama ada "-sm tensor" berfungsi merentas peranti tertentu mereka, cara memori dibahagikan dan sama ada rollback berbilang jujukan kekal andal di bawah beban kerja yang panjang atau serentak. Sumber tidak memberikan senarai perkakasan, data prestasi atau analisis ralat. Laporan daripada penyelenggara dan pengguna akan sangat berguna kerana tingkah laku selari tensor boleh berbeza-beza mengikut pemacu, ciri yang disusun, gabungan peranti dan konfigurasi model.

Kawasan ketiga ialah pariti bahagian belakang. Keluaran ini menamakan kemas kini untuk CUDA, Metal, SYCL, Vulkan, OpenCL dan WebGPU, tetapi ia tidak menyatakan bahawa setiap model atau operasi baharu berfungsi sama pada setiap bahagian belakang. Log perubahan itu sendiri menyatakan bahawa ujian seni bina dots3-note telah dilumpuhkan untuk WebGPU, yang merupakan sebab konkrit untuk mengelakkan andaian liputan silang-belakang yang lengkap. Dokumentasi susulan atau keputusan ujian harus menjelaskan perkara yang didayakan, percubaan, terhad atau tidak tersedia.

Akhir sekali, keluaran projek seterusnya akan menunjukkan sama ada perubahan ini kekal stabil. Item yang patut dipantau termasuk pembetulan untuk pemuatan dot3-nota dan prapemprosesan media, regresi yang melibatkan ramalan atau pembenaman berbilang token, perubahan selari DeepSeek 4 selanjutnya dan kemas kini pada logik pemadanan slot pelayan. Keluaran ini termasuk aset binaan setiap malam, tetapi sumber tidak menerangkan pembungkusan, kebolehulangan atau hubungannya dengan binaan stabil. Tiada bukti bebas dalam bahan yang dibekalkan menetapkan penggunaan, skala penggunaan atau kesan pengguna.

Panduan & kuiz berkaitan

Model AI DiterangkanTransformerLatihan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?