Kembali ke Berita
ProdukAI Understanding pengarahan

llama.cpp 0.4.0 menambahkan dukungan untuk model AI dan input video yang lebih baru

Rilis llama.cpp 0.4.0 menambahkan dukungan awal untuk Qwen3.8-Flash-Next dan NVIDIA Nemotron-3-Puzzle, opsi input video, batas konteks server per slot, pembacaan tensor lambat, dan perubahan ggml 0.23.0.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
Dokumen sumber utamaSumber direkam
Penerbit
github.com
Tautan sumber
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
Juga dikutip

Cerita terakhir direvisi

KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

API (Antarmuka Pemrograman Aplikasi)
Cara terstruktur bagi satu sistem perangkat lunak untuk mengirim permintaan dan menerima tanggapan dari sistem lain.
Memori (Memori Agen)
Konteks tersimpan yang digunakan agen AI di seluruh langkah atau sesi untuk meningkatkan kontinuitas.
Model Multimoda
Model yang dapat memproses atau menghasilkan beberapa tipe data seperti teks, gambar, dan audio.
Uji diri Anda sendiriKuis Penjelasan Model AI

Apa yang berubah sejak publikasi

  1. Pertama kali diterbitkan
  2. Entri llama.cpp sebelumnya mencakup dukungan pra-rilis untuk Nemotron-3-Puzzle NVIDIA. Versi 0.4.0 kini menyertakan dukungan Nemotron-3-Puzzle-75B-A9B dalam rilis bertanda lebih luas yang juga menambahkan arsitektur model baru, input video, kontrol konteks server, pembacaan tensor lambat, dan pekerjaan backend ggml 0.23.0.

Apa yang terjadi

llama.cpp merilis versi 0.4.0 di GitHub pada tanggal 4 September. Rilis ini menambahkan dukungan awal untuk Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark untuk Nemotron 3.5, nanbeige4.2-3B, dan DeepSeek-V4-Flash-Vision-Exp. Ini juga menambahkan parameter input video, batas konteks server per slot, pembacaan tensor lambat, perubahan perutean ahli, peningkatan cache KV, dan beberapa pengoptimalan backend. Rilis ini memperbarui ggml dari 0.22.0 menjadi 0.23.0. Proyek tersebut mengatakan bahwa versi tersebut menambahkan perhatian flash yang jarang, eksekusi asinkron dan API ketergantungan alokasi, peristiwa RPC dan API asinkron, serta dukungan transportasi RDMA Apple. Halaman ini mencantumkan bangunan malam yang diidentifikasi sebagai b10809. Itu tidak mendokumentasikan ketersediaan paket biner, persyaratan instalasi, distribusi bobot model, atau harga.

Halaman rilis GitHub mengidentifikasi v0.4.0 sebagai rilis terbaru dan mencatat waktu publikasi 4 September pukul 19:56, tanpa menentukan zona waktu dalam teks yang disediakan. Rilis ini mencakup perubahan API seperti llama_lazy_mode, kontrol ukuran buffer quantizer, versi sesi dan status yang diperbarui, dan pembantu tokenisasi multimodal baru.

Perubahan model dan inti mencakup dukungan arsitektur awal Qwen3.8-Flash-Next, dukungan NVIDIA Nemotron-3-Puzzle-75B-A9B, dukungan DSpark untuk Nemotron 3.5, dukungan nanbeige4.2-3B, pembacaan tensor lambat, perutean ahli per lapisan, pencarian riwayat n-gram, peningkatan pemulihan cache KV, dan perlindungan terhadap puncak RAM selama pemuatan model.

Perubahan multimodal dan server mencakup dukungan DeepSeek-V4-Flash-Vision-Exp, opsi baris perintah video, batas konteks per slot, URL data untuk media, pelestarian default output penalaran, dan penolakan panggilan alat asisten yang telah diisi sebelumnya. UI juga mengubah kebijakan alat dan perilaku pengaturan, namun sumbernya tidak memberikan data adopsi atau kinerja pengguna.

Detail sumber: github.com ↗

Mengapa itu penting

Ini adalah pembaruan substansial pada runtime sumber terbuka yang digunakan oleh pengembang yang membuat inferensi AI dan aplikasi multimodal. Cakupan modelnya yang diperluas dapat membuat model yang lebih baru dirilis dapat diuji dalam sistem berbasis llama.cpp, sementara dukungan input video memperluas jenis media yang dapat diproses oleh sistem tersebut. Sumber ini menjelaskan kinerja dan pekerjaan terkait memori, namun tidak memberikan tolok ukur independen, sehingga keuntungan praktis akan bergantung pada perangkat keras, format model, dan konfigurasi penerapan.

Rilis ini menghubungkan beberapa arsitektur model baru ke basis kode inferensi yang banyak digunakan, termasuk dukungan awal Qwen3.8-Flash-Next dan Nemotron-3-Puzzle. Hal ini dapat mengurangi upaya integrasi bagi pengembang yang bereksperimen dengan model tersebut, meskipun sumbernya tidak menetapkan kompatibilitas di setiap platform atau konfigurasi.

Pembaruan ggml menambahkan infrastruktur untuk perhatian yang jarang, backend asinkron, peristiwa panggilan prosedur jarak jauh, dan Apple RDMA. Perubahan ini mungkin penting untuk penerapan yang dapat menggunakan backend spesifik tersebut, namun halaman rilis tidak mengukur latensi, throughput, penggunaan memori, atau peningkatan keandalan.

Parameter video, dukungan data-URL untuk media, dan perubahan pra-pemrosesan multimodal memberikan jalur yang lebih konkrit untuk aplikasi yang menangani video dan media lainnya. Sumbernya tidak menyatakan apakah kemampuan ini tersedia dalam paket build atau dalam batasan spesifik model apa.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Pemeriksaan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang harus ditonton selanjutnya

Rilis tindak lanjut, pengujian khusus backend, dan dokumentasi harus memperjelas bagaimana model baru dan fitur video berperilaku di seluruh perangkat keras yang didukung. Ketidakpastian yang paling mendesak adalah apakah implementasi awal Qwen3.8-Flash-Next menerima pekerjaan pengoptimalan yang dijanjikan dan seberapa besar perubahan sparse-attention dan memori meningkatkan beban kerja sebenarnya.

Perhatikan pembaruan pengoptimalan pada Qwen3.8-Flash-Next dan perbaikan tambahan untuk jalur model multimodal yang baru ditambahkan.

Perhatikan hasil benchmark yang memisahkan klaim implementasi halaman rilis dari peningkatan terukur dalam kecepatan, penggunaan memori, dan konkurensi.

Perhatikan dokumentasi tentang akses paket, file model yang didukung, persyaratan perangkat keras, dan kesiapan produksi. Detail tersebut tidak diberikan di halaman rilis.

Panduan & kuis terkait

Model AI DijelaskanChatGPT & LLMtransformatorUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI

Pembaruan dan koreksi

Kisah kanonik ini diperbarui ketika peristiwa yang berkembang berubah secara signifikan. URL dan tanggal publikasi aslinya tidak pernah berubah.

  • Entri llama.cpp sebelumnya mencakup dukungan pra-rilis untuk Nemotron-3-Puzzle NVIDIA. Versi 0.4.0 kini menyertakan dukungan Nemotron-3-Puzzle-75B-A9B dalam rilis bertanda lebih luas yang juga menambahkan arsitektur model baru, input video, kontrol konteks server, pembacaan tensor lambat, dan pekerjaan backend ggml 0.23.0.
Lihat log koreksi publik
Apakah ini berguna?