Kembali ke Berita
produkAI Understanding taklimat

llama.cpp 0.4.0 menambah sokongan untuk model AI dan input video yang lebih baharu

Keluaran llama.cpp 0.4.0 menambah sokongan awal untuk Qwen3.8-Flash-Next dan NVIDIA Nemotron-3-Puzzle, pilihan input video, had konteks pelayan setiap slot, bacaan tensor malas dan perubahan ggml 0.23.0.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
Dokumen sumber utamaSumber direkodkan
Penerbit
github.com
Pautan sumber
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
Juga dipetik

Cerita terakhir disemak

KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Model Multimodal
Model yang boleh memproses atau menjana berbilang jenis data seperti teks, imej dan audio.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berubah sejak penerbitan

  1. Pertama kali diterbitkan
  2. Entri llama.cpp terdahulu meliputi sokongan prakeluaran untuk Nemotron-3-Puzzle NVIDIA. Versi 0.4.0 kini termasuk sokongan Nemotron-3-Puzzle-75B-A9B dalam keluaran berteg yang lebih luas yang turut menambah seni bina model yang lebih baharu, input video, kawalan konteks pelayan, pembacaan tensor malas dan kerja hujung belakang ggml 0.23.0.

Apa yang berlaku

llama.cpp mengeluarkan versi 0.4.0 pada GitHub pada 4 September. Keluaran ini menambah sokongan awal untuk Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark untuk Nemotron 3.5, nanbeige4.2-3B, dan DeepSeek-V4-Flash-Vision-Exp. Ia juga menambah parameter input video, had konteks pelayan setiap slot, membaca tensor malas, perubahan penghalaan pakar, penambahbaikan cache KV dan pengoptimuman berbilang bahagian belakang. Keluaran mengemas kini ggml dari 0.22.0 hingga 0.23.0. Projek itu mengatakan bahawa versi menambah perhatian kilat yang jarang, pelaksanaan tak segerak dan API kebergantungan peruntukan, acara RPC dan API async, dan sokongan pengangkutan Apple RDMA. Halaman tersebut menyenaraikan binaan setiap malam yang dikenal pasti sebagai b10809. Ia tidak mendokumenkan ketersediaan binari berpakej, keperluan pemasangan, pengedaran berat model atau harga.

Halaman keluaran GitHub mengenal pasti v0.4.0 sebagai keluaran terkini dan merekodkan masa penerbitan 4 September 19:56, tanpa menyatakan zon waktu dalam teks yang dibekalkan. Keluaran ini termasuk perubahan API seperti llama_lazy_mode, kawalan saiz penimbal pengkuantiti, versi sesi dan keadaan terkini serta pembantu tokenisasi berbilang mod baharu.

Perubahan model dan teras termasuk sokongan seni bina Qwen3.8-Flash-Next awal, sokongan NVIDIA Nemotron-3-Puzzle-75B-A9B, sokongan DSpark untuk Nemotron 3.5, sokongan nanbeige4.2-3B, pembacaan tensor yang malas, penghalaan pakar setiap lapisan, pencarian sejarah n-gram dan penambahbaikan RAM semasa penyimpanan, model penyimpanan pearks KV. memuatkan.

Perubahan multimodal dan pelayan termasuk sokongan DeepSeek-V4-Flash-Vision-Exp, pilihan baris arahan video, had konteks setiap slot, URL data untuk media, pemeliharaan lalai output penaakulan dan penolakan panggilan alat pembantu yang dipraisi. UI juga mengubah dasar alat dan tingkah laku tetapan, tetapi sumbernya tidak memberikan data penerimaan atau prestasi pengguna.

Butiran sumber: github.com ↗

Mengapa ia penting

Ini ialah kemas kini yang besar kepada masa jalan sumber terbuka yang digunakan oleh pembangun membina inferens AI dan aplikasi multimodal. Liputan model yang diperluaskan boleh menjadikan model yang dikeluarkan baru-baru ini boleh diuji dalam sistem berasaskan llama.cpp, manakala sokongan input video meluaskan jenis media yang boleh diproses oleh sistem tersebut. Sumber menerangkan prestasi dan kerja berkaitan memori, tetapi tidak menyediakan penanda aras bebas, jadi keuntungan praktikal akan bergantung pada perkakasan, format model dan konfigurasi penggunaan.

Keluaran ini menghubungkan beberapa seni bina model yang lebih baharu kepada pangkalan kod inferens yang digunakan secara meluas, termasuk sokongan Qwen3.8-Flash-Next dan Nemotron-3-Puzzle awal. Ini mungkin mengurangkan kerja penyepaduan untuk pembangun yang bereksperimen dengan model tersebut, walaupun sumbernya tidak mewujudkan keserasian merentas setiap platform atau konfigurasi.

Kemas kini ggml menambah infrastruktur untuk perhatian yang jarang, hujung belakang tak segerak, acara panggilan prosedur jauh dan Apple RDMA. Perubahan ini mungkin penting untuk penempatan yang boleh menggunakan bahagian belakang khusus tersebut, tetapi halaman keluaran tidak mengukur kependaman, daya pemprosesan, penggunaan memori atau peningkatan kebolehpercayaan.

Parameter video, sokongan data-URL untuk media dan perubahan prapemprosesan berbilang mod menyediakan laluan yang lebih konkrit untuk aplikasi yang mengendalikan video dan media lain. Sumber tidak menyatakan sama ada keupayaan ini tersedia dalam binaan berpakej atau di bawah batasan khusus model.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Keluaran susulan, ujian khusus bahagian belakang dan dokumentasi harus menjelaskan cara model dan ciri video baharu berkelakuan merentas perkakasan yang disokong. Ketidakpastian yang paling segera ialah sama ada pelaksanaan awal Qwen3.8-Flash-Next menerima kerja pengoptimuman yang dijanjikan dan berapa banyak perubahan perhatian dan memori yang jarang meningkatkan beban kerja sebenar.

Nantikan kemas kini pengoptimuman kepada Qwen3.8-Flash-Next dan pembetulan tambahan untuk laluan model multimodal yang baru ditambah.

Perhatikan hasil penanda aras yang memisahkan tuntutan pelaksanaan halaman keluaran daripada keuntungan terukur dalam kelajuan, penggunaan memori dan serentak.

Tonton dokumentasi tentang akses berpakej, fail model yang disokong, keperluan perkakasan dan kesediaan pengeluaran. Butiran tersebut tidak dibekalkan oleh halaman keluaran.

Panduan & kuiz berkaitan

Model AI DiterangkanChatGPT & LLMTransformerUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI

Kemas kini dan pembetulan

Kisah kanonik ini dikemas kini apabila peristiwa yang sedang berkembang berubah secara material. URL dan tarikh penerbitan asalnya tidak pernah berubah.

  • Entri llama.cpp terdahulu meliputi sokongan prakeluaran untuk Nemotron-3-Puzzle NVIDIA. Versi 0.4.0 kini termasuk sokongan Nemotron-3-Puzzle-75B-A9B dalam keluaran berteg yang lebih luas yang turut menambah seni bina model yang lebih baharu, input video, kawalan konteks pelayan, pembacaan tensor malas dan kerja hujung belakang ggml 0.23.0.
Lihat log pembetulan awam
Adakah ini berguna?