Apa yang berlaku
llama.cpp mengeluarkan versi 0.4.0 pada GitHub pada 4 September. Keluaran ini menambah sokongan awal untuk Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark untuk Nemotron 3.5, nanbeige4.2-3B, dan DeepSeek-V4-Flash-Vision-Exp. Ia juga menambah parameter input video, had konteks pelayan setiap slot, membaca tensor malas, perubahan penghalaan pakar, penambahbaikan cache KV dan pengoptimuman berbilang bahagian belakang. Keluaran mengemas kini ggml dari 0.22.0 hingga 0.23.0. Projek itu mengatakan bahawa versi menambah perhatian kilat yang jarang, pelaksanaan tak segerak dan API kebergantungan peruntukan, acara RPC dan API async, dan sokongan pengangkutan Apple RDMA. Halaman tersebut menyenaraikan binaan setiap malam yang dikenal pasti sebagai b10809. Ia tidak mendokumenkan ketersediaan binari berpakej, keperluan pemasangan, pengedaran berat model atau harga.
Halaman keluaran GitHub mengenal pasti v0.4.0 sebagai keluaran terkini dan merekodkan masa penerbitan 4 September 19:56, tanpa menyatakan zon waktu dalam teks yang dibekalkan. Keluaran ini termasuk perubahan API seperti llama_lazy_mode, kawalan saiz penimbal pengkuantiti, versi sesi dan keadaan terkini serta pembantu tokenisasi berbilang mod baharu.
Perubahan model dan teras termasuk sokongan seni bina Qwen3.8-Flash-Next awal, sokongan NVIDIA Nemotron-3-Puzzle-75B-A9B, sokongan DSpark untuk Nemotron 3.5, sokongan nanbeige4.2-3B, pembacaan tensor yang malas, penghalaan pakar setiap lapisan, pencarian sejarah n-gram dan penambahbaikan RAM semasa penyimpanan, model penyimpanan pearks KV. memuatkan.
Perubahan multimodal dan pelayan termasuk sokongan DeepSeek-V4-Flash-Vision-Exp, pilihan baris arahan video, had konteks setiap slot, URL data untuk media, pemeliharaan lalai output penaakulan dan penolakan panggilan alat pembantu yang dipraisi. UI juga mengubah dasar alat dan tingkah laku tetapan, tetapi sumbernya tidak memberikan data penerimaan atau prestasi pengguna.
Mengapa ia penting
Ini ialah kemas kini yang besar kepada masa jalan sumber terbuka yang digunakan oleh pembangun membina inferens AI dan aplikasi multimodal. Liputan model yang diperluaskan boleh menjadikan model yang dikeluarkan baru-baru ini boleh diuji dalam sistem berasaskan llama.cpp, manakala sokongan input video meluaskan jenis media yang boleh diproses oleh sistem tersebut. Sumber menerangkan prestasi dan kerja berkaitan memori, tetapi tidak menyediakan penanda aras bebas, jadi keuntungan praktikal akan bergantung pada perkakasan, format model dan konfigurasi penggunaan.
Keluaran ini menghubungkan beberapa seni bina model yang lebih baharu kepada pangkalan kod inferens yang digunakan secara meluas, termasuk sokongan Qwen3.8-Flash-Next dan Nemotron-3-Puzzle awal. Ini mungkin mengurangkan kerja penyepaduan untuk pembangun yang bereksperimen dengan model tersebut, walaupun sumbernya tidak mewujudkan keserasian merentas setiap platform atau konfigurasi.
Kemas kini ggml menambah infrastruktur untuk perhatian yang jarang, hujung belakang tak segerak, acara panggilan prosedur jauh dan Apple RDMA. Perubahan ini mungkin penting untuk penempatan yang boleh menggunakan bahagian belakang khusus tersebut, tetapi halaman keluaran tidak mengukur kependaman, daya pemprosesan, penggunaan memori atau peningkatan kebolehpercayaan.
Parameter video, sokongan data-URL untuk media dan perubahan prapemprosesan berbilang mod menyediakan laluan yang lebih konkrit untuk aplikasi yang mengendalikan video dan media lain. Sumber tidak menyatakan sama ada keupayaan ini tersedia dalam binaan berpakej atau di bawah batasan khusus model.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Keluaran susulan, ujian khusus bahagian belakang dan dokumentasi harus menjelaskan cara model dan ciri video baharu berkelakuan merentas perkakasan yang disokong. Ketidakpastian yang paling segera ialah sama ada pelaksanaan awal Qwen3.8-Flash-Next menerima kerja pengoptimuman yang dijanjikan dan berapa banyak perubahan perhatian dan memori yang jarang meningkatkan beban kerja sebenar.
Nantikan kemas kini pengoptimuman kepada Qwen3.8-Flash-Next dan pembetulan tambahan untuk laluan model multimodal yang baru ditambah.
Perhatikan hasil penanda aras yang memisahkan tuntutan pelaksanaan halaman keluaran daripada keuntungan terukur dalam kelajuan, penggunaan memori dan serentak.
Tonton dokumentasi tentang akses berpakej, fail model yang disokong, keperluan perkakasan dan kesediaan pengeluaran. Butiran tersebut tidak dibekalkan oleh halaman keluaran.