Dzokera kuNhau
ProductAI Understanding muchidimbu

llama.cpp 0.4.0 inowedzera tsigiro yemhando nyowani dzeAI uye kupinza kwevhidhiyo

Kuburitswa kwellama.cpp 0.4.0 kunowedzera tsigiro yekutanga yeQwen3.8-Flash-Next uye NVIDIA Nemotron-3-Puzzle, sarudzo dzekupinza vhidhiyo, per-slot server context limits, simbe yekuverenga, uye ggml 0.23.0 shanduko.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
Primary-source documentKwakanyorwa
Muparidzi
github.com
Source link
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
Source type
Gwaro rekutanga - chiziviso chepamutemo, bepa, faira, kana peji rebato rekutanga ratinoverenga zvakananga.
Zvakare zvakataurwa

Nyaya yakazogadziridzwa

ContextNzwisisa izvi mumasekonzi makumi matanhatu

Tanga pano

Matemu akakosha

API (Application Programming Interface)
Nzira yakarongeka yeimwe software system yekutumira zvikumbiro uye kugamuchira mhinduro kubva kune imwe system.
Memory (Agent Memory)
Yakachengetwa mamiriro mumiriri weAI anoshandisa pamatanho kana masesheni kuvandudza kuenderera.
Multimodal Model
Modhi inogona kugadzirisa kana kugadzira akawanda emhando dzedata senge zvinyorwa, mufananidzo, uye odhiyo.
Zviedze iwe pachakoAI Models Inotsanangurwa Mibvunzo

Chii chakachinja kubva pakadhindwa

  1. Yakatanga kubudiswa
  2. Iyo yekutanga llama.cpp yekupinda yakafukidza pre-kuburitswa rutsigiro rweNVIDIA's Nemotron-3-Puzzle. Shanduro 0.4.0 ikozvino inosanganisira Nemotron-3-Puzzle-75B-A9B tsigiro mune yakakura tagged kuburitswa iyo inowedzera nyowani modhi yezvivakwa, kupinza vhidhiyo, server mamiriro ekutonga, usimbe tensor kuverenga, uye ggml 0.23.0 backend basa.

Chii chaitika

llama.cpp yakabudiswa vhezheni 0.4.0 paGitHub musi waGunyana 4. Kuburitswa kunowedzera rutsigiro rwekutanga rweQwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark yeNemotron 3.5, nanbeige, uye nanbeige, uye. DeepSeek-V4-Flash-Vision-Exp. Iyo inowedzerawo vhidhiyo-yekupinda ma paramita, per-slot server mamiriro emiganhu, usimbe kuverenga, nyanzvi-nzira shanduko, KV-cache kuvandudzwa, uye akawanda backend optimizations. Iyo yekuburitsa inogadziridza ggml kubva 0.22.0 kusvika 0.23.0. Iyo purojekiti inoti iyo vhezheni inowedzera sparse flash kutarisisa, asynchronous kuuraya uye kugovera-kutsamira APIs, RPC chiitiko uye async APIs, uye Apple RDMA yekufambisa rutsigiro. Iro peji rinonyora chivakwa chehusiku chinozivikanwa se b10809. Iyo haina magwaro epakeji-binary kuwanikwa, kuisirwa zvinodiwa, modhi-huremu kugovera, kana mitengo.

GitHub peji rekuburitsa rinoratidza v0.4.0 seyachangoburwa uye inorekodha nguva yekuburitswa yaGunyana 4 nguva dza19:56, pasina kudoma nguva yenguva muzvinyorwa zvinopihwa. Kuburitswa kunosanganisira API shanduko dzakadai se llama_lazy_mode, quantizer buffer-saizi zvidzoreso, yakagadziridzwa chikamu uye nyika shanduro, uye itsva multimodal tokenization vabatsiri.

Kuchinja kwemuenzaniso nepakati kunosanganisira yekutanga Qwen3.8-Flash-Next architecture rutsigiro, NVIDIA Nemotron-3-Puzzle-75B-A9B tsigiro, DSpark tsigiro yeNemotron 3.5, nanbeige4.2-3B tsigiro, simbe yekuverenga, per-layer-kutarisisa kwenyanzvi, kuvandudza nhoroondo yeVV, kugadziridza kwehunyanzvi hwekuita, nstov inodzivirira kubva pakakwirira RAM panguva yekurodha modhi.

Multimodal uye server shanduko dzinosanganisira DeepSeek-V4-Flash-Vision-Exp tsigiro, vhidhiyo yekuraira-mutsara sarudzo, per-slot mamiriro emiganhu, data maURL enhau, kuchengetedza kwakasarudzika kwekubuda kwekufunga, uye kurambwa kwekufanozadzikiswa kwechishandiso chekubatsira mafoni. Iyo UI zvakare inoshandura-chishandiso-gwara uye marongero maitiro, asi sosi inopa hapana kutorwa kwemushandisi kana data rekuita.

Kwakabva mashoko: github.com ↗

Nei zvichikosha

Ichi chiitiko chakakura kune yakavhurika-sosi yekumhanyisa nguva inoshandiswa nevagadziri vanovaka AI inference uye multimodal application. Yakawedzerwa modhi yekuvhara inogona kuita kuti ichangoburwa mamodheru iongororwe mukati mellama.cpp-based masisitimu, nepo vhidhiyo-yekupinza rutsigiro ichiwedzera mhando dzemidhiya idzo masisitimu anogona kugadzirisa. Sosi yacho inotsanangura kuita uye basa rine chekuita nendangariro, asi haripe mabhenji akazvimiririra, saka budiriro inoshanda inotsamira pane Hardware, mafomati emhando, uye deployment kumisikidza.

Kuburitswa kunobatanidza akati wandei mavakirwo emhando nyowani kune yakashandiswa zvakanyanya inference codebase, kusanganisira yekutanga Qwen3.8-Flash-Inotevera uye Nemotron-3-Puzzle rutsigiro. Izvo zvinogona kuderedza basa rekubatanidza kune vanogadzira vanoedza neaya mamodheru, kunyangwe sosi yacho isingagadziri kuenderana papuratifomu yega yega kana kumisikidzwa.

Iyo ggml yekuvandudza inowedzera zvivakwa zvekutarisisa zvishoma, asynchronous backends, kure maitiro ekufona zviitiko, uye Apple RDMA. Shanduko idzi dzinogona kuve nebasa kune deployments inogona kushandisa iwo chaiwo backends, asi peji rekuburitsa hariverenge latency, throughput, ndangariro kushandiswa, kana kuvimbika kuvandudzwa.

Vhidhiyo paramita, data-URL rutsigiro rwemidhiya, uye multimodal preprocessing shanduko inopa yakawedzera kongiri nzira yezvishandiso zvinobata vhidhiyo uye mamwe midhiya. Iyo sosi haitaure kana aya masimba anowanikwa mumapakiti ekuvaka kana pasi pezvipimo-zvakasarudzika.

Interactive Mechanism

Interactive Mechanism: Iyo Inonyatsoshanda

Ongorora ari pasi tekinoroji kuseri kwekusimudzira uku uchipindirana.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactive Concept Check+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Zvekutarisa zvinotevera

Kuteedzera-kuburitswa, backend-chaiyo bvunzo, uye zvinyorwa zvinofanirwa kujekesa maitiro matsva emhando uye vhidhiyo maficha pane ese anotsigirwa hardware. Kunyanya kukurumidza kusava nechokwadi ndechekuti yekutanga Qwen3.8-Flash-Inotevera kuisirwa inogamuchira yakavimbiswa optimization basa uye kuti yakawanda sei iyo sparse-kutarisisa uye ndangariro shanduko inovandudza basa chairo.

Tarisa kune optimization updates kuQwen3.8-Flash-Inotevera uye zvimwe zvigadziriso zvezvichangobva kuwedzerwa multimodal modhi nzira.

Tarisa uone mabhenji mabhenji anoparadzanisa kuburitswa kwepeji yekuburitsa zvichemo kubva kuyerwa kuwana mukumhanya, kushandiswa kwendangariro, uye concurrency.

Tarisa zvinyorwa pamusoro pekupinda mupakiti, anotsigirwa modhi mafaera, hardware zvinodiwa, uye kugadzira-kugadzirira. Iwo mameseji haana kupihwa neiyo yekuburitsa peji.

Related guides & Quizzes

AI Models InotsanangurwaChatGPT neLLMsTransformersEdza zvaunoziva - edza yemahara AI quizTarisa kumusoro izwi reAI mune yedu glossaryTevedza iyo AI modhi yekuburitsa tracker

Updates uye kugadzirisa

Iyi nyaya yecanonical inogadziridzwa panzvimbo kana chiitiko chirikuridzika chichichinja. URL yayo uye zuva rekutanga kuburitswa hazvichinji.

  • Iyo yekutanga llama.cpp yekupinda yakafukidza pre-kuburitswa rutsigiro rweNVIDIA's Nemotron-3-Puzzle. Shanduro 0.4.0 ikozvino inosanganisira Nemotron-3-Puzzle-75B-A9B tsigiro mune yakakura tagged kuburitswa iyo inowedzera nyowani modhi yezvivakwa, kupinza vhidhiyo, server mamiriro ekutonga, usimbe tensor kuverenga, uye ggml 0.23.0 backend basa.
Ona gwaro rezvigadziriso zveveruzhinji
Wakawana izvi zvinobatsira?