Terug naar Nieuws
ProductAI Understanding-briefing

llama.cpp 0.4.0 voegt ondersteuning toe voor nieuwere AI-modellen en video-invoer

De llama.cpp 0.4.0-release voegt initiële ondersteuning toe voor Qwen3.8-Flash-Next en NVIDIA Nemotron-3-Puzzle, video-invoeropties, servercontextlimieten per slot, lazy tensor-lezen en ggml 0.23.0-wijzigingen.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
Primair brondocumentBron opgenomen
Uitgever
github.com
Bronlink
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
Ook aangehaald

Verhaal laatst herzien

ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

API (Applicatieprogrammeringsinterface)
Een gestructureerde manier waarop het ene softwaresysteem verzoeken kan verzenden naar en antwoorden kan ontvangen van een ander systeem.
Geheugen (agentgeheugen)
Opgeslagen context die een AI-agent in stappen of sessies gebruikt om de continuïteit te verbeteren.
Multimodaal model
Een model dat meerdere gegevenstypen, zoals tekst, afbeeldingen en audio, kan verwerken of genereren.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er veranderd sinds de publicatie

  1. Voor het eerst gepubliceerd
  2. De eerdere llama.cpp-inzending had betrekking op pre-release-ondersteuning voor de Nemotron-3-Puzzle van NVIDIA. Versie 0.4.0 bevat nu Nemotron-3-Puzzle-75B-A9B-ondersteuning in een bredere getagde release die ook nieuwere modelarchitecturen, video-invoer, servercontextcontroles, lazy tensor-lezen en ggml 0.23.0-backend-werk toevoegt.

Wat is er gebeurd

llama.cpp heeft op 4 september versie 0.4.0 uitgebracht op GitHub. De release voegt initiële ondersteuning toe voor Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark voor Nemotron 3.5, nanbeige4.2-3B en DeepSeek-V4-Flash-Vision-Exp. Het voegt ook video-invoerparameters, servercontextlimieten per slot, lazy tensor reading, expert-routing-wijzigingen, KV-cache-verbeteringen en meerdere backend-optimalisaties toe. De release update ggml van 0.22.0 naar 0.23.0. Het project zegt dat de versie spaarzame flash-aandacht, asynchrone uitvoering en toewijzingsafhankelijkheid-API's, RPC-gebeurtenis en asynchrone API's, en Apple RDMA-transportondersteuning toevoegt. Op de pagina staat een nachtelijke build geïdentificeerd als b10809. Het documenteert niet de beschikbaarheid van binaire pakketten, de installatievereisten, de verdeling van het modelgewicht of de prijzen.

De GitHub-releasepagina identificeert v0.4.0 als de nieuwste release en registreert een publicatietijd van 4 september van 19:56, zonder een tijdzone op te geven in de aangeleverde tekst. De release bevat API-wijzigingen zoals llama_lazy_mode, quantizer-buffergroottecontroles, bijgewerkte sessie- en statusversies, en nieuwe multimodale tokenisatie-helpers.

Model- en kernwijzigingen omvatten initiële Qwen3.8-Flash-Next-architectuurondersteuning, NVIDIA Nemotron-3-Puzzle-75B-A9B-ondersteuning, DSpark-ondersteuning voor Nemotron 3.5, nanbeige4.2-3B-ondersteuning, lazy tensor-lezen, expertrouting per laag, opzoeken van n-gramgeschiedenis, verbeteringen aan het herstel van KV-cache en beveiliging tegen RAM-pieken tijdens het laden van modellen.

Multimodale en serverwijzigingen omvatten DeepSeek-V4-Flash-Vision-Exp-ondersteuning, video-opdrachtregelopties, contextlimieten per slot, gegevens-URL's voor media, standaardbehoud van redeneringsuitvoer en afwijzing van vooraf ingevulde assistent-tooloproepen. De gebruikersinterface verandert ook het gedrag van het toolbeleid en de instellingen, maar de bron biedt geen gebruikersacceptatie- of prestatiegegevens.

Brongegevens: github.com ↗

Waarom het ertoe doet

Dit is een substantiële update van een open-source runtime die wordt gebruikt door ontwikkelaars die AI-inferentie en multimodale applicaties bouwen. De uitgebreide modeldekking kan recentelijk uitgebrachte modellen testbaar maken binnen op llama.cpp gebaseerde systemen, terwijl video-invoerondersteuning het soort media verbreedt dat deze systemen kunnen verwerken. De bron beschrijft prestatie- en geheugengerelateerd werk, maar biedt geen onafhankelijke benchmarks, dus praktische voordelen zullen afhangen van hardware, modelformaten en implementatieconfiguratie.

De release verbindt verschillende nieuwere modelarchitecturen met een veelgebruikte inferentiecodebase, inclusief initiële ondersteuning voor Qwen3.8-Flash-Next en Nemotron-3-Puzzle. Dat kan het integratiewerk verminderen voor ontwikkelaars die met deze modellen experimenteren, hoewel de bron geen compatibiliteit voor elk platform of elke configuratie tot stand brengt.

De ggml-update voegt infrastructuur toe voor beperkte aandacht, asynchrone backends, externe procedureaanroepgebeurtenissen en Apple RDMA. Deze wijzigingen kunnen van belang zijn voor implementaties die deze specifieke backends kunnen gebruiken, maar de releasepagina kwantificeert geen latentie-, doorvoer-, geheugengebruik- of betrouwbaarheidsverbeteringen.

Videoparameters, data-URL-ondersteuning voor media en multimodale voorverwerkingswijzigingen bieden een concreter pad voor toepassingen die video en andere media verwerken. De bron vermeldt niet of deze mogelijkheden beschikbaar zijn in pakketversies of onder welke modelspecifieke beperkingen.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

Vervolgreleases, backend-specifieke tests en documentatie moeten duidelijk maken hoe het nieuwe model en de videofuncties zich gedragen op ondersteunde hardware. De meest directe onzekerheid is of de initiële Qwen3.8-Flash-Next-implementatie het beloofde optimalisatiewerk zal ontvangen en in hoeverre de schaarse aandacht en geheugenveranderingen de echte werklast zullen verbeteren.

Houd rekening met optimalisatie-updates voor Qwen3.8-Flash-Next en aanvullende oplossingen voor de nieuw toegevoegde multimodale modelpaden.

Let op benchmarkresultaten die de implementatieclaims van de releasepagina scheiden van gemeten winsten in snelheid, geheugengebruik en gelijktijdigheid.

Bekijk de documentatie over pakkettoegang, ondersteunde modelbestanden, hardwarevereisten en productiegereedheid. Deze details worden niet verstrekt door de releasepagina.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdChatGPT & LLM'sTransformatorenTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker

Updates en correcties

Dit canonieke verhaal wordt op zijn plaats bijgewerkt wanneer de zich ontwikkelende gebeurtenis wezenlijk verandert. De URL en de oorspronkelijke publicatiedatum veranderen nooit.

  • De eerdere llama.cpp-inzending had betrekking op pre-release-ondersteuning voor de Nemotron-3-Puzzle van NVIDIA. Versie 0.4.0 bevat nu Nemotron-3-Puzzle-75B-A9B-ondersteuning in een bredere getagde release die ook nieuwere modelarchitecturen, video-invoer, servercontextcontroles, lazy tensor-lezen en ggml 0.23.0-backend-werk toevoegt.
Zie het openbare correctielogboek
Vond je dit nuttig?