Tillbaka till Nyheter
ProduktAI Understanding genomgång

llama.cpp 0.4.0 lägger till stöd för nyare AI-modeller och videoingång

Utgåvan llama.cpp 0.4.0 lägger till initialt stöd för Qwen3.8-Flash-Next och NVIDIA Nemotron-3-Puzzle, alternativ för videoingång, kontextgränser för server per slot, lat tensorläsning och ggml 0.23.0 ändringar.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
Primärt källdokumentKälla inspelad
Förläggare
github.com
Källlänk
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
Också citerad

Berättelsen senast reviderad

SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

API (Application Programming Interface)
Ett strukturerat sätt för ett mjukvarusystem att skicka förfrågningar till och ta emot svar från ett annat system.
Minne (agentminne)
Lagrat sammanhang som en AI-agent använder över steg eller sessioner för att förbättra kontinuiteten.
Multimodal modell
En modell som kan bearbeta eller generera flera datatyper som text, bild och ljud.
Testa dig självAI Models Explained Quiz

Vad har förändrats sedan publiceringen

  1. Först publicerad
  2. Den tidigare llama.cpp-posten täckte stöd för pre-release för NVIDIA:s Nemotron-3-Puzzle. Version 0.4.0 inkluderar nu Nemotron-3-Puzzle-75B-A9B-stöd i en bredare taggad version som också lägger till nyare modellarkitekturer, videoingång, serverkontextkontroller, lazy tensor-läsning och ggml 0.23.0 backend-arbete.

Vad hände

llama.cpp släppte version 0.4.0 på GitHub den 4 september. Utgåvan lägger till initialt stöd för Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark för Nemotron 3.5, nanbeige, och 3.2-3. DeepSeek-V4-Flash-Vision-Exp. Den lägger också till videoingångsparametrar, kontextgränser för per-slot-server, lat tensorläsning, expertruttändringar, förbättringar av KV-cache och flera backend-optimeringar. Utgåvan uppdaterar ggml från 0.22.0 till 0.23.0. Projektet säger att versionen lägger till sparsam flash-uppmärksamhet, asynkron exekvering och tilldelningsberoende API:er, RPC-händelser och asynkron-API:er och Apple RDMA-transportstöd. Sidan listar en nattlig byggnad identifierad som b10809. Den dokumenterar inte paketerad binär tillgänglighet, installationskrav, modellviktsfördelning eller prissättning.

GitHub-utgivningssidan identifierar v0.4.0 som den senaste versionen och registrerar en publiceringstid för 4 september 19:56, utan att ange en tidszon i den medföljande texten. Utgåvan innehåller API-ändringar som llama_lazy_mode, kontroller för kvantiserare buffertstorlek, uppdaterade sessions- och tillståndsversioner och nya multimodala tokeniseringshjälpare.

Modell- och kärnförändringar inkluderar initialt Qwen3.8-Flash-Next-arkitekturstöd, NVIDIA Nemotron-3-Puzzle-75B-A9B-stöd, DSpark-stöd för Nemotron 3.5, nanbeige4.2-3B-stöd, lat tensorläsning, per-lagers expertrouting, n-gram-säkerhetsuppslag, n-gram-uppslagshistorik och förbättringar av n-gram-sökningar RAM-minnet toppar under modellladdning.

Multimodala och serverändringar inkluderar DeepSeek-V4-Flash-Vision-Exp-stöd, videokommandoradsalternativ, kontextgränser per plats, data-URL:er för media, standardbevarande av resonemangsutdata och avvisande av förifyllda anrop av assistentverktyg. Användargränssnittet ändrar också verktygspolicy och inställningsbeteende, men källan ger ingen användarantagande eller prestandadata.

Källinformation: github.com ↗

Varför det spelar roll

Detta är en betydande uppdatering av en runtime med öppen källkod som används av utvecklare som bygger AI-inferens och multimodala applikationer. Dess utökade modelltäckning kan göra nyare släppta modeller testbara inom llama.cpp-baserade system, medan stöd för videoingång breddar de typer av media som dessa system kan bearbeta. Källan beskriver prestanda och minnesrelaterat arbete, men ger inga oberoende riktmärken, så praktiska vinster kommer att bero på hårdvara, modellformat och distributionskonfiguration.

Utgåvan kopplar flera nyare modellarkitekturer till en allmänt använd inferenskodbas, inklusive initial Qwen3.8-Flash-Next och Nemotron-3-Puzzle-stöd. Det kan minska integrationsarbetet för utvecklare som experimenterar med dessa modeller, även om källan inte etablerar kompatibilitet över varje plattform eller konfiguration.

ggml-uppdateringen lägger till infrastruktur för sparsam uppmärksamhet, asynkrona backends, fjärranropshändelser och Apple RDMA. Dessa ändringar kan ha betydelse för distributioner som kan använda dessa specifika backends, men releasesidan kvantifierar inte latens, genomströmning, minnesanvändning eller tillförlitlighetsförbättringar.

Videoparametrar, data-URL-stöd för media och multimodala förbearbetningsförändringar ger en mer konkret väg för applikationer som hanterar video och andra media. Källan anger inte om dessa funktioner är tillgängliga i paketerade versioner eller under vilka modellspecifika begränsningar.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Vad du ska titta på härnäst

Uppföljande utgåvor, backend-specifika tester och dokumentation bör klargöra hur den nya modellen och videofunktionerna beter sig över den hårdvara som stöds. Den mest omedelbara osäkerheten är huruvida den initiala Qwen3.8-Flash-Next-implementeringen får det utlovade optimeringsarbetet och hur mycket de sparsamma uppmärksamhets- och minnesförändringarna förbättrar verkliga arbetsbelastningar.

Håll utkik efter optimeringsuppdateringar till Qwen3.8-Flash-Next och ytterligare korrigeringar för de nyligen tillagda multimodala modellvägarna.

Håll utkik efter benchmarkresultat som skiljer releasesidans implementeringsanspråk från uppmätta vinster i hastighet, minnesanvändning och samtidighet.

Se efter dokumentation om paketerad åtkomst, modellfiler som stöds, hårdvarukrav och produktionsberedskap. Dessa uppgifter tillhandahålls inte av releasesidan.

Relaterade guider och frågesporter

AI-modeller förklarasChatGPT och LLM:erTransformatorerTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker

Uppdateringar och korrigeringar

Denna kanoniska berättelse uppdateras på plats när händelsen som utvecklas väsentligt förändras. Dess URL och ursprungliga publiceringsdatum ändras aldrig.

  • Den tidigare llama.cpp-posten täckte stöd för pre-release för NVIDIA:s Nemotron-3-Puzzle. Version 0.4.0 inkluderar nu Nemotron-3-Puzzle-75B-A9B-stöd i en bredare taggad version som också lägger till nyare modellarkitekturer, videoingång, serverkontextkontroller, lazy tensor-läsning och ggml 0.23.0 backend-arbete.
Se den offentliga korrigeringsloggen
Hittade du detta användbart?