Zpět na Novinky
ProduktInstruktáž AI Understanding

llama.cpp 0.4.0 přidává podporu pro novější modely AI a video vstup

Vydání llama.cpp 0.4.0 přidává počáteční podporu pro Qwen3.8-Flash-Next a NVIDIA Nemotron-3-Puzzle, možnosti vstupu videa, kontextové limity pro jednotlivé sloty serveru, líné čtení tenzorů a změny ggml 0.23.0.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
Primární zdrojový dokumentZdroj zaznamenán
Vydavatel
github.com
Odkaz na zdroj
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
Typ zdroje
Primární dokument — oficiální oznámení, papír, podání nebo stránka první strany, kterou čteme přímo.
Také citováno

Příběh naposledy revidován

KontextPochopte to za 60 sekund

Začněte zde

Klíčové pojmy

API (Application Programming Interface)
Strukturovaný způsob, jak jeden softwarový systém posílat požadavky a přijímat odpovědi z jiného systému.
Paměť (paměť agenta)
Uložený kontext, který agent AI používá v krocích nebo relacích ke zlepšení kontinuity.
Multimodální model
Model, který dokáže zpracovat nebo generovat více typů dat, jako je text, obrázek a zvuk.
Otestujte seKvíz s vysvětlením modelů umělé inteligence

Co se změnilo od vydání

  1. Poprvé zveřejněno
  2. Dřívější záznam llama.cpp pokrýval předběžnou podporu pro Nemotron-3-Puzzle od NVIDIA. Verze 0.4.0 nyní obsahuje podporu Nemotron-3-Puzzle-75B-A9B v širším tagovaném vydání, které také přidává novější modelové architektury, video vstup, ovládání kontextu serveru, líné čtení tenzorů a backendovou práci ggml 0.23.0.

Co se stalo

llama.cpp vydala verzi 0.4.0 na GitHub 4. září. Vydání přidává počáteční podporu pro Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark pro Nemotron 3.5, nanbeige,4.2-3 DeepSeek-V4-Flash-Vision-Exp. Přidává také parametry videovstupu, kontextové limity pro jednotlivé sloty serveru, líné čtení tenzorů, změny směrování expertů, vylepšení KV-cache a více optimalizací backendu. Vydání aktualizuje ggml z 0.22.0 na 0.23.0. Projekt říká, že verze přidává řídkou pozornost flash, asynchronní spouštění a API pro závislost na alokaci, RPC událostí a asynchronní API a podporu přenosu Apple RDMA. Stránka uvádí noční sestavení označené jako b10809. Nedokumentuje dostupnost binárních balíčků, požadavky na instalaci, distribuci hmotnosti modelu nebo ceny.

Stránka vydání GitHub identifikuje v0.4.0 jako nejnovější vydání a zaznamenává čas zveřejnění 4. září v 19:56, aniž by bylo v dodaném textu uvedeno časové pásmo. Vydání obsahuje změny API, jako je llama_lazy_mode, ovládací prvky velikosti vyrovnávací paměti kvantizeru, aktualizované verze relace a stavu a nové pomocníky pro multimodální tokenizaci.

Změny modelu a jádra zahrnují počáteční podporu architektury Qwen3.8-Flash-Next, podporu NVIDIA Nemotron-3-Puzzle-75B-A9B, podporu DSpark pro Nemotron 3.5, podporu nanbeige4.2-3B, líné čtení tenzorů, vylepšení expertního směrování na jednotlivé vrstvy, zabezpečení proti obnovení paměti RAM a historie vzhledu n-gramů během špičkového vzhledu načítání.

Multimodální a serverové změny zahrnují podporu DeepSeek-V4-Flash-Vision-Exp, možnosti příkazového řádku videa, kontextové limity pro jednotlivé sloty, adresy URL dat pro média, výchozí zachování výstupu zdůvodnění a odmítnutí předvyplněných volání asistenta. Uživatelské rozhraní také mění chování nástrojů a nastavení, ale zdroj neposkytuje žádné údaje o přijetí nebo výkonu uživatelem.

Podrobnosti o zdroji: github.com ↗

Proč na tom záleží

Toto je podstatná aktualizace open-source runtime používaného vývojáři vytvářejícími AI inference a multimodální aplikace. Jeho rozšířené modelové pokrytí umožňuje testovat novější modely v systémech založených na llama.cpp, zatímco podpora videovstupu rozšiřuje druhy médií, které tyto systémy mohou zpracovávat. Zdroj popisuje výkon a práci související s pamětí, ale neposkytuje žádné nezávislé benchmarky, takže praktické přínosy budou záviset na hardwaru, formátech modelu a konfiguraci nasazení.

Vydání připojuje několik novějších modelových architektur k široce používané inferenční kódové základně, včetně počáteční podpory Qwen3.8-Flash-Next a Nemotron-3-Puzzle. To může snížit integrační práci pro vývojáře experimentující s těmito modely, ačkoli zdroj nezajišťuje kompatibilitu napříč každou platformou nebo konfigurací.

Aktualizace ggml přidává infrastrukturu pro řídkou pozornost, asynchronní backendy, události vzdáleného volání procedur a Apple RDMA. Tyto změny mohou mít význam pro nasazení, která mohou používat tyto specifické backendy, ale stránka vydání nekvantifikuje latenci, propustnost, využití paměti nebo zlepšení spolehlivosti.

Parametry videa, podpora datových URL pro média a změny multimodálního předběžného zpracování poskytují konkrétnější cestu pro aplikace zpracovávající video a další média. Zdroj neuvádí, zda jsou tyto schopnosti dostupné v zabalených sestaveních nebo za jakých omezení specifických pro daný model.

Interactive Mechanism

Interaktivní mechanismus: Jak to vlastně funguje

Interaktivně prozkoumejte základní technologii tohoto vývoje.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktivní kontrola konceptu+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Na co se dále dívat

Následná vydání, testy specifické pro backend a dokumentace by měly objasnit, jak se nový model a funkce videa chovají na podporovaném hardwaru. Nejbezprostřednější nejistotou je, zda počáteční implementace Qwen3.8-Flash-Next dostane slíbenou optimalizační práci a jak moc změny řídké pozornosti a paměti zlepšují skutečné pracovní zatížení.

Sledujte aktualizace optimalizace pro Qwen3.8-Flash-Next a další opravy pro nově přidané cesty multimodálního modelu.

Sledujte výsledky srovnávacích testů, které oddělují požadavky na implementaci stránky vydání od naměřených zisků v rychlosti, využití paměti a souběžnosti.

Podívejte se na dokumentaci o integrovaném přístupu, podporovaných modelových souborech, hardwarových požadavcích a produkční připravenosti. Tyto podrobnosti nejsou uvedeny na stránce vydání.

Související průvodci a kvízy

Vysvětlení modelů AIChatGPT a LLMTransformátoryOtestujte si, co víte – vyzkoušejte bezplatný kvíz AIVyhledejte si termín AI v našem slovníkuPostupujte podle sledování vydání modelu AI

Aktualizace a opravy

Tento kanonický příběh je aktualizován na místě, když se rozvíjející se událost podstatně změní. Jeho URL a původní datum vydání se nikdy nemění.

  • Dřívější záznam llama.cpp pokrýval předběžnou podporu pro Nemotron-3-Puzzle od NVIDIA. Verze 0.4.0 nyní obsahuje podporu Nemotron-3-Puzzle-75B-A9B v širším tagovaném vydání, které také přidává novější modelové architektury, video vstup, ovládání kontextu serveru, líné čtení tenzorů a backendovou práci ggml 0.23.0.
Viz veřejný protokol oprav
Považujete to za užitečné?