Zurück zu den Neuigkeiten
ProduktAI Understanding Briefing

llama.cpp 0.4.0 bietet Unterstützung für neuere KI-Modelle und Videoeingaben

Die Version llama.cpp 0.4.0 bietet anfängliche Unterstützung für Qwen3.8-Flash-Next und NVIDIA Nemotron-3-Puzzle, Videoeingabeoptionen, Serverkontextbeschränkungen pro Slot, Lazy Tensor Reading und ggml 0.23.0-Änderungen.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
PrimärquellendokumentQuelle aufgezeichnet
Herausgeber
github.com
Quelllink
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
Quelltyp
Primärdokument – ​​eine offizielle Ankündigung, ein Papier, eine Akte oder eine Erstanbieterseite, die wir direkt lesen.
Auch zitiert

Geschichte zuletzt überarbeitet

KontextVerstehen Sie dies in 60 Sekunden

Beginnen Sie hier

Schlüsselbegriffe

API (Anwendungsprogrammierschnittstelle)
Eine strukturierte Möglichkeit für ein Softwaresystem, Anfragen an ein anderes System zu senden und Antworten von diesem zu empfangen.
Speicher (Agentenspeicher)
Gespeicherter Kontext, den ein KI-Agent schritt- oder sitzungsübergreifend verwendet, um die Kontinuität zu verbessern.
Multimodales Modell
Ein Modell, das mehrere Datentypen wie Text, Bild und Audio verarbeiten oder generieren kann.
Testen Sie sich selbstKI-Modelle erklärt Quiz

Was hat sich seit der Veröffentlichung geändert?

  1. Erstveröffentlichung
  2. Der frühere llama.cpp-Eintrag behandelte die Vorabunterstützung für NVIDIAs Nemotron-3-Puzzle. Version 0.4.0 umfasst jetzt Nemotron-3-Puzzle-75B-A9B-Unterstützung in einer umfassenderen getaggten Version, die auch neuere Modellarchitekturen, Videoeingabe, Serverkontextsteuerung, Lazy-Tensor-Lesen und ggml 0.23.0-Backend-Arbeit hinzufügt.

Was ist passiert?

llama.cpp hat am 4. September Version 0.4.0 auf GitHub veröffentlicht. Die Veröffentlichung bietet anfängliche Unterstützung für Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark für Nemotron 3.5, nanbeige4.2-3B und DeepSeek-V4-Flash-Vision-Exp. Es fügt außerdem Video-Eingabeparameter, Server-Kontextbeschränkungen pro Steckplatz, Lazy-Tensor-Lesen, Experten-Routing-Änderungen, KV-Cache-Verbesserungen und mehrere Backend-Optimierungen hinzu. Die Version aktualisiert ggml von 0.22.0 auf 0.23.0. Das Projekt besagt, dass diese Version spärliche Flash-Aufmerksamkeit, asynchrone Ausführung und Zuordnungsabhängigkeits-APIs, RPC-Ereignis- und asynchrone APIs sowie Apple RDMA-Transportunterstützung hinzufügt. Auf der Seite wird ein nächtlicher Build mit der Bezeichnung b10809 aufgeführt. Es dokumentiert nicht die Verfügbarkeit gepackter Binärdateien, Installationsanforderungen, Modellgewichtsverteilung oder Preise.

Die Release-Seite GitHub identifiziert v0.4.0 als die neueste Version und verzeichnet eine Veröffentlichungszeit vom 4. September um 19:56 Uhr, ohne dass im bereitgestellten Text eine Zeitzone angegeben wird. Die Veröffentlichung umfasst API-Änderungen wie llama_lazy_mode, Quantisierer-Puffergrößenkontrollen, aktualisierte Sitzungs- und Statusversionen sowie neue multimodale Tokenisierungshelfer.

Zu den Modell- und Kernänderungen gehören die anfängliche Unterstützung der Qwen3.8-Flash-Next-Architektur, NVIDIA Nemotron-3-Puzzle-75B-A9B-Unterstützung, DSpark-Unterstützung für Nemotron 3.5, nanbeige4.2-3B-Unterstützung, Lazy-Tensor-Lesen, Experten-Routing pro Schicht, N-Gramm-Verlaufssuche, Verbesserungen bei der KV-Cache-Wiederherstellung und Schutzmaßnahmen gegen RAM-Spitzen beim Laden des Modells.

Zu den multimodalen und Serveränderungen gehören die Unterstützung von DeepSeek-V4-Flash-Vision-Exp, Video-Befehlszeilenoptionen, Kontextbeschränkungen pro Steckplatz, Daten-URLs für Medien, die standardmäßige Beibehaltung der Argumentationsausgabe und die Ablehnung vorab ausgefüllter Aufrufe von Assistententools. Die Benutzeroberfläche ändert auch das Tool-Richtlinien- und Einstellungsverhalten, aber die Quelle stellt keine Benutzerakzeptanz- oder Leistungsdaten bereit.

Quellenangaben: github.com ↗

Warum es wichtig ist

Hierbei handelt es sich um ein umfangreiches Update einer Open-Source-Laufzeitumgebung, die von Entwicklern verwendet wird, die KI-Inferenz und multimodale Anwendungen erstellen. Dank der erweiterten Modellabdeckung können neuere Modelle in llama.cpp-basierten Systemen getestet werden, während die Unterstützung von Videoeingaben die Arten von Medien erweitert, die diese Systeme verarbeiten können. Die Quelle beschreibt leistungs- und speicherbezogene Arbeiten, bietet jedoch keine unabhängigen Benchmarks, sodass praktische Vorteile von der Hardware, den Modellformaten und der Bereitstellungskonfiguration abhängen.

Die Veröffentlichung verbindet mehrere neuere Modellarchitekturen mit einer weit verbreiteten Inferenzcodebasis, einschließlich anfänglicher Unterstützung für Qwen3.8-Flash-Next und Nemotron-3-Puzzle. Dies kann den Integrationsaufwand für Entwickler, die mit diesen Modellen experimentieren, reduzieren, obwohl die Quelle nicht die Kompatibilität über alle Plattformen oder Konfigurationen hinweg herstellt.

Das ggml-Update fügt Infrastruktur für spärliche Aufmerksamkeit, asynchrone Backends, Remote-Prozeduraufrufereignisse und Apple RDMA hinzu. Diese Änderungen könnten für Bereitstellungen von Bedeutung sein, die diese spezifischen Backends verwenden können, aber auf der Release-Seite werden Latenz, Durchsatz, Speichernutzung oder Zuverlässigkeitsverbesserungen nicht quantifiziert.

Videoparameter, Daten-URL-Unterstützung für Medien und multimodale Vorverarbeitungsänderungen bieten einen konkreteren Weg für Anwendungen, die Videos und andere Medien verarbeiten. Die Quelle gibt nicht an, ob diese Funktionen in Paket-Builds verfügbar sind oder unter welchen modellspezifischen Einschränkungen.

Interactive Mechanism

Interaktiver Mechanismus: Wie es tatsächlich funktioniert

Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiver Konzeptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Was Sie als nächstes sehen sollten

Folgeversionen, Backend-spezifische Tests und Dokumentation sollten klären, wie sich das neue Modell und die neuen Videofunktionen auf der unterstützten Hardware verhalten. Die unmittelbarste Unsicherheit besteht darin, ob die anfängliche Qwen3.8-Flash-Next-Implementierung die versprochene Optimierungsarbeit erhält und inwieweit die Änderungen bei geringer Aufmerksamkeit und Speicher die tatsächliche Arbeitslast verbessern.

Achten Sie auf Optimierungsupdates für Qwen3.8-Flash-Next und zusätzliche Korrekturen für die neu hinzugefügten multimodalen Modellpfade.

Achten Sie auf Benchmark-Ergebnisse, die die Implementierungsansprüche der Release-Seite von den gemessenen Zuwächsen bei Geschwindigkeit, Speichernutzung und Parallelität trennen.

Achten Sie auf Dokumentation zum Paketzugriff, unterstützten Modelldateien, Hardwareanforderungen und Produktionsbereitschaft. Diese Details werden auf der Release-Seite nicht bereitgestellt.

Verwandte Leitfäden und Quizze

KI-Modelle erklärtChatGPT & LLMsTransformatorenTesten Sie, was Sie wissen – probieren Sie ein kostenloses KI-Quiz ausSuchen Sie in unserem Glossar nach einem KI-BegriffFolgen Sie dem AI-Modell-Release-Tracker

Aktualisierungen und Korrekturen

Diese kanonische Geschichte wird aktualisiert, wenn sich das sich entwickelnde Ereignis wesentlich ändert. Die URL und das ursprüngliche Veröffentlichungsdatum ändern sich nie.

  • Der frühere llama.cpp-Eintrag behandelte die Vorabunterstützung für NVIDIAs Nemotron-3-Puzzle. Version 0.4.0 umfasst jetzt Nemotron-3-Puzzle-75B-A9B-Unterstützung in einer umfassenderen getaggten Version, die auch neuere Modellarchitekturen, Videoeingabe, Serverkontextsteuerung, Lazy-Tensor-Lesen und ggml 0.23.0-Backend-Arbeit hinzufügt.
Sehen Sie sich das öffentliche Korrekturprotokoll an
Fanden Sie das nützlich?