Retour aux Actualités
ProduitBriefing AI Understanding

llama.cpp 0.4.0 ajoute la prise en charge des nouveaux modèles d'IA et des entrées vidéo

La version llama.cpp 0.4.0 ajoute la prise en charge initiale de Qwen3.8-Flash-Next et NVIDIA Nemotron-3-Puzzle, des options d'entrée vidéo, des limites de contexte de serveur par emplacement, une lecture de tenseur paresseuse et des modifications de ggml 0.23.0.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
Document de source principaleSource enregistrée
Éditeur
github.com
Lien source
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
Type de source
Document principal : une annonce officielle, un document, un dépôt ou une page de première partie que nous lisons directement.
Également cité

Histoire révisée pour la dernière fois

ContexteComprenez cela en 60 secondes

Commencez ici

Termes clés

API (interface de programmation d'applications)
Une manière structurée permettant à un système logiciel d'envoyer des requêtes et de recevoir des réponses d'un autre système.
Mémoire (mémoire de l'agent)
Contexte stocké qu'un agent IA utilise au fil des étapes ou des sessions pour améliorer la continuité.
Modèle multimodal
Un modèle capable de traiter ou de générer plusieurs types de données tels que du texte, des images et de l'audio.
Testez-vousQuiz sur les modèles d'IA expliqués

Ce qui a changé depuis la publication

  1. Première publication
  2. L’entrée précédente de llama.cpp couvrait la prise en charge préliminaire du Nemotron-3-Puzzle de NVIDIA. La version 0.4.0 inclut désormais la prise en charge de Nemotron-3-Puzzle-75B-A9B dans une version balisée plus large qui ajoute également des architectures de modèles plus récentes, une entrée vidéo, des contrôles de contexte de serveur, une lecture de tenseur paresseuse et un travail backend ggml 0.23.0.

Que s'est-il passé

llama.cpp a publié la version 0.4.0 sur GitHub le 4 septembre. La version ajoute la prise en charge initiale de Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark pour Nemotron 3.5, nanbeige4.2-3B et DeepSeek-V4-Flash-Vision-Exp. Il ajoute également des paramètres d'entrée vidéo, des limites de contexte de serveur par emplacement, une lecture de tenseur paresseuse, des modifications de routage par des experts, des améliorations du cache KV et de multiples optimisations du backend. La version met à jour ggml de 0.22.0 à 0.23.0. Le projet indique que cette version ajoute une attention flash clairsemée, des API d'exécution asynchrone et de dépendance d'allocation, des API d'événement RPC et asynchrones, ainsi que la prise en charge du transport RDMA Apple. La page répertorie une version nocturne identifiée comme b10809. Il ne documente pas la disponibilité du package binaire, les exigences d'installation, la répartition du poids du modèle ou les prix.

La page de version GitHub identifie la v0.4.0 comme la dernière version et enregistre une heure de publication le 4 septembre à 19h56, sans spécifier de fuseau horaire dans le texte fourni. La version inclut des modifications d'API telles que llama_lazy_mode, des contrôles de taille de tampon de quantificateur, des versions de session et d'état mises à jour et de nouveaux assistants de tokenisation multimodaux.

Les changements de modèle et de base incluent la prise en charge initiale de l'architecture Qwen3.8-Flash-Next, la prise en charge de NVIDIA Nemotron-3-Puzzle-75B-A9B, la prise en charge de DSpark pour Nemotron 3.5, la prise en charge de nanbeige4.2-3B, la lecture du tenseur paresseuse, le routage expert par couche, la recherche de l'historique n-gramme, les améliorations de la restauration du cache KV et les protections contre les pics de RAM pendant le chargement du modèle.

Les modifications multimodales et serveur incluent la prise en charge de DeepSeek-V4-Flash-Vision-Exp, les options de ligne de commande vidéo, les limites de contexte par emplacement, les URL de données pour les médias, la préservation par défaut de la sortie de raisonnement et le rejet des appels d'outils d'assistant pré-remplis. L'interface utilisateur modifie également le comportement de la stratégie de l'outil et des paramètres, mais la source ne fournit aucune donnée sur l'adoption ou les performances des utilisateurs.

Détails de la source: github.com ↗

Pourquoi c'est important

Il s'agit d'une mise à jour substantielle d'un runtime open source utilisé par les développeurs qui créent des applications d'inférence d'IA et multimodales. Sa couverture étendue de modèles peut rendre les modèles plus récents testables dans les systèmes basés sur llama.cpp, tandis que la prise en charge des entrées vidéo élargit les types de médias que ces systèmes peuvent traiter. La source décrit les travaux liés aux performances et à la mémoire, mais ne fournit aucun point de référence indépendant. Les gains pratiques dépendront donc du matériel, des formats de modèle et de la configuration du déploiement.

La version connecte plusieurs architectures de modèles plus récentes à une base de code d'inférence largement utilisée, notamment la prise en charge initiale de Qwen3.8-Flash-Next et Nemotron-3-Puzzle. Cela peut réduire le travail d'intégration pour les développeurs expérimentant ces modèles, bien que la source n'établisse pas la compatibilité entre chaque plate-forme ou configuration.

La mise à jour ggml ajoute une infrastructure pour une attention éparse, des backends asynchrones, des événements d'appel de procédure à distance et Apple RDMA. Ces changements pourraient être importants pour les déploiements pouvant utiliser ces backends spécifiques, mais la page de publication ne quantifie pas les améliorations en matière de latence, de débit, d'utilisation de la mémoire ou de fiabilité.

Les paramètres vidéo, la prise en charge des URL de données pour les médias et les modifications du prétraitement multimodal offrent une voie plus concrète aux applications gérant la vidéo et d'autres médias. La source n'indique pas si ces fonctionnalités sont disponibles dans les versions packagées ou dans quelles limites spécifiques au modèle.

Interactive Mechanism

Mécanisme interactif : comment cela fonctionne réellement

Explorez de manière interactive la technologie sous-jacente à ce développement.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Vérification de concept interactive+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Que regarder ensuite

Les versions de suivi, les tests spécifiques au backend et la documentation devraient clarifier le comportement du nouveau modèle et des fonctionnalités vidéo sur le matériel pris en charge. L'incertitude la plus immédiate est de savoir si l'implémentation initiale de Qwen3.8-Flash-Next reçoit le travail d'optimisation promis et dans quelle mesure les changements d'attention et de mémoire améliorent les charges de travail réelles.

Surveillez les mises à jour d'optimisation de Qwen3.8-Flash-Next et les correctifs supplémentaires pour les chemins de modèle multimodaux nouvellement ajoutés.

Surveillez les résultats de référence qui séparent les affirmations d'implémentation de la page de version des gains mesurés en termes de vitesse, d'utilisation de la mémoire et de concurrence.

Consultez la documentation sur l'accès packagé, les fichiers de modèles pris en charge, la configuration matérielle requise et la préparation à la production. Ces détails ne sont pas fournis par la page de version.

Guides et quiz associés

Modèles d'IA expliquésChatGPT et LLMTransformateursTestez ce que vous savez : essayez un quiz gratuit sur l'IARecherchez un terme d'IA dans notre glossaireSuivez le suivi des versions du modèle AI

Mises à jour et corrections

Cette histoire canonique est mise à jour lorsque l’événement en développement change matériellement. Son URL et sa date de publication originale ne changent jamais.

  • L’entrée précédente de llama.cpp couvrait la prise en charge préliminaire du Nemotron-3-Puzzle de NVIDIA. La version 0.4.0 inclut désormais la prise en charge de Nemotron-3-Puzzle-75B-A9B dans une version balisée plus large qui ajoute également des architectures de modèles plus récentes, une entrée vidéo, des contrôles de contexte de serveur, une lecture de tenseur paresseuse et un travail backend ggml 0.23.0.
Voir le journal des corrections publiques
Vous avez trouvé cela utile ?