Torna alle notizie
ProdottoAI Understanding briefing

llama.cpp 0.4.0 aggiunge il supporto per i modelli AI e l'input video più recenti

La versione llama.cpp 0.4.0 aggiunge il supporto iniziale per Qwen3.8-Flash-Next e NVIDIA Nemotron-3-Puzzle, opzioni di ingresso video, limiti di contesto del server per slot, lettura pigra del tensore e modifiche ggml 0.23.0.

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
Documento di origine primariaFonte registrata
Editore
github.com
Collegamento alla fonte
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
Tipo di fonte
Documento principale: un annuncio ufficiale, un documento, un documento o una pagina proprietaria che leggiamo direttamente.
Anche citato

Ultima revisione della storia

ContestoComprendilo in 60 secondi

Inizia qui

Termini chiave

API (interfaccia di programmazione dell'applicazione)
Un modo strutturato con cui un sistema software invia richieste e riceve risposte da un altro sistema.
Memoria (memoria dell'agente)
Contesto archiviato che un agente AI utilizza attraverso passaggi o sessioni per migliorare la continuità.
Modello multimodale
Un modello in grado di elaborare o generare più tipi di dati come testo, immagine e audio.
Mettiti alla provaQuiz sulla spiegazione dei modelli di intelligenza artificiale

Cosa è cambiato dalla pubblicazione

  1. Pubblicato per la prima volta
  2. La voce precedente di llama.cpp riguardava il supporto pre-release per Nemotron-3-Puzzle di NVIDIA. La versione 0.4.0 ora include il supporto Nemotron-3-Puzzle-75B-A9B in una versione con tag più ampia che aggiunge anche architetture di modelli più recenti, input video, controlli del contesto del server, lettura pigra del tensore e lavoro backend ggml 0.23.0.

Cosa è successo

llama.cpp ha rilasciato la versione 0.4.0 su GitHub il 4 settembre. La versione aggiunge il supporto iniziale per Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark per Nemotron 3.5, nanbeige4.2-3B e DeepSeek-V4-Flash-Vision-Exp. Aggiunge inoltre parametri di input video, limiti di contesto del server per slot, lettura pigra del tensore, modifiche al routing degli esperti, miglioramenti della cache KV e ottimizzazioni multiple del backend. La versione aggiorna ggml da 0.22.0 a 0.23.0. Il progetto afferma che la versione aggiunge scarsa attenzione flash, esecuzione asincrona e API di dipendenza dall'allocazione, eventi RPC e API asincrone e supporto per il trasporto RDMA Apple. La pagina elenca una build notturna identificata come b10809. Non documenta la disponibilità dei pacchetti binari, i requisiti di installazione, la distribuzione del peso dei modelli o i prezzi.

La pagina di rilascio GitHub identifica la v0.4.0 come l'ultima versione e registra l'orario di pubblicazione del 4 settembre pari alle 19:56, senza specificare un fuso orario nel testo fornito. La versione include modifiche API come llama_lazy_mode, controlli della dimensione del buffer quantizzatore, versioni aggiornate di sessione e stato e nuovi helper per la tokenizzazione multimodale.

Le modifiche al modello e al core includono il supporto iniziale dell'architettura Qwen3.8-Flash-Next, il supporto NVIDIA Nemotron-3-Puzzle-75B-A9B, il supporto DSpark per Nemotron 3.5, il supporto nanbeige4.2-3B, la lettura tensore pigra, il routing esperto per livello, la ricerca della cronologia n-grammi, miglioramenti al ripristino della cache KV e protezioni contro i picchi di RAM durante il caricamento del modello.

Le modifiche multimodali e del server includono il supporto DeepSeek-V4-Flash-Vision-Exp, opzioni della riga di comando video, limiti di contesto per slot, URL di dati per i media, conservazione predefinita dell'output del ragionamento e rifiuto delle chiamate allo strumento di assistente precompilato. L'interfaccia utente modifica anche la politica dello strumento e il comportamento delle impostazioni, ma la fonte non fornisce dati sull'adozione o sulle prestazioni da parte degli utenti.

Dettagli della fonte: github.com ↗

Perché è importante

Si tratta di un aggiornamento sostanziale di un runtime open source utilizzato dagli sviluppatori che creano inferenza AI e applicazioni multimodali. La sua copertura di modelli ampliata può rendere testabili i modelli rilasciati più recentemente all'interno di sistemi basati su llama.cpp, mentre il supporto dell'input video amplia i tipi di media che tali sistemi possono elaborare. La fonte descrive il lavoro relativo alle prestazioni e alla memoria, ma non fornisce benchmark indipendenti, quindi i vantaggi pratici dipenderanno dall'hardware, dai formati del modello e dalla configurazione di distribuzione.

La versione collega diverse architetture di modelli più recenti a una base di codice di inferenza ampiamente utilizzata, incluso il supporto iniziale Qwen3.8-Flash-Next e Nemotron-3-Puzzle. Ciò potrebbe ridurre il lavoro di integrazione per gli sviluppatori che sperimentano tali modelli, sebbene la fonte non stabilisca la compatibilità su ogni piattaforma o configurazione.

L'aggiornamento ggml aggiunge l'infrastruttura per scarsa attenzione, backend asincroni, eventi di chiamate di procedure remote e Apple RDMA. Queste modifiche potrebbero essere importanti per le distribuzioni che possono utilizzare quei backend specifici, ma la pagina di rilascio non quantifica la latenza, la velocità effettiva, l'utilizzo della memoria o i miglioramenti dell'affidabilità.

I parametri video, il supporto dell'URL dei dati per i media e le modifiche alla preelaborazione multimodale forniscono un percorso più concreto per le applicazioni che gestiscono video e altri media. La fonte non indica se queste funzionalità sono disponibili nelle build in pacchetto o con quali limitazioni specifiche del modello.

Interactive Mechanism

Meccanismo interattivo: come funziona realmente

Esplora la tecnologia alla base di questo sviluppo in modo interattivo.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verifica concettuale interattiva+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Cosa guardare dopo

Le versioni successive, i test specifici del backend e la documentazione dovrebbero chiarire come si comportano il nuovo modello e le funzionalità video sull'hardware supportato. L'incertezza più immediata è se l'implementazione iniziale di Qwen3.8-Flash-Next riceverà il lavoro di ottimizzazione promesso e quanto le modifiche alla scarsa attenzione e alla memoria miglioreranno i carichi di lavoro reali.

Controlla gli aggiornamenti di ottimizzazione di Qwen3.8-Flash-Next e ulteriori correzioni per i percorsi del modello multimodale appena aggiunti.

Controlla i risultati dei benchmark che separano le dichiarazioni di implementazione della pagina di rilascio dai guadagni misurati in velocità, utilizzo della memoria e concorrenza.

Cerca la documentazione sull'accesso in pacchetto, sui file di modello supportati, sui requisiti hardware e sulla preparazione alla produzione. Tali dettagli non sono forniti dalla pagina di rilascio.

Guide e quiz correlati

Spiegazione dei modelli di intelligenza artificialeChatGPT e LLMTrasformatoriMetti alla prova ciò che sai: prova un quiz gratuito sull'intelligenza artificialeCerca un termine AI nel nostro glossarioSegui il tracker del rilascio del modello AI

Aggiornamenti e correzioni

Questa storia canonica viene aggiornata quando l'evento in via di sviluppo cambia materialmente. Il suo URL e la data di pubblicazione originale non cambiano mai.

  • La voce precedente di llama.cpp riguardava il supporto pre-release per Nemotron-3-Puzzle di NVIDIA. La versione 0.4.0 ora include il supporto Nemotron-3-Puzzle-75B-A9B in una versione con tag più ampia che aggiunge anche architetture di modelli più recenti, input video, controlli del contesto del server, lettura pigra del tensore e lavoro backend ggml 0.23.0.
Consulta il registro delle correzioni pubbliche
Lo hai trovato utile?