主要來源文件 來源記錄 2026年9月4日 下午8:45 [UTC]
出版商 GI github.com
來源類型 主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。 故事最後修訂 2026年9月4日 下午8:45 [UTC]
背景60 秒內了解這一點 關鍵術語 API(應用程式介面) 一種軟體系統向另一個系統發送請求並接收回應的結構化方式。 記憶體(代理記憶體) AI 代理程式跨步驟或會話使用儲存的上下文來提高連續性。 多式聯運模型 可以處理或產生文字、圖像和音訊等多種資料類型的模型。 自發布以來發生了什麼變化 2026年9月3日 下午3:55 [UTC] 首次發表 2026年9月4日 下午8:45 [UTC]最新 早期的 llama.cpp 條目涵蓋了 NVIDIA 的 Nemotron-3-Puzzle 的預發布支援。版本 0.4.0 現在在更廣泛的標記版本中包括 Nemotron-3-Puzzle-75B-A9B 支持,還添加了更新的模型架構、視頻輸入、伺服器上下文控制、惰性張量讀取和 ggml 0.23.0 後端工作。 發生了什麼事 llama.cpp 於 9 月 4 日在 GitHub 上發布了 0.4.0 版本。此版本增加了 Qwen3.8-Flash-Next、NVIDIA Nemotron-3-Puzzle-75B-A9B、DSpark for Nemotron 3.5、nanbeige4.2-3B 和 DeepSeek-V4-Flash-Vision-Exp 的初步支持。它還添加了視訊輸入參數、每個插槽伺服器上下文限制、惰性張量讀取、專家路由更改、KV 快取改進和多個後端優化。此版本將 ggml 從 0.22.0 更新到 0.23.0。該專案表示,該版本增加了稀疏快閃記憶體關注、非同步執行和分配依賴 API、RPC 事件和非同步 API 以及 Apple RDMA 傳輸支援。該頁面列出了一個標識為 b10809 的夜間建置。它不記錄打包二進制可用性、安裝要求、模型權重分佈或定價。
GitHub 發佈頁面將 v0.4.0 標識為最新版本,並記錄 9 月 4 日的發佈時間 19:56,但未在提供的文字中指定時區。此版本包括 API 更改,例如 llama_lazy_mode、量化器緩衝區大小控制、更新的會話和狀態版本以及新的多模式標記化幫助程式。
模型和核心變更包括初始 Qwen3.8-Flash-Next 架構支援、NVIDIA Nemotron-3-Puzzle-75B-A9B 支援、Nemotron 3.5 的 DSpark 支援、nanbeige4.2-3B 支援、惰性張量讀取、每層執行裝置
多模式和伺服器變更包括 DeepSeek-V4-Flash-Vision-Exp 支援、視訊命令列選項、每個插槽上下文限制、媒體資料 URL、預設保留推理輸出以及拒絕預填輔助工具呼叫。 UI 也更改了工具策略和設定行為,但來源沒有提供使用者採用或效能資料。
來源詳情: github.com ↗
為什麼這很重要 這是對建立人工智慧推理和多模式應用程式的開發人員使用的開源運行時的重大更新。其擴展的模型覆蓋範圍可以使最近發布的模型可以在基於 llama.cpp 的系統中進行測試,而視訊輸入支援則擴大了這些系統可以處理的媒體類型。此來源描述了效能和記憶體相關的工作,但沒有提供獨立的基準測試,因此實際收益將取決於硬體、模型格式和部署配置。
此版本將多個較新的模型架構連接到廣泛使用的推理程式碼庫,包括原始的 Qwen3.8-Flash-Next 和 Nemotron-3-Puzzle 支援。儘管原始程式碼並未在每個平台或配置之間建立相容性,但這可能會減少開發人員嘗試這些模型的整合工作。
ggml 更新新增了稀疏注意力、非同步後端、遠端過程呼叫事件和 Apple RDMA 的基礎設施。這些變更對於可以使用這些特定後端的部署可能很重要,但發布頁面並未量化延遲、吞吐量、記憶體使用或可靠性改進。
視訊參數、媒體資料 URL 支援以及多模式預處理更改為處理影片和其他媒體的應用程式提供了更具體的路徑。消息來源沒有說明這些功能是否在打包版本中可用或在特定於模型的限制下可用。
Interactive Mechanism互動機制:它實際上是如何運作的 以互動方式探索這項發展背後的基礎技術。
🧠 Reasoning Compute 📜 Context Window ⚡ Agent Execution Loop 🎯 RAG vs Fine-Tuning 💻 Hardware & Model Scale
Complex Accuracy 79% Math & Code Logic
Latency 3.2s Time to first full output
Inference Cost $0.0092 Per query estimated
Reasoning Style Step Verification Internal chain depth
Active Thinking Trace: 1 Deconstruct user problem into formal constraints
2 Propose candidate hypotheses & step-by-step calculation
3 Self-correction: Backtrack and refute subtle edge cases
4 Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Which component of an AI application is the machine-learning model itself? A A mathematical system mapping inputs to outputs with a structure and learned parameters B A user interface that contains every product feature C A set of websites the model is allowed to visit D A policy document that defines how a team uses AI
接下來看什麼 後續版本、後端特定測試和文件應闡明新模型和視訊功能在支援的硬體上的行為方式。最直接的不確定性是最初的 Qwen3.8-Flash-Next 實作是否收到了承諾的最佳化工作,以及稀疏注意力和記憶體變化在多大程度上改善了實際工作負載。
請關注 Qwen3.8-Flash-Next 的最佳化更新以及新新增的多模式模型路徑的其他修復。
專注於基準測試結果,將發布頁面的實作聲明與測得的速度、記憶體使用和並發性增益分開。
請注意有關打包存取、支援的模型文件、硬體要求和生產準備的文件。發布頁面未提供這些詳細資訊。
相關指引和測驗 更新和更正 當正在發生的事件發生重大變化時,這個典型的故事就會被更新。它的 URL 和原始發布日期永遠不會改變。
2026年9月4日 下午8:45 [UTC] 早期的 llama.cpp 條目涵蓋了 NVIDIA 的 Nemotron-3-Puzzle 的預發布支援。版本 0.4.0 現在在更廣泛的標記版本中包括 Nemotron-3-Puzzle-75B-A9B 支持,還添加了更新的模型架構、視頻輸入、伺服器上下文控制、惰性張量讀取和 ggml 0.23.0 後端工作。 查看公開更正日誌 →