llama.cpp 0.4.0 adds support for newer AI models and video input
The llama.cpp 0.4.0 release adds initial support for Qwen3.8-Flash-Next and NVIDIA Nemotron-3-Puzzle, video-input options, per-slot server context limits, lazy tensor reading, and ggml 0.23.0 changes.