Powrót do Wiadomości
ProduktAI Understanding odprawa

llama.cpp 0.3.0 dodaje obsługę multimodalnej nuty kropki 3 i dzielenie tensora DeepSeek 4

W ramach projektu llama.cpp opublikowano wersję 0.3.0 z obsługą modelu obrazu i dźwięku dots3-note, nową obsługą podziału tensorów DeepSeek 4, przewidywaniem wielu tokenów GLM-4.5-Air oraz aktualizacjami w backendach wnioskowania i interfejsie internetowym.

5 min readRead the primary source
Screenshot of ggml-org’s official llama.cpp v0.3.0 release notes on GitHub, showing its dots3-note and DeepSeek 4 changes. Source-page capture, not a photograph.
Dokument źródłowyŹródło zapisane
Wydawca
github.com
Link źródłowy
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.3.0
Typ źródła
Dokument podstawowy — oficjalne ogłoszenie, dokument, zgłoszenie lub strona własna, którą czytamy bezpośrednio.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Kluczowe terminy

Pamięć (pamięć agenta)
Przechowywany kontekst, którego agent AI używa na różnych etapach lub sesjach, aby poprawić ciągłość.
Model open source
Model wydany z publicznymi wagami lub kodem do kontroli, adaptacji i ponownego użycia.
Model multimodalny
Model, który może przetwarzać lub generować wiele typów danych, takich jak tekst, obraz i dźwięk.
Sprawdź sięQuiz objaśniający modele AI

Co się stało

Jak podaje strona wydania GitHub, projekt llama.cpp wypuścił wersję 0.3.0 25 sierpnia. Aktualizacja dodaje obsługę multimodalnego modelu dots3-note, w tym nowy typ pamięci podręcznej klucz-wartość DSA-ISWA, a także dodaje obsługę obrazu i dźwięku dla tego modelu. Wprowadza także tryb podziału tensora dla DeepSeek 4, naprawia wycofywanie wielu sekwencji i dodaje obsługę przewidywania wielu tokenów dla GLM-4.5-Air.

Strona GitHub identyfikuje wersję 0.3.0 jako najnowszą wersję publicznego repozytorium llama.cpp i odnotowuje wydanie o godzinie 10:22 w dniu 25 sierpnia. Wydanie jest przedstawiane jako znacząca aktualizacja wersji, a nie mała poprawka konserwacyjna. Główne zmiany dotyczą sposobu, w jaki oprogramowanie obsługuje i wykonuje modele AI, w tym nowy model multimodalny, funkcje wnioskowania specyficzne dla modelu, równoległość tensorów oraz zmiany we współdzielonych komponentach używanych przez serwer i inne narzędzia. Najbardziej znanym dodatkiem do modelu jest dots3-note. Informacje o wydaniu mówią, że llama.cpp dodaje model wraz z nowym typem pamięci podręcznej klucz-wartość DSA-ISWA. Oddzielnie wymieniono obsługę obrazu i dźwięku dots3-note, obrazów WebP za pośrednictwem ffmpeg oraz algorytmu zmiany rozmiaru z dokładnością do poduszki. W uwagach napisano również, że naprawiono ładowanie wideo, gdy na końcu pliku pojawiał się atom moov. Zmiany te wskazują, że projekt wykracza poza wykonanie modelu zorientowanego na tekst i obejmuje szerszy zestaw danych wejściowych medialnych, chociaż źródło nie opisuje możliwości modelu ani zamierzonych zastosowań.

Dla DeepSeek 4, wersja 0.3.0 dodaje tryb podziału tensora poprzez opcję „-sm tensor” i naprawia wycofywanie, gdy aktywnych jest wiele sekwencji. W tej wersji zgłoszono także poprawkę dotyczącą propagacji stanu rozdzielonego tensorem w celu wykonania równoległego tensora. Oddzielnie GLM-4.5-Air otrzymuje obsługę przewidywania wielu tokenów, podczas gdy bailingmoe3 otrzymuje obsługę DSpark. Są to zmiany na poziomie implementacji, które wpływają na sposób wykonywania, równoległości i przyspieszania poszczególnych modeli; wydanie nie twierdzi, że poprawiają jakość modelu.

Aktualizacja wprowadza również komponent ggml do wersji 0.22.0. W uwagach opisano obsługę podziału tensorowego w meta backendie ggml z wieloma backendami, ulepszoną propagację stanu podziału, źródła Metalu na operację z kompilacją równoległą oraz poprawkę, która sprawia, że ​​ggml_clamp jest poprawną operacją nielokalną. Dodatkowe zmiany obejmują nowe operacje, jądra Q2_K SYCL, połączenie mieszanki ekspertów OpenCL i poprawki w CUDA, Metal, SYCL, Vulkan, OpenCL i WebGPU. Serwer zyskuje zmienną środowiskową w celu poszerzenia różnic w debugowaniu gniazd, a interfejs sieciowy zyskuje nawigację w czacie na kartach.

Szczegóły źródła: github.com ↗

Dlaczego to ma znaczenie

Wydanie rozszerza zakres modeli sztucznej inteligencji i typów danych wejściowych obsługiwanych przez powszechnie stosowaną implementację typu open source, jednocześnie rozwiązując problemy z pamięcią, równoległością i zapleczem związane z uruchamianiem większych lub bardziej złożonych modeli. Praktyczny efekt będzie zależał od sprzętu, plików modelu, konfiguracji kompilacji i konkretnego użytego backendu.

Praktyczne znaczenie jest takie, że stos wykonawczy modelu typu open source dodaje obsługę bardziej zróżnicowanych architektur i modalności modeli w tej samej wersji. Dla programistów i badaczy korzystających z pliku llama.cpp obsługa wejść wizyjnych i audio w dots3-note może zmniejszyć potrzebę utrzymywania oddzielnych ścieżek wykonania dla tych wejść. Informacje o wydaniu stwierdzają obecność wsparcia, ale nie określają, jak kompletne, szybkie i niezawodne jest ono na konkretnym sprzęcie.

Podział tensora jest ważny, ponieważ dotyczy rozkładu obciążenia lub stanu modelu pomiędzy urządzeniami. Zmiany w DeepSeek 4 mogą sprawić, że oprogramowanie stanie się bardziej użyteczne dla osób, których dostępna moc obliczeniowa jest podzielona między wiele urządzeń, natomiast naprawa wycofywania może mieć znaczenie w przypadku obciążeń, które utrzymują więcej niż jedną aktywną sekwencję. Są to prawdopodobne korzyści operacyjne wynikające z wymienionych zmian, a nie zmierzonych wyników: źródło nie zapewnia porównań przepustowości, pamięci, opóźnień ani współczynnika awaryjności z wersją 0.2.0.

Zmiany w ggml poszerzają zasięg wydania na backendy sprzętowe. Równoległa kompilacja źródeł Metal może wpłynąć na czas kompilacji, podczas gdy meta-backend działa w trybie podzielonego stanu i poprawki dla CUDA, SYCL, Vulkan, OpenCL i WebGPU dotyczą warstwy przenośności, która łączy modele z różnymi rodzajami sprzętu. W tej wersji wymieniono także zmianę projekcji Mamba2 mającą na celu wysłanie GEMM zamiast GEMV, ale nie określono ilościowo żadnego wzrostu wydajności. Użytkownicy powinni zatem traktować notatki jako dziennik zmian wdrożeniowych, a nie jako raport porównawczy.

Wydanie ma znaczenie dla szerszego ekosystemu sztucznej inteligencji, ponieważ obsługa modeli jest kształtowana nie tylko przez twórców modeli, ale także przez warstwę oprogramowania, która umożliwia wykonywanie modeli w różnych systemach. Dodanie modelu lub moda może mieć wpływ na to, które projekty będą praktyczne w przypadku wdrożenia lokalnego lub specjalistycznego. Nadal pozostają istotne niewiadome: źródło nie podaje warunków licencji ani dystrybucji dots3-note, wymaganych wag modeli, obsługiwanych systemów operacyjnych, minimalnych wymagań sprzętowych, obsługiwanych formatów audio i wideo poza wymienionymi poprawkami ani tego, czy wszystkie funkcje są dostępne w zasobie nocnym.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Interaktywna kontrola koncepcji+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Co obejrzeć dalej

Informacje o wersji nie zawierają niezależnych testów porównawczych, wymagań sprzętowych, matryc kompatybilności ani dowodów wdrożeń produkcyjnych. Kluczową obserwacją jest to, czy użytkownicy zgłaszają niezawodne działanie ścieżek wizyjnych i audio dots3-note, podział tensora DeepSeek 4 na urządzenia oraz zaktualizowane backendy CUDA, Metal, SYCL, Vulkan, OpenCL i WebGPU.

Pierwszym punktem weryfikacji jest pokrycie funkcjonalne dots3-note. Informacje o wersji wymieniają obsługę obrazu i dźwięku, dekodowanie WebP, poprawki ładowania wideo i zachowanie zmiany rozmiaru, ale nie zawierają przykładów testowych ani obsługiwanych tabel wejściowych. Niezależne testy powinny ustalić, które formaty działają, jak wstępne przetwarzanie wpływa na wyniki, czy można połączyć dźwięk i obraz oraz czy zachowanie jest spójne we wszystkich obsługiwanych backendach. Do tego czasu „wsparcie” należy rozumieć jako zgłoszenie wdrożeniowe na poziomie projektu, a nie dowód gotowości produkcyjnej.

Drugą kwestią jest rzeczywisty efekt podziału tensora DeepSeek 4. Użytkownicy będą musieli określić, czy „-sm tensor” działa na ich poszczególnych urządzeniach, w jaki sposób pamięć jest podzielona i czy wielosekwencyjne wycofywanie zmian pozostaje niezawodne w przypadku długich lub równoczesnych obciążeń. Źródło nie podaje listy sprzętu, danych o wydajności ani analizy błędów. Raporty od opiekunów i użytkowników będą szczególnie przydatne, ponieważ zachowanie równoległe tensora może się różnić w zależności od sterowników, skompilowanych funkcji, kombinacji urządzeń i konfiguracji modelu.

The third area is backend parity. The release names updates for CUDA, Metal, SYCL, Vulkan, OpenCL, and WebGPU, but it does not say that every new model or operation works equally on each backend. The changelog itself notes that the dots3-note architecture test was disabled for WebGPU, which is a concrete reason to avoid assuming complete cross-backend coverage. Follow-up documentation or test results should clarify what is enabled, experimental, limited, or unavailable.

Finally, the project’s subsequent releases will show whether these changes remain stable. Items worth monitoring include fixes for dots3-note loading and media preprocessing, regressions involving multi-token prediction or embeddings, further DeepSeek 4 parallelism changes, and updates to the server’s slot-fitting logic. The release includes a nightly build asset, but the source does not explain its packaging, reproducibility, or relationship to stable builds. No independent evidence in the supplied material establishes adoption, deployment scale, or user impact.

Powiązane przewodniki i quizy

Wyjaśnienie modeli AITransformatorySzkolenie AISprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie z modułem śledzenia wydań modeli AI
Uznałeś to za przydatne?