뉴스로 돌아가기
제품AI Understanding 브리핑

llama.cpp 0.3.0에는 다중 모달 dots3-note 지원 및 DeepSeek 4 텐서 분할이 추가되었습니다.

llama.cpp 프로젝트는 dots3-note 비전 및 오디오 모델, 새로운 DeepSeek 4 텐서 분할 처리, GLM-4.5-Air 멀티 토큰 예측, 추론 백엔드 및 웹 인터페이스 전반에 걸친 업데이트를 지원하는 버전 0.3.0을 출시했습니다.

5 min readRead the primary source
Screenshot of ggml-org’s official llama.cpp v0.3.0 release notes on GitHub, showing its dots3-note and DeepSeek 4 changes. Source-page capture, not a photograph.
기본 소스 문서녹음된 소스
출판사
github.com
소스 링크
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.3.0
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

메모리(에이전트 메모리)
AI 에이전트는 연속성을 향상하기 위해 여러 단계 또는 세션에서 사용하는 저장된 컨텍스트입니다.
오픈 소스 모델
검사, 조정 및 재사용을 위해 공개 가중치 또는 코드와 함께 출시된 모델입니다.
다중 모드 모델
텍스트, 이미지, 오디오 등 다양한 데이터 유형을 처리하거나 생성할 수 있는 모델입니다.
자신을 테스트해 보세요AI 모델 설명 퀴즈

무슨 일이 일어났나요?

GitHub 릴리스 페이지에 따르면 llama.cpp 프로젝트는 8월 25일 버전 0.3.0을 출시했습니다. 이 업데이트는 새로운 DSA-ISWA 키-값 캐시 유형을 포함하여 dots3-note 다중 모달 모델에 대한 지원을 추가하고 해당 모델에 대한 비전 및 오디오 처리를 추가합니다. 또한 DeepSeek 4에 대한 텐서 분할 모드를 도입하고, 다중 시퀀스 롤백을 수정하고, GLM-4.5-Air에 대한 다중 토큰 예측 지원을 추가합니다.

GitHub 페이지에서는 v0.3.0을 공개 llama.cpp 저장소의 최신 릴리스로 식별하고 8월 25일 10시 22분에 릴리스를 기록합니다. 릴리스는 소규모 유지 관리 패치가 아닌 실질적인 버전 업데이트로 제공됩니다. 주요 변경 사항은 새로운 다중 모드 모델, 모델별 추론 기능, 텐서 병렬 처리, 서버 및 기타 도구에서 사용하는 공유 구성 요소의 변경 사항을 포함하여 소프트웨어가 AI 모델을 지원하고 실행하는 방법과 관련이 있습니다. 가장 눈에 띄는 모델 추가는 dots3-note입니다. 릴리스 노트에는 llama.cpp가 새로운 DSA-ISWA 키-값 캐시 유형과 함께 모델을 추가한다고 나와 있습니다. dots3-note 비전 및 오디오, ffmpeg를 통한 WebP 이미지 및 Pillow-accurate 크기 조정 알고리즘에 대한 지원을 별도로 나열합니다. 또한 메모에는 파일의 moov 원자가 끝에 나타날 때 비디오 로딩이 수정되었다고 나와 있습니다. 이러한 변경 사항은 소스가 모델의 기능이나 의도된 응용 프로그램을 설명하지 않지만 프로젝트가 텍스트 기반 모델 실행을 넘어 더 광범위한 미디어 입력 세트로 확장되고 있음을 나타냅니다.

DeepSeek 4의 경우 버전 0.3.0은 "-sm tensor" 옵션을 통해 텐서 분할 모드를 추가하고 여러 시퀀스가 ​​활성화될 때 롤백을 수정합니다. 이 릴리스에서는 텐서 병렬 실행을 위한 텐서 분할 상태 전파에 대한 수정 사항도 보고합니다. 이와 별도로 GLM-4.5-Air는 멀티 토큰 예측 지원을 받고, bailingmoe3은 DSpark 지원을 받습니다. 이는 특정 모델의 실행, 병렬화 또는 가속화 방법에 영향을 미치는 구현 수준의 변경 사항입니다. 릴리스에서는 모델 품질이 향상된다고 주장하지 않습니다.

또한 업데이트는 ggml 구성 요소를 v0.22.0으로 향상시킵니다. 이 노트에서는 ggml의 다중 백엔드 메타 백엔드의 텐서 분할 지원, 향상된 분할 상태 전파, 병렬 컴파일이 포함된 작업별 Metal 소스, ggml_clamp를 적절하지 않은 작업으로 만드는 수정 사항에 대해 설명합니다. 추가 변경 사항에는 새로운 작업, Q2_K SYCL 커널, OpenCL 전문가 혼합 바이어스 융합 및 CUDA, Metal, SYCL, Vulkan, OpenCL 및 WebGPU 전반의 수정 사항이 포함됩니다. 서버는 슬롯-디버그 차이를 확대하기 위한 환경 변수를 얻고 웹 인터페이스는 탭 채팅 탐색을 얻습니다.

소스 세부정보: github.com ↗

왜 중요한가요?

이번 릴리스에서는 널리 사용되는 오픈 소스 구현에서 지원하는 AI 모델 및 입력 유형의 범위를 확장하는 동시에 더 크고 복잡한 모델 실행과 관련된 메모리, 병렬성 및 백엔드 문제를 해결합니다. 실제 효과는 하드웨어, 모델 파일, 빌드 구성 및 사용된 특정 백엔드에 따라 달라집니다.

실질적인 의미는 오픈 소스 모델 실행 스택이 동일한 릴리스에서 보다 다양한 모델 아키텍처 및 양식에 대한 지원을 추가한다는 것입니다. llama.cpp를 사용하는 개발자와 연구원의 경우 dots3-note의 비전 및 오디오 입력 지원을 통해 해당 입력에 대해 별도의 실행 경로를 유지해야 할 필요성을 줄일 수 있습니다. 릴리스 노트에서는 지원 여부를 설정하지만 특정 하드웨어에서 지원이 얼마나 완전하고 빠르며 안정적인지는 설정하지 않습니다.

텐서 분할은 모델의 작업 부하나 상태가 여러 장치에 분산되는 방식과 관련이 있기 때문에 중요합니다. DeepSeek 4가지 변경 사항은 사용 가능한 컴퓨팅이 여러 장치에 분산되어 있는 사람들이 소프트웨어를 더 유용하게 만들 수 있는 반면, 롤백 수정은 둘 이상의 활성 시퀀스를 유지하는 작업 부하에 중요할 수 있습니다. 이는 측정된 결과가 아닌 나열된 변경 사항에 근거한 그럴듯한 운영상의 이점입니다. 소스는 버전 0.2.0과 비교하여 처리량, 메모리, 대기 시간 또는 실패율 비교를 제공하지 않습니다.

ggml 변경으로 인해 릴리스의 범위가 하드웨어 백엔드 전체로 확장되었습니다. Metal 소스에 대한 병렬 컴파일은 빌드 시간에 영향을 미칠 수 있는 반면, CUDA, SYCL, Vulkan, OpenCL 및 WebGPU에 대한 메타 백엔드 분할 상태 작업 및 수정 사항은 모델을 다양한 종류의 하드웨어에 연결하는 이식성 계층을 처리합니다. 이 릴리스에는 GEMV 대신 GEMM을 전달하기 위한 Mamba2 프로젝션 변경 사항도 나열되어 있지만 성능 향상을 정량화하지는 않습니다. 따라서 사용자는 이 메모를 벤치마크 보고서가 아닌 구현 변경 로그로 처리해야 합니다.

모델 지원은 모델 작성자뿐만 아니라 모델을 다양한 시스템에서 실행 가능하게 만드는 소프트웨어 계층에 의해 형성되기 때문에 이번 릴리스는 더 넓은 AI 생태계에 중요합니다. 모델이나 양식을 추가하면 어떤 프로젝트가 로컬 또는 전문 배포에 실용적인지에 영향을 줄 수 있습니다. 여전히 의미 있는 알 수 없는 사항이 남아 있습니다. 소스에서는 dots3-note에 대한 라이센스 또는 배포 조건, 필요한 모델 무게, 지원되는 운영 체제, 하드웨어 최소 사양, 나열된 수정 사항 이외의 지원되는 오디오 및 비디오 형식 또는 야간 자산에서 모든 기능을 사용할 수 있는지 여부를 명시하지 않습니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
대화형 개념 확인+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

다음에 무엇을 볼 것인가

릴리스 노트는 독립적인 벤치마크, 하드웨어 요구 사항, 호환성 매트릭스 또는 프로덕션 배포 증거를 제공하지 않습니다. 주요 후속 조치는 사용자가 dots3-note의 비전 및 오디오 경로, 장치 간 DeepSeek 4 텐서 분할, 업데이트된 CUDA, Metal, SYCL, Vulkan, OpenCL 및 WebGPU 백엔드에 대해 안정적인 성능을 보고하는지 여부입니다.

첫 번째 검증포인트는 dots3-note의 기능적 커버리지입니다. 릴리스 노트에는 비전 및 오디오 지원, WebP 디코딩, 비디오 로딩 수정, 크기 조정 동작이 명시되어 있지만 테스트 예제나 지원되는 입력 테이블은 포함되어 있지 않습니다. 독립적인 테스트를 통해 어떤 형식이 작동하는지, 전처리가 결과에 어떤 영향을 미치는지, 오디오와 비전을 결합할 수 있는지 여부, 지원되는 백엔드에서 동작이 일관되는지 여부를 설정해야 합니다. 그때까지 "지원"은 생산 준비 상태에 대한 증거가 아닌 프로젝트 수준 구현 주장으로 이해되어야 합니다.

두 번째 문제는 DeepSeek 4 텐서 분할의 실제 효과입니다. 사용자는 "-sm 텐서"가 특정 장치에서 작동하는지, 메모리가 어떻게 분할되는지, 다중 시퀀스 롤백이 장기 또는 동시 작업 부하에서 안정적으로 유지되는지 여부를 결정해야 합니다. 소스는 하드웨어 목록, 성능 데이터 또는 오류 분석을 제공하지 않습니다. 텐서 병렬 동작은 드라이버, 컴파일된 기능, 장치 조합 및 모델 구성에 따라 달라질 수 있으므로 관리자와 사용자의 보고서는 특히 유용합니다.

세 번째 영역은 백엔드 패리티입니다. 릴리스에서는 CUDA, Metal, SYCL, Vulkan, OpenCL 및 WebGPU에 대한 업데이트 이름을 지정하지만 모든 새로운 모델이나 작업이 각 백엔드에서 동일하게 작동한다고 언급하지는 않습니다. 변경 로그 자체에는 WebGPU에 대해 dots3-note 아키텍처 테스트가 비활성화되어 있음이 명시되어 있는데, 이는 완전한 크로스 백엔드 적용을 피하는 구체적인 이유입니다. 후속 문서 또는 테스트 결과에서는 활성화된 항목, 실험적인 항목, 제한되는 항목 또는 사용할 수 없는 항목을 명확히 해야 합니다.

마지막으로, 프로젝트의 후속 릴리스에서는 이러한 변경 사항이 안정적으로 유지되는지 확인할 것입니다. 모니터링할 가치가 있는 항목에는 dots3-note 로딩 및 미디어 전처리에 대한 수정 사항, 멀티 토큰 예측 또는 임베딩과 관련된 회귀, 추가 DeepSeek 4 병렬 처리 변경 사항 및 서버의 슬롯 피팅 로직 업데이트가 포함됩니다. 릴리스에는 야간 빌드 자산이 포함되어 있지만 소스에서는 패키징, 재현성 또는 안정적인 빌드와의 관계를 설명하지 않습니다. 제공된 자료에는 채택, 배포 규모 또는 사용자 영향을 입증하는 독립적인 증거가 없습니다.

관련 가이드 및 퀴즈

AI 모델 설명트랜스포머AI 트레이닝알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?