Quay lại Tin tức
sản phẩmAI Understanding tóm tắt

llama.cpp 0.3.0 bổ sung hỗ trợ chấm 3-nốt đa phương thức và phân tách 4 tensor DeepSeek

Dự án llama.cpp đã phát hành phiên bản 0.3.0 với sự hỗ trợ cho mô hình hình ảnh và âm thanh dots3-note, xử lý phân chia tensor DeepSeek 4 mới, dự đoán đa mã thông báo GLM-4.5-Air và các bản cập nhật trên các phần phụ trợ suy luận và giao diện web của nó.

5 min readRead the primary source
Screenshot of ggml-org’s official llama.cpp v0.3.0 release notes on GitHub, showing its dots3-note and DeepSeek 4 changes. Source-page capture, not a photograph.
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
github.com
Liên kết nguồn
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.3.0
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Bộ nhớ (Bộ nhớ tác nhân)
Bối cảnh được lưu trữ mà tác nhân AI sử dụng qua các bước hoặc phiên để cải thiện tính liên tục.
Mô hình nguồn mở
Một mô hình được phát hành với trọng lượng hoặc mã công khai để kiểm tra, điều chỉnh và tái sử dụng.
Mô hình đa phương thức
Một mô hình có thể xử lý hoặc tạo ra nhiều loại dữ liệu như văn bản, hình ảnh và âm thanh.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

Dự án llama.cpp đã phát hành phiên bản 0.3.0 vào ngày 25 tháng 8, theo trang phát hành GitHub của nó. Bản cập nhật bổ sung hỗ trợ cho mô hình đa phương thức dots3-note, bao gồm loại bộ nhớ đệm khóa-giá trị DSA-ISWA mới, đồng thời bổ sung khả năng xử lý hình ảnh và âm thanh cho mô hình đó. Nó cũng giới thiệu chế độ phân chia tensor cho DeepSeek 4, sửa lỗi khôi phục nhiều chuỗi và thêm hỗ trợ dự đoán nhiều mã thông báo cho GLM-4.5-Air.

Trang GitHub xác định v0.3.0 là bản phát hành mới nhất của kho lưu trữ công khai llama.cpp và ghi lại bản phát hành vào lúc 10:22 ngày 25 tháng 8. Bản phát hành được trình bày dưới dạng bản cập nhật phiên bản quan trọng chứ không phải là một bản vá bảo trì nhỏ. Những thay đổi trọng tâm của nó liên quan đến cách phần mềm hỗ trợ và thực thi các mô hình AI, bao gồm mô hình đa phương thức mới, các tính năng suy luận dành riêng cho mô hình, tính song song tensor và các thay đổi đối với các thành phần dùng chung được máy chủ và các công cụ khác sử dụng. Sự bổ sung mô hình nổi bật nhất là dots3-note. Ghi chú phát hành cho biết llama.cpp bổ sung mô hình cùng với loại bộ nhớ đệm khóa-giá trị DSA-ISWA mới. Họ liệt kê riêng sự hỗ trợ cho hình ảnh và âm thanh ghi chú dots3, hình ảnh WebP thông qua ffmpeg và thuật toán thay đổi kích thước chính xác của Gối. Các ghi chú cũng cho biết việc tải video đã được sửa khi nguyên tử moov của tệp xuất hiện ở cuối. Những thay đổi này cho thấy rằng dự án đang mở rộng ra ngoài việc thực thi mô hình định hướng văn bản sang một tập hợp đầu vào phương tiện rộng hơn, mặc dù nguồn không mô tả các khả năng của mô hình hoặc các ứng dụng dự kiến.

Đối với DeepSeek 4, phiên bản 0.3.0 bổ sung chế độ chia tensor thông qua tùy chọn “-sm tensor” và sửa lỗi khôi phục khi nhiều chuỗi đang hoạt động. Bản phát hành cũng báo cáo sự điều chỉnh đối với việc truyền trạng thái tensor-split để thực thi song song tensor. Riêng GLM-4.5-Air nhận được hỗ trợ dự đoán nhiều mã thông báo, trong khi bailingmoe3 nhận được hỗ trợ DSpark. Đây là những thay đổi ở cấp độ triển khai ảnh hưởng đến cách các mô hình cụ thể có thể được thực thi, song song hóa hoặc tăng tốc; bản phát hành không khẳng định rằng chúng cải thiện chất lượng mô hình.

Bản cập nhật cũng nâng thành phần ggml lên v0.22.0. Các ghi chú mô tả hỗ trợ phân tách tensor trong phần phụ trợ meta đa phụ trợ của ggml, việc truyền bá trạng thái phân tách được cải thiện, các nguồn kim loại cho mỗi hoạt động với quá trình biên dịch song song và một bản chỉnh sửa giúp ggml_clamp trở thành một hoạt động không tại chỗ thích hợp. Các thay đổi bổ sung bao gồm các hoạt động mới, hạt nhân Q2_K SYCL, phản ứng tổng hợp thiên vị của các chuyên gia OpenCL và các bản sửa lỗi trên CUDA, Metal, SYCL, Vulkan, OpenCL và WebGPU. Máy chủ nhận được một biến môi trường để mở rộng sự khác biệt về vị trí gỡ lỗi và giao diện web nhận được điều hướng trò chuyện theo thẻ.

Chi tiết nguồn: github.com ↗

Tại sao nó quan trọng

Bản phát hành mở rộng phạm vi mô hình AI và loại đầu vào được hỗ trợ bởi triển khai nguồn mở được sử dụng rộng rãi đồng thời giải quyết các vấn đề về bộ nhớ, tính song song và phụ trợ liên quan đến việc chạy các mô hình lớn hơn hoặc phức tạp hơn. Hiệu quả thực tế sẽ phụ thuộc vào phần cứng, tệp mô hình, cấu hình bản dựng và chương trình phụ trợ cụ thể được sử dụng.

Ý nghĩa thực tế là ngăn xếp thực thi mô hình nguồn mở đang bổ sung hỗ trợ cho các kiến ​​trúc và phương thức mô hình đa dạng hơn trong cùng một bản phát hành. Đối với các nhà phát triển và nhà nghiên cứu sử dụng llama.cpp, việc hỗ trợ đầu vào âm thanh và hình ảnh của dots3-note có thể làm giảm nhu cầu duy trì các đường dẫn thực thi riêng biệt cho những đầu vào đó. Ghi chú phát hành xác nhận sự hiện diện của hỗ trợ nhưng chúng không xác định mức độ đầy đủ, nhanh chóng hoặc đáng tin cậy của nó trên phần cứng cụ thể.

Việc phân tách tensor rất quan trọng vì nó liên quan đến cách phân bổ khối lượng công việc hoặc trạng thái của mô hình trên các thiết bị. Các thay đổi của DeepSeek 4 có thể giúp phần mềm trở nên dễ sử dụng hơn đối với những người có khả năng tính toán khả dụng được chia trên nhiều thiết bị, trong khi bản sửa lỗi khôi phục có thể quan trọng đối với khối lượng công việc duy trì nhiều chuỗi hoạt động. Đó là những lợi ích hoạt động hợp lý dựa trên những thay đổi được liệt kê chứ không phải kết quả đo được: nguồn không cung cấp thông lượng, bộ nhớ, độ trễ hoặc so sánh tỷ lệ lỗi so với phiên bản 0.2.0.

Những thay đổi về ggml mở rộng phạm vi tiếp cận của bản phát hành trên các chương trình phụ trợ phần cứng. Quá trình biên dịch song song cho các nguồn Metal có thể ảnh hưởng đến thời gian xây dựng, trong khi trạng thái phân tách meta-backend hoạt động và sửa lỗi cho CUDA, SYCL, Vulkan, OpenCL và WebGPU giải quyết lớp di động kết nối mô hình với các loại phần cứng khác nhau. Bản phát hành cũng liệt kê một thay đổi về phép chiếu Mamba2 nhằm gửi GEMM thay vì GEMV, nhưng nó không định lượng bất kỳ mức tăng hiệu suất nào. Do đó, người dùng nên coi các ghi chú này là nhật ký thay đổi triển khai chứ không phải là báo cáo điểm chuẩn.

Việc phát hành này có ý nghĩa quan trọng đối với hệ sinh thái AI rộng lớn hơn vì sự hỗ trợ của mô hình không chỉ được định hình bởi người tạo mô hình mà còn bởi lớp phần mềm giúp các mô hình có thể thực thi được trên các hệ thống khác nhau. Việc thêm một mô hình hoặc phương thức có thể ảnh hưởng đến dự án nào là thiết thực cho việc triển khai tại địa phương hoặc chuyên biệt. Tuy nhiên, vẫn còn những ẩn số có ý nghĩa: nguồn không nêu rõ giấy phép hoặc điều khoản phân phối cho dots3-note, trọng lượng mô hình bắt buộc, hệ điều hành được hỗ trợ, mức tối thiểu về phần cứng, định dạng âm thanh và video được hỗ trợ ngoài các bản sửa lỗi được liệt kê hoặc liệu tất cả các tính năng có sẵn trong nội dung hàng đêm hay không.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Ghi chú phát hành không cung cấp điểm chuẩn độc lập, yêu cầu phần cứng, ma trận tương thích hoặc bằng chứng về việc triển khai sản xuất. Bước tiếp theo quan trọng là liệu người dùng có báo cáo hiệu suất đáng tin cậy cho đường dẫn âm thanh và tầm nhìn của dots3-note, phân tách tensor DeepSeek 4 trên các thiết bị và các chương trình phụ trợ CUDA, Metal, SYCL, Vulkan, OpenCL và WebGPU được cập nhật hay không.

Điểm xác minh đầu tiên là phạm vi chức năng của dots3-note. Bản phát hành ghi chú hỗ trợ hình ảnh và âm thanh, giải mã WebP, sửa lỗi tải video và thay đổi kích thước, nhưng chúng không bao gồm các ví dụ kiểm tra hoặc bảng đầu vào được hỗ trợ. Thử nghiệm độc lập sẽ xác định định dạng nào hoạt động, cách xử lý trước ảnh hưởng đến kết quả, liệu âm thanh và hình ảnh có thể được kết hợp hay không và liệu hành vi có nhất quán trên các chương trình phụ trợ được hỗ trợ hay không. Cho đến lúc đó, “hỗ trợ” nên được hiểu là yêu cầu triển khai ở cấp dự án hơn là bằng chứng về mức độ sẵn sàng sản xuất.

Vấn đề thứ hai là hiệu ứng thực tế của việc phân tách tensor DeepSeek 4. Người dùng sẽ cần xác định xem “-sm tensor” có hoạt động trên các thiết bị cụ thể của họ hay không, cách phân chia bộ nhớ và liệu việc khôi phục nhiều chuỗi có còn đáng tin cậy trong khối lượng công việc dài hoặc đồng thời hay không. Nguồn không cung cấp danh sách phần cứng, dữ liệu hiệu suất hoặc phân tích lỗi. Báo cáo từ người bảo trì và người dùng sẽ đặc biệt hữu ích vì hành vi song song của tensor có thể khác nhau tùy theo trình điều khiển, tính năng được biên dịch, kết hợp thiết bị và cấu hình mô hình.

Khu vực thứ ba là tính chẵn lẻ phụ trợ. Tên phát hành cập nhật cho CUDA, Metal, SYCL, Vulkan, OpenCL và WebGPU, nhưng không nói rằng mọi mô hình hoặc hoạt động mới đều hoạt động như nhau trên mỗi chương trình phụ trợ. Bản thân nhật ký thay đổi cũng lưu ý rằng kiểm tra kiến ​​trúc dots3-note đã bị vô hiệu hóa đối với WebGPU, đây là lý do cụ thể để tránh giả định phạm vi phủ sóng phụ trợ chéo hoàn chỉnh. Tài liệu tiếp theo hoặc kết quả kiểm tra phải làm rõ những gì được kích hoạt, thử nghiệm, hạn chế hoặc không khả dụng.

Cuối cùng, các bản phát hành tiếp theo của dự án sẽ cho biết liệu những thay đổi này có ổn định hay không. Các mục đáng theo dõi bao gồm các bản sửa lỗi để tải dấu chấm 3 ghi chú và tiền xử lý phương tiện, hồi quy liên quan đến dự đoán hoặc nhúng nhiều mã thông báo, các thay đổi song song hơn nữa của DeepSeek 4 và cập nhật logic khớp khe của máy chủ. Bản phát hành bao gồm nội dung bản dựng hàng đêm nhưng nguồn không giải thích cách đóng gói, khả năng tái tạo hoặc mối quan hệ của nó với các bản dựng ổn định. Không có bằng chứng độc lập nào trong tài liệu được cung cấp chứng minh việc áp dụng, quy mô triển khai hoặc tác động của người dùng.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIMáy biến ápĐào tạo AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?