Chuyện gì đã xảy ra
Lec báo cáo rằng Qualcomm đã tiết lộ bộ xử lý thần kinh Hexagon thế hệ tiếp theo vào ngày 10 tháng 9 để xử lý khối lượng công việc AI tác nhân liên tục trên thiết bị di động. Thiết kế được báo cáo bổ sung Bộ tăng tốc phần tử cho khối lượng công việc của máy biến áp, tăng 50% bộ nhớ dùng chung và hỗ trợ các mô hình hỗn hợp chuyên gia với tối đa 30 tỷ tham số, với khoảng 3 tỷ hoạt động cho mỗi mã thông báo được tạo. Theo The Lec, NPU hỗ trợ các định dạng dữ liệu FP16, INT2, INT4, INT8 và FP8. Qualcomm tuyên bố hiệu suất nạp trước INT4 có thể nhanh hơn tới 50% và phản hồi có thể bắt đầu trong vòng 1,5 giây, mặc dù The Lec không báo cáo thử nghiệm độc lập về những số liệu đó. NPU dự kiến sẽ hoạt động với CPU Oryon và GPU Adreno của Snapdragon cho quy trình làm việc nhiều bước và xử lý AI liên quan đến đồ họa. Báo cáo cho biết Qualcomm sẽ cung cấp thêm thông tin chi tiết tại Hội nghị thượng đỉnh Snapdragon ở Hoa Kỳ từ ngày 22 đến ngày 24 tháng 9. Nguồn tin không xác định điện thoại thông minh cụ thể, ngày ra mắt, tình trạng sẵn có bán lẻ, giá cả hoặc kết quả điểm chuẩn của bên thứ ba đã được xác nhận.
Lec báo cáo rằng Qualcomm đã tiết lộ NPU Hexagon thế hệ tiếp theo vào ngày 10 tháng 9, định vị nó là phần cứng di động cho các hệ thống AI có khả năng diễn giải ngữ cảnh, lý luận trên các ứng dụng và thực hiện các tác vụ cho người dùng. Phần cứng được báo cáo bổ sung Bộ tăng tốc phần tử cùng với các phần mở rộng vô hướng, vectơ và ma trận hiện có, với mục tiêu cải thiện tính toán mô hình máy biến áp trong khi quản lý việc sử dụng năng lượng.
Báo cáo cho biết dung lượng bộ nhớ dùng chung cao hơn 50% so với thiết kế trước đó. Cơ sở lý luận đã nêu của Qualcomm là việc giữ trạng thái mô hình, kích hoạt và dữ liệu tensor trung gian gần bộ xử lý hơn có thể làm giảm quá trình truyền sang DRAM bên ngoài, có khả năng cải thiện khả năng lưu giữ ngữ cảnh và chuyển đổi tác vụ. Báo cáo không cung cấp sự so sánh độc lập với việc triển khai Hexagon trước đó.
Hexagon mới được cho là hỗ trợ các mô hình hỗn hợp các chuyên gia với tối đa 30 tỷ tham số, đồng thời kích hoạt khoảng 3 tỷ tham số được định tuyến trên mỗi mã thông báo. Lec cũng báo cáo việc quản lý bộ nhớ flash và bộ nhớ đệm NAND nhằm mục đích chỉ tải các thành phần chuyên môn có liên quan vào DRAM và giữ lại các thành phần được sử dụng thường xuyên trong bộ đệm.
NPU được cho là hỗ trợ các định dạng chính xác FP16, INT2, INT4, INT8 và FP8. Lec khẳng định tính năng nạp trước INT4 nhanh hơn tới 50% và phản hồi bắt đầu trong vòng 1,5 giây đối với Qualcomm. Không có thử nghiệm độc lập, tính sẵn có của thiết bị, giá cả hoặc sản phẩm tiêu dùng cụ thể nào được cung cấp.
Tại sao nó quan trọng
Nếu thiết kế được báo cáo của Qualcomm tiếp cận các thiết bị tiêu dùng như mô tả, nó có thể làm cho các hệ thống AI lớn hơn và nhận biết ngữ cảnh tốt hơn để chạy cục bộ trên điện thoại. Việc giữ nhiều dữ liệu mô hình hơn gần bộ xử lý có thể giảm lưu lượng bộ nhớ và độ trễ, trong khi kiến trúc hỗn hợp các chuyên gia có thể cung cấp quyền truy cập vào các khả năng chuyên biệt mà không cần kích hoạt mọi tham số cho mọi tác vụ. Điều đó quan trọng đối với quyền riêng tư, khả năng phản hồi và sử dụng ngoại tuyến, nhưng lợi ích thực tế vẫn chưa được xác minh cho đến khi có thiết bị, kiểu máy và thử nghiệm độc lập.
Thông báo nhắm đến một hạn chế trọng tâm trong AI di động: chạy các mô hình có khả năng chạy trong giới hạn chặt chẽ về băng thông bộ nhớ, mức sử dụng pin và độ trễ. Nhóm bộ nhớ dùng chung lớn hơn và kích hoạt có chọn lọc các thành phần hỗn hợp chuyên gia có thể làm giảm lượng dữ liệu được di chuyển trong quá trình suy luận cục bộ nếu kiến trúc của Qualcomm hoạt động như mô tả.
Việc xử lý cục bộ có thể mang lại những lợi ích thiết thực vì một số tương tác có thể được xử lý trên điện thoại mà không gửi mọi đầu vào đến một dịch vụ từ xa. Tuy nhiên, nguồn không thiết lập đảm bảo quyền riêng tư, chức năng ngoại tuyến, cải thiện pin hoặc hiệu suất trên các ứng dụng thực. Những kết quả đó phụ thuộc vào phần mềm, nén mô hình, giới hạn nhiệt và việc triển khai thiết bị cầm tay.
Việc tích hợp với CPU và GPU được báo cáo cho thấy Qualcomm đang coi AI tự động như một khối lượng công việc nền tảng chứ không phải là một tính năng tăng tốc riêng biệt. Tầm quan trọng của nó sẽ phụ thuộc vào việc liệu các nhà phát triển có thể truy cập phần cứng một cách hiệu quả hay không và liệu các nhà sản xuất điện thoại có cung cấp các mẫu và ứng dụng sử dụng nó hay không.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Xem gì tiếp theo
Bằng chứng có ý nghĩa tiếp theo sẽ là những tiết lộ về Snapdragon Summit của Qualcomm và các thiết bị cuối cùng sẽ sử dụng NPU. Theo dõi các nền tảng chip được đặt tên, kiểu máy được hỗ trợ, công cụ dành cho nhà phát triển, số đo thực tế trên thiết bị, mức tiêu thụ điện năng liên tục và liệu thời gian phản hồi đã tuyên bố có áp dụng cho quy trình làm việc tổng thể thay vì bản trình diễn hạn chế hay không. Tính sẵn có, giá cả và phân phối khu vực không được ghi lại trong báo cáo.
Qualcomm cho biết thêm thông tin chi tiết sẽ được tiết lộ tại Hội nghị thượng đỉnh Snapdragon từ ngày 22 đến ngày 24 tháng 9. Những tiết lộ đó có thể làm rõ nền tảng Snapdragon cụ thể, tiến trình triển khai, môi trường hoạt động được hỗ trợ và quyền truy cập của nhà phát triển.
Thử nghiệm độc lập sẽ xác minh mức cải thiện hiệu suất INT4 được báo cáo, yêu cầu bắt đầu phản hồi trong 1,5 giây, mức tiêu thụ điện năng và hiệu suất bền vững trong khối lượng công việc tác nhân nhiều bước. Nguồn không cung cấp thử nghiệm như vậy.
Vẫn chưa biết điện thoại thông minh nào sẽ sử dụng NPU, khi nào chúng sẽ đến tay khách hàng, giá của chúng là bao nhiêu hoặc liệu tất cả các tính năng được báo cáo có được kích hoạt khi ra mắt hay không.