Chuyện gì đã xảy ra
Bản in trước arXiv trình bày một nghiên cứu thực nghiệm có hệ thống về việc sử dụng năng lượng trong giai đoạn giải mã của suy luận mô hình ngôn ngữ lớn. Các nhà nghiên cứu đã đánh giá bốn mô hình nguồn mở bằng cách sử dụng sự chú ý nhiều đầu, sự chú ý truy vấn được nhóm và sự chú ý truy vấn được nhóm với sự chú ý của cửa sổ trượt trên các độ dài ngữ cảnh, kích thước lô và khối lượng công việc tạo khác nhau.
Bài viết xem xét mức tiêu thụ năng lượng trong giai đoạn giải mã của suy luận mô hình ngôn ngữ lớn, giai đoạn mà mô hình tạo ra mã thông báo đầu ra sau khi xử lý ngữ cảnh đầu vào của nó. Các tác giả mô tả công trình này như một nghiên cứu thực nghiệm có hệ thống được thúc đẩy bởi những lo ngại về tác động đến năng lượng và môi trường của việc sử dụng LLM ngày càng tăng. Họ so sánh bốn mô hình nguồn mở tiêu biểu sử dụng các thiết kế chú ý khác nhau: chú ý nhiều đầu tiêu chuẩn, chú ý truy vấn được nhóm và chú ý truy vấn nhóm kết hợp với chú ý cửa sổ trượt. Sự so sánh tập trung vào cách các thiết kế này hoạt động trong khi mã thông báo đang được tạo, với bối cảnh và điều kiện khối lượng công việc đã thay đổi để có thể quan sát được mô hình năng lượng của chúng.
Các nhà nghiên cứu thay đổi một số điều kiện hoạt động ảnh hưởng đến suy luận: độ dài ngữ cảnh, kích thước lô và khối lượng công việc tạo. Họ đo năng lượng GPU bằng cách sử dụng bộ đếm phần cứng NVIDIA và kiểm tra riêng biệt tác động của cơ chế chú ý, kích thước mô hình, tốc độ tăng trưởng bộ nhớ đệm Khóa-Giá trị và phân khối. Nguồn không xác định bốn mô hình, số lượng tham số của chúng, cấu hình phần cứng chính xác, kích thước khối lượng công việc hoặc giao thức đo lường ngoài mô tả ở mức trừu tượng này. Các phép đo này được trình bày dưới dạng so sánh giữa các điều kiện đã thử nghiệm và mô tả có sẵn nhấn mạnh các yếu tố được báo cáo thay vì báo cáo đầy đủ về hệ thống phân phối xung quanh.
Bài báo báo cáo rằng cơ chế chú ý là yếu tố chính chi phối cách giải mã năng lượng thay đổi khi độ dài bối cảnh tăng lên. Khi so sánh, các mô hình sử dụng chú ý nhiều đầu cho thấy mức tăng năng lượng nhanh hơn đáng kể so với các mô hình sử dụng chú ý truy vấn nhóm. Sự chú ý truy vấn được nhóm kết hợp với sự chú ý của cửa sổ trượt duy trì mức tiêu thụ năng lượng gần như không đổi trong các thử nghiệm được báo cáo. Các tác giả cũng báo cáo rằng kích thước mô hình chủ yếu xác định mức tiêu thụ năng lượng tuyệt đối, trong khi việc phân khối làm giảm cả năng lượng trên mỗi mã thông báo được tạo và độ trễ yêu cầu tới 87%. Do đó, kết quả phân biệt giữa lượng năng lượng được sử dụng theo giá trị tuyệt đối và cách lượng năng lượng đó thay đổi theo độ dài ngữ cảnh.
Tại sao nó quan trọng
Nghiên cứu cho thấy rằng thiết kế cơ chế chú ý của mô hình AI có thể ảnh hưởng đáng kể đến năng lượng cần thiết để tạo ra mã thông báo, đặc biệt là khi cửa sổ ngữ cảnh mở rộng. Kết quả của nó có thể giúp các nhà phát triển và vận hành mô hình cân nhắc kiến trúc và các lựa chọn phục vụ dựa trên việc sử dụng năng lượng, độ trễ và quy mô.
Ý nghĩa chính là hiệu quả sử dụng năng lượng không chỉ được xác định bởi độ lớn của mô hình ngôn ngữ. Hai mô hình phục vụ bối cảnh dài hơn có thể có hành vi mở rộng quy mô năng lượng khác nhau do cơ chế chú ý của chúng tương tác khác nhau với bộ nhớ đệm Khóa-Giá trị đang phát triển. Điều đó làm cho kiến trúc trở thành một sự cân nhắc thực tế đối với các tổ chức vận hành các dịch vụ suy luận khối lượng lớn hoặc thiết kế các mô hình nhằm xử lý dữ liệu đầu vào dài. Sự khác biệt quan trọng đối với việc lập kế hoạch vì cửa sổ ngữ cảnh tăng lên không chuyển thành một quỹ đạo năng lượng cố định trên các kiến trúc trong so sánh.
Kết quả được báo cáo về sự chú ý truy vấn được nhóm với sự chú ý của cửa sổ trượt có thể hữu ích vì nó chỉ ra một cách hạn chế sự tăng trưởng năng lượng liên quan đến các bối cảnh dài hơn. Nguồn không khẳng định rằng sự kết hợp này là vượt trội trên toàn cầu: nó báo cáo một mô hình thực nghiệm trong bốn mô hình nguồn mở trong các điều kiện đã được thử nghiệm. Bất kỳ quyết định triển khai nào cũng cần phải tính đến độ chính xác, khả năng lưu giữ ngữ cảnh, chất lượng trên các tài liệu dài, các ràng buộc triển khai và các chi phí khác không được đo lường trong nguồn được cung cấp. Những tiêu chuẩn đó rất quan trọng khi diễn giải kết quả dưới dạng bằng chứng từ các trường hợp được thử nghiệm thay vì là một khuyến nghị độc lập với hành vi của mô hình hoặc yêu cầu dịch vụ.
Kết quả phân mẻ kết nối việc sử dụng năng lượng với việc lập kế hoạch vận hành. Theo bài báo, việc xử lý các yêu cầu theo lô giúp giảm năng lượng trên mỗi mã thông báo được tạo và độ trễ yêu cầu lên tới 87%. Nếu được sao chép trong cài đặt sản xuất, điều đó có thể giúp việc lập kế hoạch và hợp nhất khối lượng công việc phù hợp với cả quản lý chi phí và môi trường. Nguồn không cho biết liệu mức giảm lớn nhất có xảy ra trong mỗi khối lượng công việc hay không, liệu việc xử lý theo đợt có làm thay đổi chất lượng đầu ra hay không hay sự cân bằng về khả năng đáp ứng có thể phát sinh đối với người dùng cá nhân. Điều đó làm cho tỷ lệ phần trăm được báo cáo có liên quan đến thiết kế hệ thống trong khi khả năng ứng dụng của nó phụ thuộc vào các điều kiện.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Những phát hiện này cần được thử nghiệm trên nhiều mô hình, nền tảng phần cứng, khối lượng công việc và quy trình suy luận đầy đủ hơn. Bài viết đo năng lượng GPU trong quá trình giải mã, do đó, kết quả của nó không tự mình thiết lập tổng năng lượng hệ thống, tác động môi trường rộng hơn hoặc hiệu suất trên mọi kiến trúc mô hình.
Câu hỏi đầu tiên là khả năng tái sản xuất. Nguồn xác định bài viết là bản in trước arXiv được gửi vào ngày 25 tháng 8 năm 2026 và cung cấp bản tóm tắt nhưng không có trạng thái đánh giá ngang hàng. Quá trình giám sát tiếp theo nên kiểm tra danh sách mô hình đầy đủ, kích thước tham số, độ dài ngữ cảnh, cấu hình lô, độ dài thế hệ, hiệu chuẩn bộ đếm năng lượng và biến thể thống kê qua các lần chạy. Những chi tiết đó sẽ giúp xác định mức độ chặt chẽ của các so sánh được báo cáo và mức độ không chắc chắn xung quanh những khác biệt quan sát được.
Phạm vi đo lường phần cứng cũng có vấn đề. Nghiên cứu đo năng lượng GPU bằng bộ đếm phần cứng NVIDIA, nhưng bản tóm tắt không báo cáo năng lượng từ CPU, bộ nhớ, mạng, làm mát, lưu trữ hoặc cơ sở hạ tầng khác. Do đó, nó hỗ trợ các kết luận về năng lượng giải mã GPU đo được chứ không phải tính toán đầy đủ về năng lượng hoặc lượng khí thải liên quan đến việc vận hành dịch vụ AI. Bộ đếm GPU cung cấp ranh giới đo lường đã nêu của nghiên cứu, do đó, kết luận phải được gắn với ranh giới đó cho đến khi các thành phần khác được đo lường.
Công việc tiếp theo sẽ kiểm tra xem các mẫu chia tỷ lệ được báo cáo có phù hợp với các mô hình mới hơn và được thiết kế khác, các nhà cung cấp công cụ tăng tốc bổ sung, bối cảnh dài hơn và khối lượng công việc tương tác hay không. Nó cũng nên so sánh năng lượng với chất lượng và thông lượng của mô hình. Cơ chế sử dụng ít năng lượng hơn trong một cấu hình có thể áp đặt sự cân bằng về công suất hoặc độ trễ ở nơi khác và nguồn được cung cấp không định lượng được những sự cân bằng đó. Những so sánh như vậy sẽ làm rõ liệu năng lượng đo được thấp hơn có đi kèm với những thay đổi trong các kết quả khác mà người vận hành quan tâm hay không.
Mức giảm tối đa 87% được báo cáo xứng đáng được giải thích cẩn thận. Bản tóm tắt quy nó theo đợt và cho biết nó áp dụng cho cả năng lượng trên mỗi mã thông báo được tạo và độ trễ yêu cầu, nhưng nó không chỉ định đường cơ sở, khối lượng công việc hoặc liệu tỷ lệ phần trăm giống nhau có áp dụng cho cả hai biện pháp hay không. Người đọc nên coi nó như kết quả được báo cáo cao hơn của nghiên cứu thay vì kỳ vọng chung cho tất cả việc triển khai LLM. Nếu không có những chi tiết đó, tỷ lệ phần trăm không thể được chuyển trực tiếp từ bản in trước sang triển khai tùy ý.