Chuyện gì đã xảy ra
Một nhóm nghiên cứu đã giới thiệu SHIFT-LLM, một khung hiệu chỉnh không cần đào tạo dành cho các mô hình ngôn ngữ lớn có khối Transformer đã được loại bỏ để giảm chi phí suy luận. Phương pháp này chèn Bộ điều hợp dư tuyến tính tại mỗi vị trí cắt tỉa và hiệu chỉnh nó bằng hồi quy bình phương nhỏ nhất dạng đóng bằng cách sử dụng tập dữ liệu được giữ lại nhỏ. Bài viết báo cáo các đánh giá trên năm dòng mô hình, sáu tiêu chí lựa chọn lớp và bảy điểm chuẩn không bắn, với khả năng phục hồi chính xác trong hầu hết các cấu hình được thử nghiệm.
Bài viết mô tả việc cắt tỉa độ sâu như một cách để giảm chi phí suy luận của các mô hình ngôn ngữ lớn bằng cách loại bỏ toàn bộ khối Transformer. Theo các tác giả, điều này tạo ra sự thay đổi phân phối: các trạng thái ẩn được tạo ra sau khi khối bị loại bỏ không còn khớp với phân phối mà các lớp phía dưới mong đợi. Kết quả không khớp có thể gây ra sự mất đi độ chính xác đáng kể mặc dù mô hình còn lại vẫn chứa hầu hết cấu trúc ban đầu của nó. SHIFT-LLM được trình bày như một khung hiệu chỉnh cho vấn đề cụ thể này, làm cho sự tương tác giữa việc loại bỏ lớp và hoạt động của mô hình xuôi dòng trở thành chủ đề trung tâm của tác phẩm.
Thành phần được đề xuất là Bộ điều hợp dư tuyến tính, hoặc LRA, được đặt tại mỗi vị trí nơi khối đã được cắt tỉa. Bộ điều hợp duy trì đường dẫn nhận dạng của khối dư ban đầu và thêm hiệu chỉnh dư affine nhẹ. Các tác giả cho biết sự hiệu chỉnh này được thực hiện thông qua hồi quy bình phương nhỏ nhất dạng đóng trên một tập hiệu chuẩn nhỏ được giữ lại. Nó không yêu cầu tính toán độ dốc. Trong mô tả của bài viết, LRA nhằm mục đích ước tính bản cập nhật còn lại có thể được tạo ra bởi khối đã bị xóa, đồng thời tránh các tính toán chú ý và chuyển tiếp nguồn cấp dữ liệu liên quan đến khối đó.
Nguồn báo cáo rằng phương pháp này đã được thử nghiệm trên năm dòng mô hình, sáu tiêu chí để chọn các lớp cần loại bỏ và bảy điểm chuẩn không bắn. Nó cho biết SHIFT-LLM đã phục hồi liên tục độ chính xác bị mất do cắt bớt độ sâu trên hầu hết các cấu hình, với mức cải thiện tối đa là 15,7 điểm phần trăm trên Llama-3.1-8B-Instruct. Nguồn không cung cấp tên điểm chuẩn, điểm cơ bản, tỷ lệ cắt tỉa, phép đo phần cứng hoặc kết quả theo từng mô hình trong văn bản được cung cấp. Nó cũng không nói rằng phương pháp này đã được sao chép hoặc tích hợp độc lập vào sản phẩm thương mại.
Tại sao nó quan trọng
Việc loại bỏ toàn bộ các lớp có thể làm giảm chi phí chạy LLM nhưng cũng có thể phá vỡ các biểu diễn bên trong mà các lớp sau mong đợi. SHIFT-LLM được thiết kế để giải quyết sự cân bằng đó bằng các chỉnh sửa nhẹ thay vì khôi phục sự chú ý đã bị loại bỏ và tính toán chuyển tiếp nguồn cấp dữ liệu. Nếu kết quả được báo cáo khái quát hóa, thì cách tiếp cận này có thể làm cho các mô hình ngôn ngữ nén trở nên thực tế hơn trong đó chi phí suy luận, bộ nhớ hoặc độ trễ bị hạn chế.
Vấn đề thực tế được bài báo giải quyết là sự cân bằng nén quen thuộc: một mô hình nhỏ hơn hoặc nông hơn có thể chạy rẻ hơn, nhưng độ chính xác của nó có thể giảm do việc loại bỏ các lớp sẽ làm thay đổi tín hiệu nội bộ được truyền qua mạng. Đóng góp của bài viết là nhắm trực tiếp vào chế độ lỗi đó thay vì coi mô hình được cắt tỉa như một mô hình nhỏ hơn thông thường. Điều này quan trọng vì chi phí suy luận không chỉ bị ảnh hưởng bởi số lượng tham số mà còn bởi mức độ chú ý và tính toán chuyển tiếp nguồn cấp dữ liệu được thực hiện cho mỗi đầu vào.
Quy trình hiệu chuẩn được báo cáo của SHIFT-LLM có khả năng hữu ích vì nó không phụ thuộc vào việc đào tạo lại dựa trên độ dốc. Các tác giả cho biết chỉ cần vài trăm mẫu hiệu chuẩn và các bộ điều hợp có thể được trang bị hồi quy dạng đóng. Điều đó có thể làm giảm gánh nặng dữ liệu, bộ nhớ và kỹ thuật liên quan đến việc khôi phục chất lượng sau khi cắt tỉa. Hệ số hóa thứ hạng thấp được đề xuất và việc hợp nhất chính xác trên các lớp được cắt tỉa liên tiếp cũng được trình bày như những cách để tăng thêm khả năng nén. Đây là những tuyên bố về thiết kế của phương pháp và các thử nghiệm được báo cáo, không phải bằng chứng cho thấy mọi hoạt động triển khai sẽ đạt được mức tiết kiệm như nhau.
Công trình cũng nêu bật lý do tại sao không thể đánh giá việc nén mô hình chỉ bằng cách đếm các tham số hoặc lớp đã bị loại bỏ. Một mô hình được cắt bớt có thể có cấu trúc nhỏ hơn trong khi vẫn gặp phải tình trạng phân phối nội bộ không khớp ảnh hưởng đến chất lượng đầu ra. Nếu khả năng phục hồi được báo cáo là mạnh mẽ, các lớp hiệu chỉnh nhẹ có thể cung cấp cho các nhà phát triển một lựa chọn khác giữa việc chạy một mô hình đầy đủ và chấp nhận sự mất đi độ chính xác của việc cắt tỉa mạnh mẽ. Tuy nhiên, tầm quan trọng công cộng vẫn bị giới hạn: nguồn được cung cấp không định lượng việc sử dụng năng lượng, chi phí phục vụ, độ trễ từ đầu đến cuối hoặc hiệu suất trong các ứng dụng có mức đặt cược cao.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Các câu hỏi mở chính là phương pháp này hoạt động như thế nào ngoài các điểm chuẩn được báo cáo, cần bao nhiêu dữ liệu hiệu chuẩn và tính toán bổ sung trong thực tế và liệu lợi ích của nó có duy trì được qua các nhiệm vụ, ngôn ngữ và môi trường triển khai hay không. Nguồn là bản in trước arXiv và không thiết lập bản sao độc lập, tính khả dụng sản xuất, kết quả độ trễ chi tiết hoặc điều kiện thử nghiệm đầy đủ đằng sau mức tăng tối đa được báo cáo.
Vấn đề đầu tiên cần xem là khả năng tái tạo. Nguồn xác định bài viết là phiên bản một của bài nộp arXiv và tóm tắt kết quả của nó, nhưng văn bản được cung cấp không bao gồm các bảng cơ bản, nghiên cứu cắt bỏ hoặc chi tiết triển khai. Các thử nghiệm độc lập sẽ cần phải kiểm tra xem liệu mức tăng được báo cáo có giữ được theo tỷ lệ cắt tỉa khác nhau hay không, các kích thước bộ hiệu chuẩn khác nhau và các lựa chọn khác nhau về lớp nào cần loại bỏ. Họ cũng cần so sánh SHIFT-LLM với phương pháp đào tạo lại, chưng cất, tinh chỉnh thông thường và các phương pháp nén khác trong ngân sách điện toán nhất quán.
Các phép đo triển khai sẽ rất quan trọng. Bài viết cho biết LRA tránh được sự chú ý tốn kém và tính toán chuyển tiếp nguồn cấp dữ liệu của các khối bị loại bỏ và hỗ trợ hệ số hóa và hợp nhất xếp hạng thấp, nhưng nguồn không báo cáo độ trễ thực tế, mức sử dụng bộ nhớ, thông lượng hoặc kết quả phần cứng. Bộ điều hợp được thêm vào có thể có các hiệu ứng khác nhau tùy thuộc vào khung suy luận và liệu các hoạt động liên tiếp có thể được hợp nhất hay không. Do đó, đánh giá thực tế phải đo lường tổng chi phí cung cấp chứ không chỉ đo độ chính xác hoặc số lượng tham số bị loại bỏ.
Phạm vi khái quát hóa là một ẩn số khác. Đánh giá được báo cáo bao gồm năm họ mô hình và bảy điểm chuẩn không bắn, nhưng bản tóm tắt được cung cấp không xác định các nhiệm vụ, ngôn ngữ, kích thước mô hình ngoài kết quả Llama-3.1-8B-Instruct hoặc hành vi của phương pháp theo hướng dẫn, sử dụng ngữ cảnh dài, đánh giá mã hóa hoặc an toàn. Nguồn cũng không xác định liệu dữ liệu hiệu chuẩn có phải giống với dữ liệu đầu vào triển khai hay không. Các bài báo hoặc mã được phát hành trong tương lai có thể làm rõ những hạn chế này và cho biết liệu cách tiếp cận này có hữu ích rộng rãi hay chủ yếu có hiệu quả đối với các kiến trúc và kiểu cắt tỉa cụ thể.