Giải mã song song bộ xương suy nghĩ
Skeleton-of-Thought (SoT) là một kỹ thuật nhắc nhở và giải mã, trước tiên yêu cầu mô hình ngôn ngữ phác thảo một khung ngắn gọn các điểm trả lời, sau đó mở rộng từng điểm song song.
Tổng quan
It matters because it can cut the wall-clock latency of long answers by roughly 2x without retraining the model.
Lặn sâu
Các mô hình ngôn ngữ lớn thường tạo ra một mã thông báo mỗi lần, do đó, một câu trả lời dài sẽ chậm đơn giản vì mỗi từ phải đợi một từ trước nó. Skeleton-of-Thought, được giới thiệu bởi các nhà nghiên cứu tại Tsinghua và Microsoft vào năm 2023, đã tái cấu trúc công việc. Cuộc gọi đầu tiên yêu cầu mô hình cung cấp một khung ngắn gọn: một danh sách được đánh số từ 3 đến 10 tiêu đề, mỗi tiêu đề chỉ có vài từ. Sau đó, loạt cuộc gọi thứ hai sẽ mở rộng mọi điểm một cách độc lập và đồng thời, vì các điểm không phụ thuộc vào nhau. Các phần mở rộng được ghép lại với nhau thành câu trả lời cuối cùng. Vì giai đoạn mở rộng chậm diễn ra song song nên tổng độ trễ giảm mạnh đối với các câu hỏi có câu trả lời tự nhiên phân tách thành các phần độc lập, chẳng hạn như liệt kê các mẹo hoặc so sánh các lựa chọn.
Hiểu biết kỹ thuật
SoT khai thác rằng suy luận của bộ giải mã bị giới hạn về độ trễ, không phải lúc nào cũng bị giới hạn về tính toán: một yêu cầu duy nhất thường khiến GPU không được sử dụng đúng mức. Việc mở rộng điểm chạy theo đợt sẽ khiến phần cứng luôn bận rộn và chồng chéo quá trình tạo mỗi điểm. Với các mô hình API, các bản mở rộng được đưa ra dưới dạng các yêu cầu đồng thời; với các mô hình địa phương, họ chia sẻ một lượt chuyển tiếp theo đợt. Giai đoạn cốt lõi bổ sung thêm chi phí ngắn cố định, do đó tốc độ mạng tăng lên theo độ dài câu trả lời và số điểm độc lập.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của giải mã song song bộ xương suy nghĩ
Mong đợi các ý tưởng SoT sẽ hợp nhất vào định tuyến thích ứng: các hệ thống sẽ phát hiện khi một truy vấn được phân tách rõ ràng và chuyển sang mở rộng song song, quay trở lại lý luận tuần tự cho các nhiệm vụ phụ thuộc chặt chẽ như chứng minh toán học. Các biến thể như SoT có phụ thuộc biểu đồ động cho phép các điểm tham chiếu lẫn nhau. Khi các khung phân phát bổ sung thêm tính năng hỗ trợ yêu cầu phụ theo lô gốc và giải mã suy đoán, các chiến lược phân tách song song sẽ trở thành lớp giảm độ trễ tiêu chuẩn thay vì thủ thuật nhắc nhở thủ công.
Triển khai trong thế giới thực
Tăng tốc chatbot trả lời 'cho tôi 8 mẹo để giảm chi phí đám mây' bằng cách mở rộng tất cả 8 mẹo cùng một lúc.
Trợ lý hỗ trợ khách hàng tạo ra hướng dẫn khắc phục sự cố có cấu trúc gồm nhiều phần với độ trễ phản hồi thấp hơn.
Đưa ra câu trả lời so sánh (ưu và nhược điểm của hai sản phẩm) trong đó mỗi dấu đầu dòng được điền đồng thời.
Hệ thống phân phối phụ trợ sắp xếp các phần câu trả lời độc lập để nâng cao mức sử dụng GPU trong quá trình tạo biểu mẫu dài.
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Skeleton-of-Thought Parallel Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Giải mã mã thông báo song song MaskGIT
Câu hỏi thường gặp
What is Skeleton-of-Thought Parallel Decoding?
Skeleton-of-Thought (SoT) là một kỹ thuật nhắc nhở và giải mã, trước tiên yêu cầu mô hình ngôn ngữ phác thảo một khung ngắn gọn các điểm trả lời, sau đó mở rộng từng điểm song song. Điều này quan trọng vì nó có thể giảm độ trễ đồng hồ treo tường của các câu trả lời dài xuống khoảng 2 lần mà không cần đào tạo lại mô hình.
Giai đoạn đầu tiên của Skeleton-of-Thought tạo ra điều gì?
Trước tiên, SoT sẽ nhắc mô hình đưa ra một bộ khung ngắn gọn gồm các tiêu đề điểm, sau đó các tiêu đề này sẽ được mở rộng riêng biệt.
Tại sao giai đoạn mở rộng điểm có thể chạy song song?
Các điểm xương được thiết kế độc lập nên việc mở rộng chúng không cần phải chờ các anh chị em.
Mục tiêu SoT thắt cổ chai chính trong giải mã LLM thông thường là gì?
Giải mã tiêu chuẩn bị giới hạn độ trễ vì mỗi mã thông báo chờ mã trước đó; Sự chồng chéo SoT có tác dụng giảm thời gian đồng hồ treo tường.
SoT có tốc độ tăng tốc lớn nhất đối với loại câu hỏi nào?
Các câu trả lời phân rã thành nhiều phần độc lập sẽ có lợi nhất vì mỗi phần sẽ mở rộng đồng thời.
SoT bổ sung thêm chi phí gì so với một thế hệ tuần tự duy nhất?
Giai đoạn khung xương thêm một độ trễ cố định nhỏ, độ trễ này bị giảm bớt khi mở rộng song song trên các câu trả lời dài.