Tiếp theoHướng dẫn tiếp theo
Ước tính chi phí API LLM và ngân sách mã thông báo
kỹ thuật
HƯỚNG DẪN KỸ THUẬT
Mã thông báo tối đa là giới hạn về số lượng mã thông báo mà một mô hình có thể tạo ra trong một phản hồi và chuỗi dừng là các chuỗi kết thúc việc tạo ngay khi mô hình tạo ra chúng.
Cùng với lý do kết thúc mà API trả về, chúng quyết định vị trí kết thúc của câu trả lời và cho bạn biết liệu nó kết thúc một cách tự nhiên hay bị cắt bỏ. Việc sử dụng đúng sẽ ngăn chặn JSON bị cắt bớt, câu trả lời chưa hoàn thành và chi tiêu lãng phí.
Một mô hình ngôn ngữ tạo ra một mã thông báo mỗi lần cho đến khi có điều gì đó yêu cầu nó dừng lại. Có ba lý do phổ biến khiến nó dừng lại. Nó tạo ra mã thông báo cuối lượt của riêng mình, nghĩa là nó quyết định câu trả lời đã hoàn tất. Nó đạt đến số lượng mã thông báo đầu ra tối đa mà bạn cho phép. Hoặc nó tạo ra văn bản khớp với một trong các chuỗi dừng của bạn. Mã thông báo tối đa thường bị nhầm lẫn với cửa sổ ngữ cảnh. Cửa sổ ngữ cảnh là tổng số mã thông báo mà mô hình có thể xử lý cùng một lúc, đầu vào và đầu ra. Mã thông báo tối đa chỉ giới hạn đầu ra của một cuộc gọi. Một mô hình có cửa sổ ngữ cảnh rất lớn vẫn có thể tạo ra phản hồi ngắn nếu mã thông báo tối đa được đặt ở mức thấp và thông tin đầu vào cộng với mã thông báo tối đa thường phải vừa với cửa sổ ngữ cảnh. API báo cáo lý do tại sao quá trình tạo kết thúc. API hoàn thành trò chuyện của OpenAI trả về một kết thúc_lý do, chẳng hạn như 'stop' cho một kết thúc tự nhiên hoặc một chuỗi dừng phù hợp, 'độ dài' khi đạt đến giới hạn đầu ra và 'tool_calls' khi mô hình muốn gọi một công cụ. API tin nhắn của Anthropic trả về một stop_reason chẳng hạn như 'end_turn', 'max_tokens', 'stop_sequence' hoặc 'tool_use'. Anthropic yêu cầu max_tokens cho mọi yêu cầu. Đối với các mô hình lý luận của mình, OpenAI đã giới thiệu max_completion_tokens, tính năng này tính các mã thông báo lý luận ẩn cũng như đầu ra hiển thị. Trình tự dừng rất hữu ích cho các định dạng có cấu trúc: kết thúc sau thẻ đóng, dừng trước nhãn người phát biểu hoặc cắt đứt sau một mục danh sách. Văn bản trùng khớp thường không được bao gồm trong kết quả trả về, vì vậy mã sẽ không thể nhìn thấy nó. Sai lầm phổ biến nhất là bỏ qua lý do về đích. Một câu trả lời bị cắt ngắn có thể trông có vẻ hợp lý, đặc biệt là văn xuôi, trong khi kết quả đầu ra có cấu trúc chỉ đơn giản là bị ngắt quãng. Một quan niệm sai lầm khác là mã thông báo tối đa thấp khiến mô hình viết ngắn gọn. Nó không; mô hình viết như bình thường và bị cắt. Yêu cầu lời nhắc ngắn gọn và sử dụng giới hạn làm giới hạn an toàn.
Các quyết định về kiến trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.
Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.
Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.
Giới hạn đầu ra đã tăng lên khi các mô hình hỗ trợ các thế hệ dài hơn và các tính năng đầu ra có cấu trúc hạn chế phản hồi đối với một lược đồ sẽ giảm nhưng không loại bỏ nguy cơ bị cắt bớt vì phản hồi đủ dài vẫn có thể đạt đến giới hạn. Các mô hình lý luận đã khiến việc lập ngân sách đầu ra trở nên quan trọng hơn vì các mã thông báo ẩn hiện có cùng giới hạn. Tên tham số và giá trị lý do kết thúc khác nhau giữa các nhà cung cấp và đã thay đổi theo thời gian, do đó, việc kiểm tra tài liệu hiện tại và gói các chi tiết này trong một lớp mã nhỏ của riêng bạn là điều hợp lý.
Trình tóm tắt đặt số mã thông báo tối đa là 150 và một số phần tóm tắt kết thúc ở giữa câu; việc kiểm tra lý do kết thúc sẽ hiển thị 'độ dài' cho các cuộc gọi đó, do đó, ứng dụng sẽ tăng giới hạn và thay vào đó yêu cầu các bản tóm tắt ngắn hơn trong lời nhắc.
Một tập lệnh trích xuất dữ liệu dưới dạng JSON không thể phân tích cú pháp khoảng một trong năm mươi phản hồi; mỗi lỗi đã đạt đến giới hạn đầu ra, do đó, mã hiện sẽ thử lại với giới hạn cao hơn khi lý do kết thúc cho biết đầu ra đã bị cắt ngắn.
Nhà phát triển tạo một dòng hội thoại tại một thời điểm sẽ sử dụng chuỗi dừng 'Người dùng:' để mô hình không tiếp tục và ghi cả dòng tiếp theo của người dùng.
Một nhóm chuyển sang mô hình lý luận nhận thấy các câu trả lời trả về trống vì lý do ẩn đã sử dụng hết giới hạn đầu ra, vì vậy họ tăng giới hạn để chừa chỗ cho cả lý luận và câu trả lời.
Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.
Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.
Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.
Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.
Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.
Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.
Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mã thông báo tối đa là giới hạn về số lượng mã thông báo mà một mô hình có thể tạo ra trong một phản hồi và chuỗi dừng là các chuỗi kết thúc việc tạo ngay khi mô hình tạo ra chúng. Cùng với lý do kết thúc mà API trả về, chúng quyết định vị trí kết thúc của câu trả lời và cho bạn biết liệu nó kết thúc một cách tự nhiên hay bị cắt bỏ. Việc sử dụng đúng sẽ ngăn chặn JSON bị cắt bớt, câu trả lời chưa hoàn thành và chi tiêu lãng phí.
Đầu ra giới hạn mã thông báo tối đa cho một cuộc gọi. Cửa sổ ngữ cảnh là tổng giới hạn riêng biệt bao gồm đầu vào và đầu ra.
'độ dài' có nghĩa là việc tạo đã dừng do đã đạt đến giới hạn đầu ra, do đó phản hồi có thể không đầy đủ.
'end_turn' có nghĩa là mô hình đã kết thúc một cách tự nhiên. 'max_tokens' có nghĩa là nó đã bị cắt và 'stop_sequence' có nghĩa là một trong các chuỗi của bạn được khớp.
Giới hạn là một điểm dừng cứng, không phải là một hướng dẫn. Yêu cầu lời nhắc ngắn gọn và giữ giới hạn làm giới hạn an toàn.
Dừng các chuỗi kết thúc quá trình tạo và thường không được bao gồm trong kết quả đầu ra được trả về, vì vậy mã của bạn không nên dựa vào việc xem chúng.
Tiếp tục học hỏi
Đã chọn thêm hướng dẫn cho chủ đề này
Tiếp theoHướng dẫn tiếp theo
Ước tính chi phí API LLM và ngân sách mã thông báo
kỹ thuật