HƯỚNG DẪN KỸ THUẬT

Mã thông báo tối đa và chuỗi dừng

Mã thông báo tối đa là giới hạn về số lượng mã thông báo mà một mô hình có thể tạo ra trong một phản hồi và chuỗi dừng là các chuỗi kết thúc việc tạo ngay khi mô hình tạo ra chúng.

  • đọc 4 phút
  • Cập nhật lần cuối
Trên trang nàyđọc 4 phút
  1. Tổng quan
  2. Lặn sâu
  3. Tác động chiến lược
  4. Tương lai của mã thông báo tối đa và chuỗi dừng
  5. Triển khai trong thế giới thực
  6. Rủi ro & lan can
  7. Lộ trình thực hiện
  8. Tiếp tục khám phá
  9. Câu hỏi thường gặp

Tổng quan

Cùng với lý do kết thúc mà API trả về, chúng quyết định vị trí kết thúc của câu trả lời và cho bạn biết liệu nó kết thúc một cách tự nhiên hay bị cắt bỏ. Việc sử dụng đúng sẽ ngăn chặn JSON bị cắt bớt, câu trả lời chưa hoàn thành và chi tiêu lãng phí.

Lặn sâu

Một mô hình ngôn ngữ tạo ra một mã thông báo mỗi lần cho đến khi có điều gì đó yêu cầu nó dừng lại. Có ba lý do phổ biến khiến nó dừng lại. Nó tạo ra mã thông báo cuối lượt của riêng mình, nghĩa là nó quyết định câu trả lời đã hoàn tất. Nó đạt đến số lượng mã thông báo đầu ra tối đa mà bạn cho phép. Hoặc nó tạo ra văn bản khớp với một trong các chuỗi dừng của bạn. Mã thông báo tối đa thường bị nhầm lẫn với cửa sổ ngữ cảnh. Cửa sổ ngữ cảnh là tổng số mã thông báo mà mô hình có thể xử lý cùng một lúc, đầu vào và đầu ra. Mã thông báo tối đa chỉ giới hạn đầu ra của một cuộc gọi. Một mô hình có cửa sổ ngữ cảnh rất lớn vẫn có thể tạo ra phản hồi ngắn nếu mã thông báo tối đa được đặt ở mức thấp và thông tin đầu vào cộng với mã thông báo tối đa thường phải vừa với cửa sổ ngữ cảnh. API báo cáo lý do tại sao quá trình tạo kết thúc. API hoàn thành trò chuyện của OpenAI trả về một kết thúc_lý do, chẳng hạn như 'stop' cho một kết thúc tự nhiên hoặc một chuỗi dừng phù hợp, 'độ dài' khi đạt đến giới hạn đầu ra và 'tool_calls' khi mô hình muốn gọi một công cụ. API tin nhắn của Anthropic trả về một stop_reason chẳng hạn như 'end_turn', 'max_tokens', 'stop_sequence' hoặc 'tool_use'. Anthropic yêu cầu max_tokens cho mọi yêu cầu. Đối với các mô hình lý luận của mình, OpenAI đã giới thiệu max_completion_tokens, tính năng này tính các mã thông báo lý luận ẩn cũng như đầu ra hiển thị. Trình tự dừng rất hữu ích cho các định dạng có cấu trúc: kết thúc sau thẻ đóng, dừng trước nhãn người phát biểu hoặc cắt đứt sau một mục danh sách. Văn bản trùng khớp thường không được bao gồm trong kết quả trả về, vì vậy mã sẽ không thể nhìn thấy nó. Sai lầm phổ biến nhất là bỏ qua lý do về đích. Một câu trả lời bị cắt ngắn có thể trông có vẻ hợp lý, đặc biệt là văn xuôi, trong khi kết quả đầu ra có cấu trúc chỉ đơn giản là bị ngắt quãng. Một quan niệm sai lầm khác là mã thông báo tối đa thấp khiến mô hình viết ngắn gọn. Nó không; mô hình viết như bình thường và bị cắt. Yêu cầu lời nhắc ngắn gọn và sử dụng giới hạn làm giới hạn an toàn.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của mã thông báo tối đa và chuỗi dừng

Giới hạn đầu ra đã tăng lên khi các mô hình hỗ trợ các thế hệ dài hơn và các tính năng đầu ra có cấu trúc hạn chế phản hồi đối với một lược đồ sẽ giảm nhưng không loại bỏ nguy cơ bị cắt bớt vì phản hồi đủ dài vẫn có thể đạt đến giới hạn. Các mô hình lý luận đã khiến việc lập ngân sách đầu ra trở nên quan trọng hơn vì các mã thông báo ẩn hiện có cùng giới hạn. Tên tham số và giá trị lý do kết thúc khác nhau giữa các nhà cung cấp và đã thay đổi theo thời gian, do đó, việc kiểm tra tài liệu hiện tại và gói các chi tiết này trong một lớp mã nhỏ của riêng bạn là điều hợp lý.

Triển khai trong thế giới thực

Trình tóm tắt đặt số mã thông báo tối đa là 150 và một số phần tóm tắt kết thúc ở giữa câu; việc kiểm tra lý do kết thúc sẽ hiển thị 'độ dài' cho các cuộc gọi đó, do đó, ứng dụng sẽ tăng giới hạn và thay vào đó yêu cầu các bản tóm tắt ngắn hơn trong lời nhắc.

Một tập lệnh trích xuất dữ liệu dưới dạng JSON không thể phân tích cú pháp khoảng một trong năm mươi phản hồi; mỗi lỗi đã đạt đến giới hạn đầu ra, do đó, mã hiện sẽ thử lại với giới hạn cao hơn khi lý do kết thúc cho biết đầu ra đã bị cắt ngắn.

Nhà phát triển tạo một dòng hội thoại tại một thời điểm sẽ sử dụng chuỗi dừng 'Người dùng:' để mô hình không tiếp tục và ghi cả dòng tiếp theo của người dùng.

Một nhóm chuyển sang mô hình lý luận nhận thấy các câu trả lời trả về trống vì lý do ẩn đã sử dụng hết giới hạn đầu ra, vì vậy họ tăng giới hạn để chừa chỗ cho cả lý luận và câu trả lời.

Rủi ro & lan can

  • Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

  • Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

  • Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

  1. Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

  2. Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

  3. Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

  4. Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Max Tokens and Stop Sequences quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

Mã thông báo tối đa và chuỗi dừng là gì?

Mã thông báo tối đa là giới hạn về số lượng mã thông báo mà một mô hình có thể tạo ra trong một phản hồi và chuỗi dừng là các chuỗi kết thúc việc tạo ngay khi mô hình tạo ra chúng. Cùng với lý do kết thúc mà API trả về, chúng quyết định vị trí kết thúc của câu trả lời và cho bạn biết liệu nó kết thúc một cách tự nhiên hay bị cắt bỏ. Việc sử dụng đúng sẽ ngăn chặn JSON bị cắt bớt, câu trả lời chưa hoàn thành và chi tiêu lãng phí.

Mã thông báo tối đa giới hạn những gì?

Đầu ra giới hạn mã thông báo tối đa cho một cuộc gọi. Cửa sổ ngữ cảnh là tổng giới hạn riêng biệt bao gồm đầu vào và đầu ra.

Cuộc gọi của bạn trả về lý do kết thúc là 'độ dài' trong API của OpenAI. Chuyện gì đã xảy ra thế?

'độ dài' có nghĩa là việc tạo đã dừng do đã đạt đến giới hạn đầu ra, do đó phản hồi có thể không đầy đủ.

Anthropic stop_reason nào cho biết mô hình đã quyết định câu trả lời của nó đã hoàn tất?

'end_turn' có nghĩa là mô hình đã kết thúc một cách tự nhiên. 'max_tokens' có nghĩa là nó đã bị cắt và 'stop_sequence' có nghĩa là một trong các chuỗi của bạn được khớp.

Tại sao việc đặt giá trị mã thông báo tối đa thấp không giúp câu trả lời ngắn gọn?

Giới hạn là một điểm dừng cứng, không phải là một hướng dẫn. Yêu cầu lời nhắc ngắn gọn và giữ giới hạn làm giới hạn an toàn.

Trình tự dừng trùng khớp có thường được bao gồm trong văn bản trả về không?

Dừng các chuỗi kết thúc quá trình tạo và thường không được bao gồm trong kết quả đầu ra được trả về, vì vậy mã của bạn không nên dựa vào việc xem chúng.