HƯỚNG DẪN xã hội

Sự chênh lệch về mã thông báo giữa các ngôn ngữ

Sự chênh lệch về mã thông báo có nghĩa là cùng một thông báo có thể sử dụng nhiều mã thông báo hơn ở một số ngôn ngữ so với tiếng Anh, bởi vì hầu hết các mã thông báo được tạo từ văn bản chủ yếu là tiếng Anh.

  • đọc 4 phút
  • Cập nhật lần cuối
Trên trang nàyđọc 4 phút
  1. Tổng quan
  2. Lặn sâu
  3. Tác động chiến lược
  4. Tương lai của sự chênh lệch về token hóa giữa các ngôn ngữ
  5. Triển khai trong thế giới thực
  6. Rủi ro & lan can
  7. Lộ trình thực hiện
  8. Tiếp tục khám phá
  9. Câu hỏi thường gặp

Tổng quan

Vì các dịch vụ AI tính phí theo mã thông báo và giới hạn số lượng mã thông báo phù hợp trong một cửa sổ ngữ cảnh, nên người nói các ngôn ngữ đó có thể trả nhiều tiền hơn, nhập ít văn bản hơn và chờ đợi lâu hơn cho cùng một tác phẩm. Điều đó làm cho thiết kế tokenizer trở thành một vấn đề công bằng cũng như kỹ thuật.

Lặn sâu

Trình tạo mã thông báo tìm hiểu những đoạn văn bản nào cần được coi là mã thông báo đơn lẻ bằng cách nghiên cứu kho ngữ liệu đào tạo. Các chuỗi thông thường có mã thông báo riêng; các chuỗi hiếm được chia thành các phần nhỏ hơn, đôi khi thành từng byte riêng lẻ. Khi kho ngữ liệu đó bị thống trị bởi tiếng Anh và một số ngôn ngữ có nguồn tài nguyên cao khác, những ngôn ngữ đó sẽ nhận được mã thông báo hiệu quả cho toàn bộ từ và các phần từ phổ biến. Các ngôn ngữ xuất hiện ít thường xuyên hơn hoặc sử dụng các tập lệnh trong đó mỗi ký tự chiếm vài byte trong mã hóa UTF-8, chẳng hạn như nhiều tập lệnh Nam Á, Đông Nam Á và Châu Phi, sẽ bị chia thành nhiều phần khác. Hiệu quả có thể đo lường được. Nghiên cứu được xuất bản vào năm 2023, bao gồm cả nghiên cứu của Petrov và các đồng nghiệp về sự không công bằng của mã thông báo, đã phát hiện ra rằng các bản dịch của cùng một văn bản có thể cần số lượng mã thông báo ở một số ngôn ngữ nhiều hơn gấp nhiều lần so với tiếng Anh, với khoảng cách lớn nhất vượt quá mười lần đối với một số ngôn ngữ và mã thông báo nhất định. Điều này quan trọng theo ba cách cụ thể. Chi phí: Giá API tính theo mỗi mã thông báo, do đó số lượng mã thông báo dài hơn đồng nghĩa với việc tăng giá trực tiếp cho cùng một nội dung. Ngữ cảnh: một cửa sổ ngữ cảnh cố định chứa ít văn bản thực tế hơn, do đó các tài liệu phải được cắt giảm và các cuộc hội thoại sẽ mất lượt sớm hơn. Tốc độ và chất lượng: nhiều mã thông báo hơn có nghĩa là nhiều bước tạo hơn và sự phân mảnh nặng nề có thể khiến mô hình khó học cách diễn đạt tốt hơn của từ, điều này có thể góp phần làm cho hiệu suất yếu hơn trong các ngôn ngữ đó. Các nhà cung cấp đã phản hồi một phần. Khi OpenAI phát hành GPT-4o vào năm 2024, nó đã giới thiệu một mã thông báo lớn hơn và cho biết họ sử dụng ít mã thông báo hơn cho nhiều ngôn ngữ không phải tiếng Anh. Từ vựng lớn hơn và dữ liệu đào tạo cân bằng hơn sẽ giúp ích, nhưng chúng không loại bỏ hoàn toàn khoảng cách. Một quan niệm sai lầm phổ biến là một số ngôn ngữ đơn giản là dài dòng hơn. Các bản dịch có độ dài khác nhau, nhưng khoảng cách lớn về mã thông báo chủ yếu đến từ cách tạo mã thông báo chứ không phải từ chính ngôn ngữ.

Tác động chiến lược

Rủi ro và an toàn

Những tác hại thảm khốc và thường ngày của AI đều phụ thuộc vào việc ai hiểu được rủi ro và ai có thể hành động.

Quyết định rõ ràng hơn

Kiến thức công cộng và chuyên môn định hình liệu chính sách an toàn mạnh mẽ có khả thi về mặt chính trị hay không.

Phá vỡ sự thổi phồng

Những lời giải thích rõ ràng làm giảm sự thu hút bởi sự cường điệu, PR trong phòng thí nghiệm và sân khấu đạo đức mơ hồ.

Tương lai của sự chênh lệch về token hóa giữa các ngôn ngữ

Từ vựng của tokenizer ngày càng phát triển và một số nhà cung cấp hiện đã công khai các cải tiến cho văn bản không phải tiếng Anh, do đó khoảng cách có thể sẽ tiếp tục thu hẹp đối với các ngôn ngữ được sử dụng rộng rãi. Các ngôn ngữ có tài nguyên thấp có thể tiếp tục bị tụt hậu trừ khi dữ liệu đào tạo và thiết kế mã thông báo có chủ ý đưa chúng vào. Nghiên cứu về các mô hình cấp byte và được nhóm động có thể giảm sự phụ thuộc vào từ vựng cố định, mặc dù những thiết kế đó có chi phí tính toán riêng. Hiện tại, các tổ chức phục vụ đối tượng đa ngôn ngữ nên đo lường số lượng mã thông báo trong từng ngôn ngữ mà họ hỗ trợ và coi giới hạn ngữ cảnh cũng như chi phí cho mỗi ngôn ngữ như một phần của kế hoạch tiếp cận.

Triển khai trong thế giới thực

Một tổ chức phi lợi nhuận về y tế dịch cùng một tờ rơi dành cho bệnh nhân sang tiếng Anh, tiếng Hindi và tiếng Amharic và nhận thấy các phiên bản không phải tiếng Anh sử dụng số lượng mã thông báo nhiều hơn gấp nhiều lần, do đó, hóa đơn API cho các ngôn ngữ đó cao hơn nhiều.

Một chatbot dành cho người nói tiếng Miến Điện đạt đến giới hạn ngữ cảnh sau khi có ít lượt trò chuyện hơn nhiều so với phiên bản tiếng Anh, do đó, nó sẽ quên các tin nhắn trước đó sớm hơn.

Một nhà phát triển kiểm tra bài viết hỗ trợ bằng tiếng Hàn bằng trình xem mã thông báo và thấy nhiều từ được chia thành các đoạn ngắn, trong khi bản gốc tiếng Anh chủ yếu ánh xạ tới một mã thông báo cho mỗi từ.

Một nhóm nghiên cứu so sánh trình mã thông báo cũ hơn và mã thông báo mới hơn từ cùng một nhà cung cấp và nhận thấy mã thông báo mới hơn sử dụng ít mã thông báo hơn đáng kể cho các tài liệu tiếng Ả Rập và tiếng Tamil của họ.

Rủi ro & lan can

  • Xử lý rủi ro hiện hữu như khoa học viễn tưởng trong khi khả năng lại phức tạp.

  • Nhầm lẫn giữa an toàn sản phẩm bề mặt với sự liên kết dưới quyền tự chủ cao.

  • Chỉ để lại những khán giả không phải người Anh và không có chuyên môn với những nguồn chất lượng thấp.

Lộ trình thực hiện

  1. Tách biệt các tác hại của sản phẩm, sử dụng sai và rủi ro mất kiểm soát/sai lệch.

  2. Hỏi bằng chứng nào sẽ thay đổi quan điểm của bạn về thời gian và mức độ nghiêm trọng.

  3. Ưu tiên các nguồn chính và đánh giá cụ thể hơn các tuyên bố tiếp thị.

  4. Xác định một lộ trình hành động: sự nghiệp, chính sách, nguồn tài trợ hoặc kỹ năng - không chỉ là nhận thức.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization Disparities Across Languages quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

Sự chênh lệch về mã thông báo giữa các ngôn ngữ là gì?

Sự chênh lệch về mã thông báo có nghĩa là cùng một thông báo có thể sử dụng nhiều mã thông báo hơn ở một số ngôn ngữ so với tiếng Anh, bởi vì hầu hết các mã thông báo được tạo từ văn bản chủ yếu là tiếng Anh. Vì các dịch vụ AI tính phí theo mã thông báo và giới hạn số lượng mã thông báo phù hợp trong một cửa sổ ngữ cảnh, nên người nói các ngôn ngữ đó có thể trả nhiều tiền hơn, nhập ít văn bản hơn và chờ đợi lâu hơn cho cùng một tác phẩm. Điều đó làm cho thiết kế tokenizer trở thành một vấn đề công bằng cũng như kỹ thuật.

Nguyên nhân chính gây ra khoảng cách lớn về số lượng mã thông báo giữa các ngôn ngữ là gì?

Trình tạo mã thông báo cung cấp mã thông báo hiệu quả cho các chuỗi phổ biến trong kho dữ liệu đào tạo của họ. Các ngôn ngữ chưa được trình bày đầy đủ sẽ được chia thành nhiều phần nhỏ hơn.

Tại sao các tập lệnh như Devanagari hay Thai thường tạo ra nhiều mã thông báo hơn theo trình mã thông báo dựa trên byte?

Mỗi ký tự trong các tập lệnh này là một vài byte UTF-8. Nếu trình mã thông báo hiếm khi hợp nhất các chuỗi byte đó thì một ký tự có thể trở thành nhiều mã thông báo.

Điều nào trong số này KHÔNG phải là một trong ba tác động của số lượng mã thông báo cao hơn có tên trong hướng dẫn?

Hướng dẫn liệt kê chi phí, không gian ngữ cảnh và tốc độ hoặc chất lượng. Việc từ chối tự động không phải là kết quả của việc đếm mã thông báo.

Thuật ngữ sinh sản có ý nghĩa gì trong bối cảnh này?

Khả năng sinh sản đo lường số token trên mỗi từ. Khả năng sinh sản cao hơn có nghĩa là văn bản được chia thành nhiều phần hơn và chi phí cao hơn.

OpenAI đã mô tả sự thay đổi gì khi phát hành GPT-4o vào năm 2024?

GPT-4o đi kèm với bộ mã thông báo từ vựng lớn hơn mà OpenAI cho biết là hiệu quả hơn đối với nhiều ngôn ngữ không phải tiếng Anh.