개요
AI 서비스는 토큰에 따라 비용을 청구하고 컨텍스트 창에 맞는 토큰 수를 제한하므로 해당 언어 사용자는 더 많은 비용을 지불하고 더 적은 양의 텍스트를 입력하며 동일한 작업을 더 오래 기다릴 수 있습니다. 이는 토크나이저 설계를 기술적 문제뿐만 아니라 공정성 문제로 만듭니다.
심층 분석
토크나이저는 훈련 코퍼스를 연구하여 단일 토큰으로 처리할 텍스트 덩어리를 학습합니다. 공통 문자열은 자체 토큰을 갖습니다. 드문 문자열은 더 작은 조각으로 나뉘며 때로는 개별 바이트로 나누어집니다. 해당 코퍼스가 영어와 기타 리소스가 많은 언어에 의해 지배되는 경우 해당 언어는 전체 단어와 공통 단어 부분에 대한 효율적인 토큰을 얻습니다. 덜 자주 등장하거나 많은 남아시아, 동남아시아 및 아프리카 스크립트와 같이 각 문자가 UTF-8 인코딩에서 몇 바이트를 차지하는 스크립트를 사용하는 언어는 더 많은 조각으로 분할됩니다. 그 효과는 측정 가능합니다. 토크나이저 불공정성에 대한 Petrov와 동료의 작업을 포함하여 2023년에 발표된 연구에 따르면 일부 언어에서는 동일한 텍스트를 번역할 때 영어보다 몇 배 더 많은 토큰이 필요할 수 있으며 특정 언어 및 토크나이저에서는 가장 큰 차이가 10배를 초과하는 것으로 나타났습니다. 이는 세 가지 구체적인 측면에서 중요합니다. 비용: API 가격은 토큰별로 책정되므로 토큰 수가 길어지면 동일한 콘텐츠에 대한 가격이 직접적으로 인상됩니다. 컨텍스트: 고정된 컨텍스트 창에는 실제 텍스트가 더 적으므로 문서를 줄여야 하며 대화는 더 빨리 이전 방향을 잃게 됩니다. 속도 및 품질: 토큰이 많을수록 생성 단계가 많아지고, 조각화가 심하면 모델이 단어의 올바른 표현을 학습하는 것이 더 어려워지며, 이는 해당 언어의 성능이 저하될 수 있습니다. 제공업체는 부분적으로 응답했습니다. OpenAI가 2024년에 GPT-4o를 출시했을 때 더 큰 토크나이저를 도입했으며 영어가 아닌 많은 언어에 대해 더 적은 토큰을 사용했다고 밝혔습니다. 더 큰 어휘와 더 균형 잡힌 훈련 데이터가 도움이 되지만 격차가 완전히 없어지지는 않습니다. 일반적인 오해는 일부 언어가 단순히 더 단어적이라는 것입니다. 번역의 길이는 다르지만 큰 토큰 격차는 주로 언어 자체가 아니라 토크나이저가 구축된 방식에서 비롯됩니다.
전략적 영향
위험과 안전
치명적인 AI 피해와 일상적인 AI 피해는 누가 위험을 이해하고 누가 조치를 취할 수 있는지에 따라 달라집니다.
더 명확한 결정들
공공 및 전문 지식은 강력한 안전 정책이 정치적으로 가능한지 여부를 결정합니다.
과장된 과장을 뚫고 나가기
명확한 설명은 과대광고, 연구실 홍보, 모호한 윤리 연극에 의한 포착을 줄입니다.
언어 간 토큰화 격차의 미래
토크나이저 어휘는 계속해서 늘어나고 있으며 현재 여러 제공업체에서 영어가 아닌 텍스트에 대한 개선 사항을 공개하고 있으므로 널리 사용되는 언어에 대한 격차는 계속 줄어들 것입니다. 자원이 부족한 언어는 훈련 데이터와 토크나이저 설계에 의도적으로 포함하지 않는 한 계속해서 지연될 수 있습니다. 바이트 수준 및 동적으로 그룹화된 모델에 대한 연구는 고정된 어휘에 대한 의존도를 줄일 수 있지만 이러한 설계에는 자체 컴퓨팅 비용이 있습니다. 현재 다국어 고객을 대상으로 하는 조직은 지원하는 각 언어의 토큰 수를 측정하고 접근성 계획의 일부로 언어별 비용 및 컨텍스트 제한을 처리해야 합니다.
실제 구현
의료 비영리 단체는 동일한 환자 전단지를 영어, 힌디어, 암하라어로 번역하고 영어가 아닌 버전이 몇 배 더 많은 토큰을 사용한다는 사실을 알게 되므로 해당 언어에 대한 API 비용이 훨씬 더 높습니다.
버마어 사용자를 위한 챗봇은 영어 버전보다 훨씬 적은 대화 횟수로 인해 상황 제한에 도달하므로 이전 메시지를 더 빨리 잊어버립니다.
개발자가 토크나이저 뷰어로 한국어 지원 기사를 확인하면 많은 단어가 짧은 조각으로 분할되는 반면 영어 원본은 대부분 단어당 하나의 토큰에 매핑됩니다.
연구팀은 동일한 제공업체의 기존 토크나이저와 최신 토크나이저를 비교한 결과 최신 토큰나이저가 아랍어 및 타밀어 문서에 눈에 띄게 적은 양의 토큰을 사용한다는 사실을 발견했습니다.
위험 및 가드레일
실존적 위험을 공상과학처럼 다루면서 능력을 합성합니다.
높은 자율성 하에서 정렬과 표면 제품 안전성을 혼동합니다.
영어가 아니거나 전문가가 아닌 청중에게는 품질이 낮은 소스만 남겨 둡니다.
구현 로드맵
제품 손상, 오용, 통제력 상실/잘못 정렬 위험을 분리합니다.
일정과 심각도에 대한 귀하의 견해를 바꿀 수 있는 증거가 무엇인지 물어보십시오.
마케팅 주장보다 기본 소스와 구체적인 평가를 선호하세요.
인식뿐만 아니라 경력, 정책, 자금 조달 또는 기술 등 하나의 행동 경로를 식별하십시오.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tokenization Disparities Across Languages quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
자주 묻는 질문
언어 간 토큰화 차이란 무엇입니까?
토큰화 불일치는 대부분의 토크나이저가 대부분 영어인 텍스트로 구축되었기 때문에 동일한 메시지가 영어보다 일부 언어에서 더 많은 토큰을 사용할 수 있음을 의미합니다. AI 서비스는 토큰에 따라 비용을 청구하고 컨텍스트 창에 맞는 토큰 수를 제한하므로 해당 언어 사용자는 더 많은 비용을 지불하고 더 적은 양의 텍스트를 입력하며 동일한 작업을 더 오래 기다릴 수 있습니다. 이는 토크나이저 설계를 기술적 문제뿐만 아니라 공정성 문제로 만듭니다.
언어 간 토큰 수 격차가 커지는 주요 원인은 무엇입니까?
토크나이저는 훈련 코퍼스에서 일반적인 문자열에 효율적인 토큰을 제공합니다. 제대로 표현되지 않은 언어는 더 많고 작은 조각으로 분할됩니다.
Devanagari 또는 Thai와 같은 스크립트가 바이트 기반 토크나이저에서 더 많은 토큰을 생성하는 이유는 무엇입니까?
이 스크립트의 각 문자는 여러 UTF-8 바이트입니다. 토크나이저가 해당 바이트 시퀀스를 거의 병합하지 않으면 한 문자가 여러 토큰이 될 수 있습니다.
다음 중 가이드에 명시된 높은 토큰 수의 세 가지 효과 중 하나가 아닌 것은 무엇입니까?
가이드에는 비용, 컨텍스트 공간, 속도 또는 품질이 나열되어 있습니다. 자동 거부는 토큰 수에 따른 결과가 아닙니다.
이 맥락에서 다산이라는 용어는 무엇을 의미합니까?
출산율은 단어당 토큰을 측정합니다. 출산율이 높을수록 텍스트가 더 많은 조각으로 분할되고 비용이 더 많이 듭니다.
OpenAI는 2024년 GPT-4o를 출시할 때 어떤 변화를 설명했나요?
GPT-4o에는 OpenAI가 영어가 아닌 많은 언어에 더 효율적이라고 말한 더 큰 어휘 토크나이저가 함께 제공됩니다.
계속 학습하세요
관련 가이드
이 주제에 대해 선택된 추가 가이드