뉴스로 돌아가기
혁신AI Understanding 브리핑

연구원들은 더 나은 태국어 훈련 코퍼스를 구축하기 위해 Ai2의 Dolma 툴킷을 적용했습니다.

태국 연구팀은 Ai2의 개방형 데이터 큐레이션 툴킷을 채택하여 470억 개의 토큰 코퍼스인 Mangosteen을 만들었습니다. 팀은 기본 웹 데이터의 대부분을 제거하면서 태국어 모델 성능을 향상시켰다고 말합니다.

5 min readRead the primary source
Primary-source image accompanying Researchers adapt Ai2’s Dolma toolkit to build a better Thai training corpus
기본 소스 문서녹음된 소스
출판사
allenai.org
소스 링크
allenai.orghttps://allenai.org/blog/thai-llm-dolma
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

사전 훈련
다운스트림 적응 전 광범위한 데이터에 대한 초기 대규모 모델 교육.
견고성
소음, 교대 또는 적대적인 입력 하에서 성능을 유지하는 모델의 능력입니다.
사실성
모델의 주장이 검증 가능한 실제 정보와 얼마나 정확하게 일치하는지입니다.
자신을 테스트해 보세요AI 모델 설명 퀴즈

무슨 일이 일어났나요?

Ai2에 따르면 태국 연구원들은 개방형 Dolma 툴킷을 사용하여 태국어 언어 모델을 사전 훈련하기 위한 470억 개의 토큰 코퍼스인 Mangosteen을 구축했습니다. 팀은 태국어 텍스트, 데이터 품질 문제, 웹이 많은 기존 데이터세트에서 종종 놓쳤던 지역적으로 중요한 소스를 설명하기 위해 Dolma의 일부를 재설계했습니다.

Ai2는 망고스틴을 Dolma를 출발점으로 사용한 태국 연구원 팀이 만든 태국 사전 훈련 코퍼스라고 설명합니다. 코퍼스에는 470억 개의 토큰이 포함되어 있습니다. 팀은 대규모 웹 데이터 컬렉션으로 시작하여 태국어 사용자의 제한된 감사, 부적절한 자료, 도서, 연구 논문, 공식 웹사이트 및 YouTube 자막에 대한 불충분한 적용 범위를 포함하여 공개적으로 사용 가능한 태국어 데이터세트에서 발견한 약점을 해결하려고 했습니다. Ai2가 프로젝트 리더이자 Vidyasirimedhi Institute of Science and Technology의 박사 과정 학생으로 확인한 Wannaphong Phatthiyaphaibun은 팀에 처음부터 완전한 데이터 큐레이션 파이프라인을 구축할 개발자가 충분하지 않다고 말했습니다.

연구진은 일부 Dolma 부품을 태국어로 직접 전송할 수 없다는 사실을 발견했습니다. 특히 태국어는 영어와 같은 방식으로 문장 경계를 표시하지 않기 때문에 문장 및 단락 수준 중복 제거로 인해 데이터가 거의 모두 제거되었다고 보고했습니다. 문서 및 URL 수준 중복 제거를 유지하고, 기타 처리 단계를 수정하고, 품질 필터를 조정하고, 언어별 도구를 교체하고, 태국어 웹 데이터의 패턴에 대한 규칙을 추가했습니다. 한 가지 예로 잘린 부분과 "자세히 보기" 메시지가 포함된 태국 뉴스 페이지가 있습니다. 팀은 불완전한 기사를 제거하기 위해 필터링을 추가했습니다.

Ai2가 설명하는 실험에서 적응된 파이프라인은 시작점으로 사용된 Common Crawl 데이터의 80% 이상과 FineWeb2의 거의 절반을 제거했습니다. FineWeb2는 소스에서 모델 교육을 위해 이미 정리 및 선별된 것으로 설명하는 컬렉션입니다. 팀은 더 작고 필터링된 데이터 세트로 훈련된 모델이 더 큰 데이터 세트로 훈련된 모델에 비해 성능을 유지하거나 향상했다고 보고했습니다. Ai2는 또한 이러한 개선 사항이 더 큰 모델에 적용되었으며 망고스틴 교육 모델이 태국 문화 지식 평가에서 더 나은 성능을 발휘했다고 말했습니다. 소스는 이러한 이득의 크기와 견고성을 평가하는 데 필요한 평가 이름, 수치 점수, 모델 구성 또는 실험 제어를 제공하지 않습니다.

소스 세부정보: allenai.org ↗

왜 중요한가요?

이 작업은 훈련 데이터를 관리하는 사람과 도구를 언어의 특정 구조에 적용할 수 있는지 여부에 따라 언어 모델 품질이 어떻게 달라질 수 있는지 보여줍니다. 팀은 더 작고 더 신중하게 선별된 데이터 세트가 더 큰 컬렉션의 결과와 일치하거나 이를 능가했으며 태국 문화 지식 평가에 대한 성능이 향상되었다고 보고했습니다.

핵심적인 의미는 방법론적입니다. 이 프로젝트는 훈련 데이터 큐레이션을 언어와 정보 환경을 이해하는 사람들이 적용해야 하는 것으로 취급합니다. 범용 파이프라인은 유용한 콘텐츠를 보존할 수 있지만 문장 경계, 중복, 품질 또는 웹 페이지 구조에 대한 가정은 언어마다 다르게 작동할 수 있습니다. 태국 팀의 경험에 따르면 영어 규칙을 중심으로 설계된 파이프라인은 다른 곳에 적용할 때 귀중한 자료를 폐기하거나 품질이 낮은 자료를 유지할 수 있습니다.

보고된 결과는 더 많은 훈련 토큰이 자동으로 더 나은 언어 모델을 생성한다는 단순한 아이디어에 도전합니다. Ai2는 팀이 모델 성능을 유지하거나 개선하면서 하나의 웹 컬렉션 대부분과 다른 웹 컬렉션의 거의 절반을 제거했다고 말합니다. 독립적으로 재생산된 경우 이는 대상 필터링 및 소스 선택이 때때로 원시 텍스트를 추가하는 것보다 더 많은 가치를 제공할 수 있음을 나타냅니다. 관련이 없거나 불완전한 자료를 줄이면 훈련 데이터를 더 쉽게 검사할 수 있지만 소스는 훈련 시간, 에너지 사용 또는 총 비용의 변화를 보고하지 않습니다.

태국 문화 지식 평가에서 보고된 개선은 특히 표현과 관련이 있습니다. 모델은 지역 참조, 기관, 역사 또는 문화적 맥락을 여전히 놓치면서 일반적인 언어 작업을 잘 수행할 수 있습니다. 팀은 그 결과를 지역 관련 데이터가 모델이 자신이 봉사하는 지역 사회를 대표하는 데 도움이 될 수 있다는 증거로 해석합니다. 그 결론은 이 소스에서 독립적으로 확립된 결과가 아니라 프로젝트 실험의 주장으로 남아 있습니다. 이 기사에서는 벤치마크, 테스트한 문화 영역 또는 소스 다양성, 필터링, 데이터 양 또는 기타 변경 사항에서 이득이 발생했는지 여부에 대해 자세히 설명하지 않습니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
대화형 개념 확인+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

다음에 무엇을 볼 것인가

소스는 벤치마크 이름, 정확한 점수, 모델 크기, 컴퓨팅 비용, 코퍼스 라이선스 세부 정보 또는 독립적 복제를 제공하지 않습니다. 실질적인 중요성은 망고스틴과 수정된 파이프라인이 출시되는지 여부, 다른 태국 연구자들이 연구 결과를 재현할 수 있는지 여부, 유사한 방법으로 잘 표현되지 않는 다른 언어의 모델을 개선하는지 여부에 따라 달라집니다.

첫 번째 실질적인 질문은 연구 결과물을 이용할 수 있는지 여부입니다. 소스는 Dolma의 개방성을 강조하고 망고스틴을 재현 가능한 각색이라고 설명하지만 470억 개의 토큰 코퍼스, 필터링 규칙, 대체 도구 또는 평가 코드가 공개적으로 공개되는지 여부는 밝히지 않습니다. 라이센스 및 개인 정보 보호 고려 사항은 배포할 수 있는 항목에 영향을 미칠 수 있습니다. 특히 소스에 따르면 프로젝트가 웹 페이지, 서적, 연구 논문, 공식 웹 사이트 및 YouTube 자막을 사용했다고 밝혔기 때문입니다.

독립적인 평가가 중요할 것입니다. 소스는 Common Crawl 및 FineWeb2와의 비교를 보고하지만 모델의 매개변수 수, 훈련 절차, 데이터 혼합, 벤치마크 점수 또는 통계적 불확실성을 식별하지는 않습니다. 후속 작업에서는 Ai2에서 언급한 문화 지식 평가뿐만 아니라 언어 생성, 추론, 사실성, 안전 및 지시에 따른 작업 전반에 걸쳐 이득이 지속되는지 테스트해야 합니다. 또한 필터링을 통해 합법적인 방언, 지역 또는 소수 공동체 자료가 제거되었는지 여부도 조사해야 합니다.

더 광범위한 테스트는 이 접근 방식이 엔지니어링 리소스가 제한된 다른 언어 및 연구팀에 적용되는지 여부입니다. 여기에 제시된 Dolma의 가치는 연구자가 파이프라인을 다시 구축하는 대신 기존 파이프라인을 수정할 수 있다는 것입니다. 그러나 소스는 쓰기 시스템, 웹 생태계 또는 데이터 가용성이 다른 언어에 대해 동일한 변경 사항이 적용된다는 것을 입증하지 않습니다. 향후 업데이트에서는 재현성, 코퍼스 거버넌스, 소스 적용 범위, 모델 동작, 로컬 관련성, 데이터 품질, 개방성 및 책임감 있는 사용 간의 균형을 명확히 해야 합니다.

관련 가이드 및 퀴즈

AI 모델 설명AI 트레이닝AI 윤리알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?