Jazyk AI GUIDE

Kódování bytových párů

Byte-Pair Encoding (BPE) je algoritmus inspirovaný kompresí, který vytváří slovní zásobu opakovaným slučováním nejčastějších párů symbolů.

2 minuty čteníNaposledy aktualizováno

Přehled

It is the tokenizer behind GPT models, balancing tiny vocabularies of characters against huge vocabularies of whole words.

Hluboký ponor

BPE začíná zpracováním textu jako sekvence jednotlivých znaků (nebo nezpracovaných bajtů). Poté spočítá každý sousední pár symbolů, sloučí nejčastější pár do nového tokenu a opakuje to tisíckrát. Každé sloučení je zpravidla zaznamenáno. Běžné sekvence písmen jako 'th', 'ing' nebo celá častá slova se postupně stávají samostatnými tokeny, zatímco vzácná slova zůstávají rozdělena na menší části. Původně metoda komprese dat z roku 1994, byla adaptována na NLP Sennrichem et al. v roce 2016 pro strojový překlad. GPT-2 a GPT-4 používají BPE na úrovni bajtů, které fungují na bytech UTF-8, takže jakýkoli znak, emoji nebo jazyk lze vždy zakódovat s nulovými chybami mimo slovní zásobu.

Technický přehled

Školení BPE vytváří uspořádaný seznam slučovacích pravidel. Za účelem tokenizace nového textu jej algoritmus rozdělí na bajty/znaky a nenasytně aplikuje sloučení ve stejném pořadí priority, dokud žádné pravidlo neodpovídá. BPE na úrovni bajtů zaručuje záložní: i neviditelný symbol se rozloží na své základní bajty, takže slovní zásoba 256 bajtů plus naučená sloučení pokrývá vše bez tokenu UNK.

Strategický dopad

Rychlost a měřítko

Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.

Přístup a dosah

Rozšiřuje přístup napříč jazyky a komunikačními styly.

Jasnější rozhodnutí

Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.

Budoucnost kódování bytových párů

BPE zůstává tahounem tokenizéru, ale roste tlak na modely na úrovni bajtů nebo znaků, které přeskakují explicitní tokenizaci a vyhýbají se zvláštnostem, jako je nepříjemné rozdělení kódu, matematiky nebo neanglických skriptů. Výzkum architektur bez tokenů a naučených tokenizérů má za cíl opravit předsudky BPE. Přesto jeho rychlost a efektivita komprese znamenají, že slovníky ve stylu BPE budou v blízké budoucnosti pohánět většinu produkčních LLM.

Real-World Implementace

GPT-2 a GPT-4 používají BPE na úrovni bajtů, takže jakýkoli znak Unicode nebo emotikony lze zakódovat bez chyb.

Systémy strojového překladu používají BPE k rozdělení vzácných nebo složených slov na opakovaně použitelné části podslov sdílené napříč jazyky.

Knihovna tokenizérů Hugging Face trénuje slovní zásobu BPE pro vlastní domény, jako je biomedicínský nebo právní text.

Modely kódu tokenizují identifikátory a klíčová slova pomocí BPE a spojují časté vzory jako 'def' nebo '==' do jednotlivých tokenů.

Rizika a zábradlí

Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.

Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.

Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.

Plán implementace

1

Před zavedením definujte výstupní formát, tón a standardy kvality.

2

Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.

3

Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.

4

Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Byte-Pair Encoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Tokenizace a kódování párů bajtů

Často kladené otázky

What is Byte-Pair Encoding?

Byte-Pair Encoding (BPE) je algoritmus inspirovaný kompresí, který vytváří slovní zásobu opakovaným slučováním nejčastějších párů symbolů. Je to tokenizer za modely GPT, který vyvažuje drobné slovníky znaků a obrovské slovníky celých slov.

Jaká je základní operace, kterou BPE opakuje, aby si vybudovala svou slovní zásobu?

BPE počítá sousední páry symbolů a spojuje jeden nejčastější symbol do nového tokenu, který se tisíckrát opakuje.

Jak BPE zachází s textem, když začíná trénovat?

BPE začíná od nejmenších jednotek (znaků nebo nezpracovaných bajtů) a zvětšuje větší tokeny pomocí sloučení.

Proč se BPE na úrovni bajtů vyhýbá chybám mimo slovní zásobu (UNK)?

Protože základní slovní zásoba zahrnuje všech 256 bajtů, dokonce i neviditelné symboly se vrátí k jejich bajtové reprezentaci.

Odkud se algoritmus BPE původně vzal, než jej přijalo NLP?

BPE byla představena jako technika komprese dat v roce 1994 a později upravena pro tokenizaci podslov v roce 2016.

Jak BPE při tokenizaci nového textu aplikuje svá naučená pravidla?

Slučovací pravidla jsou uspořádána a tokenizace je chtivě aplikuje podle priority, dokud žádné další pravidlo neodpovídá.