PRŮVODCE Základy

Proč se LLM snaží počítat dopisy

Velké jazykové modely mají potíže s počítáním písmen, protože nečtou text jeden znak po druhém.

  • 4 min čtení
  • Naposledy aktualizováno
Na této stránce4 min čtení
  1. Přehled
  2. Hluboký ponor
  3. Strategický dopad
  4. Budoucnost toho, proč LLM bojují s počítáním písmen
  5. Real-World Implementace
  6. Rizika a zábradlí
  7. Plán implementace
  8. Pokračujte v objevování
  9. Často kladené otázky

Přehled

Čtou tokeny, což jsou kusy znaků, takže jednotlivá písmena uvnitř slova často model nikdy přímo nevidí. Tato jedna skutečnost vysvětluje celou rodinu zvláštních chyb v pravopisu, počítání, převracení a rýmování a říká vám, jak je obejít.

Hluboký ponor

Než jazykový model uvidí jakýkoli text, tokenizér jej rozdělí na tokeny. Většina moderních tokenizérů používá metodu, jako je kódování párů bajtů, které se učí běžné sekvence znaků z velkého množství textu. Častá slova se často stávají jediným tokenem a vzácnější slova jsou rozdělena na několik částí. Model pak obdrží každý token jako číslo a převede ho na vektor. Nikdy nepřijímá písmena uvnitř tohoto tokenu jako samostatné vstupy. Takže když se zeptáte, kolik r je v 'jahoda', model neskenuje deset znaků. Vidí možná dva nebo tři kusy a musí si vybavit ze vzorců naučených během tréninku, která písmena tyto kusy obsahují. Tato znalost existuje, ale je nepřímá a nejasná, jako když se vás někdo zeptá, kolikrát se písmeno e vyskytuje ve slově, které jste kdy viděli jen jako obrázek. Jahodová otázka se v roce 2024 stala široce sdíleným příkladem právě proto, že odpověď je lidem zřejmá a pro chatboty překvapivě těžká. Stejná příčina způsobuje související chyby: překlepy, když jsou požádány o hláskování nahlas, nesprávné obrácení slov, selhání omezení založených na písmenech, jako jsou akrostichy nebo lipogramy, a chybné počítání znaků pro omezení délky. Přesná rozdělení se mezi tokenizéry liší, takže jeden model může dostat dané slovo správně, zatímco jiný selže. Obvyklá mylná představa je, že to ukazuje, že modely neumějí uvažovat nebo jsou prostě neopatrné. Limit je většinou ve vstupním formátu, ne v obecné úvaze. Když je model vyzván, aby slovo vyhláskoval jako první, každé písmeno má tendenci stát se jeho vlastním žetonem a počítání se stává mnohem jednodušším úkolem. Novější modely uvažování často dělají tento pravopisný krok samy o sobě, což je jeden z důvodů, proč tyto otázky dávají častěji správně. Pro vše, kde záleží na přesnosti, je stále nejspolehlivější metodou spuštění krátkého kousku kódu.

Strategický dopad

Jasnější rozhodnutí

Pomůže vám oddělit jasná technická tvrzení od marketingového jazyka.

Cena a rozpočet

Než utratíte peníze nebo čas, můžete se zeptat na lepší implementační otázky.

Tým a pracovní postup

Týmy se sdíleným porozuměním dělají lepší rozhodnutí o produktech, zásadách a učení.

Budoucnost toho, proč LLM bojují s počítáním písmen

Výzkumníci zkoumají modely, které pracují přímo s bajty nebo znaky, a hybridní návrhy, které dynamicky seskupují bajty, což by mohlo učinit úkoly na úrovni postav přirozenějšími. Tyto přístupy mají kompromisy, protože delší vstupní sekvence stojí více výpočtů. Mezitím modely uvažování, které hláskují slova krok za krokem, a modely, které volají kódové nástroje, již mnoho z těchto chyb v praxi snižují. Je rozumné očekávat v průběhu času méně nepříjemných chyb při počítání písmen, ale u úloh, které vyžadují přesný počet znaků, pravděpodobně zůstane osvědčeným postupem použití kódu spíše než důvěra ve vzpomínku na model.

Real-World Implementace

Na otázku, kolikrát se písmeno r objeví v 'jahoda', odpoví chatbot dvěma místo tří, protože slovo se k modelu dostane jako několik vícepísmenných kousků místo deseti samostatných písmen.

Učitel požádá modelku, aby napsala větu, kde každé slovo začíná písmenem s, a on zasune slova, která ne, protože musí první písmeno každého slova odvodit, místo aby je viděl.

Vývojář požádá o slovo 'encyklopedie' napsané pozpátku a dostane verzi s prohozenými nebo chybějícími písmeny; Požadavek na model, aby nejprve vypsal písmena jedno na řádek a poté seznam obrátil, to opraví.

Logická aplikace potřebuje pro slovní hru přesný počet písmen, takže je vypočítává pomocí jediného řádku běžného kódu a model používá pouze k psaní nápověd.

Rizika a zábradlí

  • Různé týmy mohou používat stejný termín odlišně, proto definujte rozsah včas.

  • Srovnávací testy mohou vypadat dobře, zatímco výkon v reálném světě je nerovnoměrný.

  • Ignorování kvality dat a plánů hodnocení často vytváří křehké výsledky.

Plán implementace

  1. Začněte s jasnou definicí výsledku, který potřebujete.

  2. Před testováním vyberte jednu metriku úspěchu a jednu podmínku selhání.

  3. Spusťte malý pilotní projekt s reprezentativními údaji, nikoli leštěnou ukázkovou sadu.

  4. Dokumentujte, kde pomáhá Proč LLMs bojují počítání dopisů a kde jsou jednodušší metody lepší.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Why LLMs Struggle to Count Letters quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Často kladené otázky

Co je to, proč se LLM snaží počítat dopisy?

Velké jazykové modely mají potíže s počítáním písmen, protože nečtou text jeden znak po druhém. Čtou tokeny, což jsou kusy znaků, takže jednotlivá písmena uvnitř slova často model nikdy přímo nevidí. Tato jedna skutečnost vysvětluje celou rodinu zvláštních chyb v pravopisu, počítání, převracení a rýmování a říká vám, jak je obejít.

Jaký je hlavní důvod, proč jazykové modely chybně započítávají písmena ve slově?

Modely dostávají žetony, které často obsahují několik postav. Písmena uvnitř tokenu nejsou samostatnými vstupy, takže si je model musí vyvolat nepřímo.

Co vytváří tokenizér z kusu textu?

Tokenizér rozděluje text na části z pevného slovníku a každý mapuje na celočíselné ID, které se pak změní na vektor.

Která rychlá změna nejvíce pomáhá modelu správně počítat písmena?

Psaní slova s ​​oddělovači jako s-t-r-a-w obvykle vkládá každé písmeno do vlastního tokenu, což značně usnadňuje počítání.

Co dělá kódování bajtových párů svou slovní zásobu?

BPE začíná od bajtů nebo znaků a neustále spojuje nejčastější sousední páry, takže ze společných řetězců se stávají jednotlivé tokeny.

Proč může modelka zacházet s „Jahoda“ a „jahoda“ odlišně?

Tokenizéry často obsahují úvodní mezery a malá písmena v tokenech, takže malé změny povrchu mohou způsobit různá rozdělení tokenů.