Jazyk AI GUIDE

Logitová zaujatost

Logit bias je knoflík, který posune jazykový model směrem ke konkrétním tokenům nebo od nich tím, že k jejich skóre přidá pevné číslo, než model vybere další slovo.

2 minuty čteníNaposledy aktualizováno

Přehled

It is a lightweight way to ban words, force choices, or shape style without retraining anything.

Hluboký ponor

Než si model vybere svůj další žeton, vytvoří logit (nenormalizované skóre) pro každý žeton ve svém slovníku. Logit bias vám umožňuje přidat konstantní hodnotu k logitům vybraných tokenů podle jejich číselných ID tokenů. Díky velkému kladnému zkreslení je mnohem pravděpodobnější, že bude token odebrán; velké negativní zkreslení (často -100 v API) to fakticky zakazuje. Vzhledem k tomu, že k úpravě dojde před softmaxem, který změní skóre na pravděpodobnost, i mírné odchylky významně posunou distribuci. Zásadní je, že zaujatost je klíčována na ID tokenů, nikoli na celá slova – takže slovo s více tokeny může vyžadovat zaujatost každého z jeho částí, aby je zcela potlačilo nebo podpořilo. Jedná se o rychlou, chirurgickou kontrolu, která nevyžaduje žádné jemné dolaďování a aplikuje se na žádost.

Technický přehled

Logity jsou skutečně hodnotná skóre; softmax je umocňuje, takže přidání +5 k tokenu vynásobí jeho nenormalizovanou váhu e^5 (~148x) před normalizací. Přidání -100 posune jeho pravděpodobnost po softmaxu v podstatě na nulu. Protože tokenizéry používají jednotky podslov, slovo 'nešťastný' mohou být dva tokeny; ovlivnění pouze prvního dílu to plně neovládá. Tato granularita podslov je hlavní problém, když se lidé pokoušejí zakázat konkrétní slovo a stále částečně prosakuje.

Strategický dopad

Rychlost a měřítko

Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.

Přístup a dosah

Rozšiřuje přístup napříč jazyky a komunikačními styly.

Jasnější rozhodnutí

Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.

Budoucnost Logit Bias

Logit bias zůstává základem rychlého řízení, ale přibývají bohatší alternativy: strukturované/omezené dekódování pro pevné záruky a řízení aktivace nebo reprezentační inženýrství, které posouvá vnitřní vektory modelu spíše než jen výstupní skóre. Očekávejte, že rozhraní API udrží zkreslení logit jako jednoduchý únikový nástroj a zároveň nabídnou ovládání vyšší úrovně – zakázané fráze, direktivy stylu, bezpečnostní filtry – které zpracovávají tokenizaci automaticky, takže vývojáři nemusí uvažovat o nezpracovaných ID tokenů.

Real-World Implementace

Nastavení zkreslení -100 na žetony vulgárních výrazů, aby se zabránilo chatbotovi produkovat určitá slova.

Vynucení klasifikátoru ano/ne poskytnutím silného pozitivního zkreslení tokenům „Ano“ a „Ne“ a potlačením všeho ostatního.

Odrazování nadužívané fráze nebo výplňového slova tím, že na jejich tokeny použijete mírné negativní zkreslení.

Posílení termínů specifických pro doménu (jako je název produktu), aby je sumarizátor spolehlivě zmiňoval.

Rizika a zábradlí

Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.

Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.

Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.

Plán implementace

1

Před zavedením definujte výstupní formát, tón a standardy kvality.

2

Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.

3

Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.

4

Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Logit Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Zkreslení pozice ALiBi

Často kladené otázky

What is Logit Bias?

Logit bias je knoflík, který posune jazykový model směrem ke konkrétním tokenům nebo od nich tím, že k jejich skóre přidá pevné číslo, než model vybere další slovo. Je to jednoduchý způsob, jak zakázat slova, vynutit si volby nebo tvarovat styl, aniž byste cokoli přeškolovali.

Co mění logit bias?

Logit bias přidává k logitům vybraných ID tokenů konstantu, čímž mění pravděpodobnost, že budou vybrány, aniž by se změnil samotný model.

Čeho v mnoha rozhraních API dosáhne zkreslení logitu -100 na tokenu?

Velké záporné vychýlení jako -100 žene pravděpodobnost tokenu po softmaxu v podstatě na nulu, takže se prakticky nikdy nevytvoří.

Proč může zákaz slova se zkreslením logit někdy uniknout částečný výstup?

Tokenizéry rozdělují mnoho slov do více tokenů podslov, takže ovlivnění pouze prvního kusu nedokáže potlačit celé slovo.

K jakému identifikátoru je klíčováno zkreslení logit?

Hodnoty zkreslení se aplikují na konkrétní ID tokenů ze slovníku tokenizátora, a proto musíte znát ID částí slova.

Protože logity procházejí softmaxem, jaký je účinek přidání kladného vychýlení?

Softmax umocňuje logity, takže i mírné kladné zkreslení podstatně znásobí nenormalizovanou váhu tokenu a prudce zvýší jeho šance.