Dellu ci xibaar yi
YeesalAI Understanding

Jàngat dafa wane ni xeeti làkk yuñ maskeer yi dañu soxla pexe yu wuute

Gëstu bu bees bu arXiv bu jëfandikoo NVIDIA H200 GPU dafa wane ni xeetu làkk yu maske-diffusion yi ñooy gëna yàgg ci benn laajte ci yónnee CPU bi, ba noppi ni batching buñ boole mën na yokk bu baax produit bi.

5 min readRead the primary source
Source-page capture accompanying Study finds masked-diffusion language models need different serving strategies
Këyitu xët bu njëkkSource biñ enregistre
Siiwalkat
arxiv.org
Lëkkalekaayu cosaan
arxiv.orghttps://arxiv.org/abs/2608.23807
Xeetu balluwaay
Këyitu njëkk - ab yëgle ofisel, këyit, dosiye, wala xëtu pàrti bu njëkk bi ñuy jàng ci saasi.
KontekstXam lii ci 60 seconde

Tambalil fii

Term yu am solo

LoRA (Adaptaasioŋ bu am rang bu woyof)
Pexem ajustement bu baax te baax ci parametre yi, di yokk matrisi adaptatër yu rang bu woyof.
Memoire (Memoire agent)
Kontekst buñ denc bi ab ndawu IA di jëfandikoo ci jéego yi wala sesioŋ yi ngir gëna mëna wéy.
Modèlu diffusion
Architecture generatif buy jàng ni ñuy delloosi bruit ngir mëna synthesize ay nataal, audio wala yeneen ëmbiit.
Nattal sa boppModèlu IA leeral quiz

Lu xew

Gëstukat yi dañu wane ni xeetu làkk bu maske-diffusion di doxee ci biir sargal buy liggéey ci hardware dëgg, ñu gis ni latency ak bëgg-bëggu batching wuute nañu ak yu xeetu làkk autoregressive yiñ gëna xam.

Këyit dañu ko jox arXiv ci 24 ut, di jàngat xeeti làkk yuñ maskeer, wala dLLMs. DLLM yi wuute nañu ak sistem autoregressif yiy defar mbind yu toppalante, ndax dLLM yi mën nañu dindi token yu bari benn yoon. Auteur yi dañu wax ni wuute gi taxna ñu mëna defar ay sistem yuy liggéey dLLM, ndax dañuy jël ay xalaat yu bawoo ci xeetu liggéey bu autoregressive. Seenug jàppale bu mag bi mooy màndargaal empirik ci biir sargal buy boole, du waxtaan theorik kese. Kon këyit dafay tënk laaj biy liggéey ci njeexitalu liggéeyu mekaniismu defar bi. Tegtaleem mingi aju ci doxalinu sistem bi ci biir sargal, ak xeetu defar ay token yu bari jaaraleko ci denoising yu bari te baña topp benn yoon bu toppalante.

Gëstukat yi jëfandikoo nañu LLaDA-8B-Instruct ak benn adaptëru LoRA buy forse diffusion diskret ci benn GPU NVIDIA H200. Dañu jàngat tabb gi ci GSM8K ak HumanEval. Këyit dafa wax ni jafe-jafe laaj bi dafa wuute: laaj yi dañu daanu ci 11 niveau denoising-step fixe. Bindkat yi dañu natt ndax benn siñaal mën na wax luy waaja am laata ñuy tàmbali, waaye valeur R2 bi ñu gëna xam mooy 0.150, loolu dafay wane ni performance predictif bu néew doole ci seen jàngat. Tanneef yooyu ñooy wane yaatuwaayu natt yi. Seetlu yiñ xamle dañuy fësal boole biñ natt ci model bi, adaptatër bi, GPU bi, ak benchmark yi, ba noppi ñu wane test biñ def ci wax luy am ci benn màndarga bi.

Gëstu bi dafa wane ni budget yu gàtt yi mën nañu nëbb coppite yi am ci liggéey bi. Sunu sukkandikoo ci këyit bi, budget yi nekk ci suufu 320 token mën nañu dagg laaj yi balaa tasaaroo ci latency di feeñ. Ci eskaalu benn laaj, 24% ci diiru montu kuuraŋ bi kese lañu doon xayma GPU, fekk dessitu bi CPU-side dispatch overhead la woon. Bi ñuy boole ay laaj ci anam wu ñuy séddoo benn jéego bu jëm kanam ci jéego bu nekk ci denoising, produit bi dafa ëppoon 16.0 yoon ci dayo 16 bu gëna bari ci baseline bu nekk ci laaj-yonne. Këyit dafay génne ci sàrtu waxtu jeexal lote ngir lote buñ boole ak fees bu takku ci suufu ñëwu Poisson. Natt yooyu yépp dañuy boole doxalinu niveau laajte ak niveau system bi. Dañuy leeral fi ñuy dundee jot ak ni ñuy séddoo liggéey ci laaj yi di soppi produit bi ñuy rapoor, ci noonu lañuy tëye jàngat batch-timeout bi boole ci xeetu ñëw bi.

Ay leeral ci cosaan: arxiv.org ↗

Lu tax mu am solo

Li ñu gis mën na jàppale ingénieur yi ñu defar jumtukaay yu gëna am njariñ ngir modeli làkk yu lalu ci diffusion, ci noonu lañuy wane ni ay benchmark yu gàtt ak ay xalaat yuñ jëlee ci liggéey bu autoregressive mën nañu nëbb njëg yu am solo ci liggéey bi.

Li am solo ci jëfandikoo gi mooy liggéey dLLM mën na soxla parallelism ci niveau bu wuute ak liggéey autoregressive. Ci kontu këyit bi, li gëna am solo ci séddoo liggéey mooy jéego bu nekk buy dindi bruit, du laaj bi yépp. Loolu dafay soppi ni sistem bi wara xalaatee ci admission, batching, ak eviction sudee ay laaj yu bari ñu ngi jaar ci ordinatër buñ bokk. Lépp soo ko boolee mu nekk njàngale ci sistem buy méngale infrastructure yi ak anam wi ñuy defaree model bi. Taxawaay boobu dafay ame njeexital ci ni ñuy jàngatee komponent yi. Duggal, batching, ak dàq duñu ay detay yu am solo ci kaadar bii; ñu bokk ci ñiy méngale sistem bi ak anam wi ñuy dindi bruit ci model bi.

Li ñu gis ci CPU-overhead dafa am solo lool ci koom-koomu dugal ak ingenieur performance. Sudee ci configuration bi ñu natt, yokk kàttan gaawaay mën na baña saafara jafe-jafe bi ci boppam. Resultaa bi batching bi ñu xamle dafay wane ni coordination yi mën nañu amortise njëgu yónnee yi, ndigam resultaawu këyit bi dafa tënku ci modelam, adaptatër, hardware, liggéey, ak baseline. Li muy tekki mooy fàww ñu xoolaat yoon wi yépp, daale ko ci ñëwu laaj bi ba ci liggéeyu gaawaay bi. Natt yi ci këyit bi dañuy wane yoon woowu ci tabb biñ natt, te njariñu batching bi dafay wane li tax barabu kaw gi am solo suñuy jàngat performance.

Këyit dafay ñaawlu itam ni ñu mëna def ay benchmark ci dLLMs. Budget generation bu gàtt mën na tax latency di nuru lu gëna dëppoo ndax laaj bi dafay jeex balaa coppite bi mat sëkk ci jéego denoising yi di feeñ. Loolu lu am solo la ci képp kuy méngale sistem yiy serwiis wala di xayma waxtu tontu yi jëfandikukat yi di gis. Auteur yi dañu wax ci structure bi ni kalite bi warul wàññeeku ndax dayo bi dafay yokk ci ñetti gis-gis yuñ wax, waaye rapoor yi bawoo ci GSM8K dañu natt njubte gi ci benn laaj, muy 74% ba 76%. Loolu terewul kalite bu soppeeku ci bépp anam bu ñuy jëlee lote. Loolu moo waral itam këyit bi tàqale xalaat structurel ak firnde yuñ natt. Tegtal yi dañu jàppale argument bi bindkat yi wax, ci noonu la nattug njubte giñ xamle mingi yam ci benn laaj buñ wax te tontuwul laaj bu gëna yaatu bi.

Interactive Mechanism

Mekanism buy weccoo xalaat: naka lay doxee

Saytu xarala yu bees yi ci ginaaw yokkute bii ci anam wu weccoo xalaat.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Saytu konsept buy weccoo xalaat+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Li nga wara seetaan ci topp

Jàngat bi dafay teela màndargaal bu sukkandiko ci benn model configuration, benn GPU, ak ñaari benchmark. Dina ñu soxla ay test yu moom seen bopp ci model yi, hardware yi, sargu liggéey yi ak jekkal defar yi ngir xam fu resultaa yi di doxee ci anam wu yaatu.

Li gëna mag buñu xamul mooy mën nañu ko yamale. Jàngat bi dafay jëfandikoo benn xeetu tasaaroo buñ maske, LLaDA-8B-Instruct ak benn adaptatër LoRA D2F, ak benn GPU NVIDIA H200. Source bi waxul ndax 11 niveau yu lim yi, mën nañu wax luy waaja am, CPU-to-GPU balance timing, wala 16.0x batching gain dina feeñ ak yeneen dLLMs, adaptateurs, accelerateurs, logiciel stacks, wala njaxasu laaj. Liggéeyukaay yooyu dañu am solo sooy tekki li ciy génn. Li ñu gis mooy firnde ci tabb biñ natt, du kàrt bu mat sëkk ci doxalinu maske-diffusion ci bépp configuration bu mëna am.

Beneen liggéey dafa wara natt dem bi ak dikk bi ci liggéey bi ak ay génne yu gëna gudd wala yu bari te wuute. Këyit dafay artu bu baax ni budget yu nekk ci suufu 320 jetons mën nañu nëbb tasaaroo latency, kon jàngat yi dañu wara am ay liggéey yu yàgg yu doy ngir wane jeffin ju denoising. Dina am solo itam ñu natt latency geen gi, produit bi, jëfandikoo mémoire bi, ak kalite bi ñu boole, duñu jël benn lim biy génne ni firnde bu doy ci njariñu jëfandikoo gi. Natt yu mel noonu ñooy gëna yombal ràññee yokkute ci produit moyenne ak yokkute buy wéy di am njariñ ci trafic dëgg. Dina ñu wane itam ndax doxalinu kalendriye biñ seetlu dafay wéy su liggéey bi ak guddaayu génne bi soppeekoo.

Kalite bi ñuy wax mingi wéy di am sart. Auteur yi dañu wax ni kalite bi warul wàññeeku ndax dayo lots ci ñatti gis-gis, waaye source bi xamul benn set bu yaatu ci resultaa yi gëna jub ci dayo lots, te du wax itam disponibilite production wala deployment yi jàkkarloo ak jëfandikukat yi. Replication moomel sa bopp ci GSM8K, HumanEval, ak yeneen liggéey dina tax ñu xam ndax batching synchronisé nekk na njàngale bu am njariñ ci jëmmal wala gëna bari ay optimisation ci tabb jàngat bii. Ba test yooyu di am, li gëna am solo mooy li ñuy jàng: batching synchronized nekk na njàngale bu am njariñ ci tabb biñ xamle, ci noonu lañu wara xam njariñu jëfandikoo gi gëna yaatu.

Gid ak quiz yu ci méngoo

Model IA leeral nañu koTransformatërTaggat ci IAChatGPT & LLMsNatt li nga xam — natt quiz IA bu amul faydaSeetal benn baat IA ci sunu glossaireToppal toppukaayu génne xeetu IA
Gis nga lii am njariñ?