Terug naar Nieuws
InnovatieAI Understanding-briefing

Paper stelt snelheidsmatching voor om de beloning voor diffusiemodellen te verfijnen

Onderzoekers stellen beloningsgebaseerde snelheidsmatching voor, een trajectvrije methode die de snelheidsvelden van diffusiemodellen rechtstreeks bijwerkt en, zo melden zij, vergelijkbare of betere resultaten behaalt dan op waarschijnlijkheid gebaseerde methoden tegen lagere trainingskosten.

5 min readRead the primary source
Primary-source image accompanying Paper proposes velocity matching to scale reward fine-tuning for diffusion models
Primair brondocumentBron opgenomen
Uitgever
arxiv.org
Bronlink
arxiv.orghttps://arxiv.org/abs/2608.23664
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Fijnafstelling
Voortdurende training over domeinspecifieke gegevens om een ​​vooraf getraind model aan te passen aan een specifieke taak.
Versterkend leren
Training door beloningssignalen waarbij een agent acties leert die het rendement op de lange termijn maximaliseren.
Verspreidingsmodel
Een generatieve architectuur die leert ruis om te keren om afbeeldingen, audio of andere inhoud te synthetiseren.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

Een team van zeven onderzoekers heeft een arXiv-paper ingediend waarin beloningsgebaseerde snelheidsmatching (RVM) wordt voorgesteld, een methode voor het afstemmen van diffusiemodellen op menselijke voorkeuren of taakspecifieke doelen. RVM werkt het snelheidsveld van het model rechtstreeks bij in plaats van waarschijnlijkheden te reconstrueren op basis van ruisonderdrukkingstrajecten of het benaderen van eindpuntwaarschijnlijkheden.

De bron is een arXiv-inzending gedateerd 24 augustus 2026, getiteld “Scaling for Diffusion Models via Velocity Matching.” De auteurs presenteren het afstemmen van beloningen als een manier om diffusiemodellen aan te passen aan menselijke voorkeuren en taakspecifieke doelstellingen. Hun centrale bewering is dat bestaande benaderingen gebruik maken van beleidsgradiëntmachines die zijn ontworpen voor autoregressieve modellen, waardoor extra complexiteit ontstaat omdat diffusiemodellen geen hanteerbare waarschijnlijkheden bieden voor gegenereerde steekproeven.

De voorgestelde methode, op beloning gebaseerde snelheidsmatching, wordt beschreven als trajectvrij. In plaats van waarschijnlijkheden te construeren op basis van stochastische ruisonderdrukkingsovergangen of eindpuntwaarschijnlijkheden te benaderen met een bewijsondergrens, werkt RVM rechtstreeks op het snelheidsveld. Volgens de samenvatting van het artikel versterkt de update de richtingen die verband houden met generaties met hoge beloningen en onderdrukt het de richtingen die verband houden met generaties met lage beloningen.

RVM bevat een optionele ankerterm die bedoeld is om de drift ten opzichte van een referentiesnelheid te beheersen. De auteurs zeggen ook dat het raamwerk recente verfijningsmethoden, waaronder RAM en DiffusionNFT, als speciale gevallen kan herstellen. Dat maakt het voorstel tot een verenigende formulering en tot een nieuwe updateregel, ook al geeft de aangeleverde bron geen uitleg over de exacte afleidingen of de voorwaarden waaronder die gelijkwaardigheden gelden.

De onderzoekers rapporteren tests voor verschillende grootschalige taken voor het verfijnen van beloningen in het diffusiemodel. Ze zeggen dat RVM concurrerend was met trajectgebaseerde beleidsgradiëntmethoden of beter presteerde, terwijl er aanzienlijk minder trainingskosten nodig waren. Voor het genereren van video's melden ze dat standaardvoorkeursbeloningen visueel zuivere maar bijna statische resultaten kunnen opleveren; ze introduceren een dynamische trackingbeloning en zeggen dat deze de beweging verbeterde en tegelijkertijd de algehele VBench-prestaties verbeterde. In de aangeleverde bron zijn geen numerieke scores, modelnamen, trainingsbudgetten of vergelijkingstabellen opgenomen.

Brongegevens: arxiv.org ↗

Waarom het ertoe doet

Het artikel stelt dat directe snelheidsupdates de kosten van het afstemmen van beloningen voor grootschalige beeld- en videoverspreidingssystemen kunnen vereenvoudigen en verlagen. De video-experimenten identificeren ook een afweging tussen standaardvoorkeursbeloningen: ze kunnen de voorkeur geven aan visueel zuivere resultaten met weinig beweging.

Als de beweringen van het artikel worden gegeneraliseerd, zou het direct optimaliseren van de oorspronkelijke snelheidsrepresentatie van een diffusiemodel het afstemmen van beloningen gemakkelijker op schaal kunnen maken. Het praktische belang is niet louter een nieuwe verliesfunctie: de methode richt zich op de computationele en algoritmische overhead die gepaard gaat met op waarschijnlijkheid gebaseerde beleidsoptimalisatie. Lagere trainingskosten zouden voorkeurs- of taakspecifieke aanpassingen toegankelijker kunnen maken voor teams die met grote beeld- en videogeneratoren werken.

Het artikel vestigt ook de aandacht op het ontwerp van de beloning zelf. In de video-experimenten van de auteurs zou een beloning die de nadruk legt op visuele reinheid naar verluidt de voorkeur geven aan output met weinig beweging. Hun dynamische trackingbeloning wordt gepresenteerd als een manier om beweging effectiever te meten, terwijl het algehele VBench-resultaat van het artikel nog steeds wordt verbeterd. Dit illustreert dat het verbeteren van een generatief systeem niet alleen afhangt van de updateregel, maar ook van wat het optimalisatieproces moet waarderen.

De optionele ankerterm is van belang omdat beloningsoptimalisatie een model kan wegleiden van referentiegedrag. De bron zegt dat de ankerbesturing afwijkt van een referentiesnelheid, maar geeft niet aan hoe die controle de kwaliteit, diversiteit, stabiliteit of het risico van overfitting voor een beloning beïnvloedt. Deze details zullen bepalen of RVM nuttig is voor gecontroleerde aanpassing in plaats van alleen voor benchmarkoptimalisatie.

Het resultaat blijft een onderzoeksclaim uit een arXiv-artikel, en geen bewijs dat de training van diffusiemodellen in grote lijnen is veranderd. Het geleverde abstract identificeert niet de geteste modellen, datasets, beloningsgroottes, rekenbesparingen, statistische variatie of foutgevallen. Er wordt ook niet vastgesteld of de methode even goed werkt voor afbeeldingen, video en andere verspreidingstoepassingen, of dat de voordelen ervan afhangen van bepaalde beloningsontwerpen.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

De belangrijkste vragen zijn of de gerapporteerde kosten- en kwaliteitsvoordelen van RVM gelden voor onafhankelijk gereproduceerde experimenten, beloningsfuncties, modelgroottes en generatietaken, en of de methode kan voorkomen dat er wordt geoptimaliseerd voor beperkte of misleidende beloningen. De aangeleverde bron biedt geen numerieke resultaten, implementatiedetails, computerbudgetten of bewijs van externe validatie.

De reproductie zou zich eerst moeten concentreren op de vergelijking van het artikel met op trajecten gebaseerde beleidsgradiëntmethoden. Nuttige controles zouden hetzelfde model en dezelfde taak omvatten onder op elkaar afgestemde computerbudgetten, omdat “substantieel lagere trainingskosten” alleen zinvol zijn als de boekhouding al het relevante trainings- en evaluatiewerk omvat. De aangeleverde bron geeft geen numerieke kostenratio, waardoor de omvang van het geclaimde voordeel onbekend is.

Het beloningsontwerp verdient een aparte evaluatie van de snelheidsupdate. De auteurs zeggen dat, zodra de snelheidsupdate vereenvoudigd is, de specifieke verliesvariant er minder toe doet dan het belonings- en ankerontwerp. Deze bewering suggereert dat verbeteringen sterk kunnen afhangen van hoe generaties met hoge en lage beloningen worden geëtiketteerd of gescoord. Onafhankelijke tests moeten daarom de beloningsfuncties variëren en meten of de winst aanhoudt buiten de geselecteerde doelstellingen van het artikel.

Voor het genereren van video's moeten waarnemers controleren of beloningen voor dynamisch volgen de betekenisvolle beweging verbeteren of alleen de zichtbare verandering vergroten. De bron rapporteert betere beweging en een verbeterd algemeen VBench-resultaat, maar biedt niet de onderliggende statistieken of beschrijft de faalmodi. Evaluatie moet de visuele kwaliteit, temporele consistentie en diversiteit samen onderzoeken, inclusief gevallen waarin beweging ongewenst is of in strijd is met de beoogde inhoud.

De bredere betekenis van het artikel zal afhangen van implementatie- en validatiedetails die niet aanwezig zijn in de aangeleverde bron. Belangrijke onbekenden zijn onder meer de exacte snelheidsparametrisering, ankerinstellingen, model- en datasetdekking, trainingsduur, reproduceerbaarheid van de gerapporteerde vergelijkingen en of RVM stabiel blijft naarmate de beloningsdoelstellingen veranderen. Vervolgdocumenten, vrijgegeven code en onafhankelijke replicaties zouden helpen vaststellen of het voorstel een algemene schaalmethode is of een resultaat dat verband houdt met specifieke experimenten.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-trainingTransformatorenToekomst van AITest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?