Technische GIDS

Model samenvoegen

Het samenvoegen van modellen combineert de gewichten van twee of meer getrainde neurale netwerken in één enkel model – zonder enige hertraining of toegang tot de oorspronkelijke trainingsgegevens.

2 min readLaatst bijgewerkt

Overzicht

It matters because it lets teams blend specialized skills cheaply, turning expensive fine-tuned models into reusable building blocks.

Diepe duik

Bij het samenvoegen van modellen worden de feitelijke parameters (gewichten) van meerdere modellen die dezelfde architectuur delen, samengevoegd. De eenvoudigste methode, gewichtsmiddeling, neemt gewoon het gemiddelde van de overeenkomstige gewichten. Slimmere methoden werken met 'taakvectoren': het verschil tussen een verfijnd model en de basis ervan. Het toevoegen van een taakvector injecteert een vaardigheid; het aftrekken ervan kan ongewenst gedrag verwijderen. Technieken als TIES-Merging en DARE trimmen en herschalen deze vectoren om interferentie te verminderen wanneer veel modellen worden gecombineerd. Omdat er geen gradiëntdaling of gegevens nodig zijn, verloopt een samenvoeging binnen enkele seconden op een laptop. Het addertje onder het gras: het werkt alleen als modellen afstammen van een gemeenschappelijke basis en in compatibele gebieden met gewichtsruimte leven.

Technisch inzicht

Het belangrijkste idee is dat door het nauwkeurig afstemmen de gewichten langs een relatief vlak 'verliesbekken' in de buurt van het basismodel worden verplaatst. Een taakvector is eenvoudigweg (verfijnde gewichten minus basisgewichten). Omdat deze vectoren grofweg lineair en vaak vrijwel orthogonaal zijn voor verschillende taken, kunt u er meerdere bij elkaar optellen en behoudt het gecombineerde model elke vaardigheid. TIES en DARE snoeien eerst kleine of tegenstrijdige gewichtsdelta's om onenigheid over de tekens te verminderen en voegen ze vervolgens samen, zodat de ene taak de andere niet kan overschrijven.

Strategische impact

Cost and budget

Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.

Clearer decisions

Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.

Quality control

Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.

De toekomst van het samenvoegen van modellen

Verwacht dat samenvoegen een standaardonderdeel wordt van het model 'supply chain'. Hubs bieden al duizenden samenvoegbare controlepunten, en tools als mergekit maken recepten deelbaar. Onderzoek beweegt zich in de richting van geautomatiseerd zoeken naar samenvoegingen (evolutionaire algoritmen die laaggewijze overvloeiverhoudingen kiezen), samenvoegen over enigszins verschillende architecturen en on-the-fly Mixture-of-Experts-componenten samenvoegen. Naarmate de open finetuning toeneemt, biedt het samenvoegen een vrijwel vrije manier om capaciteiten samen te stellen, hoewel voor de licentieverlening en de herkomst van samengevoegde modellen duidelijkere normen nodig zullen zijn.

Implementatie in de echte wereld

Een op codering afgestemd model combineren met een op chat afgestemd model, zodat één LLM zowel code schrijft als op natuurlijke wijze converseert, zonder ook maar één keer opnieuw te hoeven trainen.

Evolutionaire samenvoegingsexperimenten waarbij een Japans taalmodel werd gecombineerd met een Engels wiskundig model om een ​​sterke Japanse wiskundeoplosser te produceren.

Het aftrekken van een 'toxiciteits'-taakvector van de gewichten van een model om de schadelijke output te verminderen zonder nieuwe veiligheidsgegevens te verzamelen.

Het samenvoegen van verschillende LoRA-adapters die zijn getraind in verschillende schrijfstijlen in één model dat flexibel van toon kan wisselen.

Risico's en vangrails

Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.

Infrastructuur- en onderhoudskosten worden vaak onderschat.

De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.

Implementatie routekaart

1

Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.

2

Benchmark onder realistische belasting- en gegevensomstandigheden.

3

Instrumentbewaking op fouten, drift en gebruikersimpact.

4

Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Merging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Samenvoeging van evolutionair modellen van Sakana AI

Frequently asked questions

What is Model Merging?

Het samenvoegen van modellen combineert de gewichten van twee of meer getrainde neurale netwerken in één enkel model – zonder enige hertraining of toegang tot de oorspronkelijke trainingsgegevens. Het is belangrijk omdat teams gespecialiseerde vaardigheden goedkoop kunnen combineren, waardoor dure, verfijnde modellen kunnen worden omgezet in herbruikbare bouwstenen.

Wat combineert het samenvoegen van modellen in de eerste plaats?

Het samenvoegen van modellen werkt rechtstreeks op de geleerde gewichten/parameters van modellen, waardoor ze in één set worden samengevoegd, in plaats van gegevens of runtime-uitvoer te combineren.

Waarom kan het samenvoegen van modellen binnen enkele seconden worden uitgevoerd op bescheiden hardware?

Omdat samenvoegen feitelijk een rekenkundig gewogen gewicht is ten opzichte van bestaande gewichten, is er geen sprake van kostbare backpropagatie of gegevensdoorgifte.

Welk probleem pakken methoden als TIES-Merging en DARE specifiek aan?

TIES en DARE snoeien en herschalen taakvectoren om conflicterende updates (tegengesteld teken) te verminderen, zodat de ene taak de andere niet overschrijft.

Hoe kan samenvoeging worden gebruikt om ongewenst gedrag te *verwijderen*?

Het ontkennen (aftrekken) van een taakvector die verband houdt met een ongewenste eigenschap, zoals toxiciteit, kan het model van dat gedrag afleiden.