Papir finner sene lag av en blanding av ekspertmodeller tåler tung ekspertmaskering
Et forhåndstrykk rapporterer at deaktivering av lavmagnitude-eksperter i de siste fem lagene av en 35-milliarder-parameter Mixture-of-Experts-modell bevarte langt mer brukbare kodeoversettelsesutdata enn å spre de samme kuttene over alle lagene. Den dekker én modell og én benchmark, og abstraktet rapporterer ingen demaskert grunnlinje.