Papier stellt fest, dass späte Schichten eines Mixture-of-Experts-Modells eine starke Expertenmaskierung tolerieren
Ein Vorabdruck berichtet, dass durch die Deaktivierung von Experten geringer Größe in den letzten fünf Schichten eines Mixture-of-Experts-Modells mit 35 Milliarden Parametern weitaus mehr nutzbare Codeübersetzungsausgaben erhalten blieben, als wenn die gleichen Schnitte über alle Schichten verteilt würden. Es deckt ein Modell und einen Benchmark ab, und in der Zusammenfassung wird keine unmaskierte Basislinie angegeben.