Papír nalezl pozdní vrstvy modelu směsi odborníků tolerující maskování těžkých odborníků
Předtisk uvádí, že deaktivace expertů s nízkou velikostí v posledních pěti vrstvách modelu Mixture-of-Experts s 35 miliardami parametrů zachovala mnohem více použitelných výstupů pro překlad kódu, než kdyby se stejné řezy rozprostíraly ve všech vrstvách. Zahrnuje jeden model a jeden benchmark a abstrakt neuvádí žádnou nezamaskovanou základní linii.