W artykule odkryto, że późne warstwy modelu złożonego z ekspertów tolerują silne maskowanie eksperckie
Wstępny wydruk donosi, że wyłączenie ekspertów o małej wielkości w ostatnich pięciu warstwach 35-miliardowego modelu mieszanki ekspertów pozwoliło zachować znacznie bardziej przydatne wyniki tłumaczenia kodu niż rozłożenie tych samych cięć na wszystkich warstwach. Obejmuje jeden model i jeden punkt odniesienia, a streszczenie nie zawiera niezamaskowanych wartości bazowych.