Voltar às notícias
InovaçãoAI Understanding briefing

Pesquisadores da Apple relatam lei de dimensionamento para modelos de treinamento com dados escassos

Um estudo de mais de 2.000 execuções de treinamento de modelos de linguagem diz que dados de destino escassos podem ser repetidos de 15 a 20 vezes em misturas, com a melhor taxa variando de acordo com a escala e o cálculo.

Por 5 min read
Unoccupied data-center equipment room with server cabinets and coiled fiber cables in early morning light
A versão curta

Um estudo de mais de 2.000 execuções de treinamento de modelos de linguagem diz que dados de destino escassos podem ser repetidos de 15 a 20 vezes em misturas, com a melhor taxa variando de acordo com a escala e o cálculo.

O que aconteceu

Os pesquisadores da Apple estudaram como o treinamento do modelo de linguagem deveria combinar dados alvo escassos com dados genéricos abundantes. Eles relatam que a repetição pode ser útil no pré-treinamento com dados mistos e introduzem uma lei de escalonamento destinada a orientar essas decisões.

O artigo apresenta o que a Apple chama de lei de escala de mistura com reconhecimento de repetição. De acordo com a fonte, o método leva em conta o valor decrescente de tokens alvo repetidos, ao mesmo tempo que representa dados genéricos como um componente de regularização. Neste enquadramento, os escassos dados alvo continuam a fazer parte da mistura, mesmo quando não conseguem fornecer um grande volume de texto único. A parte genérica é tratada como um componente separado da mistura de treinamento, e não como um substituto do material alvo. A descrição fornecida apresenta a lei como uma forma de raciocinar sobre esses componentes em conjunto. Não descreve uma implementação pública nem identifica um produto que utiliza o método.

Os pesquisadores dizem que a otimização desta lei produz configurações de mistura eficazes e recomendações práticas para pré-treinamento sob restrições de dados. Essa declaração descreve o resultado da pesquisa relatado, incluindo o uso pretendido da lei para orientar decisões sobre repetições e proporções de mistura. Não diz que toda configuração é eficaz, que a mesma configuração se aplica a todas as escalas, ou que dados escassos têm uma taxa de repetição ótima fixa. Em vez disso, o rascunho mais amplo diz que a melhor taxa pode variar de acordo com a escala e o cálculo, enquanto a contribuição declarada do documento é uma estrutura para fazer a escolha. A fonte apoia, portanto, um relatório sobre orientação de formação, e não uma afirmação sobre um sistema acabado.

A página não afirma que o método foi incorporado a um modelo público, produto, serviço de treinamento ou pacote de software lançado. Também não estabelece melhorias de produtos posteriores ou replicação independente. O relato disponível é, conseqüentemente, limitado ao estudo e aos experimentos de treinamento relatados. Esses limites são importantes porque uma configuração de mistura eficaz no artigo não é o mesmo que evidência de que um modelo implantado melhorou. A descrição do rascunho fica ao nível do que os investigadores relatam e do que a fonte fornecida permite concluir. Nenhuma reivindicação adicional de implantação ou adoção segue o resumo em papel.

Leia a fonte primária: machinelearning.apple.com

Por que isso importa

Muitos domínios especializados e línguas de poucos recursos não possuem texto exclusivo suficiente para apoiar o treinamento convencional em grande escala. Uma maneira melhor de definir proporções de repetição e mistura poderia ajudar os pesquisadores a usar dados limitados de forma mais eficiente, embora a fonte fornecida não estabeleça melhorias de produto posteriores ou replicação independente.

A importância do artigo, portanto, reside em saber se a sua lei de escala é preditiva e portátil. O resumo da página de pesquisa apóia uma ampla afirmação experimental em mais de 2.000 execuções e vários tipos de dados, mas deixa fatos importantes desconhecidos: os critérios exatos de avaliação, o tamanho e a composição dos conjuntos de dados, o hardware e os orçamentos de treinamento, os métodos de linha de base e até que ponto os resultados variaram entre os modelos. Essas incógnitas afetam a confiança com que o relacionamento relatado pode ser usado fora do estudo. O resumo dá uma razão para examinar a abordagem, embora não resolva até que ponto as suas recomendações devem ser aplicadas.

Nenhuma confirmação independente, implantação de produção ou impacto no usuário público é estabelecida pelo material fornecido. Essa limitação é importante ao avaliar por que o resultado é importante, porque um método pode ser útil como estrutura de pesquisa sem ainda alterar a forma como os modelos são construídos ou experimentados pelos usuários. O valor potencial advém da tomada de decisões mais sistemáticas sobre dados-alvo escassos: os investigadores podem ter uma forma mais clara de considerar a repetição juntamente com dados genéricos abundantes. A fonte fornecida, contudo, não estabelece que este potencial já tenha produzido melhores produtos, custos mais baixos ou um benefício demonstrado para qualquer domínio específico.

A questão prática é se as orientações comunicadas melhoram a utilização de dados limitados, preservando ao mesmo tempo o papel dos dados genéricos na formação. Uma melhor forma de definir proporções de repetição e mistura poderia ajudar os investigadores a utilizar dados limitados de forma mais eficiente, mas o projecto não afirma que este resultado tenha sido demonstrado na implantação. Sua importância está, portanto, condicionada ao desempenho preditivo, à portabilidade entre modelos e tipos de dados e à confirmação além dos experimentos relatados. Até que esses pontos fiquem mais claros, a descrição mais forte apoiada é que o trabalho oferece uma abordagem de lei de escala para estudar misturas de dados sob escassez, com detalhes importantes ainda não resolvidos.

O que assistir a seguir

As principais questões são se a lei proposta generaliza além dos experimentos relatados, com que precisão ela prevê o desempenho antes de uma execução de treinamento e se dados repetidos criam riscos de memorização ou de ajuste excessivo em implantações reais.

As principais questões são se a lei proposta generaliza além dos experimentos relatados, com que precisão ela prevê o desempenho antes de uma execução de treinamento e se dados repetidos criam riscos de memorização ou de ajuste excessivo em implantações reais. Estas questões abrangem tanto a fiabilidade científica como o risco operacional. A generalização mostraria se a relação é útil para além das condições estudadas, enquanto a precisão preditiva determinaria se pode orientar as escolhas antes de os recursos serem comprometidos. As questões de memorização e sobreajuste abordam a possibilidade de que a repetição de material escasso possa afetar o comportamento do modelo de maneiras que não são capturadas por um único resultado de treinamento.

As evidências de implantação determinarão se o método é importante além das curvas de pré-treinamento. Avaliações futuras devem acompanhar o desempenho do domínio-alvo juntamente com a memorização, contaminação, sobreajuste e desempenho em tarefas genéricas. Também será importante verificar se as recomendações permanecem úteis quando os dados apresentam ruído, são legalmente restritos ou mudam ao longo do tempo. Estas verificações ligariam o quadro proposto às condições práticas sob as quais dados limitados são efectivamente tratados. Também ajudariam a distinguir uma melhoria numa métrica comunicada de um benefício de formação mais amplo que permanece visível em tarefas específicas e genéricas.

Até que estas questões sejam respondidas, o documento apoia um quadro de formação promissor, e não uma garantia de melhores modelos ou custos mais baixos. O mesmo padrão se aplica a reivindicações sobre portabilidade, implantação e impacto no usuário: o material fornecido não as estabelece. O que deve ser observado é, portanto, a evidência de que a lei prevê resultados antes da formação, permanece útil em todos os contextos relevantes e não introduz riscos inaceitáveis ​​de memorização ou de sobreajuste. Os resultados que abordam estes pontos esclareceriam o alcance prático do quadro sem alterar o que o próprio estudo atual relata.

Guias e questionários relacionados

Achou isso útil?
O briefing semanal

Obtenha as histórias de IA que realmente importam.

Um e-mail útil por semana — o que mudou na IA, por que ela é importante, além de ferramentas, guias, oportunidades e formas práticas de agir.

Gratuito · Sem spam · Cancele a inscrição com um clique