A seguirPróximo guia
Quantização pós-treinamento GPTQ e AWQ
Técnico
GUIA Técnico
DeepSpeed (Microsoft) e Megatron-LM (NVIDIA) são as pilhas de software que tornam realmente viáveis modelos de treinamento com bilhões de parâmetros em milhares de GPUs.
Sem eles, os modelos de fronteira de hoje simplesmente não caberiam na memória ou terminariam o treinamento em um tempo razoável.
Treinar um modelo grande em uma GPU é impossível porque os pesos, gradientes e estados do otimizador não se ajustam. Essas pilhas dividem o trabalho em muitas GPUs. A Megatron-LM foi pioneira no paralelismo de tensores, dividindo multiplicações de matrizes individuais dentro de cada camada nas GPUs, além do paralelismo de pipeline, que coloca diferentes camadas em diferentes GPUs. A contribuição exclusiva do DeepSpeed é o ZeRO (Zero Redundancy Optimizer), que fragmenta estados, gradientes e parâmetros do otimizador entre GPUs em vez de replicá-los, reduzindo drasticamente a memória por GPU. Os dois são frequentemente combinados (Megatron-DeepSpeed) para treinar modelos como BLOOM-176B e Megatron-Turing NLG. Eles também adicionam precisão mista, checkpoint de ativação e descarregamento para CPU ou NVMe para que modelos grandes sejam treinados em hardware limitado.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
Espere uma integração mais estreita com o FSDP (Fully Sharded Data Parallel) nativo do PyTorch, que absorveu muitas ideias ZeRO, confundindo a linha entre pilhas de pesquisa e estruturas principais. As abordagens orientadas ao compilador e os planejadores de paralelismo automático visam remover o ajuste manual. À medida que os clusters de treinamento crescem em direção a centenas de milhares de aceleradores, a tolerância a falhas, o dimensionamento elástico e a comunicação sobreposta com a computação tornam-se as fronteiras dominantes da engenharia, juntamente com o suporte para novo hardware como NVIDIA Blackwell e chips de treinamento personalizados.
Treinando o modelo multilíngue aberto BLOOM-176B usando a pilha combinada Megatron-DeepSpeed em centenas de GPUs.
Microsoft e NVIDIA treinando o modelo Megatron-Turing NLG de 530 bilhões de parâmetros com paralelismo 3D.
ZeRO-Offload permite que os pesquisadores ajustem modelos de vários bilhões de parâmetros em uma única GPU de estação de trabalho, espalhando estados do otimizador para CPU RAM.
Usar pontos de verificação de ativação nessas pilhas para ajustar janelas de contexto mais longas, recalculando ativações em vez de armazená-las todas.
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
DeepSpeed (Microsoft) e Megatron-LM (NVIDIA) são as pilhas de software que tornam realmente viáveis modelos de treinamento com bilhões de parâmetros em milhares de GPUs. Sem eles, os modelos de fronteira de hoje simplesmente não caberiam na memória ou terminariam o treinamento em um tempo razoável.
ZeRO (Zero Redundancy Optimizer) elimina a redundância de memória particionando estados, gradientes e parâmetros do otimizador entre GPUs, em vez de replicá-los em cada dispositivo.
O paralelismo tensorial particiona a matemática dentro de uma única camada (como uma grande multiplicação de matriz) em várias GPUs, o que é uma divisão intracamada.
O ZeRO Stage 3 fragmenta parâmetros, além de gradientes e estados do otimizador, reunindo-os sob demanda, proporcionando a maior redução de memória.
O checkpoint de ativação armazena menos ativações intermediárias e as recalcula durante a retropropagação, trocando computação adicional por memória reduzida.
O paralelismo 3D empilha três estratégias ortogonais: paralelismo de dados, paralelismo de tensor (intracamada) e paralelismo de pipeline (intercamada).
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Quantização pós-treinamento GPTQ e AWQ
Técnico