A seguirPróximo guia
Modelos generativos baseados em pontuação
IA visual
GUIA Técnico
Os modelos baseados em energia (EBMs) aprendem uma função escalar de 'energia' que atribui valores baixos a dados plausíveis e valores altos a dados implausíveis, definindo uma distribuição de probabilidade sem forçá-la a ser fácil de normalizar.
This flexibility makes them a unifying lens for much of machine learning, from classifiers to generative models.
Um modelo baseado em energia define uma probabilidade por meio da distribuição de Boltzmann (Gibbs): p(x) é proporcional a exp(-E(x)), onde E(x) é uma função de energia aprendida, geralmente uma rede neural. O treinamento reduz a energia dos dados reais e aumenta a energia de todo o resto. O problema é a função de partição Z, a soma ou integral de exp(-E(x)) sobre todas as entradas possíveis, que geralmente é intratável para calcular. Portanto, os EBMs são treinados com aproximações: divergência contrastiva, correspondência de pontuação ou estimativa contrastiva de ruído, e amostrados por meio de métodos MCMC, como a dinâmica de Langevin, que segue o gradiente de energia. Exemplos clássicos incluem redes Hopfield e máquinas Boltzmann restritas; o trabalho moderno conecta EBMs a modelos de difusão, GANs e até mesmo classificadores comuns reinterpretados como funções de energia.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
Os EBMs estão desfrutando de um interesse renovado porque fornecem uma ponte teórica entre modelos de difusão, modelos generativos baseados em pontuação e redes discriminativas. A pontuação que um modelo de difusão aprende é essencialmente um gradiente de energia. Espere mais sistemas híbridos que utilizem funções de energia para restrições flexíveis e combináveis (combinando múltiplas energias para orientar a geração), amostragem melhor e mais rápida do que MCMC e aplicações em raciocínio e planejamento onde 'encontrar a configuração de energia mais baixa' expressa naturalmente otimização e satisfação de restrição.
Redes Hopfield agindo como memória associativa que recupera um padrão armazenado de uma entrada ruidosa ou parcial, estabelecendo-se em um estado de baixa energia
Máquinas Boltzmann restritas usadas historicamente para filtragem colaborativa e pré-treinamento de redes de crenças profundas
Reinterpretando um classificador padrão como um modelo baseado em energia (a abordagem JEM) para melhorar a calibração, robustez e detecção fora de distribuição
Predição estruturada e satisfação de restrições, onde as soluções são encontradas minimizando uma energia aprendida sobre muitas variáveis de interação (por exemplo, estimativa de pose ou layout)
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Os modelos baseados em energia (EBMs) aprendem uma função escalar de 'energia' que atribui valores baixos a dados plausíveis e valores altos a dados implausíveis, definindo uma distribuição de probabilidade sem forçá-la a ser fácil de normalizar. Essa flexibilidade os torna uma lente unificadora para grande parte do aprendizado de máquina, desde classificadores até modelos generativos.
Através da distribuição de Boltzmann, p(x) é proporcional a exp(-E(x)), portanto, dados plausíveis recebem baixa energia e alta probabilidade.
Computar Z requer somar ou integrar exp(-E(x)) em todo o espaço de entrada, o que geralmente é inviável, forçando métodos de treinamento aproximados.
A dinâmica de Langevin move iterativamente as amostras morro abaixo ao longo do gradiente de energia enquanto adiciona ruído, convergindo para regiões de baixa energia.
Como Z não depende de x, diferenciar log p(x) em relação a x o cancela, deixando apenas o gradiente de energia, que é tratável.
As redes Hopfield são um dos primeiros modelos baseados em energia que armazenam padrões como estados de baixa energia e os recuperam minimizando a energia.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Modelos generativos baseados em pontuação
IA visual