A seguirPróximo guia
Aprendizagem por reforço com feedback humano
Técnico
GUIA Técnico
A aprendizagem por reforço inverso (IRL) inverte o RL padrão: em vez de receber uma recompensa e encontrar uma política, ele observa o comportamento do especialista e infere a função de recompensa oculta que o explica.
Isto é importante porque uma recompensa recuperada generaliza-se muito melhor para novas situações do que ações copiadas diretamente.
A aprendizagem por reforço inverso pergunta: que objetivo um especialista deve ter perseguido para se comportar daquela maneira? Dadas as demonstrações, a IRL recupera uma função de recompensa sob a qual esse comportamento parece ideal (ou quase ideal) e, em seguida, usa a RL padrão para derivar uma política. A motivação é a generalização – uma recompensa aprendida captura o porquê do comportamento, para que o agente possa agir de forma sensata em estados que as demonstrações nunca cobriram, ao contrário da clonagem comportamental que apenas imita ações. O problema é fundamentalmente mal colocado: muitas funções de recompensa explicam o mesmo comportamento, inclusive as triviais. As principais abordagens resolvem esta ambiguidade, incluindo métodos de margem máxima que preferem recompensas que tornem o especialista claramente o melhor, e IRL de entropia máxima, que escolhe a distribuição de recompensas de menor comprometimento consistente com os dados.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
A IRL sustenta cada vez mais a aprendizagem por recompensa para alinhamento: em vez de humanos codificarem recompensas manualmente, os sistemas inferem o que as pessoas valorizam a partir do comportamento e do feedback. Espere ligações mais estreitas com a aprendizagem por reforço a partir do feedback humano e da aprendizagem por preferências, adaptando-se ao modelo de linguagem e às configurações robóticas. A pesquisa está avançando na recuperação de recompensas de vídeos brutos e observações parciais, e em direção a recompensas comprovadamente identificáveis que resistam aos problemas de hacking de recompensas e ambiguidade que afetam os métodos atuais.
Veículos autônomos inferindo preferências de direção (suavidade, margens de segurança) de motoristas humanos
Robôs aprendendo objetivos de tarefas a partir de demonstrações humanas para generalizar para novos layouts
Modelagem do movimento de pedestres ou animais recuperando os objetivos por trás das trajetórias observadas
Inferência de recompensa para alinhamento de IA, aprendendo valores humanos a partir de escolhas demonstradas
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
A aprendizagem por reforço inverso (IRL) inverte o RL padrão: em vez de receber uma recompensa e encontrar uma política, ele observa o comportamento do especialista e infere a função de recompensa oculta que o explica. Isto é importante porque uma recompensa recuperada generaliza-se muito melhor para novas situações do que ações copiadas diretamente.
A IRL toma demonstrações como dados e infere a função de recompensa subjacente sob a qual o comportamento do especialista parece ideal.
Múltiplas funções de recompensa, incluindo uma recompensa trivial totalmente zero, podem tornar o comportamento observado ideal, de modo que a recompensa não é determinada exclusivamente apenas por demonstrações.
Uma função de recompensa codifica por que o especialista agiu daquela maneira, permitindo que a política derivada se comportasse de maneira sensata em novos estados, enquanto a clonagem apenas copia as ações vistas nos dados.
A IRL de entropia máxima pressupõe que trajetórias de recompensa mais alta são exponencialmente mais prováveis, fornecendo um objetivo único que também tolera especialistas imperfeitos e barulhentos.
A IRL produz uma recompensa, que é então entregue a um algoritmo RL normal para calcular uma política ideal sob esse objetivo inferido.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Aprendizagem por reforço com feedback humano
Técnico