A seguirPróximo guia
Agendamento de taxa de aprendizagem
Técnico
GUIA Técnico
Q-Learning é um algoritmo de aprendizagem por reforço que ensina a um agente quais ações compensam melhor, aprendendo gradualmente o valor de cada movimento por meio de tentativa e erro.
It matters because it can find optimal behavior without ever being told the rules of its environment.
Q-Learning aprende uma função chamada Q(s, a): a recompensa esperada a longo prazo de tomar a ação 'a' no estado 's' e depois agir de forma otimizada. O agente começa a não saber nada, tenta ações e observa recompensas. Após cada etapa, ele direciona sua estimativa de valor Q para a recompensa recém-recebida, mais o melhor valor futuro descontado que espera do próximo estado. Crucialmente, está “fora da política” e “livre de modelos”: pode aprender a melhor política enquanto explora aleatoriamente e nunca precisa de um modelo de como o mundo transita. Dada a exploração suficiente de cada par estado-ação, os valores Q provavelmente convergem para os valores ideais, e a melhor ação em qualquer estado é simplesmente aquela com o Q mais alto.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
O Q-Learning tabular clássico tem dificuldades quando os estados são muitos para serem armazenados em uma tabela. A direção dominante é combiná-lo com redes neurais, como em Deep Q-Networks (DQN), que aproximam valores Q de entradas brutas como pixels. A pesquisa continua a estabilizar isso com repetição de experiência, redes-alvo e variantes como Double DQN e Q-Learning distributivo, que reduzem o viés de superestimação e representam distribuições de retorno completo em vez de médias únicas.
Agentes de jogos Atari (DQN da DeepMind) aprendendo a jogar Breakout e Pong diretamente dos pixels da tela
Otimizando o tempo dos semáforos nos cruzamentos para minimizar o tempo total de espera dos veículos
Navegação do robô através de uma grade ou labirinto onde o robô aprende o caminho mais curto para maximizar a recompensa
Decisões dinâmicas de preços e estoque em que um agente aprende quais ações maximizam o lucro a longo prazo
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Q-Learning é um algoritmo de aprendizagem por reforço que ensina a um agente quais ações compensam melhor, aprendendo gradualmente o valor de cada movimento por meio de tentativa e erro. É importante porque pode encontrar o comportamento ideal sem nunca ter sido informado das regras do seu ambiente.
Q(s, a) estima a recompensa futura total descontada pela ação a no estado s e pelo comportamento ideal a partir de então, e não apenas a recompensa imediata.
O máximo nas próximas ações significa que o Q-Learning aprende o valor da política ideal gananciosa, mesmo enquanto o agente explora com uma política de comportamento diferente.
Gama (entre 0 e 1) desconta recompensas futuras; valores próximos a 1 tornam o agente míope, valores próximos a 0 tornam-no míope.
O erro TD é a lacuna entre a nova estimativa alvo (recompensa mais o melhor valor futuro descontado) e a antiga estimativa Q; a atualização diminui essa lacuna.
Uma tabela de pesquisa precisa de uma entrada por par estado-ação, o que é inviável quando os estados chegam a bilhões, motivando aproximadores de redes neurais como DQN.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Agendamento de taxa de aprendizagem
Técnico