GUIDA ALL'AI linguistica

Ottimizzazione della politica prossimale

La Proximal Policy Optimization (PPO) è l’algoritmo di apprendimento per rinforzo maggiormente associato alla messa a punto dei modelli linguistici a partire dal feedback umano.

2 minuti di letturaUltimo aggiornamento

Panoramica

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Immersione profonda

PPO è stato introdotto da OpenAI nel 2017 ed è diventato il cavallo di battaglia dietro RLHF per sistemi come InstructGPT e ChatGPT. La sfida principale nel RL con gradiente di policy è che un singolo aggiornamento eccessivamente grande può ridurre le prestazioni. Il PPO affronta questo problema con un “obiettivo surrogato ritagliato”: misura quanto più (o meno) è diventata probabile un’azione rispetto alla vecchia politica, moltiplica quel rapporto per il vantaggio (quanto l’azione è stata migliore del previsto) e riduce il rapporto a un piccolo intervallo come 0,8-1,2. Ciò limita la portata in cui la policy può spostarsi per ogni aggiornamento, mantenendo stabile l’apprendimento pur consentendo un miglioramento costante. Nel modello linguistico RLHF, l'"azione" genera un token o una risposta, la ricompensa proviene da un modello di ricompensa e una penalità di divergenza KL impedisce al modello di allontanarsi troppo dal suo comportamento originale.

Approfondimento tecnico

Il PPO massimizza un obiettivo ritagliato: min(ratio * vantaggio, clip(ratio, 1-eps, 1+eps) * vantaggio), dove rapporto è la probabilità di azione nuova su vecchia. I vantaggi vengono solitamente stimati con la stima dei vantaggi generalizzati e una rete di valore appreso (critico). In RLHF, la ricompensa totale combina il punteggio del modello di ricompensa con una penalità KL per token rispetto alla politica di riferimento, bilanciando il guadagno della ricompensa con il rimanere vicino al modello originale.

Impatto strategico

Velocità e scala

I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.

Accedere e raggiungere

Espande l'accesso attraverso lingue e stili di comunicazione.

Decisioni più chiare

I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.

Il futuro dell’ottimizzazione delle politiche prossimali

Il PPO rimane forte ma è notoriamente complicato: necessita di una rete di valore separata, di un'attenta messa a punto degli iperparametri e di molto calcolo. Stanno guadagnando terreno alternative più semplici, tra cui DPO (niente RL) e GRPO, che abbassa la rete del valore stimando i vantaggi da gruppi di risposte campionate e ha alimentato recenti modelli di ragionamento. La PPO persisterà laddove l’esplorazione politica aiuta davvero, ma il settore sta attivamente scambiando parte della sua complessità con metodi più economici.

Implementazione nel mondo reale

Ottimizzazione di InstructGPT e ChatGPT per seguire le istruzioni e le preferenze umane tramite RLHF

Addestramento di agenti di gioco e di controllo della robotica, il dominio originale di PPO prima dei modelli linguistici

Ridurre la tossicità o migliorare l'utilità massimizzando il punteggio del modello di ricompensa sotto un vincolo KL

Ottimizzazione dell'utilizzo degli strumenti o del comportamento dell'agente in più fasi in cui un modello viene premiato per aver completato correttamente le attività

Rischi e guardrail

Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.

La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.

I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.

Tabella di marcia per l'implementazione

1

Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.

2

Risposte concrete con fonti attendibili ogni volta che la precisione è importante.

3

Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.

4

Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Ottimizzazione della politica relativa del gruppo

Domande frequenti

What is Proximal Policy Optimization?

La Proximal Policy Optimization (PPO) è l’algoritmo di apprendimento per rinforzo maggiormente associato alla messa a punto dei modelli linguistici a partire dal feedback umano. Migliora una politica con piccoli passi attenti per evitare l’instabilità che affligge i metodi ingenui del gradiente politico.

Quale problema affronta principalmente il "clipping" del PPO?

Ritagliare il rapporto di probabilità impedisce che ogni singolo aggiornamento sposti troppo la politica, che è la principale fonte di instabilità nei metodi basati sul gradiente di politica.

Nel modello linguistico RLHF con PPO, da dove viene solitamente il segnale di ricompensa?

Un modello di ricompensa fornisce la ricompensa scalare per le risposte generate, poiché sarebbe impossibile che gli esseri umani attribuissero un punteggio a ogni output durante RL.

Cosa fa la penalità di divergenza KL nel RLHF basato su PPO?

La penalità KL per token rispetto alla politica originale (di riferimento) scoraggia il modello dal cambiare il suo comportamento in modo troppo drastico mentre insegue la ricompensa.

Qual è il ruolo della rete del valore (critica) nel PPO?

Il PPO è un metodo attore-critico; la rete del valore stima la ricompensa attesa, consentendo stime dei vantaggi (spesso tramite GAE) che riducono la varianza.

Cosa rappresenta il "vantaggio" nel PPO?

Il vantaggio misura quanto è stata migliore (o peggiore) l’azione scelta rispetto alla stima del valore, indicando alla politica quali azioni rafforzare.