Policy gradient-metoder: REINFORCE
Policy gradient-teoremet, REINFORCE-algoritmen, subtraktion af baseline, reduktion af varians.
Policy gradient-metoder: REINFORCE er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.
Værdibaseret kontra politikbaseret RL
Nogle RL-metoder lærer handlingernes værdi og handler derefter grådigt. Politikgradientmetoder lærer i stedet politikken direkte: en funktion, der giver sandsynligheder for handlinger. Det håndterer kontinuerte handlinger og stokastiske politikker naturligt.
Politikken pi(a|s)
En parametriseret politik pi(a|s, theta) afbilder en tilstand til en sandsynlighedsfordeling over handlinger med parametrene theta (et neuralt netværk). Træningen justerer theta, så handlinger, der giver større belønning, foretrækkes.
class Policy(nn.Module):
def __init__(self, obs_dim, n_actions):
super().__init__()
self.net = nn.Sequential(
nn.Linear(obs_dim, 128), nn.ReLU(),
nn.Linear(128, n_actions)
)
def forward(self, s):
return torch.softmax(self.net(s), dim=-1)Udtagning af handlinger
Fordi politikken er en fordeling, udtager du en handling i stedet for at vælge den største værdi. Udtagning giver udforskning og gør politikken stokastisk.
probs = policy(state)
dist = torch.distributions.Categorical(probs)
action = dist.sample()
log_prob = dist.log_prob(action)Udrulning af et forløb
En episode (forløb) er sekvensen af tilstande, handlinger og belønninger fra start til slut. Du indsamler et helt forløb ved at handle i miljøet, indtil det afsluttes.
states, actions, rewards, log_probs = [], [], [], []
state, _ = env.reset()
done = False
while not done:
probs = policy(torch.tensor(state).float())
dist = torch.distributions.Categorical(probs)
a = dist.sample()
state, r, term, trunc, _ = env.step(a.item())
rewards.append(r); log_probs.append(dist.log_prob(a))
done = term or truncDet diskonterede afkast G_t
Afkastet G_t er den samlede fremtidige belønning fra tidspunkt t, diskonteret med gamma, så belønninger tættere på nutiden tæller mere. Det fortæller, hvor gode de handlinger, der blev udført fra trin t og frem, viste sig at være.
def returns(rewards, gamma=0.99):
G, out = 0, []
for r in reversed(rewards):
G = r + gamma * G
out.insert(0, G)
return torch.tensor(out)REINFORCE-målfunktionen
REINFORCE udfører gradientstigning på det forventede afkast. Intuitivt: Øg sandsynligheden for handlinger, der førte til et højt afkast, og mindsk sandsynligheden for dem, der førte til et lavt afkast. Hver handling vægtes med G_t.
Politikgradienten
Tabsfunktionen er -sum(log_prob * G_t). Det negative fortegn omdanner gradientstigning til gradientnedstigning, så optimeringsalgoritmen maksimerer afkastet. Handlinger med højt afkast får deres log-sandsynlighed øget.
G = returns(rewards)
loss = -torch.sum(torch.stack(log_probs) * G)Opdatering af politikken
Tilbagepropagér, og udfør et optimeringstrin som normalt. Én opdatering bruger et helt forløb, hvorefter du kasserer det (REINFORCE bruger kun data fra den aktuelle politik).
optimizer.zero_grad()
loss.backward()
optimizer.step()Problemet med høj varians
Den grundlæggende REINFORCE er notorisk ustabil og har høj varians: Afkastet varierer voldsomt mellem episoder, så gradientestimaterne bliver støjfyldte, og læringen bliver langsom og uforudsigelig.
Referenceværdi til reduktion af varians
Hvis du trækker en referenceværdi (f.eks. det gennemsnitlige afkast) fra G_t, reduceres variansen uden at skævvride gradienten. Vi belønner handlinger for at være bedre end forventet, ikke blot for at have et positivt afkast.
baseline = G.mean()
advantage = G - baseline
loss = -torch.sum(torch.stack(log_probs) * advantage)Hvorfor REINFORCE er vigtigt
REINFORCE er grundlaget for alle metoder med politikgradienter. Dets svagheder, høj varians og ineffektiv brug af data, motiverer aktør-kritiker- og PPO-metoderne, som du ser bagefter.
Hurtigt tjek
Afprøv din forståelse af politikgradienter.
Opsamling: REINFORCE
Du har lært at parametrisere en politik pi(a|s,theta), køre forløb igennem, beregne det diskonterede afkast G_t og udføre gradientstigning med tabsfunktionen -sum(log_prob * G_t). Du har set REINFORCE's høje varians, og hvordan en referenceværdi reducerer den.
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 53
- Lektioner
- 225
Ofte stillede spørgsmål
Er lektionen “Policy gradient-metoder: REINFORCE” gratis?
Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Policy gradient-metoder: REINFORCE”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Policy gradient-metoder: REINFORCE”?
Policy gradient-teoremet, REINFORCE-algoritmen, subtraktion af baseline, reduktion af varians. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Lær AI med Python?
Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.
Hvor lang tid tager lektionen “Policy gradient-metoder: REINFORCE”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?
Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Policy gradient-metoder: REINFORCE
- Actor-critic-metoder (A2C)
- Proximal Policy Optimization (PPO)
- Tilpassede Gymnasium-miljøer