CMD + K

Kapittel 10Begreper & formler · Introduksjon til forsterkningslæring
Referanseside · Kapittel 10

Begreper & referanser

Alle nøkkelbegrepene, formlene og referansene fra Introduksjon til forsterkningslæring, samlet på én side. Bruk denne som oppslag når du leser, øver flashcards eller tar quiz.

Øv med flashcards15 kort fra dette kapittelet

Begreper

Sentrale begreper fra kapittelet med korte definisjoner.

01Agent og miljø

Agenten velger handlinger, mens miljøet svarer med neste tilstand og belønning.

02Tilstand

Informasjonen agenten bruker som beskrivelse av situasjonen på et bestemt tidspunkt.

03Handling

Et valg agenten kan gjøre i en tilstand.

04Belønning

Et numerisk signal fra miljøet som vurderer den siste overgangen, ikke nødvendigvis hele løsningen.

05Policy

En regel eller sannsynlighetsfordeling som bestemmer hvilken handling agenten velger i hver tilstand.

06Verdifunksjon

Forventet framtidig retur fra en tilstand eller et tilstand–handling-par under en bestemt policy.

07Q-learning

En off-policy metode som lærer handlingsverdier mot den beste estimerte fortsettelsen.

08Utforskning–utnyttelse

Avveiingen mellom å prøve usikre handlinger og å velge handlingen som hittil ser best ut.

Formler

Hver formel: hva den heter, hvordan den ser ut, og hva symbolene betyr.

diskontert-retur

Diskontert retur

Returen summerer fremtidige belønninger og demper fjerne belønninger med .

R_(t+k+1)belønning k steg fram i tid
γdiskonteringsfaktor mellom 0 og 1
G_tretur fra tidspunkt t
tilstandsverdi

Tilstandsverdi

Verdien er forventet retur fra tilstand når policyen følges.

πpolicy
stilstand
G_tframtidig retur
V^π(s)forventet retur fra s under π
bellman-optimalitet

Bellmans optimalitetsligning

Optimal handlingsverdi består av umiddelbar belønning og beste diskonterte fortsettelse.

Q*(s,a)optimal handlingsverdi
R_(t+1)umiddelbar belønning
γdiskonteringsfaktor
S_(t+1)neste tilstand
q-learning-oppdatering

Q-learning-oppdatering

Q-learning flytter den gamle verdien mot et mål som bruker belønningen og beste verdi i neste tilstand.

αlæringsrate
robservert belønning
γdiskonteringsfaktor
Q(s,a)gammel handlingsverdi
epsilon-greedy

Epsilon-greedy policy

Policyen velger oftest beste kjente handling, men utforsker tilfeldig med sannsynlighet .

εsannsynlighet for tilfeldig utforskning
Amengden mulige handlinger
π(a|s)sannsynlighet for handling a i tilstand s

Kodesnutter

Kodesnutter fra kapittelet, vist literal.

kap10-ett-q-steg

Én Q-learning-oppdatering

python
import numpy as np rng = np.random.default_rng(4172)Q = rng.normal(0, 0.05, size=(4, 3))s, a, neste_s = 1, 2, 3r = 1.0alpha = 0.25gamma = 0.90 gammel = Q[s, a]maal = r + gamma * np.max(Q[neste_s])td_feil = maal - gammelQ[s, a] = gammel + alpha * td_feil print(f"gammel={gammel:.3f}")print(f"mål={maal:.3f}, TD-feil={td_feil:.3f}")print(f"ny={Q[s, a]:.3f}")

Oppdateringen flytter bare det besøkte tilstand–handling-paret en andel α mot Bellman-målet. De andre Q-verdiene står uendret i dette steget.

kap10-seedet-grid

Seedet epsilon-greedy Q-learning i et linjemiljø

python
import numpy as np rng = np.random.default_rng(4172)Q = np.zeros((5, 2))  # handling 0=venstre, 1=høyrealpha, gamma, epsilon = 0.25, 0.95, 0.20 for episode in range(300):    s = 0    while s != 4:        if rng.random() < epsilon:            a = rng.integers(2)        else:            beste = np.flatnonzero(Q[s] == Q[s].max())            a = rng.choice(beste)        neste = max(0, s - 1) if a == 0 else min(4, s + 1)        reward = 1.0 if neste == 4 else -0.02        maal = reward if neste == 4 else reward + gamma * Q[neste].max()        Q[s, a] += alpha * (maal - Q[s, a])        s = neste print(np.round(Q, 3))print("grådig policy:", Q.argmax(axis=1))

Det lille miljøet viser hele samspillet mellom exploration, overgang, reward, bootstrappet mål og gradvis forbedring av policyen.

Læringsmål

Hva du skal kunne etter å ha lest kapittelet.

  1. 01Modellere et enkelt problem med agent, miljø, tilstander, handlinger og belønninger
  2. 02Beregne diskontert retur og skille umiddelbar belønning fra langsiktig verdi
  3. 03Tolke tilstands- og handlingsverdier og bruke Bellman-prinsippet
  4. 04Utføre én Q-learning-oppdatering med korrekt håndtering av terminal tilstand
  5. 05Forklare exploration–exploitation og beregne handlingssannsynligheter under epsilon-greedy
  6. 06Evaluere en lært policy separat fra den utforskende treningspolicyen