CMD + K

Tilbake til Introduksjon til maskinlæring

TDT4172 • Q-learning-grid

Følg én Q-verdi fra erfaring til policy

Mål: regn Q-learning-oppdateringen steg for steg, skill exploration fra utnytting og les den grådige policyen som vokser fram.

Steg 1 · utforsking
startmål +1felle −1agent
M
VEGG
VEGG
VEGG
VEGG
X
S
1 / 18Utforsking valgte opp. Q(s,a) oppdateres til -0.016.
Q-oppdateringenutforsket

Q((5,1), ↑)0,000 + 0,40 × (-0,040 + 0,92 × 0,000 0,000) = -0,016

Reward r

-0,040

max Q(s′,a′)

0,000

Bellman-mål

-0,040

Ny Q-verdi

-0,016

Lær mer

Q-tabellen estimerer forventet diskontert retur for hvert tilstand–handling-par. Off-policy betyr at målet bruker den beste neste Q-verdien, selv når atferden fortsatt utforsker med ε-greedy.

En terminal overgang bootstrapper ikke videre: målet er bare rewarden. I større eller kontinuerlige tilstandsrom erstattes ofte tabellen av en funksjonsapproksimator, men oppdateringsideen er den samme.