CMD + K
Tilbake til Introduksjon til maskinlæring
TDT4172 • Q-learning-grid
Følg én Q-verdi fra erfaring til policy
Mål: regn Q-learning-oppdateringen steg for steg, skill exploration fra utnytting og les den grådige policyen som vokser fram.
Steg 1 · utforsking
startmål +1felle −1agent
→
→
→
→
M
↑
VEGG
↑
↑
↑
↑
VEGG
↑
VEGG
↑
↑
VEGG
↑
X
↑
S
→
↑
↑
↑
1 / 18Utforsking valgte opp. Q(s,a) oppdateres til -0.016.
Q-oppdateringenutforsket
Q((5,1), ↑) ← 0,000 + 0,40 × (-0,040 + 0,92 × 0,000 − 0,000) = -0,016
Reward r
-0,040
max Q(s′,a′)
0,000
Bellman-mål
-0,040
Ny Q-verdi
-0,016
Relaterte kapitler