Begreper & referanser
Alle nøkkelbegrepene, formlene og referansene fra Lineær regresjon og gradient descent, samlet på én side. Bruk denne som oppslag når du leser, øver flashcards eller tar quiz.
Begreper
Sentrale begreper fra kapittelet med korte definisjoner.
En modell som beregner prediksjonen som en vektet sum av inputvariablene og et biasledd.
En verdi, som en vekt eller et biasledd, som lærealgoritmen tilpasser fra treningsdata.
Et konstantledd som lar den lineære prediksjonen forskyves uten at inputverdiene endres.
En funksjon som gir et tall på hvor dårlige modellens prediksjoner er for et datasett eller eksempel.
En iterativ metode som flytter parameterne i motsatt retning av tapsgradienten.
Steglengden som bestemmer hvor kraftig parameterne endres i hver gradientoppdatering.
Et mindre utvalg av treningsobservasjoner som brukes til å anslå gradienten i ett treningssteg.
Formler
Hver formel: hva den heter, hvordan den ser ut, og hva symbolene betyr.
Lineær regresjonsmodell
Modellen predikerer en vektet sum av featureverdiene pluss et konstantledd.
Mean squared error
MSE straffer store residualer ekstra fordi hvert avvik kvadreres.
Gradienten til MSE
Gradienten uttrykker hvordan MSE endrer seg når hver vekt justeres.
Gradient descent-oppdatering
Parameterne flyttes mot lavere tap med læringsrate .
Mean absolute error
MAE gir lineær straff for residualer og er derfor mindre følsom for ekstreme feil enn MSE.
Forklart varians
sammenligner modellen med en baseline som alltid predikerer gjennomsnittet.
Minibatch-gradient
En minibatch estimerer gradienten fra et delsett i stedet for hele treningssettet.
Kodesnutter
Kodesnutter fra kapittelet, vist literal.
Prediksjon, residualer, MSE og MAE
import numpy as np X = np.array([[1.0], [2.0], [3.0], [4.0]])y = np.array([2.8, 5.1, 7.2, 8.9])w = np.array([2.0])b = 1.0 y_hat = X @ w + bresidual = y - y_hatmse = np.mean(residual ** 2)mae = np.mean(np.abs(residual)) print("Prediksjoner:", y_hat)print(f"MSE={mse:.3f}, MAE={mae:.3f}")Snutten skiller mellom prediksjon, residual og aggregert tap. Samme residualer straffes kvadratisk i MSE og lineært i MAE.
Lineær regresjon trent med gradient descent
import numpy as np rng = np.random.default_rng(4172)X = rng.uniform(-2, 2, size=80)y = 1.5 * X - 0.7 + rng.normal(scale=0.25, size=80) w, b, eta = 0.0, 0.0, 0.08for epoke in range(120): y_hat = w * X + b feil = y_hat - y dw = 2 * np.mean(feil * X) db = 2 * np.mean(feil) w -= eta * dw b -= eta * db print(f"w={w:.3f}, b={b:.3f}")print("MSE:", np.mean((w * X + b - y) ** 2))Syntetiske data og støy er seedet. Løkken beregner analytiske gradienter for vekt og bias og flytter begge mot lavere MSE.
Læringsmål
Hva du skal kunne etter å ha lest kapittelet.
- 01Beregne prediksjon og residual for en lineær regresjonsmodell
- 02Sammenligne MSE, MAE og R-kvadrat og forklare hva de fremhever
- 03Utlede eller bruke MSE-gradienten i ett gradient descent-steg
- 04Diagnostisere for liten og for stor læringsrate fra et tapsforløp
- 05Forklare sammenhengen mellom batchstørrelse, parameteroppdatering og epoke