CMD + K

Kapittel 2Begreper & formler · Lineær regresjon og gradient descent
Referanseside · Kapittel 2

Begreper & referanser

Alle nøkkelbegrepene, formlene og referansene fra Lineær regresjon og gradient descent, samlet på én side. Bruk denne som oppslag når du leser, øver flashcards eller tar quiz.

Øv med flashcards17 kort fra dette kapittelet

Begreper

Sentrale begreper fra kapittelet med korte definisjoner.

01Lineær modell

En modell som beregner prediksjonen som en vektet sum av inputvariablene og et biasledd.

02Modellparameter

En verdi, som en vekt eller et biasledd, som lærealgoritmen tilpasser fra treningsdata.

03Biasledd

Et konstantledd som lar den lineære prediksjonen forskyves uten at inputverdiene endres.

04Residual

Forskjellen mellom observert målverdi og modellens prediksjon.

05Tapsfunksjon

En funksjon som gir et tall på hvor dårlige modellens prediksjoner er for et datasett eller eksempel.

06Gradient descent

En iterativ metode som flytter parameterne i motsatt retning av tapsgradienten.

07Læringsrate

Steglengden som bestemmer hvor kraftig parameterne endres i hver gradientoppdatering.

08Minibatch

Et mindre utvalg av treningsobservasjoner som brukes til å anslå gradienten i ett treningssteg.

Formler

Hver formel: hva den heter, hvordan den ser ut, og hva symbolene betyr.

lineaer-regresjon

Lineær regresjonsmodell

Modellen predikerer en vektet sum av featureverdiene pluss et konstantledd.

xfeaturevektor
wvektor av lærte vekter
bbiasledd
\hat{y}prediksjon
mse

Mean squared error

MSE straffer store residualer ekstra fordi hvert avvik kvadreres.

nantall observasjoner
y_iobservert målverdi
\hat{y}_imodellens prediksjon
mse-gradient

Gradienten til MSE

Gradienten uttrykker hvordan MSE endrer seg når hver vekt justeres.

Xdatamatrise
wvektvektor
ymålvektor
Jtapsfunksjon
gradient-oppdatering

Gradient descent-oppdatering

Parameterne flyttes mot lavere tap med læringsrate .

ttreningssteg
\etalæringsrate
\nabla_w Jtapsgradient med hensyn på vektene
mae

Mean absolute error

MAE gir lineær straff for residualer og er derfor mindre følsom for ekstreme feil enn MSE.

y_i-\hat{y}_iresidual for observasjon i
nantall observasjoner
r-kvadrat

Forklart varians

sammenligner modellen med en baseline som alltid predikerer gjennomsnittet.

R^2score relativt til gjennomsnittsbaselinen
\bar{y}gjennomsnittlig målverdi
minibatch-gradient

Minibatch-gradient

En minibatch estimerer gradienten fra et delsett i stedet for hele treningssettet.

Bminibatch med observasjonsindekser
|B|batchstørrelse
\ell_itap for observasjon i

Kodesnutter

Kodesnutter fra kapittelet, vist literal.

prediksjon-og-tap

Prediksjon, residualer, MSE og MAE

python
import numpy as np X = np.array([[1.0], [2.0], [3.0], [4.0]])y = np.array([2.8, 5.1, 7.2, 8.9])w = np.array([2.0])b = 1.0 y_hat = X @ w + bresidual = y - y_hatmse = np.mean(residual ** 2)mae = np.mean(np.abs(residual)) print("Prediksjoner:", y_hat)print(f"MSE={mse:.3f}, MAE={mae:.3f}")

Snutten skiller mellom prediksjon, residual og aggregert tap. Samme residualer straffes kvadratisk i MSE og lineært i MAE.

gradient-descent-fra-bunnen

Lineær regresjon trent med gradient descent

python
import numpy as np rng = np.random.default_rng(4172)X = rng.uniform(-2, 2, size=80)y = 1.5 * X - 0.7 + rng.normal(scale=0.25, size=80) w, b, eta = 0.0, 0.0, 0.08for epoke in range(120):    y_hat = w * X + b    feil = y_hat - y    dw = 2 * np.mean(feil * X)    db = 2 * np.mean(feil)    w -= eta * dw    b -= eta * db print(f"w={w:.3f}, b={b:.3f}")print("MSE:", np.mean((w * X + b - y) ** 2))

Syntetiske data og støy er seedet. Løkken beregner analytiske gradienter for vekt og bias og flytter begge mot lavere MSE.

Læringsmål

Hva du skal kunne etter å ha lest kapittelet.

  1. 01Beregne prediksjon og residual for en lineær regresjonsmodell
  2. 02Sammenligne MSE, MAE og R-kvadrat og forklare hva de fremhever
  3. 03Utlede eller bruke MSE-gradienten i ett gradient descent-steg
  4. 04Diagnostisere for liten og for stor læringsrate fra et tapsforløp
  5. 05Forklare sammenhengen mellom batchstørrelse, parameteroppdatering og epoke