CMD + K

Kapittel 1Begreper & formler · Fra problem til trenbart datasett
Referanseside · Kapittel 1

Begreper & referanser

Alle nøkkelbegrepene, formlene og referansene fra Fra problem til trenbart datasett, samlet på én side. Bruk denne som oppslag når du leser, øver flashcards eller tar quiz.

Øv med flashcards14 kort fra dette kapittelet

Begreper

Sentrale begreper fra kapittelet med korte definisjoner.

01Veiledet læring

Læring fra eksempler der hvert input har en kjent målverdi som modellen skal lære å predikere.

02Uveiledet læring

Læring uten kjente målverdier, der algoritmen leter etter struktur eller avvik i inputdataene.

03Feature

En målbar inputvariabel modellen bruker for å lage en prediksjon.

04Label

Den observerte klassen eller målverdien som en veiledet modell trenes mot.

05Treningssett

Datadelen som brukes til å tilpasse modellparametere og preprocessing-transformasjoner.

06Valideringssett

En separat datadel som brukes til modellvalg og hyperparameterjustering under utvikling.

07Testsett

En urørt datadel som brukes én gang til en avsluttende vurdering av valgt arbeidsflyt.

08Datalekkasje

At informasjon som ikke ville vært tilgjengelig ved reell prediksjon, påvirker trening eller modellvalg.

Formler

Hver formel: hva den heter, hvordan den ser ut, og hva symbolene betyr.

standardisering

Standardisering

Standardisering sentrerer en feature og uttrykker verdien i antall standardavvik fra middelverdien.

xopprinnelig featureverdi
\mumiddelverdi estimert fra treningssettet
\sigmastandardavvik estimert fra treningssettet
min-maks-skalering

Min–maks-skalering

Min–maks-skalering flytter treningsområdets minste verdi til 0 og største verdi til 1.

x_minminste treningsverdi
x_maxstørste treningsverdi
x'skalert verdi
treningsandel

Andel i treningssettet

Med treningsandel legges omtrent av de observasjonene i treningssettet.

rvalgt treningsandel
ntotalt antall observasjoner
n_trainantall treningsobservasjoner
one-hot-koding

One-hot-koding

En kategoriverdi erstattes av en indikatorvektor slik at kategoriene ikke får en falsk tallrekkefølge.

kkategorien til observasjonen
e_kindikatorvektor med én aktiv posisjon

Kodesnutter

Kodesnutter fra kapittelet, vist literal.

seedet-datasplitt

En reproduserbar trenings-, validerings- og testsplitt

python
import numpy as np rng = np.random.default_rng(4172)X = rng.normal(size=(1_000, 3))y = 2 * X[:, 0] - X[:, 1] + rng.normal(scale=0.4, size=1_000) indeks = rng.permutation(len(X))train, valid, test = np.split(indeks, [600, 800]) print(X[train].shape, X[valid].shape, X[test].shape)print("Ingen overlapp:", len(set(train) & set(test)) == 0)

En lokal generator med fast seed gjør både syntetiske data og splitting reproduserbar. Indeksene er disjunkte, og testdelen holdes utenfor utviklingssløyfen.

fit-kun-paa-trening

Standardiser uten å lekke teststatistikk

python
import numpy as np X_train = np.array([[40., 2.], [55., 3.], [70., 4.], [85., 5.]])X_test = np.array([[100., 6.], [115., 7.]]) middel = X_train.mean(axis=0)std = X_train.std(axis=0) Z_train = (X_train - middel) / stdZ_test = (X_test - middel) / std print("Treningsmiddel etter skalering:", Z_train.mean(axis=0))print("Test transformert med treningsstatistikk:", Z_test)

Middel og standardavvik tilpasses bare på treningsdata. Testdata transformeres med de samme tallene og får derfor ikke kunstig middelverdi null.

Læringsmål

Hva du skal kunne etter å ha lest kapittelet.

  1. 01Formulere et maskinlæringsproblem med tydelig analyseenhet, prediksjonstidspunkt, features og label
  2. 02Velge en splittestrategi som respekterer tid og grupperte observasjoner
  3. 03Skille rollene til trenings-, validerings- og testsett og oppdage datalekkasje
  4. 04Tilpasse skalering, imputering og kategorikoding kun på treningsdata
  5. 05Begrunne feature engineering ut fra tilgjengelighet ved reell prediksjon