Begreper & referanser
Alle nøkkelbegrepene, formlene og referansene fra Fra problem til trenbart datasett, samlet på én side. Bruk denne som oppslag når du leser, øver flashcards eller tar quiz.
Begreper
Sentrale begreper fra kapittelet med korte definisjoner.
Læring fra eksempler der hvert input har en kjent målverdi som modellen skal lære å predikere.
Læring uten kjente målverdier, der algoritmen leter etter struktur eller avvik i inputdataene.
Den observerte klassen eller målverdien som en veiledet modell trenes mot.
Datadelen som brukes til å tilpasse modellparametere og preprocessing-transformasjoner.
En separat datadel som brukes til modellvalg og hyperparameterjustering under utvikling.
En urørt datadel som brukes én gang til en avsluttende vurdering av valgt arbeidsflyt.
At informasjon som ikke ville vært tilgjengelig ved reell prediksjon, påvirker trening eller modellvalg.
Formler
Hver formel: hva den heter, hvordan den ser ut, og hva symbolene betyr.
Standardisering
Standardisering sentrerer en feature og uttrykker verdien i antall standardavvik fra middelverdien.
Min–maks-skalering
Min–maks-skalering flytter treningsområdets minste verdi til 0 og største verdi til 1.
Andel i treningssettet
Med treningsandel legges omtrent av de observasjonene i treningssettet.
One-hot-koding
En kategoriverdi erstattes av en indikatorvektor slik at kategoriene ikke får en falsk tallrekkefølge.
Kodesnutter
Kodesnutter fra kapittelet, vist literal.
En reproduserbar trenings-, validerings- og testsplitt
import numpy as np rng = np.random.default_rng(4172)X = rng.normal(size=(1_000, 3))y = 2 * X[:, 0] - X[:, 1] + rng.normal(scale=0.4, size=1_000) indeks = rng.permutation(len(X))train, valid, test = np.split(indeks, [600, 800]) print(X[train].shape, X[valid].shape, X[test].shape)print("Ingen overlapp:", len(set(train) & set(test)) == 0)En lokal generator med fast seed gjør både syntetiske data og splitting reproduserbar. Indeksene er disjunkte, og testdelen holdes utenfor utviklingssløyfen.
Standardiser uten å lekke teststatistikk
import numpy as np X_train = np.array([[40., 2.], [55., 3.], [70., 4.], [85., 5.]])X_test = np.array([[100., 6.], [115., 7.]]) middel = X_train.mean(axis=0)std = X_train.std(axis=0) Z_train = (X_train - middel) / stdZ_test = (X_test - middel) / std print("Treningsmiddel etter skalering:", Z_train.mean(axis=0))print("Test transformert med treningsstatistikk:", Z_test)Middel og standardavvik tilpasses bare på treningsdata. Testdata transformeres med de samme tallene og får derfor ikke kunstig middelverdi null.
Læringsmål
Hva du skal kunne etter å ha lest kapittelet.
- 01Formulere et maskinlæringsproblem med tydelig analyseenhet, prediksjonstidspunkt, features og label
- 02Velge en splittestrategi som respekterer tid og grupperte observasjoner
- 03Skille rollene til trenings-, validerings- og testsett og oppdage datalekkasje
- 04Tilpasse skalering, imputering og kategorikoding kun på treningsdata
- 05Begrunne feature engineering ut fra tilgjengelighet ved reell prediksjon