Det finnes et ordtak i bransjen om at nybegynnere justerer algoritmen og de erfarne justerer dataene. Det er ingen tilfeldighet: mye av en maskinlæringsmodells kvalitet kommer fra hvordan rådata gjøres om til de features modellen lærer av. En flott algoritme på dårlige features taper nesten alltid mot en enkel algoritme på gode features.

I denne artikkelen går vi gjennom grunnleggende feature engineering: hva det er, hvordan kategoriske variabler og skalering håndteres, hvorfor lekkasje er farlig og hvorfor mindre ofte er mer. Det er en av de beste investeringene du kan gjøre i modellkvalitet.

Nybegynnere justerer algoritmen; de erfarne justerer dataene. Mye av en modells kvalitet kommer fra hvordan rådata gjøres om til features.

Hva feature engineering er

Feature engineering betyr å gjøre rådata om til variabler som beskriver fenomenet på en måte modellen kan bruke — for eksempel en ukedag eller sesong fra en dato.

Unngå lekkasje

Den vanligste feilen er å bruke en feature som inneholder informasjon om fremtiden eller målet som skal forutsies. Det ser strålende ut i test og feiler i produksjon.

Enkelhet vinner

Noen få velvalgte features slår ofte titalls dårlig gjennomtenkte. Start med forretningsforståelse, ikke automatisering.

God feature engineering er ofte den beste investeringen i modellkvalitet — og den krever domeneforståelse, ikke bare teknikk.

Kategoriske variabler

Modeller forstår ikke tekstkategorier direkte. De må kodes som tall — for eksempel one-hot-koding, eller en ordinalskala når kategorier har en naturlig rekkefølge. Feil koding kan ødelegge en ellers god feature.

Skalering og normalisering

Mange algoritmer antar at features er på samme skala. Hvis en feature er i euro og en annen i prosent, dominerer den med store verdier. Skalering jevner ut dette og forbedrer ofte resultatet merkbart.

Mindre er mer

For mange features legger til støy og risiko for overtilpasning. Luk features som ikke tilfører verdi og foretrekk tolkbare variabler. En enkel modell du forstår slår ofte en kompleks du ikke gjør.

Tids- og tekstfeatures

En dato er ikke særlig nyttig for en modell som den er, men du kan utlede rike features fra den: ukedag, måned, sesong, om det er en helligdag, hvor mange dager siden forrige hendelse. Det samme gjelder tekst: lengde, forekomst av nøkkelord eller følelsestone kan være verdifulle features. God feature engineering betyr å hjelpe modellen å se det et menneske ville se intuitivt.

Domeneforståelse slår automatisering

Automatiske feature engineering-verktøy kan hjelpe, men de erstatter ikke en forståelse av hva dataene betyr i forretningen. En ekspert som vet at en viss verdi er uvanlig, eller at to felt henger sammen, lager ofte bedre features enn noen algoritme. Den beste feature engineeringen kommer fra å kombinere forståelse av data og domene — ikke fra teknikk alene.

Vanlige fallgruver

De fleste feil kommer ikke fra teknologien, men fra designet. Typiske feil er: å starte med for stort omfang, å mangle tydelige mål, å ignorere mennesker og prosesser og å glemme vedlikehold rett etter lansering. Å gjøre feature engineering lykkes når du holder løsningen enkel, måler resultatet og korrigerer kursen raskt. Kompleksitet som ikke trengs er alltid en risiko.

Hvordan du måler suksess

Suksess kan ikke bedømmes uten en måling definert på forhånd. Sett en baslinje før du starter, velg et par tydelige nøkkeltall knyttet til forretningen og følg dem regelmessig. Unngå målinger som ser bra ut, men ikke endrer beslutninger. En god måling svarer på spørsmålet: ga dette arbeidet reell verdi, og hvor mye? Når svaret er et tall, går samtalen fra meninger til fakta.

Oppsummering og neste steg

Hovedbudskapet er enkelt: start med et tydelig behov, hold løsningen håndterbar og mål resultatet. Ikke jag etter perfeksjon, men etter en retning som gir verdi og forbedres over tid. Vil du diskutere hvordan dette gjelder din egen situasjon, hjelper vi gjerne med en kartlegging og planlegging av de første stegene.