Der findes et mundheld i branchen om, at begyndere justerer algoritmen, og de erfarne justerer dataene. Det er ingen tilfældighed: meget af en maskinlæringsmodels kvalitet kommer fra, hvordan rådata omdannes til de features, modellen lærer af. En fancy algoritme på dårlige features taber næsten altid til en simpel algoritme på gode features.

I denne artikel gennemgår vi grundlæggende feature engineering: hvad det er, hvordan kategoriske variabler og skalering håndteres, hvorfor lækage er farligt, og hvorfor mindre ofte er mere. Det er en af de bedste investeringer, du kan gøre i modelkvalitet.

Begyndere justerer algoritmen; de erfarne justerer dataene. Meget af en models kvalitet kommer fra, hvordan rådata omdannes til features.

Hvad feature engineering er

Feature engineering betyder at omdanne rådata til variabler, der beskriver fænomenet på en måde, modellen kan bruge — for eksempel en ugedag eller sæson fra en dato.

Undgå lækage

Den mest almindelige fejl er at bruge en feature, der indeholder information om fremtiden eller det mål, der skal forudsiges. Det ser strålende ud i test og fejler i produktion.

Enkelhed vinder

Nogle få velvalgte features slår ofte snesevis af dårligt gennemtænkte. Start med forretningsforståelse, ikke automation.

God feature engineering er ofte den bedste investering i modelkvalitet — og den kræver domæneforståelse, ikke kun teknik.

Kategoriske variabler

Modeller forstår ikke tekstkategorier direkte. De skal kodes som tal — for eksempel one-hot-kodning eller en ordinalskala, når kategorier har en naturlig orden. Forkert kodning kan ødelægge en ellers god feature.

Skalering og normalisering

Mange algoritmer antager, at features er på samme skala. Hvis én feature er i euro og en anden i procent, dominerer den med store værdier. Skalering udjævner dette og forbedrer ofte resultatet mærkbart.

Mindre er mere

For mange features tilføjer støj og risiko for overfitting. Beskær features, der ikke tilfører værdi, og foretræk fortolkelige variabler. En simpel model, du forstår, slår ofte en kompleks, du ikke gør.

Tids- og tekstfeatures

En dato er ikke særlig nyttig for en model, som den er, men du kan udlede rige features fra den: ugedag, måned, sæson, om det er en helligdag, hvor mange dage siden forrige hændelse. Det samme gælder tekst: længde, forekomst af nøgleord eller følelsestone kan være værdifulde features. God feature engineering betyder at hjælpe modellen med at se det, et menneske ville se intuitivt.

Domæneforståelse slår automation

Automatiske feature engineering-værktøjer kan hjælpe, men de erstatter ikke en forståelse af, hvad dataene betyder i forretningen. En ekspert, der ved, at en bestemt værdi er usædvanlig, eller at to felter hænger sammen, skaber ofte bedre features end nogen algoritme. Den bedste feature engineering kommer fra at kombinere forståelse af data og domæne — ikke fra teknik alene.

Almindelige faldgruber

De fleste fejl kommer ikke fra teknologien, men fra designet. Typiske fejl er: at begynde med for stort omfang, at mangle klare mål, at ignorere mennesker og processer og at glemme vedligeholdelse lige efter lancering. At lave feature engineering lykkes, når du holder løsningen enkel, måler resultatet og korrigerer kursen hurtigt. Kompleksitet, der ikke er nødvendig, er altid en risiko.

Hvordan du måler succes

Succes kan ikke bedømmes uden en måling defineret på forhånd. Sæt en baseline, før du begynder, vælg et par klare nøgletal knyttet til forretningen, og følg dem regelmæssigt. Undgå målinger, der ser godt ud, men ikke ændrer beslutninger. En god måling svarer på spørgsmålet: gav dette arbejde reel værdi, og hvor meget? Når svaret er et tal, går samtalen fra meninger til fakta.

Sammenfatning og næste skridt

Hovedbudskabet er enkelt: begynd med et klart behov, hold løsningen håndterbar, og mål resultatet. Jag ikke efter perfektion, men efter en retning, der giver værdi og forbedres over tid. Vil du drøfte, hvordan dette gælder din egen situation, hjælper vi gerne med en kortlægning og planlægning af de første skridt.