Test og forsøg

Holdout-test i markedsføring: hvornår kan den bruges?

Attributionsmodeller – last-click, multi-touch eller regressionsbaserede – viser, hvilke kontaktpunkter der indgår i kunderejser, der ender med køb.

Hvorfor holdout-test i markedsføring?

Attributionsmodeller – last-click, multi-touch eller regressionsbaserede – viser, hvilke kontaktpunkter der indgår i kunderejser, der ender med køb. Det er korrelation: De konverterende kunder har ofte set annoncerne, men mange ville have købt alligevel.

Holdout-testen skaber det kontrafaktiske scenarie, attributionsdata aldrig kan give: En tilfældigt udvalgt del af målgruppen får ikke markedsføringen i testperioden. Forskellen i udfald mellem eksponerede og holdout-gruppen er den inkrementelle effekt – den del af salget, der ikke ville være kommet af sig selv.

Det er den eneste metode, der direkte besvarer spørgsmålet »hvad ville der være sket uden markedsføringen?«, og den giver et tal til at beslutte, om budgettet skal op, ned eller flyttes til en anden kanal.

Hvad er en holdout-test – og hvad kræver den?

En holdout-test er et kontrolleret eksperiment: Målgruppen opdeles tilfældigt i en behandlingsgruppe, der eksponeres for markedsføringen, og en holdout-gruppe, der ikke eksponeres eller eksponeres i lavere grad. Randomiseringen er central – den gør grupperne sammenlignelige, så forskellen i udfald kan tilskrives indsatsen og ikke kundesammensætningen.

Behandlingen skal være klart defineret, før testen starter: kanal, budget, frekvens, kreative elementer og periode. En test på »markedsføring generelt« kan ikke fortolkes bagefter.

Kontrolgruppen behøver ikke være helt uden markedsføring. En intensitets-holdout, hvor kontrolgruppen får reduceret budget eller lavere frekvens, er ofte nemmere at få godkendt kommercielt og måler stadig den marginale effekt af den øverste del af budgettet.

Målevinduet skal fastlægges før teststart og matche den adfærd, du vil måle. Klik og førstegangskøb viser sig inden for dage; effekter på genkøb, kundeværdi og abonnementsfornyelse kan først aflæses efter måneder.

Vælg på forhånd én måleenhed – ordrer, omsætning, nye kunder eller dækningsbidrag – og et beslutningskriterium, så resultatet ikke efterrationaliseres. Uden det dokumenterer testen kun, hvad der skete; den bliver ikke et beslutningsgrundlag.

Hvornår kan holdout-test bruges?

Målgruppen skal være stor nok til, at begge grupper kan give et brugbart resultat inden for testperioden. Jo mindre inkrementel effekt du skal kunne påvise, jo større grupper kræves der, fordi den naturlige variation i salget ellers overdøver effekten.

Eksponeringen skal kunne styres. Du skal aktivt kunne undlade at vise annoncer til en udvalgt gruppe – typisk via målgruppeudelukkelser i annonceplatformen – og kunne kontrollere, at gruppen ikke alligevel eksponeres gennem andre kanaler.

Effekten skal kunne måles inden for en periode, hvor du stadig kan handle på resultatet. En test, der først svarer om et år, er sjældent relevant for et kvartalsbudget.

Du skal kunne acceptere, at en gruppe ikke får markedsføringen. Salget, du mister i kontrolgruppen, er en omkostning ved testen og skal med i regnestykket, før du siger ja. Hvis kampagnen ikke må tabe omsætning, er der ikke tale om en test.

Der skal være en konkret beslutning på spil: Skal budgettet skaleres op, skal en kanal skæres, skal retargeting fortsætte, eller skal et nyt tiltag i luften? En holdout-test uden en efterfølgende beslutning giver ingen værdi.

Testen er også velegnet, når du skal prioritere mellem kanaler i en portefølje. Ved at køre holdout på én kanal ad gangen – eller på flere sideløbende med tilfældige grupper – kan du sammenligne inkrementelle effekter i stedet for attributionsnumre, der ikke er målt på samme grundlag.

Hvornår er holdout-test ikke egnet?

Ved små målgrupper eller nicher bliver testen enten for usikker eller for lang. Her er det mere realistisk at ændre budgetretning over tid og følge udviklingen, vel vidende at andre faktorer spiller ind.

Spillover ødelægger testen. Hvis kontrolgruppen alligevel ser kampagnen via en anden kanal, deler husstand eller enhed med behandlingsgruppen, eller hvis annoncerne skaber mund-til-mund-effekt, udvandes forskellen, og effekten underestimeres. Jo bredere mediemix, jo sværere er behandlingen at isolere.

Langsigtede brandeffekter fanges ikke i et kort målevindue. Kendskab og præference opbygges over år, så en test på få uger kan vise en beskeden effekt, mens den langsigtede effekt er større – eller omvendt. Det kræver en lang måleperiode og tålmodighed i organisationen.

Kanaler uden digital styring – massemedier, sponsoraftaler, udendørs – kan ikke opdeles tilfældigt på personniveau. Her er geo-holdout med test- og kontrolmarkeder eller switchback-design, hvor indsatsen tændes og slukkes i skift, de bedste alternativer.

Testen kan også være uegnet af kommercielle eller etiske grunde: hvis kontrolgruppen er kunder med et serviceløfte, hvis kampagnen er en prisforhøjelse varslet til alle, eller hvis forskelsbehandlingen af kunder vil blive opfattet som urimelig. Afklar med jura, om opdelingen i test- og kontrolgrupper er forenelig med jeres databehandlingsgrundlag, før testen sættes i gang.

Holdout er uegnet som efterrationalisering. Har kampagnen allerede kørt, eller er den besluttet af andre grunde, kan du ikke rekonstruere en kontrolgruppe bagefter – et før/efter-tal påvirkes af sæson, konkurrenttiltag og prisændringer og kan ikke kaldes en inkrementel effekt.

Holdout-test og attribution – brug dem sammen

Multi-touch attribution og regressionsbaserede modeller er stærke i detaljen: De fordeler kredit mellem mange berøringspunkter, viser rækkefølgen i kunderejsen og kan opdateres løbende på store datamængder. Svagheden er, at de bygger på observerede data og på antagelsen om, at berøringspunkter før et køb også har forårsaget det.

Holdout-testen leverer det kausale ankerpunkt, modellerne mangler. Praktisk betyder det: Hvis attributionsmodellen vurderer, at en kanal står for en stor del af konverteringerne, men en holdout-test viser en beskeden inkrementel effekt, skal kanalens vægt ned – og omvendt. Uden et sådant ankerpunkt optimerer du på modellens eget spejlbillede.

Arbejdsdelingen: Holdout svarer på, om indsatsen skaber meromsætning, og hvor meget. Attribution og regressionsmodeller svarer på, hvor i kunderejsen indsatsen virker, og hvordan kreditten skal fordeles, når det næste mediemix planlægges.

Kør derfor holdout med mellemrum på de kanaler, hvor budgettet er størst eller mest omdiskuteret, og brug resultatet til at kalibrere modellerne. Testen behøver ikke køre konstant – kun når der er noget at kalibrere eller en beslutning at træffe.

Holdout-test i en moden dansk e-handel

Dansk Industri estimerer i analysen »Danskernes e-commerce tracker 2025«, at danskerne handlede online for ca. 136 mia. kr. i 2025 – en stigning på 3 mia. kr. siden 2024. Omkring 81 % af danskerne handler online hver måned. »Vi er formentlig tæt på et mætningsniveau,« siger Mie Bilberg, ansvarlig for e-commerce i DI. Ifølge Dansk Industri betyder det ikke, at markedet står stille: Væksten flytter karakter – mindre jagt på nye onlinekøbere og mere kamp om oplevelse, værdi, relevans og tillid.

Mobilen er samtidig blevet den vigtigste handelskanal: 49 % af danskerne gennemførte deres seneste onlinekøb på mobilen. Det gør målingen sværere, fordi en kunde kan se en annonce på én enhed og købe på en anden – en pointe, der taler for at måle inkrementel effekt på kundeniveau frem for enhedsniveau.

At markedet er modent, betyder ikke, at det står stille. Ifølge Dansk Erhverv var Temu på rekordtid blevet den 3. mest benyttede netbutik i Danmark med omkring 20.000 pakker dagligt til danske hjem og pakkebokse – svarende til syv millioner forsendelser om året. Zalando topper fortsat danskernes hitliste over foretrukne webshops.

Konkurrencen handler i stigende grad om tillid. Mie Bilberg fra DI siger, at »relationer betyder nu næsten lige så meget som rabatter – og tilliden er kommet under pres«. I Dansk Erhvervs Temu-debat henviste Esben Grønborg Geist fra Forbrugerrådet til, at 30 ud af 38 undersøgte varer fra Temu ikke levede op til EU's regler.

For en dansk netbutik betyder det, at merinvesteringer i markedsføring i højere grad skal hentes i markedsandele og kundeværdi end i et voksende antal nye onlinekøbere. I et mættet marked er den marginale effekt af ekstra budget typisk mindre og sværere at se i de rå kanaltal – netop derfor bliver eksperimenter med kontrolgrupper et redskab til at prioritere, hvor kronerne gør mest gavn.

Dansk e-handel i 2025 – nøgletal

  • 2025Onlinehandel i Danmark — 136 mia. kr.
  • 81%Andel danskerne, der handler online hver måned
  • 49%Andel onlinekøb via mobil (seneste køb)
  • 20.000Temu’s daglige pakker til danske hjem

Beslutningsguide: Sådan vurderer du, om holdout-test kan bruges

Er målgruppen stor nok til, at en forskel mellem behandling og kontrol kan ses inden for testperioden, selv hvis effekten er beskeden? Hvis nej, skal testen skaleres op, målgruppen udvides eller et andet design vælges.

Kan du aktivt udelukke en tilfældigt udvalgt gruppe fra eksponering i alle de kanaler, testen omfatter – og kan du forhindre, at gruppen alligevel rammes via andre kanaler og enheder?

Er behandlingen entydigt defineret: kanal, budget, frekvens, kreativt materiale og testperiode? Kan den ikke beskrives i én sætning, kan resultatet ikke fortolkes.

Er målevinduet langt nok til den adfærd, du vil måle, og er måleenheden og beslutningskriteriet fastlagt, før testen starter?

Kan du kommercielt acceptere, at kontrolgruppen ikke får markedsføringen – og er det tabte salg i gruppen ført ind som en omkostning ved testen?

Er der en konkret beslutning, testen skal understøtte – skalering, nedskæring, kanalvalg eller budgetfordeling – og har beslutningstageren accepteret resultatet på forhånd?

Hvis svarene er ja, er en holdout-test den rigtige metode til at måle inkrementel effekt, og resultatet bør bruges til at kalibrere attributions- og regressionsmodellerne. Hvis ét eller flere svar er nej, er geo-holdout, switchback eller en intensitets-test med reduceret budget ofte det næstbedste alternativ.

Mere fra Test og forsøg

Test og forsøg

A/B-test: hvor mange visninger er nok?

Digst kalder en A/B-test en metode til at teste to versioner af fx en knap, en hjemmeside eller en app for at se, hvilken løsning der bedst løser brugernes behov eller udfordring.

Test og forsøg

Sådan undgår du fejlkilder i markedseksperimenter

En fejlkilde er en årsag til, at der opstår fejl under udarbejdelsen af en markedsanalyse – fx en for lav svarprocent. Det er definitionen i Systimes lærebog i afsætning.