blond kvinde, pige, dejlig, papir, tom, skærm, hold, isoleret baggrund, tom side, tom, a4, ren, smil
Foto af Miller_Eszter på Pixabay

Test og forsøg

A/B-test: hvor mange visninger er nok?

Digst kalder en A/B-test en metode til at teste to versioner af fx en knap, en hjemmeside eller en app for at se, hvilken løsning der bedst løser brugernes behov eller udfordring.

Hvad tæller som en visning i en A/B-test?

Digst kalder en A/B-test en metode til at teste to versioner af fx en knap, en hjemmeside eller en app for at se, hvilken løsning der bedst løser brugernes behov eller udfordring. Digst beskriver to måder: en gruppe får version A og en anden version B, eller én samlet gruppe tester begge versioner.

Searchmind beskriver samme opdeling i digitale tests: kontrolgruppen får originalen, variantgruppen en anden udgave. Trafikken fordeles ofte 50/50, så 50 % får originalen og 50 % varianten. Spørger du, hvor mange visninger der er nok, er det derfor antallet pr. variant – ikke den samlede trafik – der afgør, om testen kan konkludere noget. Ved 50/50 får hver variant halvdelen af visningerne.

En visning er en lejlighed, hvor en bruger i målgruppen faktisk får vist en af de to versioner. Digitale A/B-tests opsættes typisk via tredjepartsværktøjer, der integreres på hjemmesiden med et script i sidens head-sektion, skriver Searchmind. Værktøjerne er bl.a. Google Optimize (gratis) samt VWO, Optimizely og AB Tasty (betalte).

Der findes ikke et fast antal visninger

Ingen af kilderne opgiver et konkret tal for, hvor mange visninger en A/B-test kræver. Antallet afhænger af testens formål, af succesmålet du måler på, og af hvor stor en forskel du forventer mellem versionerne.

Digst understreger, at du før testen skal være skarp på formål og fokus. Når en bruger møder to versioner, kan mange ting springe i øjnene – om teksten er forståelig, om flowet er intuitivt, eller noget tredje. Læg dig derfor fast på testens formål og på, hvilke konkrete variationer du vil teste, så evalueringen bagefter bliver lettere.

Finally ser det samme krav fra webshop-vinklen: start med at analysere data og finde problemet i fx Google Analytics eller Hotjar, og formuler en klar hypotese i formatet »Fordi vi ser [data/observation], tror vi, at ved at ændre [variabel], vil vi opnå [målbart resultat]«. Finallys eksempel er et stort drop-off i kurven på mobil, hvor hypotesen er, at en tydeligere fragtpris under totalbeløbet vil øge antallet af gennemførte køb. Uden et defineret succesmål findes der ikke et antal visninger, der er »nok«.

Jo mindre forskel, jo flere visninger kræver testen

Digst skriver direkte, at forskellene mellem de versioner, du designer, skal være betydelige nok til at have reel indflydelse på den valgte succesmåling. Er ændringen så subtil, at du næsten ikke forventer bevægelse i succesmålet, kræver det tilsvarende meget mere trafik at skelne en eventuel effekt fra den tilfældige variation mellem to grupper.

Finally peger på den anden fælde: test kun én variabel. Ændrer du overskrift, billede og knaptekst på én gang, ved du ikke, hvilken ændring der skabte resultatet. Blander du flere ændringer sammen, bliver den målte forskel også sværere at tolke, uanset hvor mange visninger testen får.

Digst tilføjer en kontrol, der handler om afviklingen, ikke trafikmængden: viser du to versioner til samme brugergruppe, bør nogle se version A først og andre version B først, så rækkefølgen ikke skævvrider resultatet.

Stop ikke på mavefornemmelsen – brug signifikans og varighed

Finally har »bestem statistisk signifikans og varighed« som et selvstændigt trin, når testen opsættes. Varigheden fastlægges på forhånd – ikke ved at kigge på tallene undervejs og stoppe, når forskellen ser overbevisende ud.

Digst bakker op: modstå fristelsen til at bryde ind, mens testen løber, medmindre du kan se, at noget går helt galt. Vær tålmodig og lad testen køre som planlagt; det giver de mest pålidelige resultater.

Searchmind beskriver, hvornår man kan konkludere: når der er nok data, kan statistiske modeller og analyser vise, hvilken af de to varianter der performer bedst for et givent konverteringsmål. Her skal mavefornemmelsen ud af ligningen – uden A/B-tests bliver ændringer på hjemmesiden let en subjektiv vurdering af, hvad der ser bedst ud, mens det i sidste ende er målgruppen, der afgør, hvad der performer bedst.

Praktisk tjekliste: har du nok visninger?

  1. Definer formål og succesmål. Digstvær skarp på formål og fokus, og læg dig fast på, hvilke konkrete variationer du vil teste. 2) Find problemet i dataene. Finally: brug analyseværktøjer som Google Analytics eller Hotjar og se, hvor brugerne falder fra. 3) Formuler hypotesen som »Fordi vi ser [data], tror vi, at ved at ændre [variabel], vil vi opnå [målbart resultat]« (Finally).
  2. Vælg én variabel at teste (Finally). 5) Design variationerne, så forskellene er betydelige nok til at påvirke det valgte succesmål, og lav en spørgeguide med (Digst). 6) Fordel trafikken – Searchmind beskriver 50/50 som den typiske fordeling mellem kontrol og variant. 7) Bestem statistisk signifikans og varighed på forhånd (Finally).
  3. Lad testen køre som planlagt uden at bryde ind (Digst). 9) Vurder til sidst, om der er nok data: Searchmind peger på, at konklusionen om, hvilken variant der performer bedst, trækkes via statistiske modeller og analyser, når dataene er indsamlet. Er svaret nej på trin 1 og 4 – uklart formål eller flere ændrede variabler – er flere visninger ikke løsningen.

Praktisk tjekliste: har du nok visninger?

  • 1) Definer formål og succesmålVær skarp på formål og fokus, og læg dig fast på, hvilke konkrete variationer du vil teste.
  • 2) Find problemet i dataeneBrug analyseværktøjer som Google Analytics eller Hotjar og se, hvor brugerne falder fra.
  • 3) Formuler hypotesen»Fordi vi ser [data], tror vi, at ved at ændre [variabel], vil vi opnå [målbart resultat]«
  • 4) Vælg én variabel at testeUndgå at ændre flere elementer samtidig for at sikre tydelig måling.
  • 5) Design betydelige forskelleSørg for, at ændringerne er store nok til at påvirke det valgte succesmål.
  • 6) Fordel trafikkenTypisk 50/50 mellem kontrol- og variantgruppe.
  • 7) Bestem signifikans og varighed på forhåndLad testen køre uden at bryde ind undervejs.
  • 8) Lad testen køre som planlagtModstå fristelsen til at stoppe tidligt baseret på mavefornemmelse.
  • 9) Vurder data efter testenKonklusion trækkes via statistiske modeller, når der er nok data.

Når trafikken er lav: suppler med kvalitative metoder

Digst anbefaler at kombinere metoder. I en simpel form kan en A/B-test være et greb under et kvalitativt interview, fx sammen med en tænke-højt-test, hvor brugeren med en overstregningstusch markerer, hvad der er forståeligt, og hvad der ikke er. I et større setup kan brugeren tilgå to versioner af den digitale løsning og rangere deres værdi, fx via et spørgeskema.

Det giver retning og forståelse, før du tester digitalt igen: Digst understreger, at du skal hjælpe brugeren på vej ved at forklare, hvad de sidder med foran sig, og hvad scenariet for fremtidig brug er.

Pointen er, at en digital test kun kan konkludere statistisk, når der er nok data (Searchmind). Er målgruppen for lille, eller er ændringen for subtil til at give en målbar forskel, giver kvalitative metoder svar på, hvorfor brugerne foretrækker den ene løsning frem for den anden – det kan en underbelyst digital test ikke.

Efter testen: beslut ud fra data – ikke mavefornemmelse

Resultatet skal munde ud i en beslutning. Searchmind beskriver det sådan: afhængigt af testens resultat implementerer man varianten på hjemmesiden – eller lader være, hvis originalen har performet bedre. Formålet med at teste er netop at sikre data-drevne beslutninger om ændringer på hjemmesiden frem for en subjektiv vurdering af, hvad der ser bedst ud (Searchmind).

Digst har et selvstændigt »efter«-trin: sæt tid af til at sammenfatte resultaterne. Har testen kørt med kvalitative interviews, kan du sammenholde udsagn for at finde ud af, hvorfor brugerne bedre kunne lide den ene løsning frem for den anden. Har den kørt digitalt eller via spørgeskema, kan du registrere, hvad brugerne reagerede på, og eventuelt hvor mange klik eller flows de har gennemført.

Finally ser hver test som et led i en række: målet er ikke én magisk løsning, men systematisk at teste, lære og forbedre, så hver test giver dybere indsigt i kundernes adfærd og kan bruges til at træffe bedre forretningsbeslutninger. Viser en test ikke en effekt, er det også et resultat – du har fået afvist en hypotese og kan bruge læringen i den næste test.

Mere fra Test og forsøg

Test og forsøg

Holdout-test i markedsføring: hvornår kan den bruges?

Attributionsmodeller – last-click, multi-touch eller regressionsbaserede – viser, hvilke kontaktpunkter der indgår i kunderejser, der ender med køb.

Test og forsøg

Sådan undgår du fejlkilder i markedseksperimenter

En fejlkilde er en årsag til, at der opstår fejl under udarbejdelsen af en markedsanalyse – fx en for lav svarprocent. Det er definitionen i Systimes lærebog i afsætning.