
Interbedömaröverensstämmelse är ett mått på hur konsekventa mätningarna är mellan två eller flera observatörer, så kallade bedömare. Medicinska forskare använder sig till exempel ofta av en grupp läkare för att observera och klassificera resultaten av ett behandlingsexperiment. Att mäta överensstämmelsen mellan observatörerna är viktigt, eftersom man vill kunna vara säker på att de effekter som syns beror på själva experimentet och inte på stora skillnader mellan bedömarna. Den vanligaste statistiken för att mäta interbedömaröverensstämmelse kallas kappa.
Beräkna den procentuella överensstämmelsen genom att dividera antalet observationer där bedömarna agree med det totala antalet observationer. Tänk dig till exempel ett experiment där 100 patienter får en behandling mot astma. Två läkare ombeds klassificera patienterna i två kategorier: kontrollerade (ja) eller inte kontrollerade (nej) astmasymptom. Resultatet kan se ut så här:
I exemplet blir den procentuella överensstämmelsen (Pa) lika med antalet observationer där bedömarna agree (70 + 15) dividerat med totala antalet observationer (100), alltså 85 procent (0,85). Detta värde används i täljaren i den slutliga formeln.
En del av den observerade överensstämmelsen beror enbart på slumpen. Därför behöver vi räkna ut hur stor överensstämmelse som skulle uppstå om bedömningarna gjordes helt slumpmässigt.
Sammanställ först hur ofta respektive läkare svarade ja respektive nej:
Om bedömningarna var helt slumpmässiga skulle sannolikheten för att båda svarar ja bli 0,80 × 0,75 = 0,60 (60 procent), och sannolikheten för att båda svarar nej skulle bli 0,20 × 0,25 = 0,05 (5 procent).
Den totala sannolikheten för överensstämmelse enbart på grund av slumpen (Pe) blir summan av dessa värden: 0,60 + 0,05 = 0,65 (65 procent). Detta värde används både i täljaren och i nämnaren i den slutliga formeln.
Beräkna kappa med följande formel:
k = (Pa − Pe) / (1 − Pe)
I vårt exempel blir resultatet:
k = (0,85 − 0,65) / (1 − 0,65) = 0,20 / 0,35 ≈ 0,57
Utvärdera kappa för att avgöra hur stark interbedömaröverensstämmelsen är. En vanlig tumregel är att värden över 0,80 är utmärkta och värden över 0,60 är goda. Allt under 0,60 betraktas som mindre än optimal överensstämmelse.
I vårt exempel ligger kappa på cirka 0,57, vilket ligger strax under gränsen för god interbedömarreliabilitet. Studiens resultat bör därför tolkas med detta i åtanke.
För mer precis tolkning används ofta Landis och Kochs välkända skala: värden mellan 0,41 och 0,60 motsvarar måttlig överensstämmelse, 0,61–0,80 betydande överensstämmelse och över 0,81 nästan perfekt överensstämmelse.
Vill du utvärdera överensstämmelsen mellan fler än två bedömare används i stället så kallad Fleiss kappa. Det är en betydligt mer komplicerad beräkning som bör utföras med hjälp av statistisk programvara.
Hälsa och Sjukdom © https://www.sjukdom.online