Vergelijken
Cijfers worden voortdurend naast elkaar gelegd. Dit jaar tegenover vorig jaar, deze afdeling tegenover die afdeling, ons ziekenhuis tegenover het landelijk gemiddelde. En bijna altijd wordt daar meteen een conclusie aan verbonden. Terwijl de vraag die daarvoor komt vaak wordt overgeslagen: mag je die twee getallen eigenlijk wel vergelijken?
In deze aflevering ontleedt Jeroen Buisman twee voorbeelden. Een verzuimcijfer dat stijgt terwijl er net beleid is gestart om het terug te dringen, en twee afdelingen met een verschillend percentage heropnames. In beide gevallen kloppen de cijfers, is de vergelijking toegestaan, en is de conclusie die eruit getrokken wordt toch fout.
Verder komt aan bod wanneer een vergelijking wel kan en wanneer niet, wat je moet doen als je echt wilt weten of iets werkt, en welke vragen je zou moeten stellen: als maker van het rapport, en als manager die zo'n vergelijking voorgelegd krijgt.
Transcript
Om te beginnen wil ik mijn excuses aanbieden. Het is een tijdje stil geweest. Door de vakantie en door drukte in het algemeen is deze aflevering flink later uitgekomen dan ik van plan was. Dank voor het geduld, en fijn dat je weer luistert.
Ik wil het deze keer over het vergelijken van cijfers hebben. Want er worden voortdurend cijfers naast elkaar gelegd; sterker nog, dat moet ook wel, want een cijfer zonder context zegt helemaal niets. Wat vergelijken we? Dit jaar tegenover vorig jaar. Deze afdeling tegenover die afdeling. Ons ziekenhuis tegenover het landelijk gemiddelde. En bijna altijd wordt daar meteen een conclusie aan verbonden.
Terwijl de vraag die je eigenlijk moet stellen niet gesteld wordt: mag je die twee getallen eigenlijk wel vergelijken?
Welkom bij Data met impact. De podcast over de zin en onzin van data, mensen en techniek. Ik ben Jeroen Buisman, en met InfoReports help ik organisaties in het maatschappelijk domein om grip te krijgen op hun informatie.
Laat ik beginnen met een voorbeeld.
Een organisatie kijkt naar het ziekteverzuim. In jaar één was dat vier procent. In jaar twee is het zeven procent. Dat is een flinke stijging.
Tot zover is er op zich niets aan de hand. Die twee getallen mag je naast elkaar leggen, en de conclusie is dat het verzuim in jaar twee hoger was dan in jaar één. Klaar. Dat zijn gewoon harde feiten.
Maar, er speelt meer. In jaar één is er beleid gestart om het verzuim terug te dringen. Er is een verzuimcoach aangesteld, leidinggevenden hebben een training gehad, er zijn afspraken gemaakt over hoe snel je belt als iemand zich ziek meldt. Van alles. Daar is geld en tijd in gegaan.
En dan is de logische vraag: werkt dat beleid eigenlijk?
Als iemand dan sec naar die twee getallen kijkt dan is de conclusie: nee, natuurlijk niet, want het verzuim is gestegen van vier naar zeven procent. Dat is ruim de helft erbij. Jammer van de tijd die er in is gestoken.
Maar dat is een conclusie die je natuurlijk niet mag trekken.
Want sta eens stil bij wat je eigenlijk zou moeten weten om die vraag, “werkt het beleid?”, te beantwoorden.
Je wilt weten wat het beleid heeft opgeleverd. Dus je wilt de wereld mét beleid vergelijken met de wereld zónder beleid. Hoeveel verzuim was er geweest in jaar twee als die verzuimcoach er nooit was gekomen?
Nou, dat getal heb je dus niet. En het bijzondere is: dat is geen kwestie van beter meten of van een betere rapportage bouwen. Dat getal bestaat niet. Er is maar één jaar twee geweest, en daarin was dat beleid er. Die andere versie van jaar twee, zonder beleid, is nooit gebeurd.
Dus wat doet iedereen? Die pakt het enige andere getal dat er wel is, namelijk jaar één, en gebruikt dat als vergelijking. Alsof jaar één laat zien hoe jaar twee eruit had gezien zonder beleid.
Maar, dat klopt alleen als er verder niets veranderd is tussen die twee jaren. Laten we eens kijken of dat zo is.
Stel dat er in jaar twee een flinke griepgolf door het land ging. Dan stijgt het verzuim overal, bij organisaties met en zonder beleid. Dat heeft helemaal niets met die verzuimcoach te maken, en je kan leidinggevenden trainen tot je er bij neervalt, maar daarmee hou je een griepgolf niet tegen.
Of stel dat er mensen nieuw zijn aangenomen, en een deel is weggegaan. Dat doet misschien wel iets voor de gemiddelde leeftijd. Daarmee verandert je hele populatie, en daarmee je verwachte verzuimcijfer, zonder dat er iemand anders met zijn gezondheid is omgegaan.
Wat ook kan, is dat er twee mensen langdurig zijn uitgevallen door iets wat helemaal buiten het werk lag. Het gebeurt. In een organisatie of afdeling van honderd man is dat meteen twee procent. Twee individuele gevallen, en je jaarcijfer staat op zijn kop.
En laten we het eens van een andere kant bekijken. Stel dat het verzuim zonder dat beleid tien procent zou zijn geweest, door die griepgolf en die twee langdurig zieken. Dan heeft het beleid drie procentpunt verschil gemaakt, en is het een doorslaand succes.
In het ene geval heeft het beleid niets gedaan, in het andere geval heeft het drie procentpunt gescheeld. Aan die twee getallen zie je het verschil tussen die twee situaties niet. In allebei de gevallen zie je precies hetzelfde staan: vier procent, en daarna zeven.
Terug naar de vraag: werkt ons beleid? Het antwoord dat je krijgt gaat over iets anders, namelijk: was het verzuim hoger dan vorig jaar? Dat is een andere vraag. En omdat het antwoord op de ene vraag wordt gebruikt om de andere te beantwoorden, ligt er een conclusie op tafel die er niet in zit.
Ok, dat was een vergelijking in de tijd: dezelfde organisatie, twee verschillende jaren. Er is nog een soort vergelijking, en die gaat op een vergelijkbare manier mis. Twee groepen, op hetzelfde moment.
Neem twee afdelingen in een ziekenhuis, allebei met een percentage heropnames. Bij de een is dat, ik verzin maar wat, vijf procent, bij de ander negen. Dat staat zo op een dashboard, netjes naast elkaar, en de vraag komt vanzelf: waarom doet die tweede afdeling het zoveel slechter?
Nou, ook hier: die twee getallen zijn waarschijnlijk qua berekening prima. Er is niets mis mee. Alleen zitten er onder dat verschil minstens drie verklaringen, en het getal kan ze niet uit elkaar houden.
De eerste is de patiënt. Doet die ene afdeling vooral planbare ingrepen bij mensen die verder gezond zijn, en krijgt de andere de complexe gevallen en de spoed? Dan is het volstrekt logisch dat er bij die tweede meer mensen terugkomen. Dat gaat niet over slechte zorg, dat komt door verschil in samenstelling van de patiëntenpopulatie. Sterker nog, als die twee afdelingen hetzelfde percentage zouden hebben, zou je je pas echt zorgen moeten maken over die eerste afdeling.
De tweede is de registratie. Wat is eigenlijk de definitie van “heropname”, en werkt die wel gelijk door voor beide afdelingen? Wanneer telt een heropname mee? Binnen dertig dagen? Ook als iemand terugkomt voor iets wat helemaal los staat van de vorige opname? Ook als hij op een andere afdeling wordt opgenomen?
En daar zit een addertje. Stel dat de patiënten van die ene afdeling bij een heropname ergens anders in het ziekenhuis terechtkomen, en dat ze bij de andere afdeling gewoon terugkomen waar ze vandaan kwamen. Als je dan sec de heropnames op die afdeling zelf telt, ga je de mist in. Bij de eerste afdeling verdwijnen ze uit het cijfer, terwijl ze wel degelijk hebben plaatsgevonden.
Wat ik hiermee wil zeggen is dat de definitie van een cijfer, én hoe de processen er uit zien in een organisatie, ook invloed kunnen hebben. En dat zie je aan het cijfer zelf niet terug.
De derde is het absolute aantal van de populatie. Als die eerste afdeling er tweehonderd per jaar doet en de tweede vijfentwintig, dan betekent negen procent bij die tweede afdeling iets heel anders. Dat zijn twee patiënten. Was er eentje niet teruggekomen, dan had er vijf procent gestaan en was er op het oog niets aan de hand geweest. Bij kleine aantallen schiet een percentage alle kanten op, en één geval verschil maakt het beeld compleet anders.
Drie verklaringen bij hetzelfde verschil, en ze hebben volstrekt verschillende consequenties. Bij de eerste is er niets aan de hand. Bij de tweede moet je uitzoeken of die definitie bij beide afdelingen hetzelfde uitpakt. En bij de derde moet je stoppen met op dat percentage sturen. En welke van de drie het is, kun je aan dat ene getal niet zien.
Nu wil ik vooral niet het idee wekken dat je nooit meer iets mag vergelijken. Wat ik vooral wil is dat je cijfers niet klakkeloos aanneemt, en jezelf blijft afvragen: past mijn vraag bij het antwoord wat ik hier krijg?
Het onderscheid dat helpt, is het volgende. Er zijn vragen waarbij je alleen wilt beschrijven wat er gebeurd is. Heel feitelijk. En er zijn vragen waarbij je wilt weten waaróm iets gebeurd is, of iets werkt, of wie het beter doet.
Voor het eerste soort vraag is een vergelijking vaak prima. Was het verzuim hoger dan vorig jaar? Ja. Zijn er meer patiënten met een heropname? Ja. Zolang de definitie niet is veranderd en de registratie op dezelfde manier is gedaan (die voorbehouden moet je dan nog wel maken), kun je die vraag gewoon beantwoorden.
Voor het tweede soort vraag ligt het compleet anders. Want, zodra je een oorzaak wilt aanwijzen, of een oordeel wilt vellen over wie het beter doet, dan heb je meer nodig dan het kale cijfer. Dan moet je gaan weten wat de achtergronden bij dat cijfer zijn, wat er wel is meegeteld, en wat niet, en wat de onderliggende samenstelling is. Dan moet je ineens gaan kijken naar de mensen die in dat cijfer zitten.
Dus de vraag die je jezelf moet stellen is niet of de cijfers kloppen. Die kloppen meestal wel. De vraag is of ze de vraag kunnen beantwoorden die je stelt. En eigenlijk zou je moeten beginnen met deze vraag te beantwoorden: wat maakt dat ik deze cijfers wél betrouwbaar kan vergelijken?
En wat nou als je dat dus niet kan doen? Dan wordt het lastiger.
Als je echt wilt weten of een maatregel werkt, heb je eigenlijk een wetenschappelijke meetmethode nodig. Een groep die de maatregel wel kreeg en een groep die hem niet kreeg. Een verwachting die je vooraf uitspreekt, zodat je achteraf kunt zien of het uitkwam.
Eigenlijk: als je achteraf wilt kunnen beoordelen of iets gewerkt heeft, moet je dat vaak vooraf inrichten. Achteraf is het niet meer te repareren. De werkelijkheid zonder die maatregel bestaat niet meer, en die krijg je ook niet terug.
Een tweede manier is een vergelijking met een extern normcijfer. Hoe doen wij het ten opzichte van vergelijkbare organisaties? Dat kan helpen, al loop je daar tegen hetzelfde probleem aan: zijn die organisaties wel vergelijkbaar met de jouwe, qua patiënten en qua registratie?
En er is een derde mogelijkheid, die je alleen niet direct iets geeft waar je wat mee kan. Namelijk: je behandelt het cijfer als een aanleiding om iets uit te zoeken, en niet als een uitspraak op zichzelf. Het verzuim is gestegen. Dat weten we. Nu gaan we uitzoeken hoe dat komt, en daar hebben we meer voor nodig dan alleen dit getal. Dat vraagt om analyses en duiding.
In dat licht wil ik het ook hebben over de rol van de BI-afdeling.
Als er in een organisatie beleid wordt bedacht, zit de BI-afdeling daar meestal niet bij. Die hoort er pas van als het beleid bij wijze van spreken een jaar loopt en iemand om de cijfers vraagt om het beleid te monitoren. Op dat moment is de vraag eigenlijk al niet meer goed te beantwoorden.
Terwijl juist bij de start van zo’n traject het moment is waarop de BI-afdeling een belangrijke rol had kunnen spelen. Iemand die aan tafel zit als het beleid bedacht wordt, kan zeggen: als jullie straks willen weten of dit werkt, dan moeten we nu iets afspreken over hoe we dat gaan meten. Welke groep vergelijken we? Wat verwachten we dat er gebeurt? Waar gaan we op meten, en vanaf wanneer?
Dat is even werk aan het begin, en het scheelt een jaar later een discussie waar niemand uit komt.
Dus wat ik BI-afdelingen zou willen meegeven: ga aan die tafel zitten. Zorg dat je uitgenodigd wordt. Wacht niet tot je de vraag krijgt. Als je hoort dat er iets bedacht wordt waar straks een cijfer over moet komen, meld je dan. Soms moet je gewoon je plek opeisen.
Maar dat kan een BI-afdeling niet alleen. De organisatie moet die plek ook geven.
Dat betekent dat, als organisatie, je de mensen die de informatie moeten leveren erbij haalt op het moment dat je iets bedenkt, en niet pas als je een rapportage wilt. Een wijziging in een werkproces of een applicatie bepaalt wat er straks nog te meten valt. Wie daar pas achteraf van hoort, mag de gevolgen opruimen.
En het betekent ook iets over hoe je met cijfers omgaat als ze er eenmaal liggen. Een verschil in een percentage is een startpunt voor een gesprek. Wie het gebruikt als oordeel over een afdeling, krijgt vanzelf afdelingen die hun registratie gaan aanpassen in plaats van hun werk.
Ik sluit af met twee korte lijstjes.
Als je een rapportage maakt en je legt twee getallen naast elkaar, vraag jezelf dan af: gaat het over dezelfde groep? Is de definitie in beide gevallen hetzelfde? Is er in de tussentijd iets veranderd in de registratie of in het werkproces? Zijn de aantallen groot genoeg om een percentage betekenis te geven? En wordt hier een beschrijvende vraag gesteld, of een vraag naar een oorzaak? Oftewel: wat wil ik vergelijken, en kan dat wel op deze manier?
En als je manager bent en er wordt je een vergelijking voorgelegd, vraag dan: wat vergelijken we hier precies? Wat zou er nog meer kunnen meespelen? Als dit cijfer anders was geweest, wat hadden we dan besloten? En: kan dit cijfer de vraag beantwoorden die ik eigenlijk stel?
Die laatste vraag is de belangrijkste. Want een cijfer dat klopt is nog geen antwoord op je vraag.
Twee getallen naast elkaar leggen is zo gebeurd. Iedereen kan het, en het ziet er heel overtuigend uit. Maar of je het mág, is een andere vraag, en die beantwoorden kost meer moeite.
Dus de volgende keer dat iemand je een vergelijking laat zien, is de eerste vraag niet welk getal hoger is. De eerste vraag is wat je wilde weten, en of dit de manier is om daar achter te komen.
Want onthoud: een goed antwoord begint altijd met een betere vraag.
Bedankt voor het luisteren. Vond je deze aflevering iets om over door te denken? Deel hem dan met iemand die regelmatig cijfers naast elkaar legt. En wil je weten hoe wij bij InfoReports naar dit soort vraagstukken kijken? Kijk dan op inforeports.nl. Tot de volgende keer.