De vragen en discussies die bij Kennismaking met onderzoeksmethoden en statistiek horen: verbanden, tegenstellingen en denkfouten uit de stof. 33 vragen, waarvan 30 met een antwoord dat vrij te lezen is.
Een theorie is een samenhangende verzameling uitspraken over hoe variabelen zich in het algemeen tot elkaar verhouden. Die is te algemeen om te meten. Een hypothese is de concrete uitkomst die je in één bepaald onderzoek verwacht als de theorie klopt. Uit één theorie volgen dus veel hypothesen, en elk onderzoek toetst er één.
Neem de theorie dat geeuwen de hersenen afkoelt. Daaruit volgt de voorspelling dat iemand met een koud kompres op zijn voorhoofd minder meegeeuwt met filmpjes dan iemand met een warm kompres. Het aantal keren geeuwen zijn de data. Die data bewijzen de theorie niet: ze steunen haar of ondermijnen haar, en het oordeel valt pas als je alle studies bij elkaar legt.
Bijstellen hoort bij de theorie-data-cyclus, dus op zichzelf is er niets mis mee. Het wordt anders zodra elke bijstelling een extra uitzondering is die alleen dít ene resultaat opvangt. Dan schuift de theorie op richting een verklaring die niets meer uitsluit, en precies daar mikt spaarzaamheid op. De vraag die jij beantwoordt: welke uitkomst zou deze theorie, ná de bijstelling, nog kunnen laten zakken?
Bij de beschikbaarheidsheuristiek telt hoe makkelijk iets in je opkomt. Opvallende, recente en emotionele gebeurtenissen komen sneller boven, dus schat je hun aantal te hoog in. Je eigen mening speelt daarbij geen rol.
Bij confirmatiebias telt juist wél wat je al vindt: je zoekt, ziet en onthoudt vooral bewijs dat je overtuiging bevestigt, en tegenbewijs redeneer je weg. Zelfs de vraag die je stelt lokt de bevestiging al uit.
Kort gezegd gaat de eerste over gemak van herinneren en de tweede over de richting van je overtuiging. Vraag je bij een casus dus af of iemand iets overschat omdat het in het nieuws was, of omdat het hem goed uitkomt.
Dat is precies de bias blind spot: de meeste mensen vinden zichzelf minder bevooroordeeld dan de gemiddelde ander, en dat kan niet voor iedereen kloppen. Nadenken over jezelf helpt hier dus weinig. Wat wel werkt ligt buiten jezelf: een vergelijkingsgroep, openbare waarnemingen en iemand die je tegenspreekt. Welke van je eigen overtuigingen heb jij ooit actief proberen te weerleggen in plaats van te onderbouwen?
Ga in vaste volgorde te werk. Tel eerst de variabelen, kijk dan of ze gemeten of gemanipuleerd zijn, en let pas daarna op het werkwoord. Eén gemeten variabele hoort bij een frequentieclaim, twee gemeten variabelen bij een associatieclaim, en een gemanipuleerde variabele met een gemeten uitkomst maakt een causale claim mogelijk.
Signaalwoorden helpen: hangt samen met, vaker bij, voorspelt. Bij veroorzaakt, verhoogt, leidt tot of zorgt voor gaat het om causaliteit. Let op dat ook een voorzichtig “kan bijdragen aan” causaal is. Het werkwoord beslist dus niet alleen, want de kop en de studie eronder kunnen uit elkaar lopen.
De redenering is dat een kunstmatige situatie met een sluitende conclusie meer waard is dan een levensechte studie met vijf alternatieve verklaringen. Je koopt dus zekerheid over het mechanisme met onzekerheid over het bereik. Dat bereik is daarna een volgende vraag, voor een volgende studie. Alleen: wie stelt die vraag, en wat doe je in de tussentijd met de conclusie?
Misleiding mag alleen als het onderzoek zonder haar niet uitvoerbaar is en de opbrengst haar rechtvaardigt. Over pijn of hevige emotionele belasting misleid je nooit. Er zijn twee vormen: misleiding door weglating, waarbij je niet vertelt wat je precies meet, en misleiding door onjuiste informatie, zoals de nepschokken bij Milgram.
De nabespreking is daarna geen formaliteit. De deelnemer hoort wat het onderzoek werkelijk inhield, waarom de misleiding nodig was en wat er met zijn gegevens gebeurt. Het doel is dat onjuiste indrukken worden weggenomen, zodat niemand met een verkeerd beeld van zichzelf naar huis gaat.
Niet de onderzoeker alleen, en dat is precies waarom een ethische toetsingscommissie vooraf meekijkt, met iemand van buiten de wetenschap erbij. Bij Tuskegee en Milgram zat de fout niet in de opzet maar in die afweging. Toch blijft zij een oordeel en geen som. Waar leg jij de grens tussen spanning die een deelnemer mag ervaren en spanning die kennis niet waard is?
Betrouwbaarheid gaat over consistentie: wijst de meting steeds hetzelfde aan? Validiteit gaat over de vraag of zij aanwijst wat zij belooft. Een weegschaal die er vijf kilo naast zit geeft elke ochtend hetzelfde getal: perfect betrouwbaar en toch onjuist. Hoofdomtrek meten om intelligentie vast te stellen levert bij herhaling dezelfde uitkomst en zegt niets over intelligentie.
Andersom kan niet. Een meting die bij elke afname iets anders aanwijst kan het begrip niet trouw weergeven, want welke van die uitkomsten zou dan de goede zijn? Betrouwbaarheid is daarmee een voorwaarde voor validiteit, geen bewijs ervan.
Alfa meet of de vragen van een schaal onderling samenhangen, en dat lukt het best bij vragen die elkaar herhalen. Maar inhoudsvaliditeit eist juist dat de meting alle onderdelen van de conceptuele definitie dekt: bij studiestress dus piekeren, uitstellen én lichamelijke spanning. Een keurige alfa kan zo een veel te smalle schaal verbergen. Waaraan zou jij bij een vragenlijst zien welke van de twee je voor je hebt?
Kies in twee stappen. Vraag eerst wat het meetniveau toelaat: bij nominaal kan alleen de modus, vanaf ordinaal mag de mediaan, en het gemiddelde pas vanaf intervalniveau, want optellen veronderstelt gelijke afstanden.
Kijk daarna naar de vorm van de verdeling. Bij scheefheid of duidelijke uitschieters meld je de mediaan, ook al is het gemiddelde toegestaan. Het gemiddelde telt elke score met zijn volle gewicht en wordt naar de staart getrokken; de mediaan telt alleen posities en blijft daardoor staan. Bij reistijden van 15, 20, 20, 25, 30 en 90 minuten is de mediaan 22,5 en het gemiddelde ruim 33.
Aan wat de variabele meet, niet aan wat er in de kolom staat. Codes bij een nominale variabele zijn labels en geen hoeveelheden, dus een gemiddelde van 1,8 verwijst nergens naar. Het meetniveau kies je in SPSS zelf, en het programma controleert die keuze niet. Welke andere uitkomsten in je uitvoer worden daarmee stilletjes onzin?
Omdat het gemiddelde waar je vanaf rekent uit die steekproef zelf komt. De scores liggen daardoor zo dicht mogelijk om hun eigen gemiddelde heen: rond elk ander getal zouden de afwijkingen groter uitvallen. De kwadratensom is dus systematisch te klein als schatting voor de populatie. Delen door n min 1 maakt de uitkomst iets groter en herstelt die onderschatting, en het getal dat je daarbij kwijtraakt heet een vrijheidsgraad.
Bij vijf cijfers met een kwadratensom van 36 scheelt dat merkbaar: delen door 5 geeft 7,2 en delen door 4 geeft 9. Hoe groter de steekproef, hoe kleiner dat verschil wordt.
Het rekenen blijft kloppen: z is gewoon de afstand tot het gemiddelde in standaardafwijkingen, en standaardiseren verandert de vorm van de verdeling niet. Wat sneuvelt is de vertaling naar een percentiel, want die leunt op de klokvorm. Bij reistijd of inkomen klopt de 68 procent niet meer. Wat zegt een z van +2 dan nog over iemands plaats in de groep?
Vraag je af wie het probleem veroorzaakt. Bij observer bias kleurt de waarnemer de codering: bij twijfelgevallen kiest hij de kant van zijn hypothese. Bij een observer effect verandert de waarnemer het gedrag van de ander, zoals bij het paard Clever Hans, dat reageerde op kleine bewegingen van de mensen om hem heen. Bij reactiviteit verandert de deelnemer zichzelf, omdat hij weet dat er naar hem gekeken wordt.
De maatregelen volgen die driedeling. Tegen de eerste twee helpen een codeboek, een blinde beoordelaar en twee onafhankelijke waarnemers. Tegen reactiviteit helpen onopvallend observeren, wachten tot deelnemers gewend zijn, of sporen van gedrag meten in plaats van gedrag zelf.
Precies de ruil die achter elke antwoordschaal zit. Zonder middenoptie verdwijnt op het hek zitten, maar de neutrale deelnemer krijgt nu een score die zijn houding niet weergeeft. Je ruilt dus een antwoordtendens in voor een probleem met de constructvaliditeit. Hoe zou je in de data terugzien welke van die twee je hier hebt gekozen?
Omdat omvang en manier van trekken twee verschillende dingen doen. Wie de verkeerde mensen benadert, benadert ze bij tienduizend antwoorden nog steeds verkeerd. De manier van trekken bepaalt de externe validiteit; de omvang maakt de schatting alleen preciezer, dus de foutmarge smaller, en dat hoort bij de statistische validiteit.
In 1936 voorspelde een grote tijdschriftenquête in de Verenigde Staten de verkeerde winnaar van de presidentsverkiezingen, ondanks miljoenen antwoordkaarten: de adressenlijst bevatte vooral welgestelde huishoudens en alleen wie wilde stuurde de kaart terug. Vraag dus eerst hoe deze mensen erin zijn gekomen, en pas daarna hoeveel het er zijn.
Dat weet je niet, en dat is de prijs die deze opzet bewust betaalt. Het experiment laat zien dát het mechanisme bij deze deelnemers werkt; of het ook bij andere groepen optreedt is een volgende vraag voor een volgende studie. Alleen gebeurt dat vervolgonderzoek meestal opnieuw bij aangemelde eerstejaars. Vanaf wanneer wordt dat een probleem voor de conclusie?
Omdat r alleen meet hoe goed één rechte lijn past. Bij een kromlijnig verband, bijvoorbeeld een omgekeerde U, komt r rond nul uit terwijl er wel degelijk een patroon zit: studenten die heel weinig en studenten die heel veel koffie drinken presteren allebei slechter dan de middengroep.
Er is nog een oorzaak. Bij beperkt bereik heeft een variabele zo weinig spreiding dat geen enkel verband zich meer kan laten zien; meet je alleen bij studenten die tussen de 7 en de 8 staan, dan zakt r richting nul. Bekijk daarom altijd eerst het spreidingsdiagram en pas daarna het getal.
Een moderator beantwoordt de vraag voor wie of wanneer een verband het sterkst geldt. Dat blijft beschrijving, want beide variabelen zijn nog altijd alleen gemeten: het richtingsprobleem en het derde-variabeleprobleem staan onaangetast overeind. Toch klinkt een verband dat bij de ene groep wel en bij de andere niet optreedt als een aanwijzing over de oorzaak. Wanneer is dat terecht?
Verklaarde variantie is het kwadraat van de correlatie en zegt welk deel van de verschillen in de ene variabele samenhangt met de verschillen in de andere. Bij een r van 0,75 is dat 0,5625, dus ongeveer 56 procent; de overige 44 procent hangt samen met van alles wat niet is gemeten.
Kwadrateren is streng, en daar zit de tegenvaller. Een correlatie van 0,20 klinkt als iets, maar levert vier procent op. Let ook op het woord zelf: verklaarde variantie is een rekenterm en geen oorzaak. Beide variabelen zijn alleen gemeten, dus studietijd maakt geen 56 procent van het cijfer.
De afstanden tussen de scores. Een extreem hoge waarde wordt gewoon het hoogste rangnummer, en dat is winst bij een scheve verdeling of bij ordinale gegevens. Maar op interval- of rationiveau zit juist in die afstanden de informatie waarvoor je hebt gemeten. Wanneer is die ene uitschieter ruis die je mag afvlakken, en wanneer is hij het interessantste geval in je bestand?
Random assignment verdeelt de deelnemers met het lot over de condities, zodat de groepen vooraf gemiddeld gelijk zijn op alles wat je niet hebt gemeten. Het beschermt tegen groepen die al systematisch verschilden en dient de interne validiteit: zonder deze stap draagt geen enkele causale uitspraak.
Random sampling trekt de deelnemers met het lot uit de populatie. Het beschermt tegen een steekproef die niet op de populatie lijkt en dient de externe validiteit: zonder deze stap mag je niet generaliseren. Toewijzen gebeurt binnen de studie, trekken loopt van buiten naar binnen. Veel experimenten hebben het eerste keurig geregeld en het tweede niet.
Na die verdeling drukt het effect even zwaar op beide condities, dus het kan het verschil tussen die condities niet meer verklaren. Verdwenen is het niet: het zit nog in de scores, als variatie die niets met je manipulatie te maken heeft. Wat doet die extra variatie met de kans dat je een verschil dat er werkelijk is, ook terugvindt?
Omdat twee heel verschillende dingen dezelfde stilte opleveren. Denk aan een radio: het verschil tussen de groepen is het signaal, de variatie binnen de groepen is de ruis. Een zwak signaal ontstaat door een zwakke manipulatie, een ongevoelige meting of een plafond- of bodemeffect, waarbij alle scores tegen het maximum of het minimum aan zitten. Te veel ruis komt van meetfout, individuele verschillen en situatieruis.
Loop daarom een vaste rij vragen langs. Was er een manipulatiecheck? Lagen de condities ver genoeg uit elkaar? Hoeveel deelnemers deden mee, en dus hoeveel power had de studie? En hoe breed is het betrouwbaarheidsinterval rond het gevonden verschil?
Het placebo-effect is geen meetfout: de verbetering is echt, alleen is de oorzaak de verwachting en niet de behandeling. Voor de wetenschappelijke vraag telt dat onderscheid, want de studie wil weten wat de behandeling zélf toevoegt. Voor de patiënt telt vooral dat hij opknapt. Welke van die twee vragen beantwoordt een dubbelblind placebogecontroleerd onderzoek eigenlijk?
De standaardafwijking zegt hoe ver losse mensen van het gemiddelde af liggen: zij beschrijft je groep. De standaardfout van het gemiddelde zegt hoe ver steekproefgemiddelden van het populatiegemiddelde af liggen: zij beschrijft de precisie van je schatting. Je berekent haar door de standaardafwijking te delen door de wortel uit n.
Bij 64 studenten met een standaardafwijking van 16 minuten is de standaardfout dus 16 gedeeld door 8, ofwel 2 minuten. Staan beide als antwoordoptie naast elkaar, vraag je dan af of het over spreiding tussen personen gaat of over de precisie van een schatting. De standaardfout is altijd het kleinste getal van de twee.
Niet dat 95 procent van de studenten ertussen valt, en ook niet dat er 95 procent kans is dat het populatiegemiddelde in dít interval ligt, want die parameter is een vast getal. Wat wel klopt: herhaal je deze werkwijze heel vaak, dan bevat 95 van de 100 intervallen het populatiegemiddelde. Waarom rapporteert iedereen dan toch één interval alsof het iets over dit onderzoek zegt?
Hij betekent: als de nulhypothese waar is, is de kans op deze uitkomst of een nog extremere uitkomst 3 procent. De redenering loopt dus vooruit, van een aanname over de populatie naar jouw gegevens, en niet terug van je gegevens naar de waarheid van een hypothese.
Hij is daarmee niet de kans dat de nulhypothese waar is, en niet de kans dat je conclusie fout is. Hij zegt ook niets over de grootte of het belang van het effect: bij een grote genoeg groep wordt een verwaarloosbaar verschil significant. Rapporteer daarom altijd de effectgrootte en het betrouwbaarheidsinterval ernaast.
Aan het artikel zelf meestal niet, en daar zit het probleem. Wie veel toetsen uitvoert en alleen de gelukte meldt, verzamelt vals alarm zonder dat de lezer het ziet. Een effectgrootte en een smal betrouwbaarheidsinterval helpen, replicatie helpt meer. Wat zou een tijdschrift moeten eisen voordat één significante uitkomst geloofwaardig heet?
Nog geen antwoord: een vraag om zelf over na te denken.
Nog geen antwoord: een vraag om zelf over na te denken.
Nog geen antwoord: een vraag om zelf over na te denken.
Samenvatting Kennismaking met onderzoeksmethoden en statistiek · Oefenen met Kennismaking met onderzoeksmethoden en statistiek · Bekijk prijzen