Vragen over Kennismaking met onderzoeksmethoden en statistiek (KOM)

De vragen en discussies die bij Kennismaking met onderzoeksmethoden en statistiek horen: verbanden, tegenstellingen en denkfouten uit de stof. 33 vragen, waarvan 30 met een antwoord dat vrij te lezen is.

Hoofdstuk 1: Psychologie als manier van denken

Wat is het verschil tussen een theorie en een hypothese, en waarom kun je een theorie niet rechtstreeks toetsen?

Een theorie is een samenhangende verzameling uitspraken over hoe variabelen zich in het algemeen tot elkaar verhouden. Die is te algemeen om te meten. Een hypothese is de concrete uitkomst die je in één bepaald onderzoek verwacht als de theorie klopt. Uit één theorie volgen dus veel hypothesen, en elk onderzoek toetst er één.

Neem de theorie dat geeuwen de hersenen afkoelt. Daaruit volgt de voorspelling dat iemand met een koud kompres op zijn voorhoofd minder meegeeuwt met filmpjes dan iemand met een warm kompres. Het aantal keren geeuwen zijn de data. Die data bewijzen de theorie niet: ze steunen haar of ondermijnen haar, en het oordeel valt pas als je alle studies bij elkaar legt.

Als een theorie na elke tegenvaller wordt bijgesteld, blijft zij dan falsifieerbaar?

Bijstellen hoort bij de theorie-data-cyclus, dus op zichzelf is er niets mis mee. Het wordt anders zodra elke bijstelling een extra uitzondering is die alleen dít ene resultaat opvangt. Dan schuift de theorie op richting een verklaring die niets meer uitsluit, en precies daar mikt spaarzaamheid op. De vraag die jij beantwoordt: welke uitkomst zou deze theorie, ná de bijstelling, nog kunnen laten zakken?

Hoofdstuk 2: Bronnen van kennis

Hoe houd ik de beschikbaarheidsheuristiek en confirmatiebias uit elkaar?

Bij de beschikbaarheidsheuristiek telt hoe makkelijk iets in je opkomt. Opvallende, recente en emotionele gebeurtenissen komen sneller boven, dus schat je hun aantal te hoog in. Je eigen mening speelt daarbij geen rol.

Bij confirmatiebias telt juist wél wat je al vindt: je zoekt, ziet en onthoudt vooral bewijs dat je overtuiging bevestigt, en tegenbewijs redeneer je weg. Zelfs de vraag die je stelt lokt de bevestiging al uit.

Kort gezegd gaat de eerste over gemak van herinneren en de tweede over de richting van je overtuiging. Vraag je bij een casus dus af of iemand iets overschat omdat het in het nieuws was, of omdat het hem goed uitkomt.

Als je je eigen vertekening slechter ziet dan die van een ander, hoe controleer je die dan bij jezelf?

Dat is precies de bias blind spot: de meeste mensen vinden zichzelf minder bevooroordeeld dan de gemiddelde ander, en dat kan niet voor iedereen kloppen. Nadenken over jezelf helpt hier dus weinig. Wat wel werkt ligt buiten jezelf: een vergelijkingsgroep, openbare waarnemingen en iemand die je tegenspreekt. Welke van je eigen overtuigingen heb jij ooit actief proberen te weerleggen in plaats van te onderbouwen?

Hoofdstuk 3: Drie claims, vier validiteiten

Hoe zie ik aan een krantenkop of het om een associatieclaim of een causale claim gaat?

Ga in vaste volgorde te werk. Tel eerst de variabelen, kijk dan of ze gemeten of gemanipuleerd zijn, en let pas daarna op het werkwoord. Eén gemeten variabele hoort bij een frequentieclaim, twee gemeten variabelen bij een associatieclaim, en een gemanipuleerde variabele met een gemeten uitkomst maakt een causale claim mogelijk.

Signaalwoorden helpen: hangt samen met, vaker bij, voorspelt. Bij veroorzaakt, verhoogt, leidt tot of zorgt voor gaat het om causaliteit. Let op dat ook een voorzichtig “kan bijdragen aan” causaal is. Het werkwoord beslist dus niet alleen, want de kop en de studie eronder kunnen uit elkaar lopen.

Bij een causale claim mag de externe validiteit wijken. Wat heb je aan een sluitend experiment als je niet weet op wie het slaat?

De redenering is dat een kunstmatige situatie met een sluitende conclusie meer waard is dan een levensechte studie met vijf alternatieve verklaringen. Je koopt dus zekerheid over het mechanisme met onzekerheid over het bereik. Dat bereik is daarna een volgende vraag, voor een volgende studie. Alleen: wie stelt die vraag, en wat doe je in de tussentijd met de conclusie?

Hoofdstuk 4: Ethische richtlijnen voor onderzoek

Wanneer mag een onderzoeker deelnemers misleiden, en wat moet de nabespreking dan doen?

Misleiding mag alleen als het onderzoek zonder haar niet uitvoerbaar is en de opbrengst haar rechtvaardigt. Over pijn of hevige emotionele belasting misleid je nooit. Er zijn twee vormen: misleiding door weglating, waarbij je niet vertelt wat je precies meet, en misleiding door onjuiste informatie, zoals de nepschokken bij Milgram.

De nabespreking is daarna geen formaliteit. De deelnemer hoort wat het onderzoek werkelijk inhield, waarom de misleiding nodig was en wat er met zijn gegevens gebeurt. Het doel is dat onjuiste indrukken worden weggenomen, zodat niemand met een verkeerd beeld van zichzelf naar huis gaat.

Weldoen weegt de opbrengst af tegen het risico. Wie bepaalt hoeveel een deelnemer daarvoor mag inleveren?

Niet de onderzoeker alleen, en dat is precies waarom een ethische toetsingscommissie vooraf meekijkt, met iemand van buiten de wetenschap erbij. Bij Tuskegee en Milgram zat de fout niet in de opzet maar in die afweging. Toch blijft zij een oordeel en geen som. Waar leg jij de grens tussen spanning die een deelnemer mag ervaren en spanning die kennis niet waard is?

Hoofdstuk 5: Goed meten herkennen

Waarom kan een meting betrouwbaar zijn en toch niet valide, en waarom werkt het niet andersom?

Betrouwbaarheid gaat over consistentie: wijst de meting steeds hetzelfde aan? Validiteit gaat over de vraag of zij aanwijst wat zij belooft. Een weegschaal die er vijf kilo naast zit geeft elke ochtend hetzelfde getal: perfect betrouwbaar en toch onjuist. Hoofdomtrek meten om intelligentie vast te stellen levert bij herhaling dezelfde uitkomst en zegt niets over intelligentie.

Andersom kan niet. Een meting die bij elke afname iets anders aanwijst kan het begrip niet trouw weergeven, want welke van die uitkomsten zou dan de goede zijn? Betrouwbaarheid is daarmee een voorwaarde voor validiteit, geen bewijs ervan.

Een hoge Cronbachs alfa haal je ook door tien keer bijna dezelfde vraag te stellen. Wat zegt dat getal dan nog?

Alfa meet of de vragen van een schaal onderling samenhangen, en dat lukt het best bij vragen die elkaar herhalen. Maar inhoudsvaliditeit eist juist dat de meting alle onderdelen van de conceptuele definitie dekt: bij studiestress dus piekeren, uitstellen én lichamelijke spanning. Een keurige alfa kan zo een veel te smalle schaal verbergen. Waaraan zou jij bij een vragenlijst zien welke van de twee je voor je hebt?

Statistiek: meetniveaus, frequenties en centrummaten

Wanneer rapporteer je de mediaan en wanneer het gemiddelde?

Kies in twee stappen. Vraag eerst wat het meetniveau toelaat: bij nominaal kan alleen de modus, vanaf ordinaal mag de mediaan, en het gemiddelde pas vanaf intervalniveau, want optellen veronderstelt gelijke afstanden.

Kijk daarna naar de vorm van de verdeling. Bij scheefheid of duidelijke uitschieters meld je de mediaan, ook al is het gemiddelde toegestaan. Het gemiddelde telt elke score met zijn volle gewicht en wordt naar de staart getrokken; de mediaan telt alleen posities en blijft daardoor staan. Bij reistijden van 15, 20, 20, 25, 30 en 90 minuten is de mediaan 22,5 en het gemiddelde ruim 33.

SPSS rekent zonder klagen een gemiddelde uit over de codes 1, 2 en 3 van studierichting. Waaraan zie je zelf dat zo'n getal nergens over gaat?

Aan wat de variabele meet, niet aan wat er in de kolom staat. Codes bij een nominale variabele zijn labels en geen hoeveelheden, dus een gemiddelde van 1,8 verwijst nergens naar. Het meetniveau kies je in SPSS zelf, en het programma controleert die keuze niet. Welke andere uitkomsten in je uitvoer worden daarmee stilletjes onzin?

Statistiek: spreiding, z-scores en de normaalverdeling

Waarom deel je bij een steekproef door n min 1 en niet gewoon door n?

Omdat het gemiddelde waar je vanaf rekent uit die steekproef zelf komt. De scores liggen daardoor zo dicht mogelijk om hun eigen gemiddelde heen: rond elk ander getal zouden de afwijkingen groter uitvallen. De kwadratensom is dus systematisch te klein als schatting voor de populatie. Delen door n min 1 maakt de uitkomst iets groter en herstelt die onderschatting, en het getal dat je daarbij kwijtraakt heet een vrijheidsgraad.

Bij vijf cijfers met een kwadratensom van 36 scheelt dat merkbaar: delen door 5 geeft 7,2 en delen door 4 geeft 9. Hoe groter de steekproef, hoe kleiner dat verschil wordt.

De vuistregel 68-95-99,7 geldt alleen bij een ongeveer normale verdeling. Wat is een z-score dan nog waard bij scheve gegevens?

Het rekenen blijft kloppen: z is gewoon de afstand tot het gemiddelde in standaardafwijkingen, en standaardiseren verandert de vorm van de verdeling niet. Wat sneuvelt is de vertaling naar een percentiel, want die leunt op de klokvorm. Bij reistijd of inkomen klopt de 68 procent niet meer. Wat zegt een z van +2 dan nog over iemands plaats in de groep?

Hoofdstuk 6: Enquêtes en observaties

Hoe houd ik observer bias, observer effects en reactiviteit uit elkaar?

Vraag je af wie het probleem veroorzaakt. Bij observer bias kleurt de waarnemer de codering: bij twijfelgevallen kiest hij de kant van zijn hypothese. Bij een observer effect verandert de waarnemer het gedrag van de ander, zoals bij het paard Clever Hans, dat reageerde op kleine bewegingen van de mensen om hem heen. Bij reactiviteit verandert de deelnemer zichzelf, omdat hij weet dat er naar hem gekeken wordt.

De maatregelen volgen die driedeling. Tegen de eerste twee helpen een codeboek, een blinde beoordelaar en twee onafhankelijke waarnemers. Tegen reactiviteit helpen onopvallend observeren, wachten tot deelnemers gewend zijn, of sporen van gedrag meten in plaats van gedrag zelf.

Een even aantal antwoordopties haalt het hek weg, maar dwingt wie geen mening heeft tot een kant. Wat meet je dan bij die deelnemer?

Precies de ruil die achter elke antwoordschaal zit. Zonder middenoptie verdwijnt op het hek zitten, maar de neutrale deelnemer krijgt nu een score die zijn houding niet weergeeft. Je ruilt dus een antwoordtendens in voor een probleem met de constructvaliditeit. Hoe zou je in de data terugzien welke van die twee je hier hebt gekozen?

Hoofdstuk 7: Steekproeven

Waarom maakt een grotere steekproef een scheve steekproef niet recht?

Omdat omvang en manier van trekken twee verschillende dingen doen. Wie de verkeerde mensen benadert, benadert ze bij tienduizend antwoorden nog steeds verkeerd. De manier van trekken bepaalt de externe validiteit; de omvang maakt de schatting alleen preciezer, dus de foutmarge smaller, en dat hoort bij de statistische validiteit.

In 1936 voorspelde een grote tijdschriftenquête in de Verenigde Staten de verkeerde winnaar van de presidentsverkiezingen, ondanks miljoenen antwoordkaarten: de adressenlijst bevatte vooral welgestelde huishoudens en alleen wie wilde stuurde de kaart terug. Vraag dus eerst hoe deze mensen erin zijn gekomen, en pas daarna hoeveel het er zijn.

Bij een experiment mag een gemakssteekproef, want daar telt de interne validiteit. Hoe weet je dan of het effect buiten die groep bestaat?

Dat weet je niet, en dat is de prijs die deze opzet bewust betaalt. Het experiment laat zien dát het mechanisme bij deze deelnemers werkt; of het ook bij andere groepen optreedt is een volgende vraag voor een volgende studie. Alleen gebeurt dat vervolgonderzoek meestal opnieuw bij aangemelde eerstejaars. Vanaf wanneer wordt dat een probleem voor de conclusie?

Hoofdstuk 8: Bivariaat correlationeel onderzoek

Waarom betekent een r van nul niet dat er geen verband is?

Omdat r alleen meet hoe goed één rechte lijn past. Bij een kromlijnig verband, bijvoorbeeld een omgekeerde U, komt r rond nul uit terwijl er wel degelijk een patroon zit: studenten die heel weinig en studenten die heel veel koffie drinken presteren allebei slechter dan de middengroep.

Er is nog een oorzaak. Bij beperkt bereik heeft een variabele zo weinig spreiding dat geen enkel verband zich meer kan laten zien; meet je alleen bij studenten die tussen de 7 en de 8 staan, dan zakt r richting nul. Bekijk daarom altijd eerst het spreidingsdiagram en pas daarna het getal.

Een moderator maakt een verband preciezer zonder er een oorzaak van te maken. Waar zit dan het verschil?

Een moderator beantwoordt de vraag voor wie of wanneer een verband het sterkst geldt. Dat blijft beschrijving, want beide variabelen zijn nog altijd alleen gemeten: het richtingsprobleem en het derde-variabeleprobleem staan onaangetast overeind. Toch klinkt een verband dat bij de ene groep wel en bij de andere niet optreedt als een aanwijzing over de oorzaak. Wanneer is dat terecht?

Statistiek: correlatie berekenen en interpreteren

Wat voegt r-kwadraat toe aan r, en waarom valt dat getal zo tegen?

Verklaarde variantie is het kwadraat van de correlatie en zegt welk deel van de verschillen in de ene variabele samenhangt met de verschillen in de andere. Bij een r van 0,75 is dat 0,5625, dus ongeveer 56 procent; de overige 44 procent hangt samen met van alles wat niet is gemeten.

Kwadrateren is streng, en daar zit de tegenvaller. Een correlatie van 0,20 klinkt als iets, maar levert vier procent op. Let ook op het woord zelf: verklaarde variantie is een rekenterm en geen oorzaak. Beide variabelen zijn alleen gemeten, dus studietijd maakt geen 56 procent van het cijfer.

Spearman rekent over rangnummers en ligt daardoor niet wakker van een uitschieter. Wat gooi je daarmee weg?

De afstanden tussen de scores. Een extreem hoge waarde wordt gewoon het hoogste rangnummer, en dat is winst bij een scheve verdeling of bij ordinale gegevens. Maar op interval- of rationiveau zit juist in die afstanden de informatie waarvoor je hebt gemeten. Wanneer is die ene uitschieter ruis die je mag afvlakken, en wanneer is hij het interessantste geval in je bestand?

Hoofdstuk 10: Inleiding in eenvoudige experimenten

Wat is nou precies het verschil tussen random assignment en random sampling?

Random assignment verdeelt de deelnemers met het lot over de condities, zodat de groepen vooraf gemiddeld gelijk zijn op alles wat je niet hebt gemeten. Het beschermt tegen groepen die al systematisch verschilden en dient de interne validiteit: zonder deze stap draagt geen enkele causale uitspraak.

Random sampling trekt de deelnemers met het lot uit de populatie. Het beschermt tegen een steekproef die niet op de populatie lijkt en dient de externe validiteit: zonder deze stap mag je niet generaliseren. Toewijzen gebeurt binnen de studie, trekken loopt van buiten naar binnen. Veel experimenten hebben het eerste keurig geregeld en het tweede niet.

Counterbalancing haalt een volgorde-effect niet weg maar verdeelt het. Wat blijft er dan van over in je cijfers?

Na die verdeling drukt het effect even zwaar op beide condities, dus het kan het verschil tussen die condities niet meer verklaren. Verdwenen is het niet: het zit nog in de scores, als variatie die niets met je manipulatie te maken heeft. Wat doet die extra variatie met de kans dat je een verschil dat er werkelijk is, ook terugvindt?

Hoofdstuk 11: Confounds en bedreigingen van de interne validiteit

Waarom is geen verschil vinden niet hetzelfde als bewijzen dat er geen effect is?

Omdat twee heel verschillende dingen dezelfde stilte opleveren. Denk aan een radio: het verschil tussen de groepen is het signaal, de variatie binnen de groepen is de ruis. Een zwak signaal ontstaat door een zwakke manipulatie, een ongevoelige meting of een plafond- of bodemeffect, waarbij alle scores tegen het maximum of het minimum aan zitten. Te veel ruis komt van meetfout, individuele verschillen en situatieruis.

Loop daarom een vaste rij vragen langs. Was er een manipulatiecheck? Lagen de condities ver genoeg uit elkaar? Hoeveel deelnemers deden mee, en dus hoeveel power had de studie? En hoe breed is het betrouwbaarheidsinterval rond het gevonden verschil?

Een placebogroep laat zien of een behandeling meer doet dan de verwachting. Maar als die verwachting echte verbetering geeft, werkt de behandeling dan?

Het placebo-effect is geen meetfout: de verbetering is echt, alleen is de oorzaak de verwachting en niet de behandeling. Voor de wetenschappelijke vraag telt dat onderscheid, want de studie wil weten wat de behandeling zélf toevoegt. Voor de patiënt telt vooral dat hij opknapt. Welke van die twee vragen beantwoordt een dubbelblind placebogecontroleerd onderzoek eigenlijk?

Statistiek: van steekproef naar populatie, kans en betrouwbaarheidsinterval

Wat is het verschil tussen de standaardafwijking en de standaardfout?

De standaardafwijking zegt hoe ver losse mensen van het gemiddelde af liggen: zij beschrijft je groep. De standaardfout van het gemiddelde zegt hoe ver steekproefgemiddelden van het populatiegemiddelde af liggen: zij beschrijft de precisie van je schatting. Je berekent haar door de standaardafwijking te delen door de wortel uit n.

Bij 64 studenten met een standaardafwijking van 16 minuten is de standaardfout dus 16 gedeeld door 8, ofwel 2 minuten. Staan beide als antwoordoptie naast elkaar, vraag je dan af of het over spreiding tussen personen gaat of over de precisie van een schatting. De standaardfout is altijd het kleinste getal van de twee.

Een betrouwbaarheidsinterval spreekt over de procedure en niet over dit ene geval. Wat mag je een lezer dan wél over jouw interval vertellen?

Niet dat 95 procent van de studenten ertussen valt, en ook niet dat er 95 procent kans is dat het populatiegemiddelde in dít interval ligt, want die parameter is een vast getal. Wat wel klopt: herhaal je deze werkwijze heel vaak, dan bevat 95 van de 100 intervallen het populatiegemiddelde. Waarom rapporteert iedereen dan toch één interval alsof het iets over dit onderzoek zegt?

Statistiek: hypothesen toetsen, p-waarde, t-toets en effectgrootte

Wat betekent een p van ,03 nou precies, en wat betekent hij niet?

Hij betekent: als de nulhypothese waar is, is de kans op deze uitkomst of een nog extremere uitkomst 3 procent. De redenering loopt dus vooruit, van een aanname over de populatie naar jouw gegevens, en niet terug van je gegevens naar de waarheid van een hypothese.

Hij is daarmee niet de kans dat de nulhypothese waar is, en niet de kans dat je conclusie fout is. Hij zegt ook niets over de grootte of het belang van het effect: bij een grote genoeg groep wordt een verwaarloosbaar verschil significant. Rapporteer daarom altijd de effectgrootte en het betrouwbaarheidsinterval ernaast.

Bij een alfa van 0,05 is één op de twintig toetsen op niets een vals alarm. Hoe zie je aan een artikel welk van de twee je voor je hebt?

Aan het artikel zelf meestal niet, en daar zit het probleem. Wie veel toetsen uitvoert en alleen de gelukte meldt, verzamelt vals alarm zonder dat de lezer het ziet. Een effectgrootte en een smal betrouwbaarheidsinterval helpen, replicatie helpt meer. Wat zou een tijdschrift moeten eisen voordat één significante uitkomst geloofwaardig heet?

Over het vak

Dit vak leert je in de ene week vragen stellen bij een onderzoeksopzet en in de andere week rekenen. Wat doe je met een studie waarvan de cijfers kloppen maar de opzet niet, en met een studie waarvan het omgekeerde geldt?

Nog geen antwoord: een vraag om zelf over na te denken.

Vrijwel alles wat je in de sociale wetenschap leest rust op deelnemers die zich aanmeldden voor een experiment. Hoeveel van de conclusies uit dit vak blijft daarmee overeind buiten de collegezaal?

Nog geen antwoord: een vraag om zelf over na te denken.

Acht weken lang klinkt dezelfde waarschuwing: samenhang is nog geen oorzaak. Toch neem je je eigen beslissingen dagelijks op grond van samenhang. Waar ligt voor jou de grens tussen een verstandige gok en een claim die je niet mag maken?

Nog geen antwoord: een vraag om zelf over na te denken.

Samenvatting Kennismaking met onderzoeksmethoden en statistiek · Oefenen met Kennismaking met onderzoeksmethoden en statistiek · Bekijk prijzen