ISW jaar 1 · UU (KOM)

Tentamenanalyse Kennismaking met onderzoeksmethoden en statistiek

Welke onderwerpen krijgen de meeste ruimte, waar liggen de punten en wat kost de meeste denkkracht? De stof van Kennismaking met onderzoeksmethoden en statistiek doorgerekend, met de plekken waar studenten in dit vak de mist in gaan. Gratis te lezen.

Deze pagina gaat niet over de stof van KOM, maar over de vorm van de toetsing. KOM werkt met meerkeuze-deeltoetsen, en de tien onderwerpen hieronder verschillen sterk in hoeveel ruimte ze krijgen, hoe scherp ze zich laten bevragen en hoeveel denkwerk ze kosten. De vijf grafieken tonen steeds dezelfde tien onderwerpen vanuit een andere hoek. Lees ze op volgorde: eerst waar de stof zit, dan waar de punten liggen, dan wat zwaar is, en pas daarna hoe je je weken indeelt. Klik een onderwerp aan om het in alle grafieken tegelijk te volgen.

Onderwerpen van Kennismaking met onderzoeksmethoden en statistiek naar aandeel, verwachte punten, moeilijkheid en studietijd
OnderwerpAandeel in de stofverwachte puntenMoeilijkheidStudietijd
Wetenschappelijk denken en bronnen12%11%2 van 59%
Claims en de vier validiteiten7%7%4 van 58%
Onderzoeksethiek7%7%2 van 56%
Meten: betrouwbaarheid en validiteit7%7%4 van 57%
Beschrijvende statistiek14%14%3 van 513%
Enquêtes en observatie7%7%2 van 56%
Steekproeven en generaliseren6%7%3 van 57%
Correlationeel onderzoek13%13%4 van 513%
Experimenten en interne validiteit13%13%5 van 515%
Toetsen en schatten14%14%5 van 516%

Aandeel in de tentamenstof

De verdeling laat zien dat KOM twee gezichten heeft. De vier grootste onderwerpen, Beschrijvende statistiek, Toetsen en schatten, Correlationeel onderzoek en Experimenten en interne validiteit, vullen samen ruim de helft van de stof. Alleen de twee statistiekonderwerpen bovenaan zijn samen al goed voor ruim een kwart. Het grootste segment krijgt ruim twee keer zoveel ruimte als Steekproeven en generaliseren, het kleinste. Belangrijker is waar dat gewicht ligt: het staat vrijwel volledig in de tweede helft van de cursus, bij rekenen en bij onderzoeksopzetten. De vijf smalle segmenten samen halen ongeveer een derde. Dat maakt Claims en de vier validiteiten bedrieglijk klein. Het is een kort onderwerp, maar de drie claims en de vier validiteiten keren terug in bijna elk onderwerp dat erna komt.

Zo pak je het aan: Reken niet in hoofdstukken maar in leeswerk: Onderzoeksethiek en Beschrijvende statistiek staan allebei als één onderwerp in de lijst, terwijl het tweede je twee keer zoveel tijd kost.

Puntenverdeling per onderwerp

Punten volgen niet alleen de ruimte in de stof, maar ook hoe scherp een onderwerp zich in een meerkeuzevraag laat vangen. Daardoor schuiven de staven ten opzichte van de vorige grafiek. Steekproeven en generaliseren is het enige onderwerp dat meer punten oplevert dan het aan ruimte krijgt: kanssteekproef tegenover gemakssteekproef, en representativiteit tegenover grootte, zijn onderscheidingen met precies één juist antwoord en drie geloofwaardige alternatieven. Wetenschappelijk denken en bronnen beweegt als enige de andere kant op, want een deel daarvan gaat over houding en over hoe je een artikel leest, en dat levert minder vragen op dan het aantal bladzijden doet vermoeden. Bovenaan verandert er weinig: de vijf onderwerpen boven het gemiddelde dragen samen bijna twee derde van de punten.

Zo pak je het aan: Oefen bij Beschrijvende statistiek en Toetsen en schatten ook de keuzevraag en niet alleen de som: welke maat of welke toets hoort bij dit meetniveau en deze vraagstelling.

Moeilijkheidsgraad van de onderwerpen

Twee onderwerpen staan als enige op het hoogste niveau: Toetsen en schatten en Experimenten en interne validiteit. Bij het eerste is de redenering zelf tegenintuïtief, want je begint bij de aanname die je wilt verwerpen. Bij het tweede moet je twaalf bedreigingen niet alleen kennen maar in een concrete opzet herkennen. Het contrast met Beschrijvende statistiek is leerzaam: dat onderwerp is even groot, maar staat twee stappen lager, want daar liggen de stappen vast en herhaalt het rekenwerk zich. Onder de kleinere onderwerpen springen Claims en de vier validiteiten en Meten eruit. Ze kosten weinig leestijd en toch bijna evenveel denkkracht als de zware onderwerpen. Geen enkel onderwerp staat op het laagste niveau, dus overal valt iets te begrijpen.

Zo pak je het aan: Bob rekent de t-toets foutloos uit en kiest bij de vraag welke conclusie daarbij hoort toch het verkeerde antwoord. Oefen daarom hardop de zin die bij je uitkomst hoort, niet alleen de berekening.

Waar leg je je prioriteit?

Drie onderwerpen liggen rechtsboven, waar veel punten samenvallen met veel denkwerk: Toetsen en schatten, Experimenten en interne validiteit en Correlationeel onderzoek. Samen dragen ze twee vijfde van de punten, en ze zijn geen van drieën in één avond te leren. Daar begin je. Linksboven staan Beschrijvende statistiek en Wetenschappelijk denken en bronnen, samen goed voor een kwart van de punten tegen aanmerkelijk minder moeite. Dat is je snelste rendement en een prettig blok voor een avond waarop je hoofd al vol zit. Let op de val rechtsonder. Claims en de vier validiteiten en Meten leveren samen evenveel punten als Beschrijvende statistiek in zijn eentje, maar de matrix meet ruimte en zwaarte, niet doorwerking.

Zo pak je het aan: Behandel Claims en de vier validiteiten niet als los onderwerp maar als checklist: loop de drie claims en de vier validiteiten langs bij elke studie die je bij Correlationeel onderzoek of Experimenten en interne validiteit tegenkomt.

Je studieplan

Vier onderwerpen vragen samen bijna zes van elke tien studie-uren: Toetsen en schatten, Experimenten en interne validiteit, Beschrijvende statistiek en Correlationeel onderzoek. Toetsen en schatten krijgt de grootste post, ook al is het even groot als Beschrijvende statistiek in de stof. Dat verschil komt volledig uit het denkwerk, niet uit het aantal bladzijden. Wetenschappelijk denken en bronnen zakt hier juist het hardst weg. Het leest vlot en het blijft hangen, dus het vraagt minder uren dan zijn plek in de donut suggereert. Onderzoeksethiek en Enquêtes en observatie zijn de twee kleinste posten. Dat betekent niet overslaan, maar herhalen met een begrippenlijst in plaats van opnieuw doorlezen.

Zo pak je het aan: Verdeel Toetsen en schatten en Correlationeel onderzoek over meerdere korte blokken op verschillende dagen, want formules zakken weg, en bewaar Onderzoeksethiek en Enquêtes en observatie voor het uur waarop je moe bent.

Kernbegrippen per onderwerp

Wetenschappelijk denken en bronnen

Empirisme (empiricism)
Uitspraken over mens en gedrag baseren op systematische, controleerbare waarnemingen, en dus niet op gezag, intuïtie of redeneren alleen.
Hypothese of voorspelling (hypothesis)
De concrete uitkomst die je in een specifiek onderzoek verwacht als de theorie klopt, terwijl de theorie zelf een algemene uitspraak over variabelen blijft.
Falsifieerbaarheid (falsifiability)
De eis dat er een uitkomst denkbaar is die de theorie tegenspreekt, want een theorie die met elk resultaat te rijmen valt kan nooit zakken voor een toets.
Spaarzaamheid (parsimony)
Zodra twee verklaringen even goed door de data worden gesteund, geeft het kleinste aantal losse aannames de doorslag.
Gewicht van het bewijs (weight of the evidence)
Het oordeel over een theorie berust op alle studies samen, niet op de nieuwste of de opvallendste uitkomst.
Vergelijkingsgroep (comparison group)
De groep die de behandeling of situatie niet krijgt, en zonder wie je niet kunt weten of de uitkomst er ook zonder ingreep was geweest.
Present/present bias
Alleen letten op de gevallen waarin de vermoedelijke oorzaak en het gevolg allebei aanwezig zijn, terwijl je voor een verband alle vier de combinaties nodig hebt.
Beschikbaarheidsheuristiek (availability heuristic)
Iets waarschijnlijker achten naarmate het je gemakkelijker te binnen schiet, waardoor opvallende en recente gebeurtenissen stelselmatig te hoog worden ingeschat.

Claims en de vier validiteiten

Frequentieclaim (frequency claim)
Een uitspraak over hoe vaak iets voorkomt of op welk niveau een variabele zit, dus met maar een variabele in het spel, die gemeten is.
Associatieclaim (association claim)
Een uitspraak dat twee gemeten variabelen samen bewegen, waarmee je kunt voorspellen maar niet ingrijpen.
Causale claim (causal claim)
Een uitspraak dat de ene variabele de andere verandert, die pas mag als covariantie, temporele volgorde en het uitsluiten van andere verklaringen alle drie rond zijn.
Constructvaliditeit (construct validity)
De vraag of elke variabele zo gemeten of gemanipuleerd is dat zij het bedoelde begrip weergeeft, en daarmee de validiteit die bij elke soort claim aan de orde komt.
Interne validiteit (internal validity)
De vraag of er geen andere plausibele verklaring voor het verband bestaat, en dus de validiteit die alleen bij een causale claim het zwaarst weegt.
Externe validiteit (external validity)
De vraag of de uitkomst ook geldt voor andere mensen en andere situaties, waarbij de manier van trekken zwaarder telt dan de omvang van de steekproef.
Statistische validiteit (statistical validity)
De vraag of de cijfers de conclusie dragen: hoe sterk het effect is, hoe precies de schatting, of het herhaald is en of toeval een verklaring kan zijn.
Temporele volgorde (temporal precedence)
Het causaliteitscriterium dat de vermoedelijke oorzaak in de tijd voor het gevolg ligt, precies wat een studie met twee gelijktijdig gemeten variabelen niet kan laten zien.

Onderzoeksethiek

Belmont Report
Het rapport uit 1979 dat na het Tuskegee-onderzoek drie beginselen voor onderzoek met mensen vastlegde, waar de APA-ethiekcode de uitwerking in beroepsregels van is.
Respect voor personen (respect for persons)
Het beginsel dat mensen zelf beslissen of zij meedoen, met extra bescherming voor wie die keuze niet volledig kan maken.
Weldoen (beneficence)
Het beginsel dat de verwachte opbrengst opweegt tegen de risico's voor de deelnemer, en dat die risico's zo klein mogelijk blijven.
Rechtvaardigheid (justice)
Het beginsel dat de groep die de lasten van het onderzoek draagt ook hoort tot de groep die er baat bij heeft.
Geïnformeerde toestemming (informed consent)
De deelnemer stemt vrijwillig toe nadat hij weet wat het onderzoek inhoudt, hoe lang het duurt en welke risico's eraan zitten, en hij mag altijd stoppen zonder nadeel.
Anonimiteit (anonymity)
Zelfs de onderzoeker kan niet nagaan welk antwoord bij welke deelnemer hoort.
Vertrouwelijkheid (confidentiality)
De onderzoeker weet wel wie wat heeft gezegd, houdt dat voor zich en publiceert uitsluitend op groepsniveau.
Nabespreking (debriefing)
Het gesprek na afloop waarin de deelnemer hoort wat er werkelijk werd onderzocht, waarom misleiding nodig was en wat er met zijn gegevens gebeurt.

Meten: betrouwbaarheid en validiteit

Operationele definitie (operational definition)
De concrete manier waarop een begrip in dit onderzoek wordt vastgelegd of gemanipuleerd, tegenover de conceptuele definitie die het begrip alleen in woorden omschrijft.
Betrouwbaarheid (reliability)
De mate waarin een meting bij herhaling of bij een andere beoordelaar dezelfde uitkomst geeft, wat nog niets zegt over de vraag of zij het juiste begrip meet.
Test-hertestbetrouwbaarheid (test-retest reliability)
Dezelfde mensen scoren bij twee afnames met tijd ertussen hetzelfde, iets wat je alleen mag verwachten bij eigenschappen die stabiel horen te zijn.
Interbeoordelaarsbetrouwbaarheid (interrater reliability)
Twee onafhankelijke beoordelaars coderen hetzelfde gedrag gelijk, de vorm van betrouwbaarheid die bij observatiemetingen hoort.
Interne consistentie (internal reliability)
De items die samen een schaal vormen hangen onderling samen, omdat zij hetzelfde begrip horen te meten.
Validiteit van een meting (measurement validity)
De mate waarin een meting het begrip weergeeft waarvoor zij staat, een andere vraag dan of zij steeds dezelfde uitkomst geeft.
Criteriumvaliditeit (criterion validity)
De score hangt samen met gedrag dat volgens het begrip bij de meting hoort, doordat zij bekende groepen onderscheidt of later gedrag voorspelt.
Discriminante validiteit (discriminant validity)
De meting hangt juist niet of nauwelijks samen met metingen van een ander begrip, het spiegelbeeld van convergente validiteit.

Beschrijvende statistiek

Interval (interval)
De afstanden tussen de waarden zijn gelijk, maar het nulpunt is willekeurig gekozen, zoals bij temperatuur in graden Celsius.
Ratio (ratio)
Gelijke afstanden en een absoluut nulpunt, zodat je pas op dit niveau mag zeggen dat de ene score twee keer zo hoog is als de andere.
Scheef naar rechts (positively skewed)
De meeste waarnemingen liggen laag en de dunne staart loopt naar de hoge waarden, dus de naam volgt de staart en niet de piek.
Mediaan (median)
De middelste waarde van de geordende scores, die bij een scheve verdeling of een uitschieter een eerlijker beeld van het midden geeft dan het gemiddelde.
Gemiddelde (mean)
De som van alle scores gedeeld door het aantal waarnemingen, alleen zinvol vanaf intervalniveau en gevoelig voor uitschieters.
Standaardafwijking (standard deviation)
De wortel uit de variantie, waarmee de spreiding weer in de eenheid van de variabele zelf staat.
Z-score (z score)
Het aantal standaardafwijkingen dat een score boven of onder het gemiddelde ligt, waardoor scores van verschillende schalen vergelijkbaar worden.
Normaalverdeling (normal distribution)
Een symmetrische, klokvormige verdeling waarin modus, mediaan en gemiddelde samenvallen en bij vaste z-scores vaste percentages horen.

Enquêtes en observatie

Likertschaal (Likert scale)
Een stelling met een oordeelschaal van helemaal oneens tot helemaal eens, te onderscheiden van de semantische differentiaal, die tussen twee tegengestelde bijvoeglijke naamwoorden loopt.
Sturende vraag (leading question)
De formulering duwt het antwoord een kant op, zodat hetzelfde voorval met een ander werkwoord een ander cijfer oplevert.
Dubbele vraag (double-barreled question)
Een vraag die naar twee dingen tegelijk vraagt, waardoor het antwoord geen van beide begrippen goed meet.
Antwoordtendens (response set)
De gewoonte een hele lijst op dezelfde manier in te vullen, zoals overal instemmen of altijd het middelste hokje kiezen, zodat het antwoord meer over de invulstijl zegt dan over de deelnemer.
Sociaal wenselijk antwoorden (socially desirable responding)
De deelnemer geeft bij gevoelige onderwerpen het antwoord dat hem er beter uit laat zien, wat je bestrijdt met anonieme afname en nadruk op vertrouwelijkheid.
Observer bias (waarnemersvertekening)
De waarnemer codeert wat hij verwacht te zien, dus de vertekening zit in de meting terwijl het gedrag zelf onveranderd blijft.
Observer effect (verwachtingseffect)
De waarnemer verandert zonder het te merken het gedrag zelf, zoals bij het paard Clever Hans, dus hier verschuift wat er gebeurt en niet alleen wat er genoteerd wordt.
Reactiviteit (reactivity)
Mensen gedragen zich anders zodra zij weten dat er naar hen gekeken wordt, los van wat de onderzoeker verwacht of hoopt.

Steekproeven en generaliseren

Representatieve steekproef (representative sample)
Een steekproef die de populatie weerspiegelt op de kenmerken die ertoe doen, zodat de uitkomst ook geldt voor wie niet meedeed.
Vertekende steekproef (biased sample)
Sommige leden van de populatie hadden een grotere kans om erin te belanden, waardoor de uitkomst systematisch een kant op schuift, hoe groot de steekproef ook is.
Kanssteekproef (probability sampling)
Elk lid van de populatie heeft een bekende kans om gekozen te worden en het toeval bepaalt wie het wordt, de enige route naar een uitspraak over de populatie.
Enkelvoudige aselecte steekproef (simple random sampling)
Willekeurig trekken uit een lijst van de hele populatie, de zuiverste vorm, die dus wel zo'n volledige lijst vereist.
Gestratificeerde aselecte steekproef (stratified random sampling)
De populatie wordt eerst in lagen verdeeld en daarna wordt binnen elke laag aselect getrokken, naar rato van het aandeel van die laag.
Quotasteekproef (quota sampling)
Vooraf vastleggen hoeveel mensen uit elke categorie meedoen en die aantallen opvullen met wie beschikbaar is, dus de laatste stap gebeurt op gemak en niet op toeval.
Gemakssteekproef (convenience sampling)
Onderzoeken wie toevallig beschikbaar is, waardoor de kans om gekozen te worden onbekend blijft en de beschikbare mensen van de rest verschillen.
Zelfselectie (self-selection)
De deelnemers melden zichzelf aan, zodat vooral mensen met een uitgesproken mening in de steekproef terechtkomen.

Correlationeel onderzoek

Correlatiecoëfficiënt (correlation coefficient, r)
Een getal tussen -1 en 1 waarin het teken de richting van een lineair verband geeft en de afstand tot nul de sterkte.
Spreidingsdiagram (scatterplot)
Een figuur waarin elke deelnemer een punt is, en de enige manier om te zien of het verband wel recht loopt voordat je op r afgaat.
Verklaarde variantie (r-kwadraat)
Het kwadraat van de correlatie, dat aangeeft welk deel van de verschillen in de ene variabele samenhangt met de verschillen in de andere.
Spearman-rangcorrelatie (Spearman's rank-order correlation)
De correlatie berekend over de rangnummers in plaats van over de scores zelf, passend bij ordinale variabelen, een scheve verdeling of een stijgend verband dat niet recht loopt.
Richtingsprobleem (directionality problem)
Bij twee gemeten variabelen ligt niet vast welke de oorzaak is, want A kan B beïnvloeden en B evengoed A.
Derde-variabeleprobleem (third-variable problem)
Een niet gemeten derde variabele beïnvloedt beide variabelen en brengt zo het verband tussen die twee tot stand.
Moderator (moderator)
Een variabele die de sterkte of de richting van een verband verandert, dus die zegt bij wie of wanneer het verband opgaat, terwijl een derde variabele het verband juist wegverklaart.
Beperkt bereik (restriction of range)
Meet je alleen in een smal stuk van de schaal, dan is er te weinig spreiding en zakt r richting nul, ook als er in de hele populatie wel een verband bestaat.

Experimenten en interne validiteit

Onafhankelijke variabele (independent variable)
De gemanipuleerde variabele en de vermoedelijke oorzaak, waarvan elk niveau een conditie heet.
Afhankelijke variabele (dependent variable)
De gemeten variabele en het vermoedelijke gevolg, dus de uitkomst waarvan de score afhangt van de conditie waarin iemand zat.
Random assignment
Deelnemers worden door loting over de condities verdeeld, zodat de groepen vooraf gemiddeld gelijk zijn op alles wat je niet gemeten hebt, wat iets anders is dan aselect trekken uit een populatie.
Within-groups design (within-subjects design)
Iedere deelnemer maakt alle niveaus mee, wat verschillen tussen personen uitschakelt maar volgorde-effecten oproept die je met counterbalancing over de deelnemers verdeelt.
Design confound
Een tweede variabele die door de opzet systematisch meevarieert met de condities, terwijl variatie die zich willekeurig over de condities verspreidt alleen ruis is.
Selection effect
In de ene conditie zitten vooraf al andere mensen dan in de andere, bijvoorbeeld doordat deelnemers zelf mochten kiezen, wat random assignment of matched groups voorkomt.
Rijping (maturation)
De deelnemers waren ook zonder behandeling veranderd door natuurlijke ontwikkeling, gewenning of herstel, waar geschiedenis juist een gebeurtenis van buiten de studie is.
Regressie naar het gemiddelde (regression to the mean)
Een groep die op een extreme score is geselecteerd schuift bij een tweede meting vanzelf richting het gemiddelde, omdat die extreme score deels op toeval berustte.

Toetsen en schatten

Standaardfout van het gemiddelde (standard error of the mean)
De standaardafwijking van de steekproevenverdeling, dus hoeveel gemiddelden van steekproeven van dezelfde omvang onderling verschillen, berekend als de standaardafwijking gedeeld door de wortel uit het aantal waarnemingen.
Centrale limietstelling (central limit theorem)
Bij een groeiende steekproef nadert de verdeling van steekproefgemiddelden de normaalverdeling, ongeacht hoe de scores in de populatie verdeeld zijn.
Betrouwbaarheidsinterval (confidence interval)
Een gebied rond de puntschatting waarin de parameter met een vooraf gekozen mate van zekerheid ligt, en dat breder wordt naarmate je meer zekerheid eist.
Nulhypothese (null hypothesis, H0)
De aanname dat er in de populatie geen effect of verschil is, en daarmee de aanname die je toetst en niet de aanname die je hoopt aan te tonen.
p-waarde (p value)
De kans op deze of een nog extremere uitkomst als de nulhypothese waar is, dus niet de kans dat de nulhypothese waar is.
Type I-fout
Je verwerpt de nulhypothese terwijl er geen effect is, een vals alarm met een kans gelijk aan alfa, waar een type II-fout een bestaand effect juist mist.
t-toets voor twee onafhankelijke groepen (independent-samples t test)
Het verschil tussen twee groepsgemiddelden gedeeld door de standaardfout van dat verschil, met n1 plus n2 min 2 vrijheidsgraden.
Cohens d (Cohen's d)
Het verschil tussen twee gemiddelden gedeeld door de gezamenlijke standaardafwijking, dat zegt hoe groot het effect is en niet of het significant is.

Waar het bij Kennismaking met onderzoeksmethoden en statistiek meestal misgaat

Deze fouten volgen uit de stof zelf: begrippen die op elkaar lijken, voorwaarden die samen moeten gelden, een uitzondering die blijft hangen als hoofdregel.

De claim afleiden uit het werkwoord

Wat er misgaat: Je leest "hangt samen met" en noteert een associatieclaim, of je ziet "kan bijdragen aan" en vindt dat te voorzichtig voor een causale claim. De formulering van de zin krijgt zo het laatste woord over de soort claim.

Hoe het wel moet: Tel eerst de variabelen en kijk of ze gemeten of gemanipuleerd zijn. Eén gemeten variabele is een frequentieclaim, twee gemeten variabelen een associatieclaim, en een gemanipuleerde variabele met een gemeten uitkomst hoort bij een causale claim. Pas daarna let je op het werkwoord.

Waardoor het komt: Een kop is geschreven om te overtuigen en niet om een opzet te beschrijven. Dezelfde studie heet in de titel "verbetert" en drie regels lager "in verband gebracht met", dus de taal is onbetrouwbaar terwijl de opzet dat niet is. Ook een voorzichtig "kan bijdragen aan" is nog steeds een uitspraak over oorzaak en gevolg.

Waaraan je het herkent: Je kunt na het lezen van de casus niet in één zin zeggen welke variabele de onderzoeker zelf heeft bepaald. Of je antwoord verandert zodra alleen het werkwoord in de vraag wordt vervangen, terwijl de beschreven opzet hetzelfde blijft.

Betrouwbaar gelijkstellen aan valide

Wat er misgaat: Een vragenlijst met een hoge Cronbachs alfa, of een meting die bij twee afnames hetzelfde aanwijst, noem je daarom een goede meting van het begrip.

Hoe het wel moet: Betrouwbaarheid gaat alleen over consistentie, validiteit over de vraag of je het juiste aanwijst. Een weegschaal die er vijf kilo naast zit geeft elke ochtend hetzelfde getal. Betrouwbaar zonder valide bestaat, valide zonder betrouwbaar niet.

Waardoor het komt: De voorwaarde loopt maar één kant op en die richting draai je makkelijk om. Betrouwbaarheid is nodig voor validiteit, dus het klinkt alsof zij die ook levert. Bovendien is betrouwbaarheid met een getal aan te tonen en validiteit niet, en een getal overtuigt.

Waaraan je het herkent: Je onderbouwt de kwaliteit van een meting met een cijfer over herhaling, zoals alfa of de samenhang tussen twee afnames, en noemt nergens iets buiten de meting zelf waarmee vergeleken is. De vraag "wordt hier iets herhaald of wordt hier iets vergeleken" beslist welke van de twee aan de orde is.

Aselect trekken en aselect toewijzen door elkaar halen

Wat er misgaat: Je leest dat de deelnemers aselect over de twee condities zijn verdeeld en noteert dat deze studie goed generaliseert. Of je noemt een loting bij het werven een bescherming tegen confounds.

Hoe het wel moet: Toewijzen gebeurt binnen de studie, verdeelt de deelnemers over de condities en dient de interne validiteit. Trekken loopt van de populatie naar de studie, bepaalt wie er meedoet en dient de externe validiteit.

Waardoor het komt: Beide heten aselect, in beide gevallen beslist het lot, en het woord random in de casus lijkt dus hetzelfde te beloven. Daar komt bij dat veel experimenten allebei tegelijk hebben: een keurige toewijzing en een matige steekproef eerstejaars, wat sterk en zwak in een opzet zet.

Waaraan je het herkent: Je kunt bij een opzet niet aanwijzen op welk moment het lot is ingezet, voor of na de werving. Of je uitspraak over generaliseren steunt op een zin die over condities gaat in plaats van over de populatie.

Significant verwarren met groot

Wat er misgaat: Bij p is ,001 noteer je een sterk effect. En je leest de p-waarde als de kans dat de nulhypothese waar is, of als de kans dat je conclusie fout is.

Hoe het wel moet: De p-waarde is de kans op deze of een nog extremere uitkomst als de nulhypothese waar is, meer niet. Hoe groot het effect is lees je af aan de effectgrootte, dus aan Cohens d of aan r, en hoe precies de schatting is aan het betrouwbaarheidsinterval.

Waardoor het komt: In gewoon Nederlands betekent significant aanzienlijk. In dit vak betekent het alleen dat toeval een onwaarschijnlijke verklaring is, en dat lukt bij een grote groep ook met een verwaarloosbaar verschil. De p-waarde rekent bovendien vooruit vanuit een aanname naar de gegevens, en niet terug van de gegevens naar de waarheid van een hypothese.

Waaraan je het herkent: Je conclusie noemt wel een p-waarde en geen d of r. Of je zin over p begint met "de kans dat", gevolgd door iets over de hypothese in plaats van over de uitkomst.

Altijd dezelfde validiteit als eerste vraag

Wat er misgaat: Bij een experiment met vijftig eerstejaars noem je als grootste bezwaar dat die groep niet representatief is. Bij een percentage uit een enquête ga je juist op zoek naar een alternatieve verklaring.

Hoe het wel moet: Het zwaartepunt volgt uit de claim. Bij een frequentieclaim en een associatieclaim wegen constructvaliditeit en externe validiteit het zwaarst. Bij een causale claim weegt interne validiteit het zwaarst en mag externe validiteit juist wijken.

Waardoor het komt: De vier validiteiten worden als rijtje geleerd, alsof interne validiteit de strengste is en dus overal de belangrijkste. Het is eerder een verdeling van aandacht: interne validiteit speelt alleen zodra iemand beweert dat het ene het andere verandert, en bij een frequentieclaim is er niets gemanipuleerd om te verwarren.

Waaraan je het herkent: Je antwoord op "welke vraag stel je hier als eerste" is bij drie casussen achter elkaar hetzelfde. Of je noemt bij een claim over hoe vaak iets voorkomt een confound, terwijl daar maar één variabele in het spel is.

Een grote steekproef als bewijs van representativiteit

Wat er misgaat: Vierhonderd ingevulde enquêtes uit een oproep op een studentenpagina lijken je genoeg om iets over alle studenten te zeggen, zeker als de vragenlijst goed in elkaar zit.

Hoe het wel moet: Kijk eerst hoe de deelnemers erin zijn gekomen en pas daarna naar het aantal. Alleen bij een kanssteekproef mag je generaliseren. Omvang maakt de schatting preciezer, dus de foutmarge smaller, maar zij haalt scheefheid er niet uit.

Waardoor het komt: Meer waarnemingen voelen als meer bewijs, en voor de precisie klopt dat ook. Zelfselectie werkt alleen systematisch: elke extra deelnemer komt uit dezelfde scheve groep, dus de vertekening groeit gewoon mee. Precisie hoort bij de statistische validiteit, representativiteit bij de externe.

Waaraan je het herkent: In je oordeel over een steekproef staat wel een aantal en geen woord over hoe er getrokken is. Zie je "wie zich aanmeldde", "bezoekers van de site" of "studenten in de hal", dan gaat het antwoord over externe validiteit, hoe groot de groep ook is.

Een negatieve correlatie zwak noemen

Wat er misgaat: Je leest een r van -,60 als zwakker dan een r van ,30, omdat er een min voor staat. In een rijtje correlaties zet je de negatieve daarom onderaan.

Hoe het wel moet: Lees r in twee stappen en houd ze uit elkaar. Het teken geeft de richting, de afstand tot nul geeft de sterkte. Een r van -,60 is dus sterker dan een r van ,30, en alleen een r rond nul betekent zwak.

Waardoor het komt: In gewone taal is min minder. Bij een correlatie is de min geen hoeveelheid maar een richting: hoge scores gaan hier samen met lage scores. In meerkeuzevragen zit de afleider bijna altijd precies op die verwarring.

Waaraan je het herkent: Je zet twee correlaties op sterkte in volgorde en gebruikt daarbij het getal inclusief het teken. Of je omschrijft een negatief verband als "weinig verband" in plaats van als "omgekeerd verband".

Van r rond nul concluderen dat er niets is

Wat er misgaat: De uitvoer geeft een r van ,04 en je besluit dat de twee variabelen niets met elkaar te maken hebben.

Hoe het wel moet: r meet uitsluitend hoe goed een rechte lijn past. Bekijk het spreidingsdiagram voordat je concludeert. Bij een verband in de vorm van een omgekeerde U komt r rond nul uit terwijl er een duidelijk patroon zit, en bij een homogene groep drukt beperkt bereik r richting nul.

Waardoor het komt: Een getal uit een formule voelt als een oordeel over het verband zelf, terwijl het maar één vraag beantwoordt. Wie meteen naar de uitkomst kijkt, ziet de vorm van de puntenwolk niet, en juist die vorm bepaalt of Pearson hier het goede gereedschap was.

Waaraan je het herkent: Je hebt de uitvoertabel gelezen en de figuur niet. Of de casus vermeldt dat alleen studenten met een cijfer tussen 7 en 8 zijn onderzocht, en je gebruikt de lage r toch als uitspraak over alle studenten.

Geen verschil gevonden dus geen effect

Wat er misgaat: De condities verschillen niet significant en je concludeert dat de manipulatie niet werkt.

Hoe het wel moet: Geen verschil vinden is niet hetzelfde als aantonen dat er geen verschil is. Loop eerst de opzet langs. Lag de manipulatie ver genoeg uit elkaar, raakte de meting een plafond of een bodem, hoeveel deelnemers deden er mee, en hoe breed is het interval rond het gevonden verschil?

Waardoor het komt: Het signaal kan wegvallen doordat het zwak is en doordat er te veel ruis omheen staat, en allebei leveren ze dezelfde stilte op. Bij een kleine groep is een gemiste vondst, dus een type II fout, waarschijnlijker dan de conclusie dat er werkelijk niets bestaat.

Waaraan je het herkent: In de casus staat één opvallend detail dat je hebt overgeslagen: bijna iedereen had alles goed, er deden twaalf mensen per conditie mee, of de pauze duurde vijf tegenover zeven minuten. Dat detail is het antwoord, niet de uitkomst zelf.

Het betrouwbaarheidsinterval over losse studenten lezen

Wat er misgaat: Bij een gemiddelde reistijd van 28 minuten met een interval van 24,1 tot 31,9 zeg je dat 95 procent van de studenten tussen die twee tijden reist, of dat er 95 procent kans is dat de parameter in dit ene interval ligt.

Hoe het wel moet: Het interval hoort bij de schatting van het populatiegemiddelde en niet bij de spreiding tussen personen. Herhaal je deze werkwijze heel vaak, dan bevat 95 van de 100 intervallen het populatiegemiddelde. Het populatiegemiddelde zelf is een vast getal en geen kansding.

Waardoor het komt: Het interval is gebouwd op de standaardfout en niet op de standaardafwijking. De standaardafwijking zegt hoe ver losse mensen van het gemiddelde liggen, de standaardfout hoe ver steekproefgemiddelden van de parameter liggen, en die twee staan op de toets graag als twee antwoordopties naast elkaar.

Waaraan je het herkent: Je zin over het interval heeft "de studenten" als onderwerp in plaats van "het gemiddelde". Of je hebt bij het rekenen de standaardafwijking niet door de wortel uit n gedeeld, waardoor je interval veel te breed uitvalt.

Nu weet je waar je moet beginnen

De samenvatting van Kennismaking met onderzoeksmethoden en statistiek volgt de colleges, week voor week. Week 1 lees je gratis met een account.

Begin gratis met week 1 · Samenvatting Kennismaking met onderzoeksmethoden en statistiek · Bekijk prijzen

Let op: deze analyse is een inschatting op basis van de samenvatting van dit vak, niet van eerdere tentamens. De grafieken laten zien hoe zwaar de onderwerpen in de leerstof wegen en hoe complex ze zijn. Gebruik ze om je prioriteiten te bepalen, niet als blauwdruk voor het tentamen. Een goede voorbereiding blijft altijd breder dan wat je hier ziet.