De vragen en discussies die bij Toepassing van onderzoeksmethoden en statistiek horen: verbanden, tegenstellingen en denkfouten uit de stof. 33 vragen, waarvan 30 met een antwoord dat vrij te lezen is.
Nee. Alfa zegt iets over betrouwbaarheid: hangen de items met elkaar samen, meet de schaal consequent? Of je het juiste begrip meet, is een vraag over validiteit. Denk aan de schietschijf: pijlen dicht bij elkaar naast de roos zijn heel betrouwbaar, maar niet valide.
Validiteit beoordeel je op andere manieren. Lijkt de meting in orde (indrukvaliditeit)? Dekt hij alle aspecten (inhoudsvaliditeit)? Hangt hij samen met een andere meting van hetzelfde begrip (convergent), en juist niet met iets anders (discriminant)?
Dus: een hoge alfa is nodig, maar niet genoeg. Een schaal kan heel consequent het verkeerde meten.
Regressie beschrijft een verband met een vergelijking en voorspelt daarmee. De richtingscoëfficiënt van 5,08 zegt: wie één punt meer tevredenheid heeft, heeft gemiddeld 5,08 punten meer veerkracht. Dat is een uitspraak over verschillen tussen mensen, niet over wat er gebeurt als één persoon verandert.
Ga terug naar de drie voorwaarden voor causaliteit uit HC1: covariantie, volgorde in tijd en interne validiteit. Welke daarvan laat deze analyse zien? En had je de regressie ook andersom kunnen draaien, met veerkracht als predictor van tevredenheid?
Welke opzet zou je nodig hebben om echt iets te zeggen over de richting van het verband?
Omdat elke toets een kans op een Type I-fout heeft: H0 verwerpen terwijl dat niet had gemoeten. Bij één toets met α = .05 is die kans 5 procent. Doe je er drie, dan stapelen die kansen zich op. De kans dat minstens één van de drie ten onrechte significant is, wordt veel groter dan 5 procent. Dat heet kanskapitalisatie.
De eenweg-ANOVA vergelijkt alle groepen in één keer. H0 is dat alle gemiddelden gelijk zijn, H1 dat er minstens één anders is. Zo houd je de kans op een Type I-fout op α.
Let wel op wat een significante F zegt: dát er ergens een verschil is, niet tussen welke groepen. Daarvoor heb je vervolgtoetsen nodig.
Begin bij de bedreigingen van de interne validiteit. Een controlewijk vangt rijping en geschiedenis op: als het in heel Utrecht beter gaat, zie je dat in beide wijken. Maar er is geen randomisatie. De wijken kunnen al vóór de aanpak verschillen, en dan speelt het selectie-effect.
Denk ook aan besmetting: bewoners praten met elkaar, ook over wijkgrenzen heen. En aan demand characteristics: wie weet dat de gemeente iets nieuws probeert, geeft misschien rooskleuriger antwoorden.
Kun je hier überhaupt randomiseren, op het niveau van mensen of van wijken? En hoeveel interne validiteit ben je bereid in te leveren voor een onderzoek dat in het echte leven plaatsvindt?
Het hangt af van wat je met je onderzoek wilt. Wil je een theorie vormen, omdat er weinig bekend is of omdat je wilt horen hoe respondenten het zelf zien? Dan codeer je inductief, volgens grounded theory: open, axiaal en selectief. Wil je een theorie toetsen, omdat de literatuur al thema's aanreikt? Dan codeer je deductief, met een categorisatiematrix.
Kijk ook naar je eigen topiclijst. Staat die vol begrippen uit de literatuur, dan ligt deductief voor de hand. Was je interview heel open, dan past grounded theory beter.
Belangrijk is dat je de keuze verantwoordt. Het voorbeeld van de man uit Swaziland laat zien waarom. Met het WHO-model in de hand codeer je zijn angst als "bijwerking". Met een open blik zie je dat het medicijn voor hem alleen maar ziek maakt. De route bepaalt dus wat je vindt.
Op het eerste gezicht is het goed nieuws. De meeste fragmenten passen in de thema's uit de literatuur, dus de theorie lijkt ook in deze situatie te werken.
Maar kijk naar de 17,5 procent die niet past. In het diabetesvoorbeeld zat daar "ik ben trots dat ik gewoon mee kan". Dat is geen ruis: het is een gevoel dat de matrix helemaal mist. Denk ook aan de negative case uit grounded theory. Juist het geval dat niet past, laat zien waar een theorie ophoudt.
Wat zegt een hoge fit eigenlijk, als de matrix vooral negatieve gevoelens bevat? Kan een matrix ook "goed passen" omdat hij alleen zoekt naar wat hij al verwacht?
Omdat de t-toets van een predictor afhangt van welke andere predictoren er nog in het model zitten. Elke toets vraagt: voegt deze variabele iets toe, bovenop de rest? Haal je er één weg, dan verandert "de rest", en dus ook de uitkomst voor de andere.
Een predictor die eerst niet significant was, kan dat na het weghalen van een andere wel worden. Hij deelde misschien informatie met de variabele die eruit ging. Daarom haal je per ronde één predictor weg, die met de hoogste p. Daarna draai je het model opnieuw.
In het voorbeeld ging eerst moed eruit (p = .246). Daarna bleef moraal niet significant, maar die keuze maak je pas op basis van het nieuwe model.
De gestandaardiseerde coëfficiënt β = -.723 zegt dat depressie in dit model het zwaarst weegt bij het voorspellen van veerkracht. Dat is een uitspraak over voorspellen, niet over ingrijpen.
Denk aan de twee doelen van regressie: voorspellen en beschrijven. Welke van de twee past bij deze vraag? En denk aan correlationele data uit week 1: het onderzoek manipuleert niets, dus de volgorde in tijd ligt niet vast. Misschien leidt weinig veerkracht juist tot meer depressieve klachten.
Wat zou je moeten weten, en welk soort onderzoek zou je moeten doen, voordat je een interventie op dit model baseert?
Dat hangt af van één vraag: had je vooraf verwachtingen?
Zonder verwachtingen werk je exploratief. Dan doe je eerst een omnibus-ANOVA. Alleen bij een significante F vergelijk je daarna alle paren van groepen, bijna altijd tweezijdig, met een correctie zoals Bonferroni of Tukey tegen kanskapitalisatie.
Met verwachtingen werk je confirmatief. Dan toets je meteen geplande contrasten, zonder omnibus-ANOVA vooraf. Je kiest zelf de gewichten (ze tellen op tot nul), en je toetst vaak eenzijdig. Kijk dan eerst naar het teken van de estimate en deel pas daarna de p door twee.
Op de toets staat het antwoord meestal in de opzet. Staat er "de onderzoekers verwachtten dat…", dan zijn contrasten de logische keuze.
Kijk eerst wat elke methode precies vraagt. NHST vraagt hoe goed de data bij H0 passen, en verwerpt H0 als p onder α ligt. BHE weegt fit tegen specificiteit en vraagt welke hypothese de data het best verklaart.
Een p van .038 ligt maar net onder de grens, en het effect is klein (η² = 0,033). Een hypothese als "alle gemiddelden zijn gelijk" is heel specifiek. Als de data er redelijk bij passen, beloont BHE dat.
Is de botsing dan eigenlijk een tegenspraak, of zeggen ze samen dat het bewijs dun is? En wat zou je doen om de vraag echt te beslechten?
In beide gevallen vertelt de deelnemer meer dan goed is. Het verschil zit in het onderwerp van wat hij vertelt.
Bij pseudo-intimacy gaat het persoonlijke verhaal over je onderzoeksonderwerp. De gemoedelijke sfeer van het interview maakt dat iemand dieper gaat dan hij eigenlijk wilde. Bij script deviation vertelt de deelnemer persoonlijke dingen die níets met je onderwerp te maken hebben, en die je als onderzoeker liever niet had gehoord.
Een voorbeeld. Je interviewt Mimi over studiestress. Vertelt ze ineens uitgebreid over haar paniekaanvallen voor tentamens, dan is dat pseudo-intimacy. Begint ze over een ruzie met haar ex die niets met studeren te maken heeft, dan is het script deviation.
De member check hoort bij credibility: zijn je bevindingen plausibel in de ogen van de mensen over wie ze gaan? Een "nee" lijkt dus slecht nieuws.
Maar denk aan het verschil tussen het emic-perspectief en jouw analyse. Een deelnemer kent zijn eigen ervaring het best. Jij ziet patronen over twintig interviews heen, die één persoon misschien niet herkent of niet wil herkennen. En reflexiviteit vraagt juist dat je ook je eigen blik bevraagt.
Wie heeft het laatste woord over wat een ervaring betekent: de deelnemer of de onderzoeker? En hoe zou je een onenigheid in je verslag verantwoorden zonder je analyse weg te gooien?
Nee, en dat is een klassieke valkuil op de toets. Een fout wordt pas bias als hij systematisch is. Ontbreken er toevallig een paar mensen op je lijst, zonder patroon, dan is dat een willekeurige fout (random error). Je uitkomst blijft dan gemiddeld zuiver.
Bias ontstaat pas als wie ontbreekt op een relevant punt anders is dan wie meedoet. Stel dat je een vragenlijst over studiestress afneemt, en juist de meest gestreste studenten vullen hem niet in. Dan is dat nonresponsebias: je uitkomst lijkt rooskleuriger dan de werkelijkheid.
Zoek bij een toetsvraag dus altijd naar dat systematische verschil. Vraag je af: wie mist er, en verschillen zij op het punt dat ik meet?
Alfa zegt alleen dat de items met elkaar samenhangen. Als iedereen bij alle items een beetje netter antwoordt dan de waarheid, dan hangen die items nog steeds mooi samen. De hele lijst wijst dan consistent de verkeerde kant op.
Denk aan wat je uit dit college en eerder hebt geleerd. Het responsproces van Tourangeau laat zien dat sociale wenselijkheid bij de laatste stap, response, toeslaat. De mixed-mode designs uit HC1 bieden een andere vorm voor gevoelige vragen, zoals een deel dat de respondent zelf invult. En convergente validiteit vergelijkt je lijst met een andere meting.
Welke van die middelen pakt het probleem echt aan, en welke laten het alleen beter zien? Kan een vragenlijst over iets als alcoholgebruik ooit helemaal zonder vertekening?
Kijk niet naar het onderwerp, maar naar wie er in welke conditie zit. Zitten er verschillende mensen in de verschillende niveaus, dan is de factor between. Doorloopt iedereen alle niveaus, dan is hij within.
Een voorbeeld. Zestig studenten worden verdeeld over studeren zonder muziek, met klassieke muziek of met hardcore: between, want elke student zit in één conditie. Veertig studenten vullen 's ochtends, 's middags en 's avonds dezelfde lijst in: within, want iedereen doet alle drie.
Tijd is meestal within, maar een factor als gender is altijd between. Let ook op de gevolgen: bij within kijk je naar sfericiteit in plaats van gelijke varianties, en reken je op volgorde- en leereffecten.
Een within-design vergelijkt mensen met zichzelf. Daardoor vallen de verschillen tussen personen weg, heb je minder ruis en dus meer power, met een kleinere steekproef.
Maar denk aan de nadelen. Volgorde- en carry-overeffecten: wie eerst hardcore hoorde, is misschien nog gestrest bij de klassieke muziek. Leereffecten: wie de taak al kent, scoort beter. En sommige behandelingen kun je niet terugdraaien. Een therapie die je gehad hebt, of een uitleg die je begrepen hebt, kun je niet "vergeten" voor de volgende conditie.
Bij welke onderzoeksvragen helpt counterbalancing genoeg, en bij welke maakt de aard van de manipulatie een within-design onmogelijk?
Nee. Twee losse fases achter elkaar maken nog geen mixed methods. Dat noemt het college 1 + 1 ≠ 2. De meerwaarde ontstaat pas als de twee delen elkaar echt iets opleveren. De interviews verklaren bijvoorbeeld wat de cijfers lieten zien, of de vragenlijst toetst wat de interviews opleverden.
Kijk daarom naar het doel. Wil je met de interviews de uitkomsten van de vragenlijst verklaren, dan heb je een explanatory sequential design (QUAN → QUAL). Het voorbeeld van Igo et al. (2005) laat zien hoe dat werkt: de interviews legden uit waarom de groep met maar zeven woorden per cel meer leerde.
Het lastigste deel is integreren. Een kwalitatief deel dat alleen een paar mooie citaten bij de cijfers levert, is volgens het college geen echte integratie.
Het artikel van Sleijpen et al. (2017) wil beschrijven, vertrekt vanuit de belevingswereld van de deelnemers en is holistisch. Dat zijn kenmerken van het interpretatieve paradigma. Maar de discussie legt een nadruk die de resultaten niet helemaal dragen, en de eerste auteur werkte waar de deelnemers werden geworven.
Denk na over wat het kritisch-emancipatoire paradigma wil: onderzoek als wereldverbetering, de deelnemers een stem geven. Is dat een tweede agenda die de kwaliteit aantast? Of is het een legitiem doel dat het artikel alleen beter had moeten verantwoorden?
En wat betekent het voor credibility en confirmability als een onderzoeker niet alleen wil begrijpen, maar ook wil veranderen?
In de enkelvoudige regressie was b voor IQ 0.088. In het meervoudige model is dat 0.034. Dat komt doordat elke coëfficiënt in een meervoudige regressie het effect is gecorrigeerd voor de andere voorspellers.
Zonder studie-uren in het model krijgt IQ een deel van de voorspelling op zijn naam dat eigenlijk bij elkaar hoort. Zodra uren erbij komen, deelt IQ die voorspelling. Wat overblijft, is het effect van IQ bij een gelijk aantal studie-uren.
Wil je weten welke voorspeller het zwaarst weegt, kijk dan naar de gestandaardiseerde coëfficiënten: uren .337 tegen IQ .169. Vergelijk nooit op de ongestandaardiseerde b, want die hangt af van de meeteenheid.
Begin bij het verschil tussen een willekeurige en een systematische fout. De steekproeffout is toeval: je meet niet iedereen. Je kent hem nooit precies, maar met de standaardfout kun je wel schatten hoe groot hij gemiddeld is. En hij wordt kleiner naarmate je steekproef groter wordt.
Nonresponse werkt anders. Als wie niet meedoet systematisch verschilt van wie wel meedoet, ontstaat bias. Die wordt niet kleiner door meer mensen te ondervragen: je krijgt dan alleen een preciezere schatting van een vertekend getal.
Wat zegt dat over het idee dat "veel respondenten" vanzelf een betrouwbare uitkomst geven? En welke stappen in de survey-cyclus zouden nonresponsebias kunnen beperken?
Niet altijd. Een Bayes-factor zegt hoeveel steun de ene hypothese krijgt ten opzichte van de andere. Wat dat betekent, hangt af van wat er in die hypothese staat.
In het Sesamstraat-voorbeeld zegt H1 dat kinderen die thuis kijken evenveel kennis hebben als kinderen die op school kijken. Dat is een hypothese van gelijkheid. BF.c = 3.596 betekent dan: 3,6 keer zoveel steun voor gelijke gemiddelden als voor het complement. Dat is dus steun voor "geen verschil".
Lees bij een bain-output daarom altijd eerst welke hypothese er getoetst wordt. Pas daarna kijk je naar het getal.
De Bayes-factor beloont specificiteit. Een hypothese als μC < μEI < μDI zegt veel meer dan "de gemiddelden verschillen", en als de data erbij passen, krijgt ze daarom meer steun. Een vage hypothese past altijd, maar je leert er niets van.
Maar denk aan de kant van de onderzoeker. Een specifieke hypothese moet uit theorie of eerdere kennis komen. Heb je die niet, dan gok je misschien. En denk terug aan de replicatiecrisis uit HC1: daar ging het mis doordat onderzoekers achteraf bijstuurden. Een hypothese die vooraf vastligt, beschermt daartegen.
Is specifiek zijn dan een risico, of juist de eerlijkste manier van werken? En wat doe je als je theorie gewoon nog niet ver genoeg is om een volgorde te voorspellen?
Nog geen antwoord: een vraag om zelf over na te denken.
Nog geen antwoord: een vraag om zelf over na te denken.
Nog geen antwoord: een vraag om zelf over na te denken.
Nog niet. Een boomstructuur van hoofd- en subthema's is het resultaat van axiaal coderen. Daar bundel je open codes en geef je elk thema een definitie. De vraag in die fase is: wat hoort bij elkaar?
Selectief coderen gaat een stap verder. Je legt de relaties tussen de thema's en zoekt het overkoepelende verhaal. De vraag is dan: hoe hangt het samen? Bij de Finse jongeren uit week 2 leverde dat een model op waarin ouders, groepsdruk, zelfvertrouwen en de omgeving samen de gezondheidskeuzes sturen.
Een snelle check: kun je in een paar zinnen uitleggen hoe je thema's elkaar beïnvloeden en zo je onderzoeksvraag beantwoorden? Dan zit je in de selectieve fase. Heb je alleen een lijst, dan nog niet.
Een societal blind spot is een blinde vlek in een systeem waar je zelf deel van uitmaakt. Vraag je mensen ernaar in een interview, dan krijg je vooral wat ze zelf zien, en het punt is juist dat ze het niet zien.
Bestaande gegevens zijn vastgelegd zonder dat de onderzoeker er iets aan deed. Denk aan teksten, beelden of beslissingen die een systeem al heeft gemaakt. Daar kun je op manifest niveau tellen, en op latent niveau interpreteren wat er onder ligt.
Maar wie kijkt er naar die gegevens? Als de onderzoeker zelf deel uitmaakt van hetzelfde systeem, ziet hij de blinde vlek dan wel? Wat zou reflexiviteit, of onderzoekertriangulatie, hier moeten doen?
Een schaalscore werkt alleen als een hoge score op elk item hetzelfde betekent. Bij veerkracht moet hoog steeds "veel veerkracht" zijn. Een omgekeerd geformuleerd item, zoals "Ik vraag me vaak af wat het nut van het leven is", werkt andersom. Wie daar "eens" invult, scoort hoog maar heeft juist weinig veerkracht.
Tel je zo'n item mee zonder ompolen, dan trekken de items elkaar tegen. Je score meet dan niet meer wat hij moet meten. Ompolen draait de schaal om: op een schaal van 1 tot 7 wordt een 6 een 2 en blijft een 4 een 4.
Op de vaardighedentoets kan het je opvallen in de beschrijvende statistiek. Heeft één item een veel lager gemiddelde dan de rest, dan is dat vaak het omgekeerde item. Polen eerst, optellen daarna.
Posts zijn toevallige data (organic data): ze bestaan al en zijn niet voor onderzoek gemaakt. Een vragenlijst levert doelgerichte data (designed data). Dat verschil zegt al iets over wat je in handen hebt.
Denk aan de winst. Je hebt enorm veel data, je hoeft niemand te werven en het model van Tourangeau speelt geen rol, want niemand beantwoordt jouw vraag. Denk ook aan het verlies. Je hebt geen operationalisatie van somberheid: wat is een "sombere post"? Je weet niet wie er post en wie niet, dus generaliseren naar alle studenten wordt lastig.
Welk inferentieel doel heb je eigenlijk: beschrijven, causaliteit of voorspellen? En past toevallige data bij dat doel?
Ze gaan over dezelfde data, maar beantwoorden een andere vraag. NHST neemt H0 als uitgangspunt en kijkt hoe goed de data daarbij passen. Is p kleiner dan α, dan verwerp je H0. De uitkomst heeft twee smaken: wel of niet verwerpen.
Een Bayes Factor vergelijkt twee hypothesen met elkaar. BF10 = 1,56 betekent dat H1 1,56 keer zoveel steun krijgt als H0. Dat is een gradatie, en er is geen vaste grens zoals α. De posterior modelkansen (0,609 voor H1, 0,391 voor H0) laten zien dat de keuze niet erg overtuigend is.
Dus: NHST zegt "significant", BHE zegt "een beetje meer steun voor H1". Ze spreken elkaar niet tegen, maar BHE laat beter zien hoe dun het bewijs is. In allebei de gevallen is replicatie de logische volgende stap.
Kijk eerst naar wat preregistratie precies tegenhoudt. Het tijdschrift beoordeelt de opzet vooraf en publiceert het resultaat, significant of niet. Dat raakt twee dingen: publicatiebias en twijfelachtige onderzoekspraktijken, zoals bijmeten tot p onder .05 zakt.
Denk dan aan onderzoek dat zich minder goed vooraf laat vastleggen. Hoe zit het met verkennend onderzoek zonder verwachte richting? En met de kwalitatieve lijn van TOE, waar je bij grounded theory juist codes uit de data laat komen?
Is preregistratie dus een oplossing voor alle onderzoek, of vooral voor confirmatief, toetsend onderzoek? En wat zou het betekenen als alleen dat soort onderzoek nog serieus genomen wordt?
Een probe blijft bij het onderwerp dat al op tafel ligt. Je laat merken dat je meer wilt horen. Dat kan heel klein: even stil zijn, "hm-hm" zeggen of vragen "Wat bedoel je daarmee?". Probes lopen van open (stilte) naar specifiek (samenvatten en checken of je het goed begrijpt).
Een prompt opent juist een nieuw onderwerp. "Ik wil het nu graag over de huur hebben" is een prompt. Een handig ezelsbruggetje: een probe graaft dieper in hetzelfde gat, een prompt begint een nieuw gat.
Op de toets krijg je vaak een stukje transcript. Vraag je dan bij elke interviewerzin af: gaat het gesprek over hetzelfde verder, of verschuift het onderwerp? In het eerste geval is het een probe, in het tweede een prompt.
Begin bij de twee assen. Doe je mee (participerend)? Ja, je woont er. Weten je huisgenoten het (overt of covert)? Dat bepaal jij. Zeg je niets, dan ben je complete participant; vertel je het wel, dan participant observer.
Kijk dan naar de risico's. Als je het vertelt, loop je kans op reactiviteit: Sjors doet ineens wel de afwas. Misschien treedt na een paar weken naturalisatie op. Als je het niet vertelt, zit je dicht op going native, want je bént al een insider. Je eigen positie in het huis hoort dan in je subjectivity statement.
Welke van de twee rollen levert hier betrouwbaardere data op? En is covert observeren bij mensen met wie je samenwoont nog te verantwoorden?
Samenvatting Toepassing van onderzoeksmethoden en statistiek · Oefenen met Toepassing van onderzoeksmethoden en statistiek · Bekijk prijzen