Vragen over Toepassing van onderzoeksmethoden en statistiek (TOE)

De vragen en discussies die bij Toepassing van onderzoeksmethoden en statistiek horen: verbanden, tegenstellingen en denkfouten uit de stof. 33 vragen, waarvan 30 met een antwoord dat vrij te lezen is.

Correlationeel HC2: Betrouwbaarheid en enkelvoudige regressie

Als Cronbach's alfa hoog is, meet mijn vragenlijst dan ook wat hij moet meten?

Nee. Alfa zegt iets over betrouwbaarheid: hangen de items met elkaar samen, meet de schaal consequent? Of je het juiste begrip meet, is een vraag over validiteit. Denk aan de schietschijf: pijlen dicht bij elkaar naast de roos zijn heel betrouwbaar, maar niet valide.

Validiteit beoordeel je op andere manieren. Lijkt de meting in orde (indrukvaliditeit)? Dekt hij alle aspecten (inhoudsvaliditeit)? Hangt hij samen met een andere meting van hetzelfde begrip (convergent), en juist niet met iets anders (discriminant)?

Dus: een hoge alfa is nodig, maar niet genoeg. Een schaal kan heel consequent het verkeerde meten.

Tevredenheid voorspelt veerkracht heel goed. Mag ik dan zeggen dat je veerkrachtiger wordt als je tevredener bent?

Regressie beschrijft een verband met een vergelijking en voorspelt daarmee. De richtingscoëfficiënt van 5,08 zegt: wie één punt meer tevredenheid heeft, heeft gemiddeld 5,08 punten meer veerkracht. Dat is een uitspraak over verschillen tussen mensen, niet over wat er gebeurt als één persoon verandert.

Ga terug naar de drie voorwaarden voor causaliteit uit HC1: covariantie, volgorde in tijd en interne validiteit. Welke daarvan laat deze analyse zien? En had je de regressie ook andersom kunnen draaien, met veerkracht als predictor van tevredenheid?

Welke opzet zou je nodig hebben om echt iets te zeggen over de richting van het verband?

Experimenteel HC2: Experimentele designs, interne validiteit en eenweg-ANOVA

Waarom mag ik bij drie groepen niet gewoon drie t-toetsen doen?

Omdat elke toets een kans op een Type I-fout heeft: H0 verwerpen terwijl dat niet had gemoeten. Bij één toets met α = .05 is die kans 5 procent. Doe je er drie, dan stapelen die kansen zich op. De kans dat minstens één van de drie ten onrechte significant is, wordt veel groter dan 5 procent. Dat heet kanskapitalisatie.

De eenweg-ANOVA vergelijkt alle groepen in één keer. H0 is dat alle gemiddelden gelijk zijn, H1 dat er minstens één anders is. Zo houd je de kans op een Type I-fout op α.

Let wel op wat een significante F zegt: dát er ergens een verschil is, niet tussen welke groepen. Daarvoor heb je vervolgtoetsen nodig.

Stel dat de gemeente Utrecht een nieuwe aanpak tegen eenzaamheid test door één wijk te vergelijken met een andere. Hoe sterk is zo'n onderzoek?

Begin bij de bedreigingen van de interne validiteit. Een controlewijk vangt rijping en geschiedenis op: als het in heel Utrecht beter gaat, zie je dat in beide wijken. Maar er is geen randomisatie. De wijken kunnen al vóór de aanpak verschillen, en dan speelt het selectie-effect.

Denk ook aan besmetting: bewoners praten met elkaar, ook over wijkgrenzen heen. En aan demand characteristics: wie weet dat de gemeente iets nieuws probeert, geeft misschien rooskleuriger antwoorden.

Kun je hier überhaupt randomiseren, op het niveau van mensen of van wijken? En hoeveel interne validiteit ben je bereid in te leveren voor een onderzoek dat in het echte leven plaatsvindt?

Kwalitatief HC2: Kwalitatieve data-analyse en coderen

Wanneer kies ik nou inductief en wanneer deductief coderen? Voor ons verslag lijkt allebei te kunnen.

Het hangt af van wat je met je onderzoek wilt. Wil je een theorie vormen, omdat er weinig bekend is of omdat je wilt horen hoe respondenten het zelf zien? Dan codeer je inductief, volgens grounded theory: open, axiaal en selectief. Wil je een theorie toetsen, omdat de literatuur al thema's aanreikt? Dan codeer je deductief, met een categorisatiematrix.

Kijk ook naar je eigen topiclijst. Staat die vol begrippen uit de literatuur, dan ligt deductief voor de hand. Was je interview heel open, dan past grounded theory beter.

Belangrijk is dat je de keuze verantwoordt. Het voorbeeld van de man uit Swaziland laat zien waarom. Met het WHO-model in de hand codeer je zijn angst als "bijwerking". Met een open blik zie je dat het medicijn voor hem alleen maar ziek maakt. De route bepaalt dus wat je vindt.

Een categorisatiematrix met een fit van 82,5 procent: is dat goed nieuws voor de theorie, of juist niet?

Op het eerste gezicht is het goed nieuws. De meeste fragmenten passen in de thema's uit de literatuur, dus de theorie lijkt ook in deze situatie te werken.

Maar kijk naar de 17,5 procent die niet past. In het diabetesvoorbeeld zat daar "ik ben trots dat ik gewoon mee kan". Dat is geen ruis: het is een gevoel dat de matrix helemaal mist. Denk ook aan de negative case uit grounded theory. Juist het geval dat niet past, laat zien waar een theorie ophoudt.

Wat zegt een hoge fit eigenlijk, als de matrix vooral negatieve gevoelens bevat? Kan een matrix ook "goed passen" omdat hij alleen zoekt naar wat hij al verwacht?

Correlationeel HC3: Meervoudige regressie, van stappenplan tot voorwaarden

Waarom mag ik niet alle niet-significante predictoren in één keer uit mijn model halen?

Omdat de t-toets van een predictor afhangt van welke andere predictoren er nog in het model zitten. Elke toets vraagt: voegt deze variabele iets toe, bovenop de rest? Haal je er één weg, dan verandert "de rest", en dus ook de uitkomst voor de andere.

Een predictor die eerst niet significant was, kan dat na het weghalen van een andere wel worden. Hij deelde misschien informatie met de variabele die eruit ging. Daarom haal je per ronde één predictor weg, die met de hoogste p. Daarna draai je het model opnieuw.

In het voorbeeld ging eerst moed eruit (p = .246). Daarna bleef moraal niet significant, maar die keuze maak je pas op basis van het nieuwe model.

Depressie heeft de grootste β in het veerkrachtmodel. Betekent dit dat je veerkracht het best verbetert door depressie aan te pakken?

De gestandaardiseerde coëfficiënt β = -.723 zegt dat depressie in dit model het zwaarst weegt bij het voorspellen van veerkracht. Dat is een uitspraak over voorspellen, niet over ingrijpen.

Denk aan de twee doelen van regressie: voorspellen en beschrijven. Welke van de twee past bij deze vraag? En denk aan correlationele data uit week 1: het onderzoek manipuleert niets, dus de volgorde in tijd ligt niet vast. Misschien leidt weinig veerkracht juist tot meer depressieve klachten.

Wat zou je moeten weten, en welk soort onderzoek zou je moeten doen, voordat je een interventie op dit model baseert?

Experimenteel HC3: Post-hoctoetsen, geplande contrasten en informatieve hypothesen

Wanneer kies ik post-hoctoetsen en wanneer geplande contrasten?

Dat hangt af van één vraag: had je vooraf verwachtingen?

Zonder verwachtingen werk je exploratief. Dan doe je eerst een omnibus-ANOVA. Alleen bij een significante F vergelijk je daarna alle paren van groepen, bijna altijd tweezijdig, met een correctie zoals Bonferroni of Tukey tegen kanskapitalisatie.

Met verwachtingen werk je confirmatief. Dan toets je meteen geplande contrasten, zonder omnibus-ANOVA vooraf. Je kiest zelf de gewichten (ze tellen op tot nul), en je toetst vaak eenzijdig. Kijk dan eerst naar het teken van de estimate en deel pas daarna de p door twee.

Op de toets staat het antwoord meestal in de opzet. Staat er "de onderzoekers verwachtten dat…", dan zijn contrasten de logische keuze.

NHST vindt een significant effect, maar BHE geeft meer steun aan "geen verschil". Welke van de twee moet ik geloven?

Kijk eerst wat elke methode precies vraagt. NHST vraagt hoe goed de data bij H0 passen, en verwerpt H0 als p onder α ligt. BHE weegt fit tegen specificiteit en vraagt welke hypothese de data het best verklaart.

Een p van .038 ligt maar net onder de grens, en het effect is klein (η² = 0,033). Een hypothese als "alle gemiddelden zijn gelijk" is heel specifiek. Als de data er redelijk bij passen, beloont BHE dat.

Is de botsing dan eigenlijk een tegenspraak, of zeggen ze samen dat het bewijs dun is? En wat zou je doen om de vraag echt te beslechten?

Kwalitatief HC3: Goed kwalitatief onderzoek, reflexiviteit en ethiek

Pseudo-intimacy en script deviation lijken op elkaar. Hoe houd ik ze uit elkaar?

In beide gevallen vertelt de deelnemer meer dan goed is. Het verschil zit in het onderwerp van wat hij vertelt.

Bij pseudo-intimacy gaat het persoonlijke verhaal over je onderzoeksonderwerp. De gemoedelijke sfeer van het interview maakt dat iemand dieper gaat dan hij eigenlijk wilde. Bij script deviation vertelt de deelnemer persoonlijke dingen die níets met je onderwerp te maken hebben, en die je als onderzoeker liever niet had gehoord.

Een voorbeeld. Je interviewt Mimi over studiestress. Vertelt ze ineens uitgebreid over haar paniekaanvallen voor tentamens, dan is dat pseudo-intimacy. Begint ze over een ruzie met haar ex die niets met studeren te maken heeft, dan is het script deviation.

Een member check legt mijn interpretatie terug aan de deelnemers. Maar wat als zij het niet eens zijn met mijn analyse?

De member check hoort bij credibility: zijn je bevindingen plausibel in de ogen van de mensen over wie ze gaan? Een "nee" lijkt dus slecht nieuws.

Maar denk aan het verschil tussen het emic-perspectief en jouw analyse. Een deelnemer kent zijn eigen ervaring het best. Jij ziet patronen over twintig interviews heen, die één persoon misschien niet herkent of niet wil herkennen. En reflexiviteit vraagt juist dat je ook je eigen blik bevraagt.

Wie heeft het laatste woord over wat een ervaring betekent: de deelnemer of de onderzoeker? En hoe zou je een onenigheid in je verslag verantwoorden zonder je analyse weg te gooien?

Correlationeel HC4: Meten, Total Survey Error en het responsproces

Is elke fout in een steekproef meteen bias?

Nee, en dat is een klassieke valkuil op de toets. Een fout wordt pas bias als hij systematisch is. Ontbreken er toevallig een paar mensen op je lijst, zonder patroon, dan is dat een willekeurige fout (random error). Je uitkomst blijft dan gemiddeld zuiver.

Bias ontstaat pas als wie ontbreekt op een relevant punt anders is dan wie meedoet. Stel dat je een vragenlijst over studiestress afneemt, en juist de meest gestreste studenten vullen hem niet in. Dan is dat nonresponsebias: je uitkomst lijkt rooskleuriger dan de werkelijkheid.

Zoek bij een toetsvraag dus altijd naar dat systematische verschil. Vraag je af: wie mist er, en verschillen zij op het punt dat ik meet?

Een hoge Cronbach's alfa beschermt niet tegen sociale wenselijkheid. Hoe kun je dan ooit vertrouwen op een vragenlijst over gevoelige onderwerpen?

Alfa zegt alleen dat de items met elkaar samenhangen. Als iedereen bij alle items een beetje netter antwoordt dan de waarheid, dan hangen die items nog steeds mooi samen. De hele lijst wijst dan consistent de verkeerde kant op.

Denk aan wat je uit dit college en eerder hebt geleerd. Het responsproces van Tourangeau laat zien dat sociale wenselijkheid bij de laatste stap, response, toeslaat. De mixed-mode designs uit HC1 bieden een andere vorm voor gevoelige vragen, zoals een deel dat de respondent zelf invult. En convergente validiteit vergelijkt je lijst met een andere meting.

Welke van die middelen pakt het probleem echt aan, en welke laten het alleen beter zien? Kan een vragenlijst over iets als alcoholgebruik ooit helemaal zonder vertekening?

Experimenteel HC4: Between en within, repeated measures ANOVA

Hoe weet ik of een factor between of within is?

Kijk niet naar het onderwerp, maar naar wie er in welke conditie zit. Zitten er verschillende mensen in de verschillende niveaus, dan is de factor between. Doorloopt iedereen alle niveaus, dan is hij within.

Een voorbeeld. Zestig studenten worden verdeeld over studeren zonder muziek, met klassieke muziek of met hardcore: between, want elke student zit in één conditie. Veertig studenten vullen 's ochtends, 's middags en 's avonds dezelfde lijst in: within, want iedereen doet alle drie.

Tijd is meestal within, maar een factor als gender is altijd between. Let ook op de gevolgen: bij within kijk je naar sfericiteit in plaats van gelijke varianties, en reken je op volgorde- en leereffecten.

Herhaalde metingen geven meer power. Waarom zou je dan nog ooit voor een between-design kiezen?

Een within-design vergelijkt mensen met zichzelf. Daardoor vallen de verschillen tussen personen weg, heb je minder ruis en dus meer power, met een kleinere steekproef.

Maar denk aan de nadelen. Volgorde- en carry-overeffecten: wie eerst hardcore hoorde, is misschien nog gestrest bij de klassieke muziek. Leereffecten: wie de taak al kent, scoort beter. En sommige behandelingen kun je niet terugdraaien. Een therapie die je gehad hebt, of een uitleg die je begrepen hebt, kun je niet "vergeten" voor de volgende conditie.

Bij welke onderzoeksvragen helpt counterbalancing genoeg, en bij welke maakt de aard van de manipulatie een within-design onmogelijk?

Kwalitatief HC4: Perspectieven op ethiek, mixed methods en filosofie van onderzoek

Ik doe eerst een vragenlijst en daarna een paar interviews. Is dat automatisch mixed methods?

Nee. Twee losse fases achter elkaar maken nog geen mixed methods. Dat noemt het college 1 + 1 ≠ 2. De meerwaarde ontstaat pas als de twee delen elkaar echt iets opleveren. De interviews verklaren bijvoorbeeld wat de cijfers lieten zien, of de vragenlijst toetst wat de interviews opleverden.

Kijk daarom naar het doel. Wil je met de interviews de uitkomsten van de vragenlijst verklaren, dan heb je een explanatory sequential design (QUAN → QUAL). Het voorbeeld van Igo et al. (2005) laat zien hoe dat werkt: de interviews legden uit waarom de groep met maar zeven woorden per cel meer leerde.

Het lastigste deel is integreren. Een kwalitatief deel dat alleen een paar mooie citaten bij de cijfers levert, is volgens het college geen echte integratie.

Kan een onderzoek tegelijk interpretatief en kritisch-emancipatoir zijn, zoals het artikel over jonge vluchtelingen?

Het artikel van Sleijpen et al. (2017) wil beschrijven, vertrekt vanuit de belevingswereld van de deelnemers en is holistisch. Dat zijn kenmerken van het interpretatieve paradigma. Maar de discussie legt een nadruk die de resultaten niet helemaal dragen, en de eerste auteur werkte waar de deelnemers werden geworven.

Denk na over wat het kritisch-emancipatoire paradigma wil: onderzoek als wereldverbetering, de deelnemers een stem geven. Is dat een tweede agenda die de kwaliteit aantast? Of is het een legitiem doel dat het artikel alleen beter had moeten verantwoorden?

En wat betekent het voor credibility en confirmability als een onderzoeker niet alleen wil begrijpen, maar ook wil veranderen?

Correlationeel: responsiecollege en herhaling

Waarom wordt het effect van IQ kleiner als ik studie-uren aan het model toevoeg?

In de enkelvoudige regressie was b voor IQ 0.088. In het meervoudige model is dat 0.034. Dat komt doordat elke coëfficiënt in een meervoudige regressie het effect is gecorrigeerd voor de andere voorspellers.

Zonder studie-uren in het model krijgt IQ een deel van de voorspelling op zijn naam dat eigenlijk bij elkaar hoort. Zodra uren erbij komen, deelt IQ die voorspelling. Wat overblijft, is het effect van IQ bij een gelijk aantal studie-uren.

Wil je weten welke voorspeller het zwaarst weegt, kijk dan naar de gestandaardiseerde coëfficiënten: uren .337 tegen IQ .169. Vergelijk nooit op de ongestandaardiseerde b, want die hangt af van de meeteenheid.

Een steekproeffout ontstaat altijd. Waarom maken onderzoekers zich dan vaak meer zorgen om nonresponse dan om de steekproeffout?

Begin bij het verschil tussen een willekeurige en een systematische fout. De steekproeffout is toeval: je meet niet iedereen. Je kent hem nooit precies, maar met de standaardfout kun je wel schatten hoe groot hij gemiddeld is. En hij wordt kleiner naarmate je steekproef groter wordt.

Nonresponse werkt anders. Als wie niet meedoet systematisch verschilt van wie wel meedoet, ontstaat bias. Die wordt niet kleiner door meer mensen te ondervragen: je krijgt dan alleen een preciezere schatting van een vertekend getal.

Wat zegt dat over het idee dat "veel respondenten" vanzelf een betrouwbare uitkomst geven? En welke stappen in de survey-cyclus zouden nonresponsebias kunnen beperken?

Experimenteel: responsiecollege en herhaling

Een Bayes-factor groter dan 1 betekent toch steun voor een effect?

Niet altijd. Een Bayes-factor zegt hoeveel steun de ene hypothese krijgt ten opzichte van de andere. Wat dat betekent, hangt af van wat er in die hypothese staat.

In het Sesamstraat-voorbeeld zegt H1 dat kinderen die thuis kijken evenveel kennis hebben als kinderen die op school kijken. Dat is een hypothese van gelijkheid. BF.c = 3.596 betekent dan: 3,6 keer zoveel steun voor gelijke gemiddelden als voor het complement. Dat is dus steun voor "geen verschil".

Lees bij een bain-output daarom altijd eerst welke hypothese er getoetst wordt. Pas daarna kijk je naar het getal.

Specifieke hypothesen geven een heldere conclusie. Maar is het niet riskant om je vooraf zo vast te leggen?

De Bayes-factor beloont specificiteit. Een hypothese als μC < μEI < μDI zegt veel meer dan "de gemiddelden verschillen", en als de data erbij passen, krijgt ze daarom meer steun. Een vage hypothese past altijd, maar je leert er niets van.

Maar denk aan de kant van de onderzoeker. Een specifieke hypothese moet uit theorie of eerdere kennis komen. Heb je die niet, dan gok je misschien. En denk terug aan de replicatiecrisis uit HC1: daar ging het mis doordat onderzoekers achteraf bijstuurden. Een hypothese die vooraf vastligt, beschermt daartegen.

Is specifiek zijn dan een risico, of juist de eerlijkste manier van werken? En wat doe je als je theorie gewoon nog niet ver genoeg is om een volgorde te voorspellen?

Kwalitatief, correlationeel of experimenteel: is er een vraag waarvoor je echt alle drie de lijnen van TOE nodig hebt?

Nog geen antwoord: een vraag om zelf over na te denken.

De replicatiecrisis ging over experimenten met een p-waarde. Kent kwalitatief onderzoek een eigen versie van dat probleem, en wat zou de oplossing zijn?

Nog geen antwoord: een vraag om zelf over na te denken.

Betrouwbaarheid, interne validiteit, credibility: als elke lijn zijn eigen woorden heeft voor kwaliteit, bedoelen ze dan hetzelfde?

Nog geen antwoord: een vraag om zelf over na te denken.

Kwalitatief: responsiecollege en herhaling

Ik heb een lijst met hoofdthema's en subthema's. Ben ik dan klaar met selectief coderen?

Nog niet. Een boomstructuur van hoofd- en subthema's is het resultaat van axiaal coderen. Daar bundel je open codes en geef je elk thema een definitie. De vraag in die fase is: wat hoort bij elkaar?

Selectief coderen gaat een stap verder. Je legt de relaties tussen de thema's en zoekt het overkoepelende verhaal. De vraag is dan: hoe hangt het samen? Bij de Finse jongeren uit week 2 leverde dat een model op waarin ouders, groepsdruk, zelfvertrouwen en de omgeving samen de gezondheidskeuzes sturen.

Een snelle check: kun je in een paar zinnen uitleggen hoe je thema's elkaar beïnvloeden en zo je onderzoeksvraag beantwoorden? Dan zit je in de selectieve fase. Heb je alleen een lijst, dan nog niet.

Vooroordelen in algoritmen gelden als een maatschappelijke blinde vlek. Waarom zijn juist bestaande gegevens geschikt om zoiets te onderzoeken?

Een societal blind spot is een blinde vlek in een systeem waar je zelf deel van uitmaakt. Vraag je mensen ernaar in een interview, dan krijg je vooral wat ze zelf zien, en het punt is juist dat ze het niet zien.

Bestaande gegevens zijn vastgelegd zonder dat de onderzoeker er iets aan deed. Denk aan teksten, beelden of beslissingen die een systeem al heeft gemaakt. Daar kun je op manifest niveau tellen, en op latent niveau interpreteren wat er onder ligt.

Maar wie kijkt er naar die gegevens? Als de onderzoeker zelf deel uitmaakt van hetzelfde systeem, ziet hij de blinde vlek dan wel? Wat zou reflexiviteit, of onderzoekertriangulatie, hier moeten doen?

Correlationeel HC1: Correlationele data, vragenlijsten, itemscores en schaalscores

Waarom moet ik een item eerst ompolen? Ik kan toch gewoon alles optellen?

Een schaalscore werkt alleen als een hoge score op elk item hetzelfde betekent. Bij veerkracht moet hoog steeds "veel veerkracht" zijn. Een omgekeerd geformuleerd item, zoals "Ik vraag me vaak af wat het nut van het leven is", werkt andersom. Wie daar "eens" invult, scoort hoog maar heeft juist weinig veerkracht.

Tel je zo'n item mee zonder ompolen, dan trekken de items elkaar tegen. Je score meet dan niet meer wat hij moet meten. Ompolen draait de schaal om: op een schaal van 1 tot 7 wordt een 6 een 2 en blijft een 4 een 4.

Op de vaardighedentoets kan het je opvallen in de beschrijvende statistiek. Heeft één item een veel lager gemiddelde dan de rest, dan is dat vaak het omgekeerde item. Polen eerst, optellen daarna.

Stel dat ik met data van sociale media wil onderzoeken of studenten in de tentamenweek somberder posten. Wat win en wat verlies ik ten opzichte van een vragenlijst?

Posts zijn toevallige data (organic data): ze bestaan al en zijn niet voor onderzoek gemaakt. Een vragenlijst levert doelgerichte data (designed data). Dat verschil zegt al iets over wat je in handen hebt.

Denk aan de winst. Je hebt enorm veel data, je hoeft niemand te werven en het model van Tourangeau speelt geen rol, want niemand beantwoordt jouw vraag. Denk ook aan het verlies. Je hebt geen operationalisatie van somberheid: wat is een "sombere post"? Je weet niet wie er post en wie niet, dus generaliseren naar alle studenten wordt lastig.

Welk inferentieel doel heb je eigenlijk: beschrijven, causaliteit of voorspellen? En past toevallige data bij dat doel?

Experimenteel HC1: Twee groepen vergelijken met de t-toets, via NHST en Bayesiaanse hypothese-evaluatie

Een p-waarde van .02 en een Bayes Factor van 1,56: zeggen die nou hetzelfde of niet?

Ze gaan over dezelfde data, maar beantwoorden een andere vraag. NHST neemt H0 als uitgangspunt en kijkt hoe goed de data daarbij passen. Is p kleiner dan α, dan verwerp je H0. De uitkomst heeft twee smaken: wel of niet verwerpen.

Een Bayes Factor vergelijkt twee hypothesen met elkaar. BF10 = 1,56 betekent dat H1 1,56 keer zoveel steun krijgt als H0. Dat is een gradatie, en er is geen vaste grens zoals α. De posterior modelkansen (0,609 voor H1, 0,391 voor H0) laten zien dat de keuze niet erg overtuigend is.

Dus: NHST zegt "significant", BHE zegt "een beetje meer steun voor H1". Ze spreken elkaar niet tegen, maar BHE laat beter zien hoe dun het bewijs is. In allebei de gevallen is replicatie de logische volgende stap.

Als preregistratie de replicatiecrisis helpt oplossen, waarom is niet al het onderzoek dan verplicht gepreregistreerd?

Kijk eerst naar wat preregistratie precies tegenhoudt. Het tijdschrift beoordeelt de opzet vooraf en publiceert het resultaat, significant of niet. Dat raakt twee dingen: publicatiebias en twijfelachtige onderzoekspraktijken, zoals bijmeten tot p onder .05 zakt.

Denk dan aan onderzoek dat zich minder goed vooraf laat vastleggen. Hoe zit het met verkennend onderzoek zonder verwachte richting? En met de kwalitatieve lijn van TOE, waar je bij grounded theory juist codes uit de data laat komen?

Is preregistratie dus een oplossing voor alle onderzoek, of vooral voor confirmatief, toetsend onderzoek? En wat zou het betekenen als alleen dat soort onderzoek nog serieus genomen wordt?

Kwalitatief HC1: Kwalitatieve dataverzameling met interviews, focusgroepen, observaties en etnografie

Wat is nou precies het verschil tussen een probe en een prompt? Ik haal ze steeds door elkaar.

Een probe blijft bij het onderwerp dat al op tafel ligt. Je laat merken dat je meer wilt horen. Dat kan heel klein: even stil zijn, "hm-hm" zeggen of vragen "Wat bedoel je daarmee?". Probes lopen van open (stilte) naar specifiek (samenvatten en checken of je het goed begrijpt).

Een prompt opent juist een nieuw onderwerp. "Ik wil het nu graag over de huur hebben" is een prompt. Een handig ezelsbruggetje: een probe graaft dieper in hetzelfde gat, een prompt begint een nieuw gat.

Op de toets krijg je vaak een stukje transcript. Vraag je dan bij elke interviewerzin af: gaat het gesprek over hetzelfde verder, of verschuift het onderwerp? In het eerste geval is het een probe, in het tweede een prompt.

Als ik in mijn eigen studentenhuis observeer hoe we de schoonmaak regelen, ben ik dan een complete participant, en is dat een probleem?

Begin bij de twee assen. Doe je mee (participerend)? Ja, je woont er. Weten je huisgenoten het (overt of covert)? Dat bepaal jij. Zeg je niets, dan ben je complete participant; vertel je het wel, dan participant observer.

Kijk dan naar de risico's. Als je het vertelt, loop je kans op reactiviteit: Sjors doet ineens wel de afwas. Misschien treedt na een paar weken naturalisatie op. Als je het niet vertelt, zit je dicht op going native, want je bént al een insider. Je eigen positie in het huis hoort dan in je subjectivity statement.

Welke van de twee rollen levert hier betrouwbaardere data op? En is covert observeren bij mensen met wie je samenwoont nog te verantwoorden?

Samenvatting Toepassing van onderzoeksmethoden en statistiek · Oefenen met Toepassing van onderzoeksmethoden en statistiek · Bekijk prijzen