Vragen over Verdieping in onderzoeksmethoden en statistiek (VOS)

De vragen en discussies die bij Verdieping in onderzoeksmethoden en statistiek horen: verbanden, tegenstellingen en denkfouten uit de stof. 35 vragen, waarvan 32 met een antwoord dat vrij te lezen is.

Van KOM naar VOS: het lineaire model

Waarom levert een t-toets precies dezelfde uitkomst op als een regressie met een voorspeller?

Omdat het onder water hetzelfde model is. Zet je de groep om in een voorspeller die 0 is voor de ene groep en 1 voor de andere, dan is de constante b0 het gemiddelde van de groep met een 0, en is de coëfficiënt b1 het verschil tussen de twee gemiddelden. De t bij die coëfficiënt is de coëfficiënt gedeeld door haar standaardfout, en dat is precies de toetsingsgrootheid van de t-toets. Vandaar dat de p-waarde tot op de decimaal gelijk uitvalt.

Dat is het idee achter het algemene lineaire model: uitkomst is model plus fout. Wat de toetsen uit elkaar houdt, is alleen wat je als voorspeller invult, niet hoe er gerekend wordt.

De standaardfout krimpt met de wortel uit n. Kan ik met genoeg respondenten dan alles significant maken?

In de praktijk vaak wel. Vier keer zoveel respondenten halveert de standaardfout, de t verdubbelt en het interval wordt half zo smal, terwijl het effect zelf geen millimeter groeit. De p-waarde zegt dan vooral iets over je steekproefomvang. Welk getal beslist bij jou eigenlijk de conclusie: de p, of de effectgrootte met haar interval?

Enkelvoudige en meervoudige regressie

Waarom wordt de coëfficiënt van mijn voorspeller kleiner zodra ik er een tweede voorspeller bij zet?

Omdat elke coëfficiënt in een meervoudige regressie geldt terwijl de andere voorspellers constant worden gehouden. Bij Bob zakt zelfstudie van 0,25 naar 0,23 zodra reistijd in het model komt: bij studenten met dezelfde reistijd levert een extra uur nog 0,23 punt op. Een deel van het eerste effect liep dus via reistijd, want wie ver reist studeert gemiddeld iets minder.

Dat is geen fout in je model, maar precies de winst ervan: je controleert voor een derde variabele. Let daarbij op de eenheid. De b staat in punten per uur en is je praktische uitleg, bèta staat in standaardafwijkingen en maakt voorspellers onderling vergelijkbaar.

Multicollineariteit blaast alleen de standaardfouten op. Is dat erg als ik puur wil voorspellen?

Voor de voorspelling zelf valt het mee: R kwadraat en de voorspelde waarden blijven overeind, ook bij een VIF van 12. Het probleem zit in de losse coëfficiënten. Die worden onbetrouwbaar, en een kleine wijziging in de gegevens kan het teken omkeren. De vraag is dus wat jouw model moet doen. Wil je per voorspeller een getal kunnen uitleggen, of alleen een uitkomst schatten?

Mediatie en moderatie

Hoe weet ik of een derde variabele een mediator of een moderator is?

Aan de vraag die je stelt. Een mediator beantwoordt waardoor: hij staat tussen voorspeller en uitkomst in en geeft het effect door. Je schat pad a, van voorspeller naar mediator, en pad b, van mediator naar uitkomst met de voorspeller erbij. Het product ab is het indirecte effect, en dat toets je met een bootstrapinterval.

Een moderator beantwoordt wanneer en voor wie: hij maakt het verband sterker of zwakker. Daarvoor maak je zelf een productterm en kijk je naar b3. Fleur vraagt of aanwezigheid werkt via begrip van de stof, dat is mediatie. Vraagt zij of dat verband bij de ene groep sterker is dan bij de andere, dan is het moderatie.

Als ik mediator en uitkomst omdraai past het model vaak even goed. Wat toon ik dan eigenlijk aan?

Statistisch weinig. Bij cross-sectionele gegevens zit de volgorde in de tijd alleen in je theorie en niet in je bestand. Zelfs bij een geloote voorspeller is de mediator niet toegewezen, dus een derde variabele die mediator en uitkomst allebei raakt vertekent pad b zonder dat je het ziet. Wat heb je nodig, naast een interval zonder nul, voordat je die pijl mag tekenen?

Dummy's en categorische voorspellers

Waarom maak je k min 1 dummy's en niet gewoon een per categorie?

Omdat k dummy's in elke rij optellen tot 1, net als de constante. Ze zijn dan perfect lineair afhankelijk en het model is niet meer te schatten, de zogenoemde dummyval. Met k min 1 leg je alle categorieën alsnog vast: wie op alle dummy's een 0 scoort, zit in de referentiecategorie.

Aflezen doe je vanuit die referentie. De constante is de voorspelde uitkomst voor die groep, en elke coëfficiënt is het verschil met haar, gecontroleerd voor de rest van het model. Bij Xena passen drie woonsituaties zo in twee kolommen: thuiswonend is de referentie, en de twee coëfficiënten zeggen wat een kamer in of buiten Utrecht scheelt.

Met een andere referentiecategorie krijg ik andere p-waarden. Hoe hard is die significantie dan?

Zo hard als de vergelijking die je toevallig koos. De dummycoëfficiënten, hun t-waarden en hun p-waarden hangen aan de referentiegroep, terwijl R kwadraat, de F-toets en de voorspelde waarden onveranderd blijven. Voor de variabele als geheel kijk je daarom naar de R kwadraat-verandering van het blok waarin de dummy's samen binnenkomen. Welke vergelijking wil jouw onderzoeksvraag eigenlijk zien?

Variantieanalyse: one-way en factorial ANOVA

Waarom mag ik bij drie groepen niet gewoon drie t-toetsen achter elkaar doen?

Omdat elke losse toets 5 procent kans op vals alarm houdt en die kansen zich opstapelen. Drie groepen geven drie paren, en de kans om er minstens een keer naast te zitten is 1 min 0,95 tot de derde macht, ongeveer 14 procent. Bij vijf groepen zijn dat tien paren en loopt het op naar ongeveer 40 procent. Dat heet de familiegewijze fout.

De variantieanalyse doet het in een omnibustoets, met als nulhypothese dat alle populatiegemiddelden gelijk zijn. Zij houdt het vals alarm op 5 procent voor het geheel, maar wijst geen groepen aan. Daarvoor volgt daarna een gepland contrast of een post-hoctoets met correctie.

Levene is significant bij mijn grote steekproef. Moet ik dan altijd overstappen op Welch en Games-Howell?

Niet blindelings. Levene wordt bij veel respondenten ook significant bij een verschil in spreiding dat nauwelijks iets voorstelt, en bij ongeveer even grote groepen is variantieanalyse robuust. Zwaar telt de schending pas zodra de groepen sterk in omvang verschillen. Kijk dus eerst naar je groepsgroottes en naar de spreiding zelf: wat weegt hier zwaarder, het oordeel van de toets of het beeld in je gegevens?

Repeated measures en ANCOVA

Hoe kan een groepsverschil kleiner worden door een covariaat en toch significant zijn?

Omdat een covariaat aan twee kanten werkt. Bij Rob zakt het verschil tussen twee werkgroepvormen van 7,1 tegen 6,6 naar gecorrigeerde gemiddelden van 7,0 en 6,7, dus de teller van F wordt kleiner. Tegelijk haalt het cijfer van de tussentoets een flink stuk verklaarbare variatie uit de foutterm, en die noemer daalt harder. De uitkomst is F(1, 77) = 4,52, p = ,037.

Dat is precies waarvoor de ANCOVA bedoeld is: minder ruis, en een vergelijking alsof de groepen op de covariaat gelijk waren. Noteer bij zo'n gecorrigeerd gemiddelde altijd op welke waarde is gecorrigeerd, anders is het getal niet te plaatsen.

Mag ik corrigeren voor een verschil dat de groepen juist tot die groepen maakt?

Daar zit het venijn. Bij geloote groepen corrigeer je voor toevallige verschillen en wint de analyse aan precisie. Bij groepen die vanzelf ontstonden zit het verschil in de covariaat besloten in wat die groepen zijn, en reken je met een student die niet bestaat. De correctie kan dan zowel een effect wegpoetsen als er een verzinnen. Hoe kwamen jouw deelnemers in hun groep terecht?

Logistische regressie

Wat betekent een Exp(B) van 1,49 nou concreet?

Dat de odds op de uitkomst per eenheid voorspeller met 1,49 worden vermenigvuldigd, bij Bob dus 49 procent hogere odds per extra uur zelfstudie. Odds zijn geen kansen: een kans van 0,80 geeft odds van 4, ofwel vier keer zo vaak wel als niet.

Daarom betekent een odds ratio van 2 ook geen twee keer zoveel kans. Begin je bij een kans van 0,10, dan gaan de odds van 0,11 naar 0,22 en wordt de kans 0,18. Begin je bij 0,50, dan gaan de odds van 1 naar 2 en stijgt de kans naar 0,67. Boven 1 stijgt de kans, precies 1 is geen effect, onder 1 daalt zij. Valt de 1 binnen het interval rond Exp(B), dan is het effect niet significant.

Mijn model deelt 74,5 procent van de gevallen goed in. Is dat een goed model?

Leg het eerst naast blok 0, waar het model nog niets weet en simpelweg de grootste categorie voorspelt. Bij Bob is dat al 62,0 procent, dus de winst is 12,5 procentpunt. Kijk daarna naar sensitiviteit en specificiteit apart, want bij een scheve verdeling blijft het totaal hoog terwijl de kleine groep vrijwel altijd gemist wordt. Welke van die twee missers kost in jouw onderzoek het meest?

Betrouwbaarheid en factoranalyse

Mijn Cronbachs alfa is ,84. Meet mijn schaal dan een ding?

Niet per se. Alfa gaat over samenhang tussen items, en twee groepjes items die elk onderling sterk samenhangen leveren samen ook een keurige ,85 op. Alfa hangt bovendien aan het aantal items: twintig middelmatige items halen die waarde puur door hun aantal. Boven ,95 wordt het zelfs verdacht, want dan stellen items vrijwel dezelfde vraag.

Of het een ding is, beantwoordt exploratieve factoranalyse, die in het correlatiepatroon naar onderliggende dimensies zoekt. En of je het juiste begrip te pakken hebt is nog een derde vraag: dat is validiteit, en daarover zegt alfa niets.

Alpha if item deleted zegt dat ik een item moet schrappen, maar inhoudelijk hoort het er juist bij.

Kijk dan eerst naar de item-totaalcorrelatie. Staat daar een negatief getal, zoals bij het uitstelitem van Fleur, dan is de stelling negatief geformuleerd en niet hercodeerd. Na omkeren steeg haar alfa van ,72 naar ,84 en hoefde er niets weg. Blijft het item ook na hercodering laag, dan gaat de keuze over inhoud. Wat verlies je aan dekking van het begrip als dat item vertrekt?

Kwalitatief onderzoek: ontwerp en dataverzameling

Hoeveel interviews heb ik nodig voordat ik genoeg materiaal heb?

Daar bestaat geen getal voor. Je stopt bij saturatie: het punt waarop nieuwe gesprekken geen nieuwe categorieën of inzichten meer opleveren. Dat is een uitkomst van je analyse, en die kun je alleen aantonen als je tussendoor codeert. Je laat zien dat de laatste interviews alleen codes opleverden die je al had. Wie pas na het laatste gesprek begint met coderen, kan die claim niet maken.

Het aantal volgt dus uit je materiaal en uit je selectie. Purposive sampling legt vooraf vast wie je uitnodigt en waarom. Theoretical sampling laat de analyse de volgende deelnemer aanwijzen, zoals bij Mimi, die gericht studenten opzocht die nooit bij een studieadviseur waren geweest.

Als je je vraag onderweg mag bijstellen, wat weerhoudt je er dan van naar je eigen conclusie toe te werken?

Alleen je verantwoording. Een iteratief ontwerp is geen vrijbrief: per bijstelling noteer je wat je veranderde, wanneer en waarom, zodat een ander de route kan volgen. Sensitizing concepts horen daarbij een zoeklicht te zijn en geen meetlat. Waar ligt voor jou de grens tussen scherper worden op grond van je gegevens, en je bevinding erin schrijven?

Interviewen en observeren

Wat is nou het verschil tussen doorvragen en invullen?

Bij doorvragen nodig je de deelnemer uit zijn antwoord uit te breiden zonder er zelf iets aan toe te voegen. Bij invullen lever jij het woord. 'Dus je voelde je eenzaam?' is invullen. 'Je zei dat het stil was, hoe was dat voor jou?' is doorvragen.

Vijf manieren werken bijna altijd: een stilte laten vallen, het laatste woord van de deelnemer met een vragende toon herhalen, om een voorbeeld vragen, doorvragen op vage woorden als druk of lastig, en samenvatten zodat de deelnemer kan corrigeren. Sjors liet zien wat er zonder die techniek gebeurt. Hij vroeg Bert of hij zich vast eenzaam had gevoeld, en kreeg een braaf ja op een vraag die het antwoord al bevatte.

Hoor je in een focusgroep een gedeelde norm, of vooral de dominantste spreker?

Dat is de zwakte die vastzit aan de kracht. De interactie is juist het materiaal, dus de sociale druk hoort erbij, maar een dominante spreker legt de toon op en stille deelnemers verdwijnen. De moderator verdeelt daarom actief de beurten en vraagt expliciet naar afwijkende meningen. Hoe zou jij in je verslag laten zien dat een uitspraak breed gedeeld was en niet alleen hard gezegd?

Coderen en thematische analyse

Wanneer is iets een thema en wanneer alleen een onderwerp?

Een onderwerp zegt waar de fragmenten over gaan, een thema zegt iets. 'Werkdruk' is een onderwerp. 'Werkdruk wordt pas een probleem als studenten hem niet mogen benoemen' is een thema, want daar zit een claim in die je met fragmenten kunt onderbouwen.

De vuistregel is simpel: formuleer elk thema in een zin met een werkwoord erin. Herken je je eigen thema aan een enkel zelfstandig naamwoord, en somt je resultatensectie per kop citaten op zonder er iets over te zeggen, dan is de analyse nog niet af. Hoe vaak een code voorkomt beslist het niet. Wat telt is of het patroon iets verklaart over je onderzoeksvraag.

Kan een opmerking van een enkele deelnemer een thema dragen?

Volgens de logica van thematische analyse wel, zeker als die opmerking tegen het patroon ingaat en je thema er scherper van wordt. Tegelijk loop je codes met een fragment langs om de code-explosie te voorkomen. Dat is dezelfde beslissing met twee uitkomsten: samenvoegen, of bewaren als afwijkend geval. Waaraan zie jij welk van die twee het is?

Werken met NVivo

Wat is het verschil tussen een case en een gewone node?

Een gewone node bewaart wat er gezegd wordt, een case bewaart wie het zegt. Alles wat Mimi zegt hangt aan de case Mimi, in welk bestand het ook staat. Aan zo'n case koppel je attributen: achtergrondkenmerken als studiejaar of woonsituatie, die je in een tabel klaarzet en in een keer importeert.

Zonder cases kun je alleen thema's beschrijven, met cases kun je vergelijken, en meestal draagt je vraag daarop. Bij Luna zegt de node over reistijd als afweging op zichzelf weinig. Afgezet tegen woonsituatie blijkt hij zich vrijwel alleen te vullen bij studenten die nog thuis wonen, en dat verschil is de aanzet tot haar thema.

Twee codeurs halen kappa ,38 op een code die nauwelijks voorkomt. Is ons codeboek dan slecht?

Niet automatisch. Kappa trekt eraf wat twee codeurs ook door toeval gelijk zouden doen, en bij een zeldzame code valt zij laag uit terwijl de codeurs het feitelijk eens zijn. Vaker wijst een lage waarde op een te ruime definitie of een ontbrekende uitsluitingsregel. Wat verandert er in jullie codeboek als je eerst de losse verschillen samen doorloopt, voordat er een getal in het verslag komt?

Kwaliteit van kwalitatief onderzoek

Waarom gelden validiteit en betrouwbaarheid hier niet, en wat komt ervoor in de plaats?

Omdat die begrippen uitgaan van een werkelijkheid die je met een goede meting steeds opnieuw vastlegt. Een interview laat zich niet herhalen, en een purposieve steekproef van twaalf mensen weerspiegelt geen populatie. Lincoln en Guba (1985) zetten er daarom vier eigen criteria naast, samen deugdelijkheid.

Leer ze in die paren, want een verwisseling maakt een verder goed antwoord fout.

Mijn deelnemers herkennen zich niet in mijn conclusie. Moet ik hem dan aanpassen?

Member checking versterkt de geloofwaardigheid, maar een deelnemer die het oneens is heeft niet automatisch gelijk: hij kan een analyse afwijzen die hem niet bevalt. Tegelijk werd het thema van Pleun juist scherper door het gesprek dat er niet in paste. Wanneer is weerstand een correctie op jouw lezing, en wanneer is zij zelf een bevinding?

Mixed methods

Wanneer heb je echt een gemengde studie, en wanneer twee losse onderzoeken in een omslag?

Bij het punt van integratie. Een verslag met een hoofdstuk cijfers, een hoofdstuk citaten en een conclusie die van allebei iets herhaalt, is parallel werk. Integratie gebeurt door samenvoegen, verbinden of inbedden: resultaten naast elkaar leggen en vergelijken, het ene deel het andere laten voeden, of een klein deel binnen een groot laten meelopen.

Zichtbaar maak je dat met een joint display, een tabel waarin beide soorten resultaten per thema naast elkaar staan met in de laatste kolom wat de combinatie oplevert. De toetsvraag blijft steeds dezelfde: welke uitspraak in je conclusie kon alleen ontstaan doordat beide delen er waren? Dat is de meta-inferentie.

De vragenlijst zegt tevreden, de interviews zitten vol twijfel. Welke van de twee geloof ik?

Waarschijnlijk geen van beide zonder meer. Divergentie is een uitkomst en geen mislukking: een score van 4,2 naast gesprekken vol aarzeling betekent meestal dat de schaal iets anders meet dan het gesprek. Wie dat verschil in een bijzin wegwerkt, gooit het leerzaamste deel weg. Wat zou je schaal precies moeten meten om die twee beelden weer bij elkaar te brengen?

Rapporteren van resultaten

Welke woorden mag ik gebruiken als ik alleen heb gemeten en niets heb gemanipuleerd?

Schrijf 'hangt samen met' of 'voorspelt'. Woorden als 'leidt tot', 'zorgt voor', 'verhoogt' en 'het effect van' horen bij een opzet waarin het lot bepaalt wie welke behandeling krijgt. Een regressie verandert daar niets aan, want controleren voor drie variabelen sluit de vierde niet uit.

Zeg er ook bij hoeveel het voorstelt. Bij een grote steekproef wordt een verwaarloosbaar verschil significant, dus hoort bij elke toets een effectgrootte en een betrouwbaarheidsinterval, plus een zin in gewone woorden over wat het praktisch betekent. En p = ,000 bestaat niet: dat schrijf je als p < ,001.

Alleen significante uitkomsten opschrijven maakt een verslag onbetrouwbaar, maar alles rapporteren leest niemand. Waar ligt de grens?

Het houvast is je onderzoeksvraag: die beantwoord je in de volgorde waarin je hem stelde, ook als het antwoord nee luidt. Wat afweek van je plan hoort in de methodesectie, want een verzwegen uitgevallen meting maakt je studie onherhaalbaar. Blijft er daarna nog iets over dat je weglaat, en waarom precies dat?

Toetsvoorbereiding: welke analyse bij welke vraag

Hoe kies ik op het tentamen tussen een variantieanalyse en een regressie als allebei lijken te kunnen?

Loop drie vragen af. Wat wil je weten: een verschil tussen groepen, samenhang, een voorspelling of structuur in veel items? Welk meetniveau heeft de uitkomst, numeriek of categorisch? En staan je waarnemingen los van elkaar, of horen ze bij dezelfde mensen?

Onder water is het hetzelfde model, dus vaak kloppen beide. Het verschil zit in de nadruk. Bij toegewezen condities en twee factoren ligt variantieanalyse voor de hand, met hoofdeffecten en een interactie. Zodra je continue voorspellers wilt meenemen of ergens voor wilt controleren, is regressie met dummy's handiger. Eta kwadraat is daar gewoon R kwadraat.

Bij uitval over drie faculteiten kan chi-kwadraat en kan logistische regressie. Hoe kies je dan?

Chi-kwadraat toetst of twee categorische variabelen samenhangen en levert chi-kwadraat met Cramérs V. Logistische regressie voorspelt dezelfde uitkomst uit dummy's voor faculteit, en houdt ruimte om ergens voor te controleren of een continue voorspeller toe te voegen. Wat vraagt jouw onderzoeksvraag: vaststellen dat er verschil is, of dat verschil corrigeren voor iets anders?

Over het vak

Waarom mag een interviewstudie met twaalf deelnemers iets zeggen over hoe iets werkt, terwijl een vragenlijst onder twaalf mensen niets waard is?

Nog geen antwoord: een vraag om zelf over na te denken.

Allebei de helften van dit vak waarschuwen voor dezelfde fout: eerst de conclusie hebben en er dan bewijs bij zoeken. Waar is die verleiding groter, bij het draaien van analyses of bij het kiezen van citaten?

Nog geen antwoord: een vraag om zelf over na te denken.

Als de onderzoeksvraag de methode bepaalt, hoe komt het dan dat de meeste onderzoekers de methode kiezen die zij toevallig beheersen?

Nog geen antwoord: een vraag om zelf over na te denken.

Samenvatting Verdieping in onderzoeksmethoden en statistiek · Oefenen met Verdieping in onderzoeksmethoden en statistiek · Bekijk prijzen