De vragen en discussies die bij Verdieping in onderzoeksmethoden en statistiek horen: verbanden, tegenstellingen en denkfouten uit de stof. 35 vragen, waarvan 32 met een antwoord dat vrij te lezen is.
Omdat het onder water hetzelfde model is. Zet je de groep om in een voorspeller die 0 is voor de ene groep en 1 voor de andere, dan is de constante b0 het gemiddelde van de groep met een 0, en is de coëfficiënt b1 het verschil tussen de twee gemiddelden. De t bij die coëfficiënt is de coëfficiënt gedeeld door haar standaardfout, en dat is precies de toetsingsgrootheid van de t-toets. Vandaar dat de p-waarde tot op de decimaal gelijk uitvalt.
Dat is het idee achter het algemene lineaire model: uitkomst is model plus fout. Wat de toetsen uit elkaar houdt, is alleen wat je als voorspeller invult, niet hoe er gerekend wordt.
In de praktijk vaak wel. Vier keer zoveel respondenten halveert de standaardfout, de t verdubbelt en het interval wordt half zo smal, terwijl het effect zelf geen millimeter groeit. De p-waarde zegt dan vooral iets over je steekproefomvang. Welk getal beslist bij jou eigenlijk de conclusie: de p, of de effectgrootte met haar interval?
Omdat elke coëfficiënt in een meervoudige regressie geldt terwijl de andere voorspellers constant worden gehouden. Bij Bob zakt zelfstudie van 0,25 naar 0,23 zodra reistijd in het model komt: bij studenten met dezelfde reistijd levert een extra uur nog 0,23 punt op. Een deel van het eerste effect liep dus via reistijd, want wie ver reist studeert gemiddeld iets minder.
Dat is geen fout in je model, maar precies de winst ervan: je controleert voor een derde variabele. Let daarbij op de eenheid. De b staat in punten per uur en is je praktische uitleg, bèta staat in standaardafwijkingen en maakt voorspellers onderling vergelijkbaar.
Voor de voorspelling zelf valt het mee: R kwadraat en de voorspelde waarden blijven overeind, ook bij een VIF van 12. Het probleem zit in de losse coëfficiënten. Die worden onbetrouwbaar, en een kleine wijziging in de gegevens kan het teken omkeren. De vraag is dus wat jouw model moet doen. Wil je per voorspeller een getal kunnen uitleggen, of alleen een uitkomst schatten?
Aan de vraag die je stelt. Een mediator beantwoordt waardoor: hij staat tussen voorspeller en uitkomst in en geeft het effect door. Je schat pad a, van voorspeller naar mediator, en pad b, van mediator naar uitkomst met de voorspeller erbij. Het product ab is het indirecte effect, en dat toets je met een bootstrapinterval.
Een moderator beantwoordt wanneer en voor wie: hij maakt het verband sterker of zwakker. Daarvoor maak je zelf een productterm en kijk je naar b3. Fleur vraagt of aanwezigheid werkt via begrip van de stof, dat is mediatie. Vraagt zij of dat verband bij de ene groep sterker is dan bij de andere, dan is het moderatie.
Statistisch weinig. Bij cross-sectionele gegevens zit de volgorde in de tijd alleen in je theorie en niet in je bestand. Zelfs bij een geloote voorspeller is de mediator niet toegewezen, dus een derde variabele die mediator en uitkomst allebei raakt vertekent pad b zonder dat je het ziet. Wat heb je nodig, naast een interval zonder nul, voordat je die pijl mag tekenen?
Omdat k dummy's in elke rij optellen tot 1, net als de constante. Ze zijn dan perfect lineair afhankelijk en het model is niet meer te schatten, de zogenoemde dummyval. Met k min 1 leg je alle categorieën alsnog vast: wie op alle dummy's een 0 scoort, zit in de referentiecategorie.
Aflezen doe je vanuit die referentie. De constante is de voorspelde uitkomst voor die groep, en elke coëfficiënt is het verschil met haar, gecontroleerd voor de rest van het model. Bij Xena passen drie woonsituaties zo in twee kolommen: thuiswonend is de referentie, en de twee coëfficiënten zeggen wat een kamer in of buiten Utrecht scheelt.
Zo hard als de vergelijking die je toevallig koos. De dummycoëfficiënten, hun t-waarden en hun p-waarden hangen aan de referentiegroep, terwijl R kwadraat, de F-toets en de voorspelde waarden onveranderd blijven. Voor de variabele als geheel kijk je daarom naar de R kwadraat-verandering van het blok waarin de dummy's samen binnenkomen. Welke vergelijking wil jouw onderzoeksvraag eigenlijk zien?
Omdat elke losse toets 5 procent kans op vals alarm houdt en die kansen zich opstapelen. Drie groepen geven drie paren, en de kans om er minstens een keer naast te zitten is 1 min 0,95 tot de derde macht, ongeveer 14 procent. Bij vijf groepen zijn dat tien paren en loopt het op naar ongeveer 40 procent. Dat heet de familiegewijze fout.
De variantieanalyse doet het in een omnibustoets, met als nulhypothese dat alle populatiegemiddelden gelijk zijn. Zij houdt het vals alarm op 5 procent voor het geheel, maar wijst geen groepen aan. Daarvoor volgt daarna een gepland contrast of een post-hoctoets met correctie.
Niet blindelings. Levene wordt bij veel respondenten ook significant bij een verschil in spreiding dat nauwelijks iets voorstelt, en bij ongeveer even grote groepen is variantieanalyse robuust. Zwaar telt de schending pas zodra de groepen sterk in omvang verschillen. Kijk dus eerst naar je groepsgroottes en naar de spreiding zelf: wat weegt hier zwaarder, het oordeel van de toets of het beeld in je gegevens?
Omdat een covariaat aan twee kanten werkt. Bij Rob zakt het verschil tussen twee werkgroepvormen van 7,1 tegen 6,6 naar gecorrigeerde gemiddelden van 7,0 en 6,7, dus de teller van F wordt kleiner. Tegelijk haalt het cijfer van de tussentoets een flink stuk verklaarbare variatie uit de foutterm, en die noemer daalt harder. De uitkomst is F(1, 77) = 4,52, p = ,037.
Dat is precies waarvoor de ANCOVA bedoeld is: minder ruis, en een vergelijking alsof de groepen op de covariaat gelijk waren. Noteer bij zo'n gecorrigeerd gemiddelde altijd op welke waarde is gecorrigeerd, anders is het getal niet te plaatsen.
Daar zit het venijn. Bij geloote groepen corrigeer je voor toevallige verschillen en wint de analyse aan precisie. Bij groepen die vanzelf ontstonden zit het verschil in de covariaat besloten in wat die groepen zijn, en reken je met een student die niet bestaat. De correctie kan dan zowel een effect wegpoetsen als er een verzinnen. Hoe kwamen jouw deelnemers in hun groep terecht?
Dat de odds op de uitkomst per eenheid voorspeller met 1,49 worden vermenigvuldigd, bij Bob dus 49 procent hogere odds per extra uur zelfstudie. Odds zijn geen kansen: een kans van 0,80 geeft odds van 4, ofwel vier keer zo vaak wel als niet.
Daarom betekent een odds ratio van 2 ook geen twee keer zoveel kans. Begin je bij een kans van 0,10, dan gaan de odds van 0,11 naar 0,22 en wordt de kans 0,18. Begin je bij 0,50, dan gaan de odds van 1 naar 2 en stijgt de kans naar 0,67. Boven 1 stijgt de kans, precies 1 is geen effect, onder 1 daalt zij. Valt de 1 binnen het interval rond Exp(B), dan is het effect niet significant.
Leg het eerst naast blok 0, waar het model nog niets weet en simpelweg de grootste categorie voorspelt. Bij Bob is dat al 62,0 procent, dus de winst is 12,5 procentpunt. Kijk daarna naar sensitiviteit en specificiteit apart, want bij een scheve verdeling blijft het totaal hoog terwijl de kleine groep vrijwel altijd gemist wordt. Welke van die twee missers kost in jouw onderzoek het meest?
Niet per se. Alfa gaat over samenhang tussen items, en twee groepjes items die elk onderling sterk samenhangen leveren samen ook een keurige ,85 op. Alfa hangt bovendien aan het aantal items: twintig middelmatige items halen die waarde puur door hun aantal. Boven ,95 wordt het zelfs verdacht, want dan stellen items vrijwel dezelfde vraag.
Of het een ding is, beantwoordt exploratieve factoranalyse, die in het correlatiepatroon naar onderliggende dimensies zoekt. En of je het juiste begrip te pakken hebt is nog een derde vraag: dat is validiteit, en daarover zegt alfa niets.
Kijk dan eerst naar de item-totaalcorrelatie. Staat daar een negatief getal, zoals bij het uitstelitem van Fleur, dan is de stelling negatief geformuleerd en niet hercodeerd. Na omkeren steeg haar alfa van ,72 naar ,84 en hoefde er niets weg. Blijft het item ook na hercodering laag, dan gaat de keuze over inhoud. Wat verlies je aan dekking van het begrip als dat item vertrekt?
Daar bestaat geen getal voor. Je stopt bij saturatie: het punt waarop nieuwe gesprekken geen nieuwe categorieën of inzichten meer opleveren. Dat is een uitkomst van je analyse, en die kun je alleen aantonen als je tussendoor codeert. Je laat zien dat de laatste interviews alleen codes opleverden die je al had. Wie pas na het laatste gesprek begint met coderen, kan die claim niet maken.
Het aantal volgt dus uit je materiaal en uit je selectie. Purposive sampling legt vooraf vast wie je uitnodigt en waarom. Theoretical sampling laat de analyse de volgende deelnemer aanwijzen, zoals bij Mimi, die gericht studenten opzocht die nooit bij een studieadviseur waren geweest.
Alleen je verantwoording. Een iteratief ontwerp is geen vrijbrief: per bijstelling noteer je wat je veranderde, wanneer en waarom, zodat een ander de route kan volgen. Sensitizing concepts horen daarbij een zoeklicht te zijn en geen meetlat. Waar ligt voor jou de grens tussen scherper worden op grond van je gegevens, en je bevinding erin schrijven?
Bij doorvragen nodig je de deelnemer uit zijn antwoord uit te breiden zonder er zelf iets aan toe te voegen. Bij invullen lever jij het woord. 'Dus je voelde je eenzaam?' is invullen. 'Je zei dat het stil was, hoe was dat voor jou?' is doorvragen.
Vijf manieren werken bijna altijd: een stilte laten vallen, het laatste woord van de deelnemer met een vragende toon herhalen, om een voorbeeld vragen, doorvragen op vage woorden als druk of lastig, en samenvatten zodat de deelnemer kan corrigeren. Sjors liet zien wat er zonder die techniek gebeurt. Hij vroeg Bert of hij zich vast eenzaam had gevoeld, en kreeg een braaf ja op een vraag die het antwoord al bevatte.
Dat is de zwakte die vastzit aan de kracht. De interactie is juist het materiaal, dus de sociale druk hoort erbij, maar een dominante spreker legt de toon op en stille deelnemers verdwijnen. De moderator verdeelt daarom actief de beurten en vraagt expliciet naar afwijkende meningen. Hoe zou jij in je verslag laten zien dat een uitspraak breed gedeeld was en niet alleen hard gezegd?
Een onderwerp zegt waar de fragmenten over gaan, een thema zegt iets. 'Werkdruk' is een onderwerp. 'Werkdruk wordt pas een probleem als studenten hem niet mogen benoemen' is een thema, want daar zit een claim in die je met fragmenten kunt onderbouwen.
De vuistregel is simpel: formuleer elk thema in een zin met een werkwoord erin. Herken je je eigen thema aan een enkel zelfstandig naamwoord, en somt je resultatensectie per kop citaten op zonder er iets over te zeggen, dan is de analyse nog niet af. Hoe vaak een code voorkomt beslist het niet. Wat telt is of het patroon iets verklaart over je onderzoeksvraag.
Volgens de logica van thematische analyse wel, zeker als die opmerking tegen het patroon ingaat en je thema er scherper van wordt. Tegelijk loop je codes met een fragment langs om de code-explosie te voorkomen. Dat is dezelfde beslissing met twee uitkomsten: samenvoegen, of bewaren als afwijkend geval. Waaraan zie jij welk van die twee het is?
Een gewone node bewaart wat er gezegd wordt, een case bewaart wie het zegt. Alles wat Mimi zegt hangt aan de case Mimi, in welk bestand het ook staat. Aan zo'n case koppel je attributen: achtergrondkenmerken als studiejaar of woonsituatie, die je in een tabel klaarzet en in een keer importeert.
Zonder cases kun je alleen thema's beschrijven, met cases kun je vergelijken, en meestal draagt je vraag daarop. Bij Luna zegt de node over reistijd als afweging op zichzelf weinig. Afgezet tegen woonsituatie blijkt hij zich vrijwel alleen te vullen bij studenten die nog thuis wonen, en dat verschil is de aanzet tot haar thema.
Niet automatisch. Kappa trekt eraf wat twee codeurs ook door toeval gelijk zouden doen, en bij een zeldzame code valt zij laag uit terwijl de codeurs het feitelijk eens zijn. Vaker wijst een lage waarde op een te ruime definitie of een ontbrekende uitsluitingsregel. Wat verandert er in jullie codeboek als je eerst de losse verschillen samen doorloopt, voordat er een getal in het verslag komt?
Omdat die begrippen uitgaan van een werkelijkheid die je met een goede meting steeds opnieuw vastlegt. Een interview laat zich niet herhalen, en een purposieve steekproef van twaalf mensen weerspiegelt geen populatie. Lincoln en Guba (1985) zetten er daarom vier eigen criteria naast, samen deugdelijkheid.
Leer ze in die paren, want een verwisseling maakt een verder goed antwoord fout.
Member checking versterkt de geloofwaardigheid, maar een deelnemer die het oneens is heeft niet automatisch gelijk: hij kan een analyse afwijzen die hem niet bevalt. Tegelijk werd het thema van Pleun juist scherper door het gesprek dat er niet in paste. Wanneer is weerstand een correctie op jouw lezing, en wanneer is zij zelf een bevinding?
Bij het punt van integratie. Een verslag met een hoofdstuk cijfers, een hoofdstuk citaten en een conclusie die van allebei iets herhaalt, is parallel werk. Integratie gebeurt door samenvoegen, verbinden of inbedden: resultaten naast elkaar leggen en vergelijken, het ene deel het andere laten voeden, of een klein deel binnen een groot laten meelopen.
Zichtbaar maak je dat met een joint display, een tabel waarin beide soorten resultaten per thema naast elkaar staan met in de laatste kolom wat de combinatie oplevert. De toetsvraag blijft steeds dezelfde: welke uitspraak in je conclusie kon alleen ontstaan doordat beide delen er waren? Dat is de meta-inferentie.
Waarschijnlijk geen van beide zonder meer. Divergentie is een uitkomst en geen mislukking: een score van 4,2 naast gesprekken vol aarzeling betekent meestal dat de schaal iets anders meet dan het gesprek. Wie dat verschil in een bijzin wegwerkt, gooit het leerzaamste deel weg. Wat zou je schaal precies moeten meten om die twee beelden weer bij elkaar te brengen?
Schrijf 'hangt samen met' of 'voorspelt'. Woorden als 'leidt tot', 'zorgt voor', 'verhoogt' en 'het effect van' horen bij een opzet waarin het lot bepaalt wie welke behandeling krijgt. Een regressie verandert daar niets aan, want controleren voor drie variabelen sluit de vierde niet uit.
Zeg er ook bij hoeveel het voorstelt. Bij een grote steekproef wordt een verwaarloosbaar verschil significant, dus hoort bij elke toets een effectgrootte en een betrouwbaarheidsinterval, plus een zin in gewone woorden over wat het praktisch betekent. En p = ,000 bestaat niet: dat schrijf je als p < ,001.
Het houvast is je onderzoeksvraag: die beantwoord je in de volgorde waarin je hem stelde, ook als het antwoord nee luidt. Wat afweek van je plan hoort in de methodesectie, want een verzwegen uitgevallen meting maakt je studie onherhaalbaar. Blijft er daarna nog iets over dat je weglaat, en waarom precies dat?
Loop drie vragen af. Wat wil je weten: een verschil tussen groepen, samenhang, een voorspelling of structuur in veel items? Welk meetniveau heeft de uitkomst, numeriek of categorisch? En staan je waarnemingen los van elkaar, of horen ze bij dezelfde mensen?
Onder water is het hetzelfde model, dus vaak kloppen beide. Het verschil zit in de nadruk. Bij toegewezen condities en twee factoren ligt variantieanalyse voor de hand, met hoofdeffecten en een interactie. Zodra je continue voorspellers wilt meenemen of ergens voor wilt controleren, is regressie met dummy's handiger. Eta kwadraat is daar gewoon R kwadraat.
Chi-kwadraat toetst of twee categorische variabelen samenhangen en levert chi-kwadraat met Cramérs V. Logistische regressie voorspelt dezelfde uitkomst uit dummy's voor faculteit, en houdt ruimte om ergens voor te controleren of een continue voorspeller toe te voegen. Wat vraagt jouw onderzoeksvraag: vaststellen dat er verschil is, of dat verschil corrigeren voor iets anders?
Nog geen antwoord: een vraag om zelf over na te denken.
Nog geen antwoord: een vraag om zelf over na te denken.
Nog geen antwoord: een vraag om zelf over na te denken.
Samenvatting Verdieping in onderzoeksmethoden en statistiek · Oefenen met Verdieping in onderzoeksmethoden en statistiek · Bekijk prijzen