ISW jaar 2 · UU (VOS)

Samenvatting Verdieping in onderzoeksmethoden en statistiek

De complete samenvatting van Verdieping in onderzoeksmethoden en statistiek (VOS) bij ISW aan de UU, in de volgorde van de colleges: per week de kern, de begrippen en de verbanden die je op het tentamen nodig hebt. Week 1 en 2 lees je gratis met een account in de reader.

16 hoofdstukken in 8 weken · 320 flashcards · 160 oefenvragen · 80 open vragen met modelantwoord

Complete Bundel VOS: €26,00 eenmalig (los €31,00 — je bespaart €5,00). Betalen via iDEAL, direct toegang, geen abonnement.

Verder lezen

De rest van Verdieping in onderzoeksmethoden en statistiek in één keer: eenmalig betalen via iDEAL, direct toegang, geen abonnement.

Bekijk prijzen · Oefenen met Verdieping in onderzoeksmethoden en statistiek

Vragen bij Verdieping in onderzoeksmethoden en statistiek

Waarom levert een t-toets precies dezelfde uitkomst op als een regressie met een voorspeller?

Omdat het onder water hetzelfde model is. Zet je de groep om in een voorspeller die 0 is voor de ene groep en 1 voor de andere, dan is de constante b0 het gemiddelde van de groep met een 0, en is de coëfficiënt b1 het verschil tussen de twee gemiddelden. De t bij die coëfficiënt is de coëfficiënt gedeeld door haar standaardfout, en dat is precies de toetsingsgrootheid van de t-toets. Vandaar dat de p-waarde tot op de decimaal gelijk uitvalt.

Dat is het idee achter het algemene lineaire model: uitkomst is model plus fout. Wat de toetsen uit elkaar houdt, is alleen wat je als voorspeller invult, niet hoe er gerekend wordt.

De standaardfout krimpt met de wortel uit n. Kan ik met genoeg respondenten dan alles significant maken?

In de praktijk vaak wel. Vier keer zoveel respondenten halveert de standaardfout, de t verdubbelt en het interval wordt half zo smal, terwijl het effect zelf geen millimeter groeit. De p-waarde zegt dan vooral iets over je steekproefomvang. Welk getal beslist bij jou eigenlijk de conclusie: de p, of de effectgrootte met haar interval?

Waarom wordt de coëfficiënt van mijn voorspeller kleiner zodra ik er een tweede voorspeller bij zet?

Omdat elke coëfficiënt in een meervoudige regressie geldt terwijl de andere voorspellers constant worden gehouden. Bij Bob zakt zelfstudie van 0,25 naar 0,23 zodra reistijd in het model komt: bij studenten met dezelfde reistijd levert een extra uur nog 0,23 punt op. Een deel van het eerste effect liep dus via reistijd, want wie ver reist studeert gemiddeld iets minder.

Dat is geen fout in je model, maar precies de winst ervan: je controleert voor een derde variabele. Let daarbij op de eenheid. De b staat in punten per uur en is je praktische uitleg, bèta staat in standaardafwijkingen en maakt voorspellers onderling vergelijkbaar.

Multicollineariteit blaast alleen de standaardfouten op. Is dat erg als ik puur wil voorspellen?

Voor de voorspelling zelf valt het mee: R kwadraat en de voorspelde waarden blijven overeind, ook bij een VIF van 12. Het probleem zit in de losse coëfficiënten. Die worden onbetrouwbaar, en een kleine wijziging in de gegevens kan het teken omkeren. De vraag is dus wat jouw model moet doen. Wil je per voorspeller een getal kunnen uitleggen, of alleen een uitkomst schatten?

Hoe weet ik of een derde variabele een mediator of een moderator is?

Aan de vraag die je stelt. Een mediator beantwoordt waardoor: hij staat tussen voorspeller en uitkomst in en geeft het effect door. Je schat pad a, van voorspeller naar mediator, en pad b, van mediator naar uitkomst met de voorspeller erbij. Het product ab is het indirecte effect, en dat toets je met een bootstrapinterval.

Een moderator beantwoordt wanneer en voor wie: hij maakt het verband sterker of zwakker. Daarvoor maak je zelf een productterm en kijk je naar b3. Fleur vraagt of aanwezigheid werkt via begrip van de stof, dat is mediatie. Vraagt zij of dat verband bij de ene groep sterker is dan bij de andere, dan is het moderatie.

Als ik mediator en uitkomst omdraai past het model vaak even goed. Wat toon ik dan eigenlijk aan?

Statistisch weinig. Bij cross-sectionele gegevens zit de volgorde in de tijd alleen in je theorie en niet in je bestand. Zelfs bij een geloote voorspeller is de mediator niet toegewezen, dus een derde variabele die mediator en uitkomst allebei raakt vertekent pad b zonder dat je het ziet. Wat heb je nodig, naast een interval zonder nul, voordat je die pijl mag tekenen?