Wie verlässlich verallgemeinert deine Studie? · Workshop 02 von 03
Alles, was heute kommt, steht dauerhaft online.
https://hannesdiemerling.github.io/Frequent-Reformation/
Kostenfrei, ohne Anmeldung, unter Creative Commons CC BY 4.0.
Ab der nächsten Folie steht oben rechts immer ein QR-Code. Er zeigt jeweils dorthin, wo das gerade Gezeigte nachlesbar ist. Du musst nichts mitschreiben.
Der Hub, Startseite
Workshop 01
Was wir berichten sollten: Effekte statt Signifikanz.
Heute · Workshop 02
Ob die berichteten Zahlen überhaupt für die Population gelten.
Workshop 03
Die Alternative: Wahrscheinlichkeiten für Hypothesen.
Workshop 01 hat gezeigt, was zu berichten ist. Heute geht es darum, ob die Zahlen tragen. Ein perfekt berichteter Effekt aus einer verzerrten Stichprobe ist perfekt berichtet und falsch.
Fünf Kapitel, dazu drei Vertiefungsblöcke, die über das Selbstlern-Material hinausgehen.
00:00 Ankommen und Einordnung · 8 min 00:08 Block A Kapitel plus Vertiefung · 22 min 00:30 Übung 1 am interaktiven Kapitel, dann Auflösung · 20 min 00:50 Pause · 10 min 01:00 Block B Kapitel plus Vertiefung · 22 min 01:22 Übung 2, dann Auflösung · 18 min 01:40 Vertiefung C Praxis und Transfer auf eigene Studien · 15 min 01:55 Abschluss und Wegweiser · 5 min
Die beiden Übungsblöcke laufen an deinem eigenen Gerät, im interaktiven Kapitel. Bring also etwas mit, auf dem ein Browser läuft. Installieren musst du nichts.
00:08 · 22 Minuten
Kapitel 1 und 2: von der Stichprobe zur Population, und was auf dem Weg verloren geht.
Kapitel 1 · 15 min
Die trügerische Stichprobe. Der wahre netzweite Effekt von SmartRail ist 2,5 Minuten. Niemand kennt ihn, alle schätzen ihn.
| Stichprobe | gemessener Effekt |
|---|---|
| n = 20, Team A | 0,8 min |
| n = 20, Team B | 4,2 min |
| n = 500 | nahe 2,5 min |
| n = 1000 | noch näher |
Eine systematisch verzerrte Stichprobe liefert immer falsche Ergebnisse, egal wie groß sie ist.
Zwei verschiedene Probleme: zufällige Streuung schrumpft mit n. Systematische Verzerrung nicht.
Kapitel 2 · 15 min
Die verschwundenen Problemfahrten. 100 Fahrten. Die Sensoren fallen genau dort aus, wo es schwierig wird: Baustellen, Weichenstörungen, schlechtes Wetter.
Die Daten lügen nicht, aber sie zeigen nur noch die verzerrte halbe Wahrheit.
Entscheidend ist nicht, wie viele ausfallen, sondern wer. Wenn 30 % deiner Stichprobe abbricht und das nicht zufällig geschieht, hast du keine repräsentative Stichprobe mehr.
Das Kapitel zeigt einen Fall. Es gibt drei, und sie haben sehr unterschiedliche Konsequenzen.
| Bedeutung | Was rettbar ist | |
|---|---|---|
| MCAR | völlig zufällig fehlend | unproblematisch, nur Präzisionsverlust |
| MAR | fehlend abhängig von beobachteten Variablen | korrigierbar, etwa durch multiple Imputation |
| MNAR | fehlend abhängig von unbeobachteten Werten selbst | nicht aus den Daten korrigierbar |
Das SmartRail-Beispiel ist MNAR: die Ausfälle hängen an der Streckenkomplexität, und die fehlt genau dort. Das ist der Fall, der sich nicht wegrechnen lässt. Man kann ihn nur benennen und in der Diskussion offenlegen.
Dazu die Frage der Verallgemeinerung: WEIRD-Stichproben (Western, Educated, Industrialised, Rich, Democratic) dominieren die Forschung bis heute. Auch eine perfekt vollständige Stichprobe von Psychologie-Studierenden im zweiten Semester verallgemeinert nur auf Psychologie-Studierende im zweiten Semester.
00:30 · 20 Minuten
Verzerrung selbst herstellen.
Kapitel 2, Schieber für die Drop-out-Schwelle.
Kapitel 2 auf deinem Gerät
Repräsentativität & Stichprobengröße, Kapitel 2 · live im Browser · 15 min
00:50 · 10 Minuten
Weiter um 01:00.
Danach: der Garten der sich verzweigenden Pfade.
01:00 · 22 Minuten
Kapitel 3 und 4: wie Freiheitsgrade Befunde erzeugen, und wie man Stichproben plant.
Kapitel 3 · 15 min
Strecke Köln–Düsseldorf, 30 Fahrten pro Bedingung. Der wahre Effekt ist exakt null.
| Analyseschritt | p |
|---|---|
| Alle Daten | 0.35 |
| ohne „Sonderfälle” | sinkt |
| ohne „Messfehler” | sinkt weiter |
| Endergebnis | 0.04 |
Der Effekt wurde nicht entdeckt. Er wurde durch selektives Löschen künstlich erzeugt.
Simmons, Nelson und Simonsohn (2011): durch übliche fragwürdige Forschungspraktiken (QRPs) steigt die Falsch-positiv-Rate von 5 % auf bis zu 61 %.
Kapitel 4 · 15 min
Der Vorstand fordert eine Genauigkeit von ± 1,5 Minuten. Wie viele Testfahrten braucht es dafür?
Um den Fehler zu halbieren, musst du die Stichprobengröße vervierfachen.
Das ist das Wurzelgesetz, und es ist die praktische Ernüchterung jeder Studienplanung: Genauigkeit skaliert nicht linear mit Aufwand.
Der Vorteil dieser Frage: sie ist inhaltlich beantwortbar. Wie genau du schätzen willst, weißt du. Wie groß der Effekt ist, weißt du nicht, das willst du ja erst herausfinden.
Abnehmender Grenznutzen zusätzlicher Testfahrten: irgendwann kostet jede weitere Verbesserung mehr, als sie wert ist. Das ist eine legitime Entscheidung, sie muss nur bewusst getroffen werden.
Weg 01, verbreitet
Wie viele brauche ich, um mit 80 % Wahrscheinlichkeit einen signifikanten p-Wert zu finden, wenn d = 0.5?
Annahme: der wahre Effekt ist bekannt. Grenze: ist er nicht. Also wird geraten.
Weg 02, empfohlen
Wie viele brauche ich, damit mein Intervall schmaler wird als ± 0.15?
Annahme: nur die Streuung. Stärke: die Frage ist inhaltlich entscheidbar.
Weg 03, bayesianisch
Wie viele brauche ich, damit BF ≥ 10 wird, falls H₁ stimmt?
Stärke: erlaubt sequenzielles Testen ohne Alpha-Inflation.
Maxwell, Kelley & Rausch (2008) zur Präzisionsplanung · Schönbrodt & Wagenmakers (2018) zur Bayes-Faktor-Design-Analyse · Cumming (2014) zur „new statistics”.
Der Weg, der immer funktioniert: simuliere deine eigene Studie, tausendmal.
Mit 10 bis 20 Zeilen Code bekommst du eine ehrlichere Antwort als aus jeder Tabelle. Und du kannst Drop-outs, Missings und Messfehler direkt mitmodellieren, was keine Formel für dich tut.
Der eigentliche Gewinn: du musst deine Annahmen explizit hinschreiben. Damit sind sie diskutierbar, prüfbar und für die Präregistrierung dokumentiert.
01:22 · 18 Minuten
Im Garten der sich verzweigenden Pfade.
Kapitel 3. Der wahre Effekt ist null. Trotzdem:
Kapitel 3 auf deinem Gerät
Repräsentativität & Stichprobengröße, Kapitel 3 · live im Browser · 15 min
01:40 · 15 Minuten
Kapitel 5, der strukturelle Gegenzug, und Transfer auf eigene Designs.
Kapitel 5 · 15 min
Die gefährliche Illusion der Präzision. Punktschätzer: 2,5 Minuten.
Das Intervall reicht von 5,0 Minuten bis 0,1 Minuten. Beides ist mit den Daten verträglich: ein großer Erfolg und ein Nichts.
Die Betrachtung dieser Intervalle zwingt uns, die fehlerhafte und reduktive binäre Logik von signifikant und nicht signifikant zu überwinden. Anstatt eine künstliche Schwelle anzubeten, bewerten wir die gesamte Spanne der plausiblen Wahrheiten.
Der Punktschätzer ist die unwahrscheinlichste Aussage, die du machen kannst. Er ist genau ein Wert aus einer ganzen Spanne.
Gegen den Garten der Pfade hilft keine Statistik, sondern eine Reihenfolge: erst festlegen, dann schauen.
Leichtgewichtig
Analyseplan vor der Erhebung festschreiben und mit Zeitstempel ablegen. Auf AsPredicted in unter zehn Minuten.
Vollständig
Projekt, Daten, Code, Materialien und Präregistrierung an einem Ort, versioniert und zitierbar.
Strukturell
Begutachtung vor der Erhebung. Die Zusage hängt am Design, nicht am Ergebnis. Damit ist auch ein Nullbefund publizierbar.
Präregistrierung verbietet dir nichts. Sie trennt nur, was geplant war, von dem, was du entdeckt hast. Beides ist erlaubt, beides ist wertvoll, es muss nur unterscheidbar bleiben.
Nimm eine Studie, die du gerade planst oder kürzlich abgeschlossen hast.
Im eigenen Tempo
Alle Kapitel bleiben offen zugänglich, jederzeit, ohne Anmeldung. Sie laufen vollständig im Browser.
Nachlesen
Die Vertiefungen von heute stehen als Text im Hub: p-Werte, Effektgrößen, Stichproben, bayesianische Analyse.
Einstieg über Fragen
Jede Frage führt direkt in das passende Kapitel. Gut, wenn du später mit einem konkreten Problem zurückkommst.
Fragen, Rückmeldungen, Kooperation: Thomas Schäfer, Thomas.Schaefer@hmu-erfurt.de
Fehler gefunden? Bitte als Issue melden, das hilft am meisten.
In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben.
Vertiefung A und B
WEIRD, Drop-outs, die drei Planungswege, Simulations-Skizze, Schlüsselliteratur.
Vertiefung A
p-Hacking, QRPs, Publikationsbias und die 61-Prozent-Rechnung.
Vertiefung C
Registered Reports, OSF, AsPredicted, die aktuelle Debatte.
Der nächste Schritt: Workshop 03 löst die offene Rechnung von Kapitel 5 ein. Das Glaubwürdigkeitsintervall sagt genau das, was wir vom Konfidenzintervall immer erwartet haben.
Workshop 02 · Repräsentativität & Stichprobengröße · gefördert durch die VolkswagenStiftung