Repräsentativität & Stichprobengröße

Wie verlässlich verallgemeinert deine Studie? · Workshop 02 von 03

Beyond p-values · HMU Health and Medical University Erfurt

Alles zum Mitlesen

Alles, was heute kommt, steht dauerhaft online.

https://hannesdiemerling.github.io/Frequent-Reformation/

Kostenfrei, ohne Anmeldung, unter Creative Commons CC BY 4.0.

Ab der nächsten Folie steht oben rechts immer ein QR-Code. Er zeigt jeweils dorthin, wo das gerade Gezeigte nachlesbar ist. Du musst nichts mitschreiben.

Der Hub, Startseite

Wo wir stehen

Workshop 01

Beyond Significance

Was wir berichten sollten: Effekte statt Signifikanz.

Heute · Workshop 02

Repräsentativität und Stichprobengröße

Ob die berichteten Zahlen überhaupt für die Population gelten.

Workshop 03

Denke Bayesianisch

Die Alternative: Wahrscheinlichkeiten für Hypothesen.

Workshop 01 hat gezeigt, was zu berichten ist. Heute geht es darum, ob die Zahlen tragen. Ein perfekt berichteter Effekt aus einer verzerrten Stichprobe ist perfekt berichtet und falsch.

Was du heute mitnimmst

  • Repräsentativität einer Stichprobe bewerten und Grenzen der Verallgemeinerung benennen.
  • Drop-outs und Missings als Auswahlmechanismus lesen, nicht als Datenverlust.
  • p-Hacking erkennen und die Folgen für die Falsch-positiv-Rate einschätzen.
  • Stichprobenpläne über das Wurzelgesetz und über Simulation aufstellen.
  • Unsicherheit ehrlich kommunizieren, über das binäre signifikant hinaus.

Fünf Kapitel, dazu drei Vertiefungsblöcke, die über das Selbstlern-Material hinausgehen.

Der Ablauf heute

00:00 Ankommen und Einordnung · 8 min 00:08 Block A Kapitel plus Vertiefung · 22 min 00:30 Übung 1 am interaktiven Kapitel, dann Auflösung · 20 min 00:50 Pause · 10 min 01:00 Block B Kapitel plus Vertiefung · 22 min 01:22 Übung 2, dann Auflösung · 18 min 01:40 Vertiefung C Praxis und Transfer auf eigene Studien · 15 min 01:55 Abschluss und Wegweiser · 5 min

Die beiden Übungsblöcke laufen an deinem eigenen Gerät, im interaktiven Kapitel. Bring also etwas mit, auf dem ein Browser läuft. Installieren musst du nichts.

Block A

00:08 · 22 Minuten

Kapitel 1 und 2: von der Stichprobe zur Population, und was auf dem Weg verloren geht.

Kapitel 1: Die Suche nach der Wahrheit

Kapitel 1 · 15 min

Die trügerische Stichprobe. Der wahre netzweite Effekt von SmartRail ist 2,5 Minuten. Niemand kennt ihn, alle schätzen ihn.

Stichprobe gemessener Effekt
n = 20, Team A 0,8 min
n = 20, Team B 4,2 min
n = 500 nahe 2,5 min
n = 1000 noch näher

Eine systematisch verzerrte Stichprobe liefert immer falsche Ergebnisse, egal wie groß sie ist.

Zwei verschiedene Probleme: zufällige Streuung schrumpft mit n. Systematische Verzerrung nicht.

Kapitel 2: Drop-out ist ein Auswahlmechanismus

Kapitel 2 · 15 min

Die verschwundenen Problemfahrten. 100 Fahrten. Die Sensoren fallen genau dort aus, wo es schwierig wird: Baustellen, Weichenstörungen, schlechtes Wetter.

  • Übrig bleiben die einfachen Strecken.
  • Dort wirkt SmartRail besser.
  • Der berichtete Effekt wird künstlich aufgebläht.
  • Kein Rechenfehler ist passiert.

Die Daten lügen nicht, aber sie zeigen nur noch die verzerrte halbe Wahrheit.

Entscheidend ist nicht, wie viele ausfallen, sondern wer. Wenn 30 % deiner Stichprobe abbricht und das nicht zufällig geschieht, hast du keine repräsentative Stichprobe mehr.

Vertiefung A: Missing-Mechanismen benennen

Das Kapitel zeigt einen Fall. Es gibt drei, und sie haben sehr unterschiedliche Konsequenzen.

Bedeutung Was rettbar ist
MCAR völlig zufällig fehlend unproblematisch, nur Präzisionsverlust
MAR fehlend abhängig von beobachteten Variablen korrigierbar, etwa durch multiple Imputation
MNAR fehlend abhängig von unbeobachteten Werten selbst nicht aus den Daten korrigierbar

Das SmartRail-Beispiel ist MNAR: die Ausfälle hängen an der Streckenkomplexität, und die fehlt genau dort. Das ist der Fall, der sich nicht wegrechnen lässt. Man kann ihn nur benennen und in der Diskussion offenlegen.

Dazu die Frage der Verallgemeinerung: WEIRD-Stichproben (Western, Educated, Industrialised, Rich, Democratic) dominieren die Forschung bis heute. Auch eine perfekt vollständige Stichprobe von Psychologie-Studierenden im zweiten Semester verallgemeinert nur auf Psychologie-Studierende im zweiten Semester.

Übung 1

00:30 · 20 Minuten

Verzerrung selbst herstellen.

Übung 1: den Effekt künstlich aufblähen

Kapitel 2, Schieber für die Drop-out-Schwelle.

  1. Setze die Schwelle so, dass alle Fahrten sichtbar sind. Notiere den mittleren Effekt.
  2. Schiebe die Schwelle hoch, bis der berichtete Effekt sich verdoppelt hat. Wie viele Fahrten hast du dafür entfernt?
  3. Schau auf die Punktwolke: welche Fahrten sind verschwunden? Beschreibe den Mechanismus in einem Satz.
  4. Übertrage: in deiner Forschung, wer fällt systematisch aus? Und in welche Richtung verzerrt das?

Kapitel 2 auf deinem Gerät

Verzerrung durch Dropouts und Missings

Repräsentativität & Stichprobengröße, Kapitel 2 · live im Browser · 15 min

Pause

00:50 · 10 Minuten

Weiter um 01:00.

Danach: der Garten der sich verzweigenden Pfade.

Block B

01:00 · 22 Minuten

Kapitel 3 und 4: wie Freiheitsgrade Befunde erzeugen, und wie man Stichproben plant.

Kapitel 3: Der manipulierte Streckentest

Kapitel 3 · 15 min

Strecke Köln–Düsseldorf, 30 Fahrten pro Bedingung. Der wahre Effekt ist exakt null.

Analyseschritt p
Alle Daten 0.35
ohne „Sonderfälle” sinkt
ohne „Messfehler” sinkt weiter
Endergebnis 0.04

Der Effekt wurde nicht entdeckt. Er wurde durch selektives Löschen künstlich erzeugt.

Simmons, Nelson und Simonsohn (2011): durch übliche fragwürdige Forschungspraktiken (QRPs) steigt die Falsch-positiv-Rate von 5 % auf bis zu 61 %.

Kapitel 4: Wie genau willst du schätzen?

Kapitel 4 · 15 min

Der Vorstand fordert eine Genauigkeit von ± 1,5 Minuten. Wie viele Testfahrten braucht es dafür?

Um den Fehler zu halbieren, musst du die Stichprobengröße vervierfachen.

Das ist das Wurzelgesetz, und es ist die praktische Ernüchterung jeder Studienplanung: Genauigkeit skaliert nicht linear mit Aufwand.

Der Vorteil dieser Frage: sie ist inhaltlich beantwortbar. Wie genau du schätzen willst, weißt du. Wie groß der Effekt ist, weißt du nicht, das willst du ja erst herausfinden.

Abnehmender Grenznutzen zusätzlicher Testfahrten: irgendwann kostet jede weitere Verbesserung mehr, als sie wert ist. Das ist eine legitime Entscheidung, sie muss nur bewusst getroffen werden.

Vertiefung B: drei Wege, systematisch

Weg 01, verbreitet

Power-Analyse

Wie viele brauche ich, um mit 80 % Wahrscheinlichkeit einen signifikanten p-Wert zu finden, wenn d = 0.5?

Annahme: der wahre Effekt ist bekannt. Grenze: ist er nicht. Also wird geraten.

Weg 02, empfohlen

Präzisionsplanung

Wie viele brauche ich, damit mein Intervall schmaler wird als ± 0.15?

Annahme: nur die Streuung. Stärke: die Frage ist inhaltlich entscheidbar.

Weg 03, bayesianisch

Bayes-Faktor-Design

Wie viele brauche ich, damit BF ≥ 10 wird, falls H₁ stimmt?

Stärke: erlaubt sequenzielles Testen ohne Alpha-Inflation.

Maxwell, Kelley & Rausch (2008) zur Präzisionsplanung · Schönbrodt & Wagenmakers (2018) zur Bayes-Faktor-Design-Analyse · Cumming (2014) zur „new statistics”.

Vertiefung B: Simulation statt Tabelle

Der Weg, der immer funktioniert: simuliere deine eigene Studie, tausendmal.

  1. Datengenerierenden Prozess aufschreiben: Effekt, Streuung, Fallzahl, Drop-out-Rate.
  2. Eine Studie simulieren, auswerten, Ergebnis speichern.
  3. Das tausendmal wiederholen.
  4. Anschauen, wie oft du bei welcher Fallzahl zu welchem Schluss kommst.

Mit 10 bis 20 Zeilen Code bekommst du eine ehrlichere Antwort als aus jeder Tabelle. Und du kannst Drop-outs, Missings und Messfehler direkt mitmodellieren, was keine Formel für dich tut.

Der eigentliche Gewinn: du musst deine Annahmen explizit hinschreiben. Damit sind sie diskutierbar, prüfbar und für die Präregistrierung dokumentiert.

Übung 2

01:22 · 18 Minuten

Im Garten der sich verzweigenden Pfade.

Übung 2: finde den kleinsten p-Wert

Kapitel 3. Der wahre Effekt ist null. Trotzdem:

  1. Notiere den p-Wert ohne jede Anpassung.
  2. Probiere Kombinationen aus den drei Filtern und der Subgruppen-Auswahl. Wie klein bekommst du p?
  3. Lies ab: wie viele der möglichen Pfade sind bereits signifikant?
  4. Begründe jeden deiner Filter in einem Satz, so wie du es in einem Methodenteil schreiben würdest. Klingt die Begründung unseriös?

Kapitel 3 auf deinem Gerät

p-Hacking und falsch-positive Ergebnisse

Repräsentativität & Stichprobengröße, Kapitel 3 · live im Browser · 15 min

Block C

01:40 · 15 Minuten

Kapitel 5, der strukturelle Gegenzug, und Transfer auf eigene Designs.

Kapitel 5: Unsicherheit quantifizieren

Kapitel 5 · 15 min

Die gefährliche Illusion der Präzision. Punktschätzer: 2,5 Minuten.

Das Intervall reicht von 5,0 Minuten bis 0,1 Minuten. Beides ist mit den Daten verträglich: ein großer Erfolg und ein Nichts.

Die Betrachtung dieser Intervalle zwingt uns, die fehlerhafte und reduktive binäre Logik von signifikant und nicht signifikant zu überwinden. Anstatt eine künstliche Schwelle anzubeten, bewerten wir die gesamte Spanne der plausiblen Wahrheiten.

Der Punktschätzer ist die unwahrscheinlichste Aussage, die du machen kannst. Er ist genau ein Wert aus einer ganzen Spanne.

Vertiefung C: der strukturelle Gegenzug

Gegen den Garten der Pfade hilft keine Statistik, sondern eine Reihenfolge: erst festlegen, dann schauen.

Leichtgewichtig

Präregistrierung

Analyseplan vor der Erhebung festschreiben und mit Zeitstempel ablegen. Auf AsPredicted in unter zehn Minuten.

Vollständig

OSF

Projekt, Daten, Code, Materialien und Präregistrierung an einem Ort, versioniert und zitierbar.

Strukturell

Registered Reports

Begutachtung vor der Erhebung. Die Zusage hängt am Design, nicht am Ergebnis. Damit ist auch ein Nullbefund publizierbar.

Präregistrierung verbietet dir nichts. Sie trennt nur, was geplant war, von dem, was du entdeckt hast. Beides ist erlaubt, beides ist wertvoll, es muss nur unterscheidbar bleiben.

Transfer: dein eigenes Design

Nimm eine Studie, die du gerade planst oder kürzlich abgeschlossen hast.

  1. Präzision statt Power: Wie genau musst du den Effekt schätzen, damit die Antwort für die Praxis brauchbar ist? Nenne eine Zahl mit Einheit.
  2. Auswahlmechanismus: Wer fällt bei dir systematisch aus? MCAR, MAR oder MNAR?
  3. Freiheitsgrade: Zähle die Analyseentscheidungen, die du noch nicht festgelegt hast. Wie groß ist dein Garten?
  4. Ein konkreter nächster Schritt. Ein Satz, den du diese Woche umsetzt.

Weiterarbeiten

Wie du weiterkommst

Im eigenen Tempo

Die Kapitel noch einmal

Alle Kapitel bleiben offen zugänglich, jederzeit, ohne Anmeldung. Sie laufen vollständig im Browser.

Nachlesen

Die Methoden-Seiten

Die Vertiefungen von heute stehen als Text im Hub: p-Werte, Effektgrößen, Stichproben, bayesianische Analyse.

Einstieg über Fragen

Zehn konkrete Fragen

Jede Frage führt direkt in das passende Kapitel. Gut, wenn du später mit einem konkreten Problem zurückkommst.

Mitnehmen und weitergeben

  • Alle Inhalte stehen unter Creative Commons CC BY 4.0. Du darfst sie in eigener Lehre verwenden, umbauen und weitergeben, mit Quellenangabe.
  • Auch diese Folien. Sie liegen im Hub unter Folien.
  • Geführte Workshops sind in Planung und noch nicht buchbar. Verfügbar ist alles im eigenen Tempo.

Fragen, Rückmeldungen, Kooperation: Thomas Schäfer, Thomas.Schaefer@hmu-erfurt.de

Fehler gefunden? Bitte als Issue melden, das hilft am meisten.

In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben.

Wo du das alles wiederfindest

Vertiefung A und B

Stichproben und Präzision

WEIRD, Drop-outs, die drei Planungswege, Simulations-Skizze, Schlüsselliteratur.

Vertiefung A

Probleme des p-Werts

p-Hacking, QRPs, Publikationsbias und die 61-Prozent-Rechnung.

Vertiefung C

Journals und Werkzeuge

Registered Reports, OSF, AsPredicted, die aktuelle Debatte.

Der nächste Schritt: Workshop 03 löst die offene Rechnung von Kapitel 5 ein. Das Glaubwürdigkeitsintervall sagt genau das, was wir vom Konfidenzintervall immer erwartet haben.