Bayesianische Intuition aufbauen · Workshop 03 von 03
Alles, was heute kommt, steht dauerhaft online.
https://hannesdiemerling.github.io/Frequent-Reformation/
Kostenfrei, ohne Anmeldung, unter Creative Commons CC BY 4.0.
Ab der nächsten Folie steht oben rechts immer ein QR-Code. Er zeigt jeweils dorthin, wo das gerade Gezeigte nachlesbar ist. Du musst nichts mitschreiben.
Der Hub, Startseite
Workshop 01
Effekte berichten statt Signifikanz ablesen.
Workshop 02
Ob die Zahlen für die Population tragen.
Heute · Workshop 03
Die Frage umdrehen und endlich die Antwort bekommen, die wir wollten.
Zwei offene Rechnungen aus den ersten beiden Workshops werden heute eingelöst: echte Evidenz für die Nullhypothese, und ein Intervall, das man so lesen darf, wie man es intuitiv liest.
Sieben Kapitel in drei Blöcken, dazu drei Vertiefungen, die über das Selbstlern-Material hinausgehen. Darunter der Bayes-Faktor, der in den Kapiteln gar nicht vorkommt.
00:00 Ankommen und Einordnung · 5 min 00:05 Block A Grundlagen, Kapitel 1 und 2, plus Vertiefung · 22 min 00:27 Übung 1 Basisraten, Kapitel 2 · 20 min 00:47 Pause · 10 min 00:57 Block B Die drei Zutaten, Kapitel 3 bis 5, plus Vertiefungen · 25 min 01:22 Übung 2 Prior gegen Daten, Kapitel 5 · 18 min 01:40 Block C Anwendung, Kapitel 6 und 7, plus Workflow · 15 min 01:55 Abschluss und Wegweiser · 5 min
Sieben Kapitel in zwei Stunden heißt: zügig durch die Theorie, dafür zwei richtige Arbeitsphasen am eigenen Gerät.
00:05 · 22 Minuten
Kapitel 1 und 2: zwei Begriffe von Wahrscheinlichkeit, und die Regel, die sie verbindet.
Kapitel 1 · 10 min
Frequentistisch
Wahrscheinlichkeit ist der Grenzwert relativer Häufigkeiten bei unendlich vielen Wiederholungen.
Aussagen gelten über Verfahren, nicht über einzelne Fälle.
Bayesianisch
Wahrscheinlichkeit ist ein Maß für den Grad der persönlichen Überzeugung, basierend auf dem aktuellen Informationsstand.
Aussagen gelten über Hypothesen.
Ein 95-%-Konfidenzintervall bedeutet nicht, dass der wahre Wert mit 95 % Wahrscheinlichkeit darin liegt. Es beschreibt die langfristige Erfolgsquote des Verfahrens.
SmartRail, München–Stuttgart. Wahre Pünktlichkeit 85 %, niemand weiß das. Stichprobe 1: 7 von 10. Stichprobe 2: 9 von 10.
Kapitel 2 · 10 min
\[P(\theta \mid D) = \frac{P(D \mid \theta)\, P(\theta)}{P(D)}\]
| Teil | Bedeutung |
|---|---|
| Prior \(P(\theta)\) | Deine anfängliche Überzeugung, bevor du neue Daten kennst |
| Likelihood \(P(D \mid \theta)\) | Wahrscheinlichkeit, genau diese Daten zu beobachten, falls die Hypothese wahr ist |
| Evidenz \(P(D)\) | Totale Wahrscheinlichkeit dieser Daten, unabhängig von der Hypothese |
| Posterior \(P(\theta \mid D)\) | Deine aktualisierte Überzeugung, nachdem du die Evidenz integriert hast |
Das Bayes-Theorem ist eine mathematische Anleitung dafür, aus neuen Informationen klüger zu werden.
SmartRail-Diagnose meldet eine Weichenstörung. Wie wahrscheinlich liegt wirklich eine vor?
| Basisrate einer Störung | 3 % |
| Erkennungsrate bei echter Störung | 95 % |
| Fehlalarmrate ohne Störung | 8 % |
Die Intuition sagt: über 90 %.
Die Rechnung sagt: deutlich unter 30 %.
Ein System mit vielen Fehlalarmen entwertet jeden einzelnen Alarm.
Warum: von 1000 Fahrten haben 30 eine Störung, davon werden 28 erkannt. Von den 970 ohne Störung schlagen 78 falsch Alarm. Also 28 echte gegen 78 falsche Alarme.
00:27 · 20 Minuten
Drei Schieber, eine Intuition, die kippt.
Kapitel 2, drei Schieber: Basisrate, Erkennungsrate, Fehlalarmrate.
Kapitel 2 auf deinem Gerät
Denke Bayesianisch, Kapitel 2 · live im Browser · 15 min
00:47 · 10 Minuten
Weiter um 00:57.
Danach: Prior, Likelihood, Posterior.
00:57 · 25 Minuten
Kapitel 3, 4 und 5. Drei Bausteine, ein Ergebnis.
Kapitel 3 · 10 min
Der Prior beschreibt, welche Werte eines unbekannten Parameters wir vor Beobachtung der neuen Daten für plausibel halten.
Uninformativ. Alle Werte gleich plausibel. Klingt neutral, ist es nicht: er erlaubt auch absurde Werte, etwa eine Verspätungsreduktion von 30 Minuten auf einer Strecke, die keine 30 Minuten Verspätung hat.
Informativ. Nutzt Vorwissen aus früheren Studien oder Logik, um Unsinn auszuschließen.
Schwach informativ. Der praktische Mittelweg: schließt Unsinn aus, lässt aber den Daten alle Freiheit.
Der Prior macht inhärente und ohnehin vorhandene subjektive Annahmen mathematisch angreifbar und transparent.
Kapitel 4 · 10 min
Wie wahrscheinlich ist es, exakt die vorliegenden Daten zu beobachten, falls die spezifische Hypothese wahr wäre?
Fünf Testfahrten, gemessene Ersparnis: 3 · 7 · 5 · 9 · 6 Minuten.
| Hypothese | Likelihood |
|---|---|
| θ = 0 min | praktisch null |
| θ = 3 min | gering |
| θ = 6 min | Maximum |
| θ = 12 min | gering |
Die Likelihood ist der Filter, durch den die Daten auf den Prior wirken. Sie ist keine Wahrscheinlichkeitsverteilung über θ, sondern eine Bewertung jeder Hypothese anhand derselben Daten.
Beim Maximum-Likelihood-Verfahren endet man hier: man nimmt den besten Wert. Bayesianisch geht es weiter, die Likelihood wird mit dem Prior verrechnet.
Kapitel 5 · 10 min
Prior gegen Daten. Herstellerangaben und Simulationen sagen 8 Minuten. Die fünf Testfahrten sagen 6 Minuten.
Der Posterior landet dazwischen. Wie nah an den Daten, hängt davon ab, wie sicher der Prior formuliert war:
Das bayesianische Glaubwürdigkeitsintervall liefert exakt die Aussage, die Menschen intuitiv suchen:
Mit 95 % Wahrscheinlichkeit liegt der wahre Wert in genau diesem Bereich.
Damit ist die offene Rechnung aus Workshop 02 beglichen.
In den sieben Kapiteln kommt er nicht vor. In JASP begegnet er dir zuerst.
| BF₁₀ | Evidenz für H₁ |
|---|---|
| 1 – 3 | anekdotisch |
| 3 – 10 | moderat |
| 10 – 30 | stark |
| 30 – 100 | sehr stark |
| > 100 | extrem |
Ein Verhältnis: wie viel besser hat die eine Hypothese diese Daten vorhergesagt als die andere?
Dieselben Stufen gelten symmetrisch für BF₀₁, also Evidenz für die Nullhypothese. BF₀₁ = 12 heißt: die Daten sprechen stark dafür, dass SmartRail nichts bringt.
Die Antwort auf Fehlannahme 6 aus Workshop 01. Der Signifikanztest kann keine Evidenz und Evidenz für die Null nicht auseinanderhalten. Der Bayes-Faktor kann es.
Stufen nach Lee & Wagenmakers (2013).
Aus einer Verteilung eine Entscheidung machen, ohne eine neue Schwelle zu ritualisieren.
Intervall
Equal-Tailed Interval: schneidet unten und oben je 2,5 % ab. Einfach, aber bei schiefen Verteilungen unglücklich.
Intervall
Highest Density Interval: der schmalste Bereich, der 95 % enthält. Jeder Wert darin ist plausibler als jeder Wert außerhalb.
Entscheidung
Region of Practical Equivalence: ein Bereich um Null, der als praktisch bedeutungslos gilt. Liegt das HDI außerhalb, ist die Sache klar.
ROPE ist die Brücke zu Workshop 01. Die Relevanzschwelle, die dort inhaltlich festgelegt wurde, wird hier zum statistischen Kriterium. Nicht „ist der Effekt von null verschieden”, sondern „liegt er außerhalb dessen, was mir egal ist”.
Die Kapitel zeigen, dass der Prior wirkt. Offen bleibt, wie man damit in einer Publikation umgeht.
Sensitivitätsanalyse, in vier Schritten:
Damit dreht sich der Subjektivitätsvorwurf. Wer eine Sensitivitätsanalyse berichtet, hat seine Annahmen offengelegt und geprüft. Eine frequentistische Analyse tut das für ihre Annahmen in der Regel nicht.
01:22 · 18 Minuten
Wann gewinnen die Daten?
Kapitel 5, Schieber für Prior-Mittelwert und Prior-Streuung.
Kapitel 5 auf deinem Gerät
Denke Bayesianisch, Kapitel 5 · live im Browser · 15 min
01:40 · 15 Minuten
Kapitel 6 und 7, dann der Weg in die eigene Analyse.
Kapitel 6 · 10 min
Die Prognose für morgen. Der Posterior sagt: θ liegt bei etwa 6 Minuten. Aber was macht die nächste einzelne Fahrt?
Unsicherheit 01
Wie sicher bin ich mir über den wahren Parameter θ? Diese Unsicherheit schrumpft mit mehr Daten.
Unsicherheit 02
Das natürliche Rauschen der realen Welt. Diese Unsicherheit bleibt, egal wie viele Daten du sammelst.
Deshalb ist die Posterior-Predictive immer breiter als der Posterior. Wer eine Einzelvorhersage mit der Genauigkeit des Mittelwerts angibt, verspricht zu viel.
Kapitel 7 · 10 min
Erinnerung an Kapitel 2: der Nenner \(P(D)\) normiert. Bei realistischen Modellen ist dieses Integral nicht analytisch lösbar.
Der blinde Optimierer. MCMC ist ein Verfahren, das die Verteilung abläuft, statt sie zu berechnen:
MCMC ist die Brücke von der Theorie zur praktischen Anwendbarkeit. Ohne sie wäre bayesianische Statistik auf Lehrbuchbeispiele beschränkt geblieben.
Und deshalb gibt es Diagnostik: wer approximiert, muss prüfen, ob die Approximation getaugt hat.
Schritt 4 ist nicht optional. Ein nicht konvergiertes Modell liefert Zahlen, und sie sehen genauso aus wie richtige.
Ohne Code
Klick-Oberfläche. Bayesianischer t-Test, ANOVA, Regression und Korrelation direkt neben den klassischen Verfahren. Gibt Bayes-Faktoren aus.
Der Einstieg für heute Abend.
Mit R
brm(y ~ x + (1|id), ...)
Formel-Syntax wie lme4, darunter Stan. Wer lme4 kennt, kann brms.
Volle Kontrolle
Modell selbst schreiben, moderne Sampler, ArviZ für die Diagnostik. Für alles, was keine Standardform hat.
Empfehlung: rechne deine letzte Analyse noch einmal in JASP, bayesianisch, und vergleiche. Das dauert eine halbe Stunde und ist lehrreicher als jedes weitere Kapitel.
Alle genannten Werkzeuge sind Open Source und kostenfrei.
Nimm ein eigenes Ergebnis und formuliere es dreimal:
Satz 3 ist der, den du eigentlich immer sagen wolltest. Er war nur nicht erlaubt.
Im eigenen Tempo
Alle Kapitel bleiben offen zugänglich, jederzeit, ohne Anmeldung. Sie laufen vollständig im Browser.
Nachlesen
Die Vertiefungen von heute stehen als Text im Hub: p-Werte, Effektgrößen, Stichproben, bayesianische Analyse.
Einstieg über Fragen
Jede Frage führt direkt in das passende Kapitel. Gut, wenn du später mit einem konkreten Problem zurückkommst.
Fragen, Rückmeldungen, Kooperation: Thomas Schäfer, Thomas.Schaefer@hmu-erfurt.de
Fehler gefunden? Bitte als Issue melden, das hilft am meisten.
In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben.
Vertiefung A bis C
Bayes-Faktor-Stufen, HDI und ROPE, der sechsstufige Workflow, häufige Sorgen.
Werkzeuge
JASP, Jamovi, brms, Stan, PyMC, mit Einstiegshinweisen.
Weiterlesen
McElreath, Kruschke, Gelman, Lee und Wagenmakers, plus die frei verfügbare Vorlesungsreihe.
Damit ist die Reihe komplett. Effekte berichten, Stichproben ehrlich planen, Hypothesen bewerten. Drei Fragen, drei Antworten.
Workshop 03 · Denke Bayesianisch · gefördert durch die VolkswagenStiftung