Was ein Testergebnis wirklich bedeutet
Ein Test ist positiv. Wie wahrscheinlich ist die Krankheit jetzt? Das hängt nicht nur vom Test ab — sondern davon, wie häufig die Krankheit vorher war.
Dieselbe Mammographie, derselbe Schnelltest, derselbe Betrugsfilter: Wo die Krankheit selten ist, sind die meisten positiven Ergebnisse falsch. Wo sie häufig ist, sind die meisten richtig. Das Werkzeug rechnet in Menschen, nicht in Prozenten — so, wie man es richtig versteht.
Welcher Test, welcher Mensch?
Zehn Fälle — jeder mit einem zweiten Menschen, bei dem derselbe Test etwas anderes bedeutet.
Selbst einstellen
Vortest heißt: Wie viele von 100 solchen Menschen sind krank — bevor der Test läuft? Das ist die Häufigkeit in seiner Gruppe: gleiches Alter, gleiche Beschwerden, gleiche Vorgeschichte.
Hier: Von 100 Frauen um 50 ohne Beschwerden hat etwa eine Brustkrebs — das ist die Häufigkeit in dieser Altersgruppe.
Sensitivität: Von 100 Menschen, die krank sind, meldet der Test so viele. Spezifität: Von 100, die gesund sind, lässt er so viele in Ruhe. Beides gehört dem Test und steht im Beipackzettel. Der Vortest gehört dem Menschen — und steht nirgends.
Diese Aufgabe stellte der Psychologe Gerd Gigerenzer Ärztinnen und Ärzten: Eine Frau ohne Beschwerden hat einen positiven Befund — wie wahrscheinlich hat sie Krebs? Die meisten antworteten 80 bis 90 %. Richtig sind etwa 9 %: Von 100 positiven Befunden gehören 91 zu gesunden Frauen.
Tausend Menschen, ein Test
Vierfeldertafel
| Brustkrebs | kein Brustkrebs | Σ | |
|---|---|---|---|
| Test positiv | 9 | 89 | 98 |
| Test negativ | 1 | 901 | 902 |
| Σ | 10 | 990 | 1000 |
In Worten
Von 1.000 Menschen sind 10 krank und 990 gesund.
Der Test ist bei 98 positiv: 9 davon sind krank, 89 gesund.
Ein positives Ergebnis heißt also: nur mit 9 % krank — 91 von 100 Positiven sind gesund.
Unter den 902 Negativen sind noch 1 krank — ein negatives Ergebnis lässt 0.1 % Restwahrscheinlichkeit.
Der Test hat 91 % „Genauigkeit“ — und trotzdem sind die meisten positiven Ergebnisse falsch. Genauigkeit zählt die vielen mit, die gesund und richtig negativ sind. Sie ist die irreführendste Zahl in dieser Tafel.
Fagan-Nomogramm
Gerade vom Vortest durch den Likelihood-Quotienten: rot nach positivem, blau nach negativem Ergebnis. Das ist Bayes ohne Taschenrechner — die Achsen sind logarithmische Odds, und die addieren sich.
Lohnt der Test überhaupt?
Nach Pauker und Kassirer: Ein Test lohnt nur, wenn sein Ergebnis die Entscheidung ändern kann. Das hängt davon ab, wie viel die Behandlung Kranken nützt und Gesunden schadet.
Die dünne Linie ist die Schwelle ohne Test (10 %). Je besser der Test, desto weiter rücken die beiden Schwellen auseinander — desto öfter lohnt er.
Und was bringt die Behandlung?
„Senkt das Risiko um 25 Prozent“ — die eine Zahl aus der Studie klingt groß. Die andere sagt, was es für den Menschen bedeutet. Und wer nach der Studie in Untergruppen sucht, findet immer etwas.
Was bringt die Behandlung?
Zwei Zahlen aus einer Studie: das Risiko ohne und mit Behandlung. Daraus folgt alles.
Selbst einstellen
„Senkt das Risiko um 25 %“ — stimmt. Und heißt: von 100 Behandelten hat einer etwas davon, 99 nehmen die Tablette fünf Jahre ohne Nutzen. Beide Zahlen sind wahr. Nur eine sagt, was es für den Menschen bedeutet.
Tausend Menschen nehmen die Behandlung
„Senkt das Risiko um 25 %.“ Die Zahl aus der Werbung — wahr, aber ohne das Ausgangsrisiko wertlos.
Von 4.0 % auf 3.0 %. Das ist der Unterschied, den ein Mensch erlebt.
100 Menschen müssen behandelt werden, damit einer etwas davon hat. Die anderen 99 tragen nur die Nebenwirkungen.
Untergruppen: Was der Zufall allein liefert
Eine Studie mit 8400 Menschen je Arm, zerlegt nach Sternzeichen — wie es die ISIS-2-Autoren 1988 zur Warnung selbst taten. Die Behandlung wirkt hier gar nicht: beide Arme 10 %. Alles, was du in den Gruppen siehst, ist Zufall.
| Gruppe | ohne | mit | Reduktion | p |
|---|---|---|---|---|
| Alle (8400 je Arm) | 812 | 850 | -5 % | 0,326 |
| Widder (700) | 73 | 67 | 8 % | 0,593 |
| Stier (700) | 68 | 65 | 4 % | 0,785 |
| Zwillinge (700) | 58 | 63 | -9 % | 0,634 |
| Krebs (700) | 81 | 66 | 19 % | 0,191 |
| Löwe (700) | 90 | 71 | 21 % | 0,111 |
| Jungfrau (700) | 56 | 78 | -39 % | 0,046 |
| Waage (700) | 56 | 77 | -38 % | 0,056 |
| Skorpion (700) | 57 | 67 | -18 % | 0,347 |
| Schütze (700) | 72 | 79 | -10 % | 0,546 |
| Steinbock (700) | 62 | 72 | -16 % | 0,364 |
| Wassermann (700) | 76 | 50 | 34 % | 0,015 |
| Fische (700) | 63 | 95 | -51 % | 0,007 |
p ist die Wahrscheinlichkeit, dass ein so großer Unterschied allein durch Zufall entsteht, wenn es in Wahrheit keinen gibt. Unter 0,05 — einem von zwanzig — gilt er als „signifikant“. Das ist eine Konvention, kein Beweis.
Der eine Satz, um den alles geht
Ein Test sagt nicht, ob jemand krank ist. Er macht es wahrscheinlicher oder unwahrscheinlicher, als es vorher war. Deshalb muss man wissen, wie wahrscheinlich es vorher war: Bei einer seltenen Krankheit bleibt es auch nach einem positiven Test meist unwahrscheinlich. Bei einer häufigen wird es fast sicher. Der Test ist derselbe — der Mensch davor ist ein anderer.
Sensitivitäten, Spezifitäten und Studienzahlen der Beispiele sind Lehrwerte in der Größenordnung der Literatur, keine Leitlinienzahlen; Quellen und Grenzen in docs/TESTGUETE_KRITERIEN.md. Lehrmaterial, keine klinische Entscheidungshilfe.
Hat dir das etwas gebracht? Dann teil den Link mit jemandem, dem es auch helfen könnte — und folge uns, dann verpasst du das nächste Werkzeug nicht.