Was ein Testergebnis wirklich bedeutet

Ein Test ist positiv. Wie wahrscheinlich ist die Krankheit jetzt? Das hängt nicht nur vom Test ab — sondern davon, wie häufig die Krankheit vorher war.

Dieselbe Mammographie, derselbe Schnelltest, derselbe Betrugsfilter: Wo die Krankheit selten ist, sind die meisten positiven Ergebnisse falsch. Wo sie häufig ist, sind die meisten richtig. Das Werkzeug rechnet in Menschen, nicht in Prozenten — so, wie man es richtig versteht.

Der Kurs dazu. Erst selbst schätzen, dann in Menschen rechnen — bis zu NNT und Untergruppen. Zehn Übungsfälle, Abschlussquiz, gespeicherter Fortschritt.Zum Kurs →

Welcher Test, welcher Mensch?

Zehn Fälle — jeder mit einem zweiten Menschen, bei dem derselbe Test etwas anderes bedeutet.

Medizin
Technik

Selbst einstellen

Vortest heißt: Wie viele von 100 solchen Menschen sind krank — bevor der Test läuft? Das ist die Häufigkeit in seiner Gruppe: gleiches Alter, gleiche Beschwerden, gleiche Vorgeschichte.
Hier: Von 100 Frauen um 50 ohne Beschwerden hat etwa eine Brustkrebs — das ist die Häufigkeit in dieser Altersgruppe.

Sensitivität: Von 100 Menschen, die krank sind, meldet der Test so viele. Spezifität: Von 100, die gesund sind, lässt er so viele in Ruhe. Beides gehört dem Test und steht im Beipackzettel. Der Vortest gehört dem Menschen — und steht nirgends.

Mammographie bei Frauen ohne Beschwerden, 50 Jahre

Diese Aufgabe stellte der Psychologe Gerd Gigerenzer Ärztinnen und Ärzten: Eine Frau ohne Beschwerden hat einen positiven Befund — wie wahrscheinlich hat sie Krebs? Die meisten antworteten 80 bis 90 %. Richtig sind etwa 9 %: Von 100 positiven Befunden gehören 91 zu gesunden Frauen.

Tausend Menschen, ein Test

Brustkrebs, Test positiv 9Brustkrebs, Test negativ 1kein Brustkrebs, Test positiv 89kein Brustkrebs, Test negativ 901

Vierfeldertafel

Brustkrebskein BrustkrebsΣ
Test positiv98998
Test negativ1901902
Σ109901000
Test positiv → wirklich Brustkrebs
9.2 %
positiver Vorhersagewert
Test negativ → trotzdem Brustkrebs
0.11 %
Restwahrscheinlichkeit
LR+ 10.0 · LR− 0.110 · Genauigkeit 91 %

In Worten

Von 1.000 Menschen sind 10 krank und 990 gesund.

Der Test ist bei 98 positiv: 9 davon sind krank, 89 gesund.

Ein positives Ergebnis heißt also: nur mit 9 % krank — 91 von 100 Positiven sind gesund.

Unter den 902 Negativen sind noch 1 krank — ein negatives Ergebnis lässt 0.1 % Restwahrscheinlichkeit.

Der Test hat 91 % „Genauigkeit“ — und trotzdem sind die meisten positiven Ergebnisse falsch. Genauigkeit zählt die vielen mit, die gesund und richtig negativ sind. Sie ist die irreführendste Zahl in dieser Tafel.

Fagan-Nomogramm

Gerade vom Vortest durch den Likelihood-Quotienten: rot nach positivem, blau nach negativem Ergebnis. Das ist Bayes ohne Taschenrechner — die Achsen sind logarithmische Odds, und die addieren sich.

0.10.1115510103030505070709090959599991001000.0010.010.11101001000Vortest %LRNachtest %

Lohnt der Test überhaupt?

Nach Pauker und Kassirer: Ein Test lohnt nur, wenn sein Ergebnis die Entscheidung ändern kann. Das hängt davon ab, wie viel die Behandlung Kranken nützt und Gesunden schadet.

nicht testen (bis 1.1 %)testenbehandeln, ohne zu testen (ab 50 %)Vortest
Bei 1.0 % Vortest: nicht testen.

Die dünne Linie ist die Schwelle ohne Test (10 %). Je besser der Test, desto weiter rücken die beiden Schwellen auseinander — desto öfter lohnt er.

Und was bringt die Behandlung?

„Senkt das Risiko um 25 Prozent“ — die eine Zahl aus der Studie klingt groß. Die andere sagt, was es für den Menschen bedeutet. Und wer nach der Studie in Untergruppen sucht, findet immer etwas.

Was bringt die Behandlung?

Zwei Zahlen aus einer Studie: das Risiko ohne und mit Behandlung. Daraus folgt alles.

Selbst einstellen

Herzinfarkt oder Schlaganfall, in 5 Jahren

„Senkt das Risiko um 25 %“ — stimmt. Und heißt: von 100 Behandelten hat einer etwas davon, 99 nehmen die Tablette fünf Jahre ohne Nutzen. Beide Zahlen sind wahr. Nur eine sagt, was es für den Menschen bedeutet.

Tausend Menschen nehmen die Behandlung

bewahrt 10trotzdem 30hätten ohnehin nichts gehabt 960
Relative Risikoreduktion
25 %

„Senkt das Risiko um 25 %.“ Die Zahl aus der Werbung — wahr, aber ohne das Ausgangsrisiko wertlos.

Absolute Risikoreduktion
1.0 Punkte

Von 4.0 % auf 3.0 %. Das ist der Unterschied, den ein Mensch erlebt.

Number Needed to Treat
100

100 Menschen müssen behandelt werden, damit einer etwas davon hat. Die anderen 99 tragen nur die Nebenwirkungen.

Untergruppen: Was der Zufall allein liefert

Eine Studie mit 8400 Menschen je Arm, zerlegt nach Sternzeichen — wie es die ISIS-2-Autoren 1988 zur Warnung selbst taten. Die Behandlung wirkt hier gar nicht: beide Arme 10 %. Alles, was du in den Gruppen siehst, ist Zufall.

GruppeohnemitReduktionp
Alle (8400 je Arm)812850-5 %0,326
Widder (700)73678 %0,593
Stier (700)68654 %0,785
Zwillinge (700)5863-9 %0,634
Krebs (700)816619 %0,191
Löwe (700)907121 %0,111
Jungfrau (700)5678-39 %0,046
Waage (700)5677-38 %0,056
Skorpion (700)5767-18 %0,347
Schütze (700)7279-10 %0,546
Steinbock (700)6272-16 %0,364
Wassermann (700)765034 %0,015
Fische (700)6395-51 %0,007

p ist die Wahrscheinlichkeit, dass ein so großer Unterschied allein durch Zufall entsteht, wenn es in Wahrheit keinen gibt. Unter 0,05 — einem von zwanzig — gilt er als „signifikant“. Das ist eine Konvention, kein Beweis.

3 Gruppen mit p < 0,05 (gelb) — obwohl die Behandlung nichts tut. Und in 7 Gruppen scheint sie zu schaden (rot). Zwölf Fragen an den Zufall, und jede darf zu 5 % „ja“ sagen. Wer nach der Studie in den Gruppen sucht, findet immer etwas. Deshalb zählt nur, was vorher festgelegt war — und die Gesamtzahl.

Der eine Satz, um den alles geht

Ein Test sagt nicht, ob jemand krank ist. Er macht es wahrscheinlicher oder unwahrscheinlicher, als es vorher war. Deshalb muss man wissen, wie wahrscheinlich es vorher war: Bei einer seltenen Krankheit bleibt es auch nach einem positiven Test meist unwahrscheinlich. Bei einer häufigen wird es fast sicher. Der Test ist derselbe — der Mensch davor ist ein anderer.

Sensitivitäten, Spezifitäten und Studienzahlen der Beispiele sind Lehrwerte in der Größenordnung der Literatur, keine Leitlinienzahlen; Quellen und Grenzen in docs/TESTGUETE_KRITERIEN.md. Lehrmaterial, keine klinische Entscheidungshilfe.

Hat dir das etwas gebracht? Dann teil den Link mit jemandem, dem es auch helfen könnte — und folge uns, dann verpasst du das nächste Werkzeug nicht.