← alle artikel

Studien und ihre Tücken

Eine Studie sagt in der Regel nicht viel. Studien werden massiv überinterpretiert, die meisten Ergebnisse lassen sich nicht in diesem Ausmaß replizieren, und grundsätzlich sind die meisten Theorien falsch. Deshalb beschäftigt sich dieser Artikel mal mit den typischsten Problemen bei der Interpretation von Studien.

Inhalt anzeigen
  1. Was wurde untersucht?
  2. Ein Zusammenhang ist schnell gefunden
  3. Hormonersatztherapie
  4. Der p-Wert
  5. Treffer suchen, bis man einen findet
  6. Harte Endpunkte
  7. Die fehlenden Studien
  8. Meta-Analysen
  9. Replikation
  10. Die kleine spektakuläre Studie
  11. Wie ich Studien lese
  12. Einordnung
  13. Quellen
Auf einen Blick
  • Eine einzelne Studie ist ein Datenpunkt, kein Endurteil – Studiendesign, Stichprobe und Endpunkt bestimmen, wie weit eine Schlussfolgerung reichen darf.
  • Korrelation ist nicht Kausalität: Beobachtungsstudien können durch unbekannte oder falsch kontrollierte Confounder verzerrt sein, wie die Hormonersatztherapie-Forschung der 1990er zeigte.
  • Ein p-Wert unter 0,05 sagt nichts über die Größe oder praktische Relevanz eines Effekts aus – und „nicht signifikant“ heißt nicht „kein Effekt“.
  • Publikationsbias, fehlende Replikation und flexible Analyseentscheidungen können selbst eine groß aussehende Studienlage verzerren.

„Eine Studie hat gezeigt, dass …“

Der Satz hat Gewicht. Sobald irgendwo eine Studie dahintersteht, klingt eine Aussage schnell ziemlich unangreifbar, dabei sagt die Existenz einer Studie erst einmal ziemlich wenig.

Es gibt riesige randomisierte Studien mit Tausenden Teilnehmern. Es gibt kleine Beobachtungsstudien, die einen interessanten Zusammenhang finden. Es gibt gut gemachte Arbeiten mit einem unspektakulären Ergebnis und ziemlich wackelige Studien mit einer Schlagzeile, die durch sämtliche Medien geht. Viele Studien haben signifikante Ergebnisse, aber keine relevanten praktischen Implikationen, weshalb die erste Frage, die man sich stellen sollte, nicht ist, was die Studie zeigen möchte, sondern was die Studie überhaupt zeigen kann.

Was wurde hier eigentlich untersucht?

Nehmen wir an, eine Studie untersucht sechs Monate lang Männer zwischen 55 und 70 Jahren. Gemessen wird, ob eine bestimmte Ernährung den LDL-Cholesterinwert verändert.

Das Ergebnis kann interessant sein.

Es sagt aber erst einmal nichts darüber aus, ob dieselbe Ernährung bei 25-jährigen Frauen genauso wirkt. Und es zeigt schon gar nicht automatisch, ob dadurch später weniger Menschen einen Herzinfarkt bekommen oder länger leben.

Zwischen dem, was in einer Studie tatsächlich gemessen wurde, und dem, was später daraus gemacht wird, liegen manchmal verdammt viele Schritte.

Deshalb schaue ich am Anfang auf ein paar ziemlich banale Dinge: Wer wurde untersucht? Was wurde verändert oder beobachtet? Womit wurde verglichen? Welcher Endpunkt wurde gemessen? Und wie lange lief das Ganze?

Erst danach lohnt es sich, über das Ergebnis zu reden.

Mindestens genauso wichtig ist das Studiendesign.

Eine Querschnittsstudie macht im Grunde eine Momentaufnahme. Eine Kohortenstudie begleitet Menschen über längere Zeit und schaut beispielsweise, ob bestimmte Verhaltensweisen später mit Krankheiten zusammenhängen. Bei einer randomisierten kontrollierten Studie werden Teilnehmer zufällig verschiedenen Gruppen zugeteilt.

Gerade diese Zufallszuteilung ist wertvoll. Im Idealfall verteilt sie viele Unterschiede zwischen Menschen halbwegs gleichmäßig auf die Gruppen. Wenn am Ende trotzdem ein deutlicher Unterschied entsteht, spricht das stärker dafür, dass die Intervention selbst etwas damit zu tun hatte.

Trotzdem ist auch „randomisiert“ kein Freifahrtschein, denn man kann auch eine RCT schlecht durchführen. Teilnehmer können massenhaft abbrechen, die Verblindung kann misslingen oder die Forscher können am Ende andere Ergebnisse hervorheben als ursprünglich geplant.

Gleichzeitig sind Beobachtungsstudien nicht automatisch wertlos, so kann man manche Fragen schlicht nicht experimentell untersuchen. Niemand wird Tausende Menschen zufällig einer Gruppe zuteilen, die zwanzig Jahre lang rauchen soll.

Das Design sagt also vor allem etwas darüber aus, wie mutig die Schlussfolgerung sein darf.

Ein Zusammenhang ist schnell gefunden

Ein gutes Beispiel dafür ist Ernährungsforschung.

Angenommen, eine große Beobachtungsstudie findet: Menschen, die viel von Lebensmittel X essen, bekommen häufiger eine bestimmte Krankheit.

Das klingt erst einmal verdächtig für Lebensmittel X.

Vielleicht liegt es tatsächlich daran.

Vielleicht unterscheiden sich die Gruppen aber auch an ganz anderen Stellen. Menschen, die viel X essen, rauchen womöglich häufiger. Sie bewegen sich weniger, nehmen mehr Kalorien zu sich oder unterscheiden sich beim Einkommen und bei der medizinischen Versorgung.

Solche Einflussfaktoren heißen Confounder.

Und damit wird es kompliziert.

Forscher versuchen natürlich, solche Unterschiede statistisch herauszurechnen. Alter, Rauchen, Bewegung und andere Faktoren landen dann im Rechenmodell.

Das Problem: Man kann nur korrigieren, was man kennt und vernünftig gemessen hat.

Eine Variable, die nie erfasst wurde, lässt sich im Nachhinein nicht wegmodellieren, und eine Variable, die sehr ungenau erfasst wurde, kann Ergebnisse trotzdem verzerren.

Der Epidemiologe Austin Bradford Hill hat sich schon 1965 mit genau dieser Frage beschäftigt: Wann wird aus einer beobachteten Assoziation eine plausible Kausalbehauptung?1

Er schlug mehrere Gesichtspunkte vor, unter anderem sollte der Zusammenhang zeitlich passen, in verschiedenen Untersuchungen wieder auftauchen und mit anderem Wissen vereinbar sein.

Später hat Judea Pearl die Kausalitätsforschung noch deutlich formaler gemacht. Ein wichtiger Gedanke daraus ist überraschend praktisch: Mehr Variablen statistisch zu kontrollieren ist nicht automatisch besser.2

Wenn man für die falsche Variable kontrolliert, kann man sogar neue Verzerrungen erzeugen.

Statistik ersetzt also nicht das Nachdenken darüber, wie die Dinge wahrscheinlich zusammenhängen.

Hormonersatztherapie: Wenn Beobachtungsdaten zu optimistisch aussehen

Ein berühmtes Beispiel dafür stammt aus der Medizin.

Über längere Zeit hatten Beobachtungsstudien den Eindruck vermittelt, dass Hormonersatztherapie nach der Menopause vor Herz-Kreislauf-Erkrankungen schützen könnte.

Dann kam die Women's Health Initiative.

Rossouw und Kollegen veröffentlichten 2002 die Ergebnisse einer randomisierten Studie mit 16.608 postmenopausalen Frauen. Eine Gruppe bekam eine bestimmte Kombination aus Östrogen und Gestagen, die andere ein Placebo.3

Die Studie wurde nach durchschnittlich 5,2 Jahren vorzeitig beendet.

Für koronare Herzkrankheit lag die Hazard Ratio bei 1,29. In absoluten Zahlen entsprach das ungefähr sieben zusätzlichen koronaren Ereignissen pro 10.000 Personenjahre. Auch Schlaganfälle und Lungenembolien traten häufiger auf.

Das heißt nicht, dass jede Form von Hormonersatztherapie gefährlich ist. Spätere Forschung hat unter anderem gezeigt, dass Alter, Präparat und Zeitpunkt des Therapiebeginns eine Rolle spielen.

Das Beispiel ist trotzdem lehrreich.

Menschen, die freiwillig eine bestimmte Behandlung nutzen, unterscheiden sich möglicherweise schon vorher von Menschen, die sie nicht nutzen. Genau solche Unterschiede können Beobachtungsstudien in die Irre führen.

Der p-Wert hat ein größeres Image als Informationsgehalt

Irgendwann landet man beim berühmten p < 0,05.

Viele lesen das ungefähr so: p < 0,05 = funktioniert.

Das ist keine gute Übersetzung.

Ein p-Wert sagt nicht, wie groß ein Effekt ist, und er sagt auch nicht, wie wahrscheinlich eine Hypothese stimmt, und er sagt schon gar nicht, ob ein Unterschied für einen Menschen im echten Leben relevant ist.

Greenland und Kollegen haben 2016 einen ganzen Methodenartikel über solche Fehlinterpretationen veröffentlicht, und er liest sich stellenweise wie eine Liste dessen, was Menschen seit Jahrzehnten aus p-Werten herauslesen, obwohl es gar nicht drinsteht.4

Viel interessanter als das bloße Unterschreiten einer Schwelle sind Effektgröße und Unsicherheit.

Ein einfaches Beispiel: Ein Medikament senkt das Risiko eines Ereignisses von 2,0 auf 1,5 Prozent.

DarstellungAussage
Relative Risikoreduktion„Das Risiko wurde um 25 Prozent reduziert.“
Absolute Risikoreduktion„Das absolute Risiko sank um 0,5 Prozentpunkte.“

Gleiche Daten. Andere Wirkung beim Leser.

Welche Darstellung sinnvoller ist, hängt von der Frage ab, aber für eine reale Entscheidung möchte ich normalerweise beide sehen.

Noch wichtiger ist das Konfidenzintervall: Wenn eine Studie einen Effekt schätzt, ist dieser Wert kein millimetergenau gemessener Naturparameter, sondern er hat Unsicherheit.

Ein relatives Risiko von 0,80 mit einem sehr engen Konfidenzintervall ist etwas ganz anderes als ein relatives Risiko von 0,80 mit einem Intervall, das von deutlichem Nutzen bis zu möglichem Schaden reicht.

Deshalb bedeutet „nicht statistisch signifikant“ übrigens auch nicht automatisch „kein Effekt".

Manchmal ist die ehrliche Aussage schlicht: Die Studie war zu unpräzise, um die Frage vernünftig zu beantworten.

Man kann einen Treffer auch suchen, bis man einen findet

Ein Problem beginnt noch früher als beim p-Wert.

Forscher haben bei der Analyse oft viele Möglichkeiten.

Welche Teilnehmer werden ausgeschlossen? Welcher Zeitraum wird ausgewertet? Welche Variablen landen im Modell? Werden Männer und Frauen getrennt betrachtet? Welche Altersgruppen werden gebildet?

Wenn man genug Möglichkeiten ausprobiert, steigt die Chance, irgendwo einen hübschen Wert unter 0,05 zu finden.

Simmons, Nelson und Simonsohn demonstrierten das 2011 in ihrem Paper „False-Positive Psychology" ziemlich unterhaltsam.5

Sie zeigten, dass flexible Analyseentscheidungen ausreichen können, um völlig absurde Ergebnisse statistisch signifikant aussehen zu lassen. In einem ihrer Beispiele „bewies“ eine Analyse, dass das Hören eines Beatles-Songs Menschen biologisch jünger mache.

Als Pointe wollten die Autoren zeigen, wie schnell Forschung entgleisen kann, wenn viele Entscheidungen erst getroffen werden, nachdem man die Daten gesehen hat.

Dafür gibt es inzwischen den bekannten Begriff p-hacking.

Ein Gegenmittel ist Präregistrierung. Forscher legen vorher fest, welche Hypothese sie testen, welches Ergebnis ihr Hauptendpunkt ist und wie die Analyse ungefähr aussehen soll.

Explorative Forschung ist natürlich trotzdem nicht grundsätzlich schlecht, sondern sogar sehr wertvoll, aber man sollte hinterher eben ehrlich sagen, dass man etwas entdeckt hat, und nicht so tun, als hätte man genau diese Hypothese von Anfang an testen wollen.

Harte Endpunkte muss man messen, statt auf sie zu schließen

Manche Studien sehen auf den ersten Blick extrem gut aus, ein schönes Beispiel ist hier Torcetrapib.

Ziel des Medikaments war es, das Herz-Kreislauf-Risiko zu senken, und es hatte auch einen sehr auffälligen Effekt auf Cholesterinwerte.

Barter und Kollegen untersuchten es in einer randomisierten Studie mit 15.067 Hochrisikopatienten, wobei HDL nach zwölf Monaten im Schnitt um 72,1 Prozent gestiegen und LDL um 24,9 Prozent gefallen war.6

Wenn man an dieser Stelle aufgehört hätte, hätte das Medikament ziemlich vielversprechend ausgesehen.

Leider hörte die Biologie dort nicht auf.

In der Torcetrapib-Gruppe gab es mehr kardiovaskuläre Ereignisse. Die Hazard Ratio betrug 1,25. Auch die Gesamtsterblichkeit war erhöht, hier lag die Hazard Ratio bei 1,58.

Zusätzlich stieg der systolische Blutdruck im Schnitt um 5,4 mmHg.

Die Studie wurde vorzeitig beendet.

Das Beispiel mag extrem sein, aber das Grundproblem findet man ständig: Ein Laborwert ist oft nur ein Zwischenschritt.

Ein Medikament kann einen Biomarker verbessern und Patienten trotzdem keinen Nutzen bringen.

Deshalb sollte man immer schauen, was der Endpunkt eigentlich war. Wurde ein Blutwert verändert? Oder wurden tatsächlich weniger Menschen krank?

Vielleicht fehlen genau die Studien, die nichts gefunden haben

Angenommen, zehn Studien untersuchen dieselbe Frage.

Zwei finden einen positiven Effekt. Acht finden nichts.

Wenn hauptsächlich die zwei positiven Studien veröffentlicht werden, sieht die Literatur plötzlich ziemlich überzeugend aus.

Genau dieses Problem untersuchten Turner und Kollegen 2008 bei Antidepressiva.7

Sie verglichen veröffentlichte Studien mit den Daten, die der amerikanischen Arzneimittelbehörde FDA vorlagen. Insgesamt ging es um 74 Studien mit 12.564 Patienten.

In der veröffentlichten Literatur wirkten 94 Prozent der Studien positiv, während es nach der Bewertung der FDA nur 51 Prozent waren.

23 der 74 Studien waren überhaupt nicht veröffentlicht worden. Negative oder unklare Ergebnisse verschwanden also überproportional häufig aus dem sichtbaren wissenschaftlichen Bild.

Die aus den veröffentlichten Arbeiten geschätzten Effektgrößen lagen dadurch im Mittel rund 32 Prozent höher.

Das ist Publikationsbias.

Und spätestens hier versteht man auch, warum die Anzahl positiver Paper allein wenig sagt.

Fünf veröffentlichte Studien können beeindruckend aussehen. Wenn daneben zehn unveröffentlichte Nullbefunde liegen, sieht die Sache anders aus.

Auch eine Meta-Analyse kann schlechte Zutaten haben

Meta-Analysen stehen in Grafiken zur Evidenzhierarchie oft ganz oben. Daraus entsteht schnell der Eindruck, eine Meta-Analyse sei automatisch die stärkste Form wissenschaftlicher Erkenntnis.

So einfach würde ich sie nicht behandeln.

Eine Meta-Analyse ist erst einmal eine Methode, mehrere Studien statistisch zusammenzufassen, und wenn die zugrunde liegenden Studien gut sind, kann das extrem nützlich sein.

Wenn sie alle denselben Fehler haben, wird dieser Fehler allerdings mitgerechnet, und wenn negative Studien nie veröffentlicht wurden, fehlen sie womöglich auch in der Meta-Analyse.

Deshalb lohnt es sich, selbst bei einer beeindruckend großen Analyse ein paar Ebenen tiefer zu gehen: Welche Studien stecken drin? Wie ähnlich sind die untersuchten Gruppen? Wie unterschiedlich fallen die Resultate aus? Gab es Hinweise auf Publikationsbias?

Die Zahl der eingeschlossenen Teilnehmer sieht oft beeindruckend aus, sie ersetzt die Qualitätsprüfung aber nicht.

Replikation ist ziemlich unspektakulär und gerade deshalb wertvoll

2015 versuchte die Open Science Collaboration, 100 psychologische Studien möglichst nah am Original zu wiederholen.8

Das Ergebnis machte ziemlich viel Lärm.

In den ursprünglichen Arbeiten waren 97 Prozent der untersuchten Ergebnisse statistisch signifikant. Bei den Replikationen waren es noch 36 Prozent.

Auch die Effektgrößen schrumpften. Im Durchschnitt lagen sie ungefähr halb so hoch wie in den Originalstudien.

Daraufhin konnte man überall lesen, die Psychologie sei nicht reproduzierbar, aber auch das greift zu kurz.

Eine gescheiterte Replikation beweist nicht automatisch, dass die erste Studie falsch war. Vielleicht unterschied sich die Stichprobe, vielleicht war der Kontext relevant, oder die Replikation selbst hatte Probleme.

Das Projekt hat trotzdem einen Nerv getroffen.

Ein Befund, den nur ein einziges Forschungsteam einmal gefunden hat, verdient weniger Vertrauen als ein Ergebnis, das verschiedene Gruppen mit neuen Daten wiederfinden.

Karl Popper hätte wahrscheinlich Gefallen an diesem Gedanken gefunden. In seiner „Logik der Forschung" argumentierte er bereits in den 1930er-Jahren, dass wissenschaftliche Aussagen durch bestätigende Beobachtungen nie endgültig bewiesen werden. Interessant wird eine Theorie gerade dort, wo sie überprüfbare Vorhersagen macht und an der Realität scheitern könnte.9

Thomas Kuhn ergänzte später eine andere Perspektive. Wissenschaft passiert nicht im luftleeren Raum. Forscher arbeiten innerhalb gemeinsamer Modelle und Denkweisen, die beeinflussen, welche Fragen interessant erscheinen und welche Ergebnisse überhaupt als Problem wahrgenommen werden.10

Beides sollte man im Hinterkopf haben.

Wissenschaft ist kein Automat, in den Daten hineingehen und Wahrheit herauskommt. Menschen stellen Fragen, bauen Messinstrumente, wählen statistische Modelle und interpretieren Ergebnisse.

Das macht Wissenschaft nicht beliebig. Es erklärt nur, warum Kontrolle und Replikation so viel wert sind.

Warum eine kleine spektakuläre Studie niemanden beeindrucken sollte

John Ioannidis veröffentlichte 2005 einen der wahrscheinlich meistzitierten Texte über dieses Problem: „Why Most Published Research Findings Are False“.11

Der Titel ist provokanter als die eigentliche Botschaft.

Ioannidis entwickelte ein mathematisches Modell und zeigte, unter welchen Bedingungen positive Ergebnisse besonders häufig in die falsche Richtung führen können.

Kleine Studien gehören dazu, niedrige statistische Power ebenfalls, und dasselbe gilt für sehr viele getestete Hypothesen und starke Freiheitsgrade bei der Analyse.

Eine kleine Untersuchung mit 40 Teilnehmern, einem überraschenden Befund und p = 0,047? Interessant. Mehr erst einmal nicht.

Eine große präregistrierte Studie mit einem klaren Effekt und engem Konfidenzintervall? Schon deutlich interessanter.

Mehrere unabhängige Studien, unterschiedliche Methoden und ähnliche Ergebnisse? Jetzt wird die Sache ernst.

Im Grunde funktioniert vernünftiges Studienlesen damit ein bisschen wie ein ständiges Aktualisieren der eigenen Einschätzung.

Wie ich Studien tatsächlich lesen würde

Wer beruflich nichts mit Forschung zu tun hat, muss nicht jedes Paper von vorne bis hinten durcharbeiten.

Das Abstract ist ein guter Einstieg, denn danach weiß man in der Regel schon, ob die Studie überhaupt interessant ist.

Als Nächstes schaue ich meistens in die Methoden. Dort verstecken sich oft die Informationen, die später den Unterschied machen: Wer durfte teilnehmen? Wie wurden Gruppen gebildet? Wie wurde gemessen? Was war der primäre Endpunkt? Wie viele Teilnehmer sind ausgestiegen?

Danach die Ergebnisse.

Ich will die tatsächlichen Zahlen sehen und nicht nur den Satz „die Intervention führte zu einer signifikanten Verbesserung".

Wie groß war die Verbesserung? Absolut oder nur relativ beeindruckend? Wie breit war das Konfidenzintervall?

Danach interessiert mich, ob die Autoren schon vor Studienbeginn festgelegt hatten, was sie untersuchen wollten. Bei klinischen Studien kann man dafür oft das Studienregister aufrufen.

Und dann kommt der Schritt, der bei einem einzelnen Paper gern vergessen wird: Was sagen die anderen Studien?

Gibt es Replikationen? Gibt es größere RCTs? Passt das Ergebnis zu systematischen Reviews? Oder ist die Studie ein spektakulärer Ausreißer?

Wenn man sich eine Weile in dieser Weise mit wissenschaftlicher Literatur beschäftigt, fängt man auch an, Wissenschaftsnachrichten anders wahrzunehmen.

„Studie beweist …“ klingt dann nicht mehr beeindruckend, sondern unvollständig. Man will wissen: Welche Studie?

Einordnung

Was dieser Text zeigt, ist keine neue Erkenntnis, sondern eine Sammlung wiederkehrender Fallstricke, jeweils an einem gut dokumentierten Beispiel: Studiendesign und Confounder bei der Hormonersatztherapie, p-Wert-Fehlinterpretation, p-Hacking, Surrogatendpunkte bei Torcetrapib, Publikationsbias bei Antidepressiva und fehlende Replikation in der Psychologie. Jedes einzelne Beispiel ist gut belegt.

Überinterpretiert würde die Checkliste, wenn man sie als Formel liest, die am Ende ein eindeutiges Urteil über jede beliebige Studie ausspuckt. Kritisches Lesen senkt die Wahrscheinlichkeit, sich täuschen zu lassen. Es ersetzt aber kein Fachwissen im jeweiligen Gebiet, und auch erfahrene Forscher irren sich, gerade weil Bias selten offensichtlich ist.

Offen bleibt vor allem eine Frage: Wie viel Evidenz reicht, um eine bestehende Überzeugung zu ändern? Das lässt sich nicht mechanisch berechnen. Es bleibt eine Abwägung zwischen Studiendesign, Effektgröße, Unsicherheit und dem, was sonst noch bekannt ist – keine Formel, die eine einzelne Zahl ausgibt.

Wo die Datenlage endet

Diese Fallstricke sind gut belegte, wiederkehrende Muster, aber eine Checkliste ersetzt kein Fachwissen im jeweiligen Feld. Ob eine einzelne Studie im Kontext ausreicht, um eine Überzeugung zu ändern, lässt sich nicht mechanisch berechnen, sondern bleibt eine Abwägung.

Quellen

  1. Hill AB (1965): The Environment and Disease: Association or Causation? Proceedings of the Royal Society of Medicine 58(5), 295–300. ↩ zurück zum Text
  2. Pearl J (1995): Causal Diagrams for Empirical Research. Biometrika 82(4), 669–688. ↩ zurück zum Text
  3. Rossouw JE, et al. (2002): Risks and Benefits of Estrogen Plus Progestin in Healthy Postmenopausal Women. JAMA 288(3), 321–333. n = 16.608. ↩ zurück zum Text
  4. Greenland S, Senn SJ, Rothman KJ, et al. (2016): Statistical Tests, P Values, Confidence Intervals, and Power: A Guide to Misinterpretations. European Journal of Epidemiology 31, 337–350. ↩ zurück zum Text
  5. Simmons JP, Nelson LD, Simonsohn U (2011): False-Positive Psychology: Undisclosed Flexibility in Data Collection and Analysis Allows Presenting Anything as Significant. Psychological Science 22(11), 1359–1366. ↩ zurück zum Text
  6. Barter PJ, et al. (2007): Effects of Torcetrapib in Patients at High Risk for Coronary Events. New England Journal of Medicine 357, 2109–2122. n = 15.067. ↩ zurück zum Text
  7. Turner EH, Matthews AM, Linardatos E, Tell RA, Rosenthal R (2008): Selective Publication of Antidepressant Trials and Its Influence on Apparent Efficacy. New England Journal of Medicine 358, 252–260. 74 Studien, n = 12.564. ↩ zurück zum Text
  8. Open Science Collaboration (2015): Estimating the Reproducibility of Psychological Science. Science 349(6251), aac4716. ↩ zurück zum Text
  9. Popper K (1934/1959): Logik der Forschung / The Logic of Scientific Discovery. ↩ zurück zum Text
  10. Kuhn TS (1962): The Structure of Scientific Revolutions. University of Chicago Press. ↩ zurück zum Text
  11. Ioannidis JPA (2005): Why Most Published Research Findings Are False. PLOS Medicine 2(8), e124. ↩ zurück zum Text