Was bedeutet „wissenschaftlich belegt“ eigentlich?

„Wissenschaftlich belegt“ klingt nach einem Gütesiegel: Es gibt eine Studie – also stimmt die Aussage.

So funktioniert Wissenschaft nicht.

Eine veröffentlichte Studie kann einen wichtigen Befund liefern. Sie kann aber auch nur einen einzelnen Fall beschreiben, einen statistischen Zusammenhang finden, an wenigen Tieren durchgeführt worden sein oder eine völlig andere Frage untersucht haben als diejenige, für die sie später als Beleg herangezogen wird.

Entscheidend ist deshalb nicht nur: Gibt es dafür eine Studie?

Die bessere Frage lautet: Was genau wurde untersucht – und wie weit trägt dieser Befund?

Was bedeutet wissenschaftlich belegt? – wissenschaftliche Grundlagen zu Nackthunden

Eine Publikation ist zunächst eine Publikation

Wissenschaftliche Arbeiten können sehr unterschiedliche Formen haben.

Ein Fallbericht beschreibt beispielsweise einen einzelnen ungewöhnlichen Patienten. Eine Fallserie mehrere ähnliche Fälle. Eine Querschnittsstudie untersucht Merkmale einer Population zu einem bestimmten Zeitpunkt. Kohortenstudien verfolgen Gruppen und können Zusammenhänge zwischen Expositionen und späteren Ergebnissen untersuchen. Kontrollierte Versuche vergleichen Gruppen unter festgelegten Bedingungen.

Systematische Reviews wiederum versuchen, die relevante vorhandene Forschung zu einer klar definierten Frage nach vorher festgelegten Methoden möglichst vollständig zu erfassen und kritisch zusammenzuführen. Unter geeigneten Voraussetzungen können Ergebnisse mehrerer Studien zusätzlich statistisch in einer Metaanalyse kombiniert werden.

Alle diese Arbeiten sind wissenschaftliche Publikationen. Aber sie beantworten unterschiedliche Fragen und besitzen für bestimmte Schlussfolgerungen unterschiedlich große Aussagekraft.

Die Forschungsfrage entscheidet, welche Evidenz gebraucht wird

Eine einfache Rangliste von „schwacher“ bis „starker“ Studie funktioniert deshalb nicht für jede Fragestellung.

Will man wissen, ob eine Behandlung eine bestimmte Wirkung verursacht, sind gut durchgeführte randomisierte kontrollierte Studien besonders aussagekräftig. Durch die zufällige Gruppenzuteilung soll verhindert werden, dass sich die verglichenen Gruppen bereits systematisch unterscheiden.

Will man dagegen wissen, wie häufig fehlende Zähne bei einer Hunderasse vorkommen, wäre eine randomisierte Therapiestudie das falsche Instrument. Dafür braucht man eine möglichst repräsentative Untersuchung der betreffenden Population.

Für die Frage, welche genetische Variante einer Haarlosigkeit zugrunde liegt und ob sie funktionell dafür verantwortlich ist, sind beispielsweise Familien-, Assoziations- und Funktionsuntersuchungen relevant.

Und wenn erstmals eine bislang unbekannte Erkrankung bei einem Hund beobachtet wird, kann sogar ein einzelner Fallbericht wissenschaftlich wichtig sein.

Die Qualität eines Belegs lässt sich deshalb nicht unabhängig von der Frage beurteilen, die damit beantwortet werden soll.

Ein Fallbericht beweist einen Fall – keine Häufigkeit

Fallberichte sind ein gutes Beispiel dafür, wie wissenschaftliche Befunde überinterpretiert werden können.

Wird bei einem Xolo eine bestimmte Erkrankung diagnostiziert und sorgfältig dokumentiert, kann der Bericht belegen, dass diese Erkrankung bei diesem Hund aufgetreten ist. Je nach Diagnostik kann er außerdem wertvolle Informationen über Symptome, Verlauf oder Behandlung liefern.

Er beantwortet aber nicht, wie häufig die Erkrankung bei Xolos vorkommt.

Aus einem Fall wird keine Rasseprävalenz.

Das macht den Fallbericht nicht wertlos. Fallberichte können wichtige erste Hinweise auf seltene oder bislang unbekannte Phänomene liefern und Ausgangspunkt weiterer Forschung sein. Ihre Aussagekraft besitzt lediglich klare Grenzen.

Eine Assoziation ist noch keine Ursache

Ähnlich wichtig ist die Unterscheidung zwischen Zusammenhang und Kausalität.

Wenn Hunde mit Merkmal A statistisch häufiger Merkmal B zeigen, besteht zunächst eine Assoziation. Ob A tatsächlich B verursacht, ist damit noch nicht automatisch geklärt.

Andere Faktoren können beide Merkmale beeinflussen. Die Auswahl der untersuchten Tiere kann das Ergebnis verzerren. Oder Ursache und Wirkung können anders zusammenhängen als zunächst angenommen.

Das bedeutet nicht, dass Beobachtungsstudien keine kausalen Erkenntnisse ermöglichen. Es bedeutet, dass für eine Kausalaussage zusätzliche methodische Anforderungen erfüllt sein müssen.

Deshalb ist „tritt gemeinsam auf“ nicht automatisch gleichbedeutend mit „verursacht“.

Auch eine große Zahl kann auf schwacher Grundlage stehen

Eine Prozentangabe wirkt präzise. Die entscheidende Frage lautet aber: Prozent wovon?

Wenn 40 von 100 untersuchten Hunden ein bestimmtes Merkmal besitzen, sind das tatsächlich 40 Prozent der Stichprobe.

Ob daraus folgt, dass ungefähr 40 Prozent der gesamten Rasse betroffen sind, hängt davon ab, wie diese 100 Hunde ausgewählt wurden.

Stammen sie aus einer Spezialklinik? Haben Besitzer freiwillig an einer Umfrage teilgenommen? Wurden gezielt erkrankte Tiere gesucht? Kommen viele Hunde aus denselben Familien? Oder wurde eine Population nach einem Verfahren ausgewählt, das eine belastbare Verallgemeinerung erlaubt?

Die Rechnung kann mathematisch vollkommen korrekt und die Übertragung auf die Gesamtpopulation trotzdem unzulässig sein.

Stichprobengröße und Repräsentativität sind nicht dasselbe.

Statistik beantwortet nicht automatisch die biologische Frage

Auch „statistisch signifikant“ wird häufig mit „bewiesen“ verwechselt.

Ein p-Wert beschreibt – unter den Annahmen des verwendeten statistischen Modells –, wie ungewöhnlich die beobachteten oder noch extremeren Daten wären, wenn die zugrunde gelegte Nullhypothese zuträfe. Wird ein vorher festgelegter Schwellenwert unterschritten, spricht man häufig von einem statistisch signifikanten Ergebnis.

Das sagt nicht automatisch, dass ein Effekt groß, biologisch wichtig oder klinisch relevant ist.

Umgekehrt kann eine kleine Studie einen tatsächlich vorhandenen Effekt verfehlen, weil ihre statistische Aussagekraft zu gering ist.

Deshalb gehören zur Bewertung wissenschaftlicher Ergebnisse nicht nur p-Werte, sondern beispielsweise auch Effektgrößen, Unsicherheitsintervalle, Stichprobengröße, Studiendesign und biologische beziehungsweise klinische Relevanz.

Die Methode kann wichtiger sein als das Etikett der Studie

Auch innerhalb derselben Studienart kann die Qualität erheblich variieren.

Eine große Untersuchung kann durch schlechte Auswahl der Tiere verzerrt sein. Eine kontrollierte Studie kann ungeeignete Vergleichsgruppen besitzen. Eine genetische Assoziation kann durch Populationsstruktur beeinflusst werden. Eine Umfrage kann vor allem besonders engagierte oder besonders betroffene Halter erreichen.

Zu den wichtigen Prüffragen gehören deshalb:

  • Wie wurden die Tiere ausgewählt?
  • Gab es eine geeignete Kontrollgruppe?
  • War die Stichprobe groß genug für die Fragestellung?
  • Wurden relevante Störfaktoren berücksichtigt?
  • Waren Untersucher verblindet, wenn dies möglich und sinnvoll war?
  • Passt die untersuchte Population zu der Population, über die anschließend gesprochen wird?
  • Und vor allem: Untersucht die Studie überhaupt die Behauptung, die mit ihr belegt werden soll?

Ein hochwertiges Studiendesign schützt nicht davor, dass eine Publikation später für eine Aussage zitiert wird, die sie nie untersucht hat.

Peer Review ist Qualitätskontrolle – kein Wahrheitsstempel

Auch die Veröffentlichung in einer wissenschaftlichen Fachzeitschrift macht ein Ergebnis nicht automatisch richtig.

Peer Review bedeutet grundsätzlich, dass andere Fachleute eine eingereichte Arbeit vor der Veröffentlichung beurteilen. Das kann methodische Probleme, unklare Argumentationen und Mängel in der Darstellung aufdecken.

Es garantiert jedoch weder Fehlerfreiheit noch, dass sich ein Ergebnis später reproduzieren lässt.

Entscheidend bleibt, wie gut die Untersuchung durchgeführt wurde und wie ihr Ergebnis in die übrige Evidenz passt.

Eine Studie ist selten das letzte Wort

Die Gesamtheit der Evidenz ist häufig aussagekräftiger als ein einzelner Befund.

Mehrere voneinander unabhängige Untersuchungen können Ergebnisse bestätigen, präzisieren oder ihnen widersprechen. Systematische Reviews versuchen, die vorhandene Forschung nach transparenten Kriterien zusammenzuführen, statt einzelne passende Studien herauszugreifen.

Aber auch ein Review ist nicht automatisch hochwertig. Seine Aussagekraft hängt unter anderem davon ab, wie systematisch gesucht wurde, welche Studien eingeschlossen wurden und wie gut deren Qualität ist.

Eine Metaanalyse kann statistisch sehr präzise rechnen. Sind die zugrunde liegenden Studien jedoch methodisch schwach oder beantworten unterschiedliche Fragen, wird aus ihnen durch Zusammenrechnen keine starke Evidenz.

Was „wissenschaftlich belegt“ auf dieser Seite bedeutet

Auf mehr-als-nackt.de soll „wissenschaftlich belegt“ deshalb nicht heißen: Dazu existiert irgendwo eine Publikation.

Gemeint ist vielmehr, dass eine Aussage durch wissenschaftliche Untersuchungen tatsächlich gestützt wird – und zwar nur so weit, wie Studiendesign, untersuchte Population, Methode und Ergebnisse diese Schlussfolgerung tragen.

Deshalb kann die Einordnung unterschiedlich ausfallen:

  • Ein Befund kann gut belegt sein.
  • Ein Zusammenhang kann nachgewiesen sein, während seine Ursache ungeklärt bleibt.
  • Ein Mechanismus kann biologisch plausibel sein, ohne klinisch bestätigt zu sein.
  • Ein Phänomen kann in einzelnen Fällen dokumentiert sein, ohne dass seine Häufigkeit bekannt ist.
  • Und manchmal gibt es schlicht noch nicht genügend Daten für eine belastbare Antwort.

Das ist kein Versagen von Wissenschaft. Es ist eine ihrer wichtigsten Eigenschaften, die Grenze zwischen Wissen und Nichtwissen sichtbar zu machen.

Nicht „Gibt es eine Studie?“ – sondern „Was zeigt sie?“

Wissenschaftliche Evidenz ist kein An/Aus-Schalter.

Eine einzelne Publikation kann sehr überzeugende Evidenz für eine eng umrissene Frage liefern und gleichzeitig keinerlei Grundlage für weitergehende Behauptungen bieten. Mehrere methodisch schwache Arbeiten werden nicht allein durch ihre Anzahl zu einem starken Beleg. Und fehlende Forschung beweist weder, dass etwas existiert, noch dass es nicht existiert.

Deshalb genügt es nicht, hinter eine Behauptung eine Literaturangabe zu setzen.

Man muss prüfen, was tatsächlich untersucht wurde, wie die Untersuchung durchgeführt wurde, welche Grenzen sie besitzt und ob die daraus gezogene Schlussfolgerung durch die Daten gedeckt ist.

Erst dann wird aus „Es gibt eine Studie dazu“ eine wesentlich sinnvollere Aussage:

Dafür gibt es wissenschaftliche Evidenz – und wir können sagen, wie weit sie trägt.

Quellen

  • Block G (2024): Evidence-based veterinary medicine—potential, practice, and pitfalls. Journal of Veterinary Internal Medicine 38(6): 3261–3271. Volltext
  • Sargeant JM, Kelton DF, O’Connor AM (2014): Study Designs and Systematic Reviews of Interventions: Building Evidence Across Study Designs. Zoonoses and Public Health 61(Suppl. 1): 10–17. Quelle
  • Sargeant JM, O’Connor AM (2020): Scoping Reviews, Systematic Reviews, and Meta-Analysis: Applications in Veterinary Medicine. Frontiers in Veterinary Science 7: 11. Volltext
  • Arlt SP, Heuwieser W (2016): The Staircase of Evidence – a New Metaphor Displaying the Core Principles of Evidence-based Veterinary Medicine. Veterinary Evidence 1(1). Volltext
  • Wasserstein RL, Lazar NA (2016): The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician 70(2): 129–133. Volltext