KI sagt: Nackthunde … – wie zuverlässig sind KI-Antworten über seltene Hunderassen?

„Sind Nackthunde hypoallergen?“ – „Welche Krankheiten sind typisch für den Chinese Crested?“ – „Haben Xoloitzcuintle und Peruanischer Nackthund dasselbe Haarlosigkeitsgen?“ Wer solche Fragen einer KI stellt, bekommt meist schneller eine Antwort, als ein Mensch „Primärquelle“ sagen kann. Sie klingt überzeugend.

Bei seltenen Hunderassen ist allerdings eine andere Frage entscheidend: Woher kommt dieses Wissen – und wie zuverlässig ist es?

Seltene Rassen sind ein Long-Tail-Problem

Für Sprachmodelle sind Chinese Crested, Xoloitzcuintle, Peruanischer Nackthund und American Hairless Terrier typische Long-Tail-Themen. Es gibt wissenschaftliche Literatur, aber deutlich weniger als zu häufig untersuchten Rassen oder allgemeinen Hundethemen.

Im Internet finden sich zahlreiche Rasseporträts, Gesundheitslisten und wiederholte Behauptungen – aber keine eingebaute rote Warnlampe, wenn drei Webseiten voneinander abschreiben.

Der Benchmark LongTailQA zeigt, dass Sprachmodelle bei seltenen Entitäten größere Schwierigkeiten haben und von externen Quellen profitieren können. Viel Text über Hunde bedeutet deshalb nicht automatisch viel Wissen über jede einzelne Nackthunderasse.

Illustration zu KI-Antworten über seltene Hunderassen und deren wissenschaftliche Zuverlässigkeit

Ähnliche Begriffe laden zur Vermischung ein

Alle vier Rassen können als „hairless dog“ oder Nackthund bezeichnet werden. Ihre Haarlosigkeit ist genetisch jedoch nicht identisch.

Chinese Crested, Xoloitzcuintle und Peruanischer Nackthund sind mit einer bekannten FOXI3-Variante verbunden. Beim American Hairless Terrier beruht die Haarlosigkeit dagegen auf einem anderen Mechanismus mit SGK3.

Für eine KI liegen diese Begriffe sprachlich dicht beieinander: hairless, skin, teeth, genetics, dog breed. Da kann schon einmal eine korrekte Information bei der falschen Rasse landen. Das Ergebnis wirkt dann fachlich – und ist trotzdem falsch. Eine elegante Formulierung ist schließlich noch kein Gentest.

Plausibel formuliert ist nicht dasselbe wie belegt

Sprachmodelle erzeugen sprachlich wahrscheinliche Antworten. Sie wissen nicht automatisch, ob eine Aussage stimmt. Sie wissen vor allem, wie eine Antwort klingen könnte.

„Nackthunde sind hypoallergen, weil sie keine Haare verlieren“ klingt zunächst logisch. Die Allergieforschung trägt diesen Schluss jedoch nicht. Hundeallergene stammen nicht einfach aus dem Fell. Can f 1 wird unter anderem mit Speichel in Verbindung gebracht. Vergleichsstudien fanden keinen belastbaren Grund, bestimmte Hunderassen generell als hypoallergen einzustufen.

Eine KI kann also aus zwei richtigen Einzelinformationen einen falschen Zusammenhang basteln – sprachlich sauber, wissenschaftlich eher wackelig.

Wiederholung im Internet kann wie Evidenz aussehen

Wenn zwanzig Webseiten dieselbe „rassetypische Krankheit“ nennen, sieht das nach breiter Bestätigung aus. Es können aber auch zwanzig Varianten derselben ursprünglichen Behauptung sein.

Eine Rasseseite übernimmt eine Liste, ein Blog übernimmt die Rasseseite, und irgendwann sieht die Wiederholung aus wie Forschung. Für ein Sprachmodell ist diese Herkunftsgeschichte nur schwer nachvollziehbar.

Gerade bei seltenen Rassen fällt das ins Gewicht. Wenige häufig kopierte Texte können dann einen großen Teil der verfügbaren Informationen ausmachen – unabhängig davon, ob sie gut belegt sind.

Webzugriff hilft – aber löst das Problem nicht vollständig

KI-Systeme können recherchieren und Quellen verlinken. Das ist hilfreich. Es bedeutet aber nicht, dass die Maschine plötzlich wissenschaftliche Quellenkritik studiert hätte.

Das System muss passende Quellen finden, ihre Qualität einschätzen, die relevante Aussage richtig verstehen und deren Reichweite beachten.

Eine Rasseclubseite kann erklären, welche Gentests empfohlen werden. Daraus folgt nicht automatisch, dass die betreffenden Krankheiten besonders häufig sind. Eine Fallstudie kann zeigen, dass eine Erkrankung vorkommt. Sie beweist nicht, dass sie rassetypisch oder häufig ist.

Quellenangaben allein sind kein Qualitätssiegel

Ein KI-Text mit fünf Links wirkt belastbarer als einer ohne Quellen. Doch auch die Quellen müssen geprüft werden.

Für wissenschaftliche Fragen sollte deshalb nicht nur gefragt werden: „Hat die KI eine Quelle angegeben?“ Entscheidend ist: Stützt genau diese Quelle genau diese Behauptung?

Bei Nackthunden gibt es typische Stolperfallen

Bei Fragen zu Nackthunden werden Rassen besonders leicht miteinander vermischt. Genetische Zusammenhänge werden mit allgemeinen Gesundheitsrisiken gleichgesetzt. Ein einzelner Krankheitsfall wird als Beleg für Häufigkeit dargestellt. Ein empfohlener Gentest wird mit einem Nachweis hoher Erkrankungsraten verwechselt. Und „Nackthunde“ werden als biologisch einheitliche Gruppe behandelt.

Dass FOXI3 die Entwicklung von Haaren und Zähnen beeinflusst, bedeutet beispielsweise nicht, dass jede Haut- oder Zahnerkrankung dieser Hunde durch FOXI3 verursacht wird. Gene sind kompliziert genug. Man muss ihnen nicht auch noch die gesamte Rassegesundheit zuschreiben.

Ein Chatbot-Test ist nur eine Stichprobe

Mehreren KI-Systemen dieselben Fragen zu stellen, kann interessant sein. Ein allgemeines Urteil über „die zuverlässigste KI“ lässt sich daraus jedoch kaum ableiten.

Ergebnisse hängen von Modellversion, Datum, Prompt, Sprache und Webzugriff ab. Ein fairer Vergleich müsste diese Bedingungen dokumentieren. Jede Tatsachenbehauptung müsste anschließend gegen geeignete wissenschaftliche Quellen geprüft werden.

Eine vorsichtige Antwort ist dabei nicht automatisch schlechter. „Dazu gibt es keine ausreichenden Daten“ kann bei einer seltenen Rasse die bessere Antwort sein als eine beeindruckend lange Liste vermeintlich gesicherter Fakten.

Was eine gute KI-Antwort leisten sollte

Eine belastbare Antwort sollte zwischen Wissen und Unsicherheit unterscheiden. Sie sollte angeben, ob eine Aussage auf einer genetischen Studie, einer Fallbeschreibung, einer Gesundheitsumfrage oder einer populationsbezogenen Untersuchung beruht.

Sie sollte kleine Stichproben nicht zu allgemeinen Rasseeigenschaften aufblasen, unterschiedliche Haarlosigkeitsmechanismen auseinanderhalten und dort aufhören, wo die Evidenz endet.

KI kann nützlich sein – wenn man sie nicht mit einer Quelle verwechselt

KI kann Fachbegriffe erklären, Suchstrategien entwickeln und Literatur strukturieren. Sie kann den Zugang zu einem kleinen Forschungsgebiet erleichtern. Die fertige Antwort bleibt aber ein Zwischenschritt.

Gerade bei seltenen Rassen sollte deshalb nicht gefragt werden, ob die KI überzeugend klingt. Entscheidend ist, ob sich ihre Aussagen bis zu belastbaren Quellen zurückverfolgen lassen.

Denn auch eine moderne KI kann aus seltenem Wissen eine hervorragende Antwort machen.

Oder eine hervorragend klingende.

Quellen

  • Xion W, Hadler U, Cofala T et al. (2026): LongTailQA: Benchmarking LLMs and RAG Models on Disambiguated Long-Tail Entities. DOI
  • Fatahi Bayat F, Zhang L, Munir S, Wang L (2025): FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation. ACL Anthology
  • Kalai AT, Nachum O, Vempala SS et al. (2026): Evaluating large language models for accuracy incentivizes hallucinations. Nature/DOI
  • Drögemüller C, Karlsson EK, Hytönen MK et al. (2008): A mutation in hairless dogs implicates FOXI3 in ectodermal development. PubMed
  • Parker HG, Harris A, Dreger DL et al. (2017): The bald and the beautiful: hairlessness in domestic dog breeds. DOI
  • Vredegoor DW, Willemse T, Chapman MD et al. (2012): Can f 1 levels in hair and homes of different dog breeds: lack of evidence to describe any dog breed as hypoallergenic. PubMed