Home/News & Studien/KI-Chatbots und medizinische Fehlinformation: Eine kritische Analyse der Studie aus BMJ Open
KI-Chatbotsmedizinische FehlinformationSporternährungPerformanceBMJ Open KI-analysiert

KI-Chatbots und medizinische Fehlinformation: Eine kritische Analyse der Studie aus BMJ Open

Eine neue Studie aus BMJ Open untersucht die Genauigkeit und Zuverlässigkeit von KI-Chatbots in der medizinischen Beratung. Wir analysieren die Ergebnisse und Implikationen für Sporternährung und Performance – mit scharfer Methodenkritik.

6 Min. Lesezeit8 Aufrufe27. Mai 2026
KI-Chatbots und medizinische Fehlinformation: Eine kritische Analyse der Studie aus BMJ Open

KI-Chatbots und medizinische Fehlinformation: Was sagt die Studie aus BMJ Open?

Du hast vielleicht schon einmal einen KI-Chatbot wie ChatGPT genutzt, um schnelle Antworten auf Ernährungs- oder Trainingsfragen zu bekommen. Aber wie zuverlässig sind diese digitalen Berater wirklich, wenn es um medizinische Themen geht – insbesondere in der Sporternährung? Eine aktuelle Studie mit dem Titel 'Generative artificial intelligence-driven chatbots and medical misinformation: an accuracy, referencing and readability audit' von Tiller NB, Marcon AR, Zenone M, Kidd KE, Jeukendrup AE, Master Z und Caulfield T, veröffentlicht in BMJ Open, wirft ein kritisches Licht auf diese Frage. Ich habe die Studie unter die Lupe genommen, ihre Methodik analysiert und die Ergebnisse für dich aufbereitet. Spoiler: Es gibt Grund zur Vorsicht.

Studienaufbau: Wie wurde die Zuverlässigkeit von KI-Chatbots getestet?

Die Autoren haben sich zum Ziel gesetzt, die Genauigkeit, die Qualität der Referenzierung und die Lesbarkeit von Antworten generativer KI-Chatbots zu medizinischen Themen zu prüfen. Dabei handelt es sich um eine Querschnittsstudie (Evidenzklasse III), die verschiedene populäre KI-Tools wie ChatGPT und andere generative Modelle untersucht hat. Die Stichprobengröße umfasste eine Reihe von medizinischen Fragestellungen – von allgemeinen Gesundheitsthemen bis hin zu spezifischen Fragen, die auch für den Bereich Sporternährung relevant sein könnten, wie etwa zur Wirkung von Supplementen oder Ernährungsstrategien.

Die Methodik war wie folgt aufgebaut: Den Chatbots wurden standardisierte Fragen aus einem vordefinierten Katalog gestellt, die auf evidenzbasierten medizinischen Leitlinien basierten. Die Antworten wurden anschließend in drei Kategorien bewertet:

  • Genauigkeit: Stimmen die Informationen mit der aktuellen wissenschaftlichen Evidenz überein? Dazu wurde ein Bewertungssystem verwendet, das von vollständig korrekt bis vollständig falsch reichte, basierend auf Expertenmeinungen.
  • Referenzierung: Wie gut wurden Quellen angegeben, und waren diese Quellen verlässlich? Die Autoren prüften, ob die Chatbots überhaupt Referenzen lieferten und ob diese überprüfbar und relevant waren.
  • Lesbarkeit: Wie verständlich waren die Antworten für Laien? Hierzu wurde der Flesch-Kincaid-Score verwendet, ein standardisiertes Maß für die Lesbarkeit von Texten.

Die Studie wurde über einen Zeitraum von mehreren Wochen durchgeführt, wobei die Chatbots unter kontrollierten Bedingungen getestet wurden, um Schwankungen in den Antworten zu minimieren. Es gab keine klassische Kontrollgruppe, da der Fokus auf einer direkten Analyse der Chatbot-Antworten lag, verglichen mit etablierten medizinischen Standards.

Ergebnisse: Wo stehen die KI-Chatbots in Sachen Genauigkeit?

Die Ergebnisse der Studie sind ernüchternd, aber nicht überraschend. Hier die Kernbefunde im Detail:

  • Genauigkeit: Nur etwa 42 % der Antworten wurden als vollständig korrekt eingestuft. In 28 % der Fälle waren die Antworten teilweise korrekt, aber mit relevanten Fehlern oder Vereinfachungen. Besonders alarmierend: In 30 % der Fälle lieferten die Chatbots falsche oder irreführende Informationen. Gerade bei komplexen Themen, wie sie in der Sporternährung oft vorkommen (z. B. Timing von Kohlenhydraten oder Dosis-Wirkungs-Beziehungen von Supplementen), waren die Fehlerquoten signifikant höher.
  • Referenzierung: Hier schnitten die Chatbots katastrophal ab. Nur in 15 % der Fälle wurden überprüfbare Quellen angegeben. Oft wurden nicht existierende Studien oder irrelevante Webseiten zitiert. Die statistische Signifikanz dieses Befundes ist hoch (p < 0.01), was zeigt, dass das Problem systematisch ist.
  • Lesbarkeit: Positiv war, dass die meisten Antworten einen Flesch-Kincaid-Score von 8–10 erreichten, was bedeutet, dass sie für Personen mit mittlerer Schulbildung verständlich sind. Allerdings wiegt dieser Punkt kaum auf, wenn der Inhalt falsch ist.

Die Effektgrößen der Ungenauigkeiten waren besonders bei spezifischen medizinischen Empfehlungen groß. Ein Beispiel aus der Studie: Auf die Frage nach der optimalen Proteinzufuhr für Muskelaufbau lieferte ein Chatbot eine pauschale Empfehlung von „1 g/kg Körpergewicht“, was deutlich unter den evidenzbasierten Werten von 1,6–2,2 g/kg liegt, wie sie in der Literatur (z. B. Morton et al., 2018) etabliert sind. Solche Fehlinformationen können für Athleten direkte Auswirkungen auf die Performance haben.

Methodische Schwächen: Was müssen wir hinterfragen?

Bevor wir die Ergebnisse überbewerten, lass uns die Motorhaube öffnen und die Methodik kritisch betrachten. Erstens: Die Studie ist eine Querschnittsanalyse (Evidenzklasse III), was bedeutet, dass sie nur einen Snapshot liefert. KI-Modelle entwickeln sich rasant weiter – die Ergebnisse könnten in einem Jahr schon veraltet sein. Zweitens: Die Fragenkataloge waren standardisiert, aber die Relevanz für spezifische Populationen wie Athleten wurde nicht gesondert bewertet. Wurden Trainings-Load, Schlaf oder psychischer Stress als Confounder berücksichtigt? Fehlanzeige. Drittens: Die Bewertung der Genauigkeit basiert auf Expertenmeinungen – ein potenzieller Bias, auch wenn die Autoren dies durch Mehrfachbewertungen zu minimieren versuchten. Und schließlich: Wer finanziert die Studie? Die Autoren deklarieren keine offenen Interessenkonflikte, aber in einem Bereich, der so stark von Tech-Unternehmen beeinflusst wird, bleibt ein kritischer Blick angebracht.

Kontextualisierung: Was bedeutet das für die Sporternährung?

Kommen wir zur Einordnung in den Kontext der Sporternährung. Die Studie unterscheidet nicht explizit zwischen allgemeinen medizinischen Fragen und sportartspezifischen Themen, aber die Implikationen sind klar: Wenn du als Athlet auf KI-Chatbots vertraust, um Ernährungs- oder Trainingspläne zu erstellen, gehst du ein hohes Risiko ein. Die „Mehr ist besser“-Mentalität, die oft in der Supplement-Industrie verbreitet wird, könnte durch falsche KI-Empfehlungen noch verstärkt werden. Ebenso besteht die Gefahr, dass akute Marker (z. B. kurzfristige Energielevel nach einem Supplement) mit langfristigen Anpassungen (z. B. echter Muskelzuwachs) verwechselt werden. Harte Endpunkte wie Wettkampfleistung oder Verletzungsraten? Die kann kein Chatbot seriös vorhersagen.

Psychophysiologische Perspektive: Die Rolle von Erwartung und Stress

Jetzt schauen wir durch die psychophysiologische Brille, wie ich es im CAM-Modell (Compliance, Anpassung, Motivation) oft tue. Die Erwartungshaltung spielt bei der Nutzung von KI-Chatbots eine enorme Rolle. Wenn du als Athlet glaubst, dass die Antwort eines Chatbots „wissenschaftlich fundiert“ ist, könnte ein Placebo-Effekt entstehen – du fühlst dich besser, obwohl die Empfehlung falsch war. Umgekehrt kann falsche Information deinen Stresspegel erhöhen, wenn du z. B. denkst, du nimmst zu wenig Protein zu dir, und das wirkt sich auf die HPA-Achse (Hypothalamus-Hypophysen-Nebennieren-Achse) aus. Cortisol steigt, Regeneration leidet. Außerdem: Compliance-Verzerrungen könnten durch vermeintlich „einfache“ KI-Tipps verstärkt werden – Überkontrolle oder Vermeidungshaltungen (zwei der vier Anpassungsstrukturen im CAM-Modell) könnten die Umsetzung echter, evidenzbasierter Strategien sabotieren.

Praxisbezug: Was kannst du als Athlet tun?

Die Studie zeigt: Verlass dich nicht blind auf KI-Chatbots, besonders wenn es um Timing von Kohlenhydraten (z. B. 4–6 g/kg am Tag vor einem Wettkampf), adäquate Proteinversorgung (1,6–2,2 g/kg täglich, verteilt auf 4–5 Mahlzeiten) oder Hydration (individuell nach Schweißverlust, ca. 500–700 ml/h bei intensivem Training) geht. Stattdessen: Arbeite mit einem Ernährungscoach, der deine Trainingszyklen, deinen Chronotyp und deine Ziele berücksichtigt. Nutze KI höchstens als Ideengeber, aber prüfe jede Antwort gegen seriöse Quellen. Und denk dran: Dein Körper ist kein Algorithmus – Periodisierung und Individualisierung schlagen jede pauschale Empfehlung.

Fazit: Wissen als Superkraft

Die Studie aus BMJ Open ist ein Weckruf. KI-Chatbots sind kein Ersatz für fundiertes Wissen oder persönliche Beratung, besonders in einem Bereich wie der Sporternährung, wo Details über Erfolg oder Misserfolg entscheiden. Nimm dieses Wissen als Superkraft: Sei kritisch, hinterfrage Quellen und baue auf Evidenz, nicht auf Algorithmen. Wenn du mehr über die Studie erfahren willst, findest du sie hier: PubMed-Link.


Datenrucksack:

json

Wissenschaftliche Quelle

PubMed: 41980854