Beobachtetes Signal · 21. Apr. 2026 · Research Publication · Quelle: Gary Marcus · Relevanz: 2/5 · Sentiment: Neutral
Studien belegen Unzuverlässigkeit von Chatbots bei medizinischer Beratung
Ein Substack-Beitrag von Gary Marcus fasst aktuelle begutachtete Studien zusammen, die zeigen, dass gängige Large Language Model Chatbots bei medizinischen Ratschlägen unzureichend abschneiden und Sicherheitsrisiken bergen. Eine BMJ-Untersuchung von fünf beliebten Chatbots (Gemini, DeepSeek, Meta AI, ChatGPT und Grok) ergab, dass fast die Hälfte der Antworten auf zehn medizinische Prompts hochgradig problematisch waren, einschliesslich Halluzinationen und frei erfundener Zitate. Eine JAMA Network Open-Studie zu 21 Modellen kam zu dem Schluss, dass LLMs für die frühe Diagnose ungeeignet sind. Zwei Nature Medicine-Studien zeigten, dass LLMs relevante Erkrankungen in weniger als 34,5 Prozent der Fälle identifizierten und ChatGPT 52 Prozent der Standard-Notfälle falsch triagierte. Marcus warnt, dass Verbraucher Chatbots bei medizinischen Entscheidungen nicht vertrauen sollten.
Zahlreiche Peer-Review-Studien renommierter medizinischer Fachzeitschriften belegen konsistent, dass LLM-Chatbots unsichere medizinische Ergebnisse liefern; dies ist relevant für Unternehmen, die konversatorische KI für Endverbraucher einsetzen, hat jedoch keine unmittelbaren Auswirkungen auf das Kern-AdTech-Geschäft.
Marktsignale zu DeepSeek in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Eine BMJ-Studie evaluierte fünf Chatbots (Gemini, DeepSeek, Meta AI, ChatGPT, Grok) anhand von zehn medizinischen Prompts und stellte fest, dass fast 50 Prozent der Antworten hochgradig problematisch waren.
- Die BMJ-Untersuchung ergab, dass Chatbot-Ausgaben durchgehend mit grosser Zuversicht formuliert wurden, aber Halluzinationen und erfundene Zitate enthielten.
- Eine JAMA Network Open-Studie bewertete 21 Frontier-Modelle und folgerte, dass aktuelle LLMs für klinische Entscheidungen im direkten Patientenkontakt unzuverlässig sind.
- Zwei Nature Medicine-Studien zeigten, dass LLMs relevante Krankheitsbilder in weniger als 34,5 Prozent der Fälle erkannten und ChatGPT 52 Prozent der Notfälle untertriagierte.
Verknüpfte Unternehmen
4 verknüpfte UnternehmenVerwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Forschungsexperiment: KI-Chatbots warnen Nutzer vor fiktiver Augenkrankheit
Die schwedische Forscherin Almira Osmanovic Lindström hat mit „Bixonimanie“ eine fiktive Augenkrankheit erfunden und gezielt Falschinformationen über Medium-Beiträge sowie gefälschte Preprints im Internet platziert, um die Wissensaufnahme von KI-Systemen zu testen. Gängige Large Language Models und Chatbots wie Microsoft Copilot, Perplexity AI und OpenAI ChatGPT übernahmen diese Desinformation, halluzinierten Details und warnten Nutzer vor der vermeintlichen Krankheit. Sogar wissenschaftliche Publikationen wie ein im November 2024 veröffentlichter Beitrag im Fachjournal Cureus zitierten die gefälschten Studien, bevor dieser im März 2026 zurückgezogen wurde. Nachdem das Fachmagazin Nature über das Experiment berichtete, wurden die Online-Quellen gelöscht. Experten schlagen Alarm, da sich die Manipulation zeigt, wie leicht Falschinformationen in das Training von Large Language Models und nachgelagerte Conversational Interfaces gelangen und dort die Vertrauenswürdigkeit gefährden.
Studie: Chatbots schwächen Fähigkeit zur Erkennung von Falschmeldungen
Eine Studie des MIT Media Lab zeigt, dass die dauerhafte Nutzung von KI-Systemen zur Faktenprüfung die eigenständige Fähigkeit von Nutzern zur Desinformationserkennung schwächt. In einem vierwöchigen Experiment mit 67 Teilnehmern steigerte die KI-Assistenz die Erkennungsleistung zunächst um 21 Prozent. Nach dem Entzug der KI fiel die Leistung in der vierten Woche jedoch um 15 Prozentpunkte unter den Ausgangswert, wobei rund ein Viertel der Probanden trotz nachweislich schlechterer Ergebnisse von einer Verbesserung ausging. Eine separate Untersuchung von Tests mit ChatGPT, Microsoft Copilot, Google Gemini und Perplexity AI ergab zudem, dass fast die Hälfte der Antworten signifikante Mängel aufwies, darunter Zitationsprobleme und schwerwiegende sachliche Fehler. Experten warnen, dass narrative Antwortstile Abhängigkeiten erzeugen, während sokratische Fragestellungen das kritische Denken und die Informationsintegrität im Medienumfeld besser unterstützen.
Einzelner Satz verändert KI-Diagnose um das Zwölffache
Eine unabhängige Evaluation von OpenAI’s ChatGPT Health offenbart gravierende Sicherheits- und Logikfehler. Obwohl das System mit über 260 Ärzten, mehr als 600.000 Feedback-Runden und einem eigenen Sicherheitsrahmen entwickelt wurde, zeigten sich kritische Mängel: So erkannte die interne Logik frühzeitig ein respiratorisches Versagen, empfahl im Endfazit jedoch das Abwarten auf einen Termin. In Fällen, die drei unabhängige Ärzte einstimmig als Notfall einstuften, riet das System in 52 Prozent der Fälle von der Notaufnahme ab. Suizid-Sicherheitsvorkehrungen griffen zudem stärker bei vagem Distress als bei konkreten Absichten. Ein einzelner, abwἱesender Satz eines Familienmitglieds verschob die Triage mit einer Odds Ratio von 11,7 weg von der Notfallversorgung. Der Autor betont, dass diese strukturellen Fehler universelle Eigenschaften von LLM Agents sind und fordert faktorielle Evaluationsansätze sowie mehrschichtige Gegenmaßnahmen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
