Beobachtetes Signal · 21. Apr. 2026 · Research Publication · Quelle: Gary Marcus · Relevanz: 2/5 · Sentiment: Neutral

Studien belegen Unzuverlässigkeit von Chatbots bei medizinischer Beratung

Zusammenfassung des Signals

Ein Substack-Beitrag von Gary Marcus fasst aktuelle begutachtete Studien zusammen, die zeigen, dass gängige Large Language Model Chatbots bei medizinischen Ratschlägen unzureichend abschneiden und Sicherheitsrisiken bergen. Eine BMJ-Untersuchung von fünf beliebten Chatbots (Gemini, DeepSeek, Meta AI, ChatGPT und Grok) ergab, dass fast die Hälfte der Antworten auf zehn medizinische Prompts hochgradig problematisch waren, einschliesslich Halluzinationen und frei erfundener Zitate. Eine JAMA Network Open-Studie zu 21 Modellen kam zu dem Schluss, dass LLMs für die frühe Diagnose ungeeignet sind. Zwei Nature Medicine-Studien zeigten, dass LLMs relevante Erkrankungen in weniger als 34,5 Prozent der Fälle identifizierten und ChatGPT 52 Prozent der Standard-Notfälle falsch triagierte. Marcus warnt, dass Verbraucher Chatbots bei medizinischen Entscheidungen nicht vertrauen sollten.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Zahlreiche Peer-Review-Studien renommierter medizinischer Fachzeitschriften belegen konsistent, dass LLM-Chatbots unsichere medizinische Ergebnisse liefern; dies ist relevant für Unternehmen, die konversatorische KI für Endverbraucher einsetzen, hat jedoch keine unmittelbaren Auswirkungen auf das Kern-AdTech-Geschäft.

SIGNAL RADAR

Marktsignale zu DeepSeek in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Eine BMJ-Studie evaluierte fünf Chatbots (Gemini, DeepSeek, Meta AI, ChatGPT, Grok) anhand von zehn medizinischen Prompts und stellte fest, dass fast 50 Prozent der Antworten hochgradig problematisch waren.
  • Die BMJ-Untersuchung ergab, dass Chatbot-Ausgaben durchgehend mit grosser Zuversicht formuliert wurden, aber Halluzinationen und erfundene Zitate enthielten.
  • Eine JAMA Network Open-Studie bewertete 21 Frontier-Modelle und folgerte, dass aktuelle LLMs für klinische Entscheidungen im direkten Patientenkontakt unzuverlässig sind.
  • Zwei Nature Medicine-Studien zeigten, dass LLMs relevante Krankheitsbilder in weniger als 34,5 Prozent der Fälle erkannten und ChatGPT 52 Prozent der Notfälle untertriagierte.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: Gary Marcus•Veröffentlicht: 21. Apr. 2026
Ursprünglicher Berichttitel: “Please don’t trust your chatbot for medical advice”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Conversational AI & Chatbots14. Apr. 2026

Forschungsexperiment: KI-Chatbots warnen Nutzer vor fiktiver Augenkrankheit

Die schwedische Forscherin Almira Osmanovic Lindström hat mit „Bixonimanie“ eine fiktive Augenkrankheit erfunden und gezielt Falschinformationen über Medium-Beiträge sowie gefälschte Preprints im Internet platziert, um die Wissensaufnahme von KI-Systemen zu testen. Gängige Large Language Models und Chatbots wie Microsoft Copilot, Perplexity AI und OpenAI ChatGPT übernahmen diese Desinformation, halluzinierten Details und warnten Nutzer vor der vermeintlichen Krankheit. Sogar wissenschaftliche Publikationen wie ein im November 2024 veröffentlichter Beitrag im Fachjournal Cureus zitierten die gefälschten Studien, bevor dieser im März 2026 zurückgezogen wurde. Nachdem das Fachmagazin Nature über das Experiment berichtete, wurden die Online-Quellen gelöscht. Experten schlagen Alarm, da sich die Manipulation zeigt, wie leicht Falschinformationen in das Training von Large Language Models und nachgelagerte Conversational Interfaces gelangen und dort die Vertrauenswürdigkeit gefährden.

Signal analysieren
Conversational AI & Chatbots11. Juni 2026

Studie: Chatbots schwächen Fähigkeit zur Erkennung von Falschmeldungen

Eine Studie des MIT Media Lab zeigt, dass die dauerhafte Nutzung von KI-Systemen zur Faktenprüfung die eigenständige Fähigkeit von Nutzern zur Desinformationserkennung schwächt. In einem vierwöchigen Experiment mit 67 Teilnehmern steigerte die KI-Assistenz die Erkennungsleistung zunächst um 21 Prozent. Nach dem Entzug der KI fiel die Leistung in der vierten Woche jedoch um 15 Prozentpunkte unter den Ausgangswert, wobei rund ein Viertel der Probanden trotz nachweislich schlechterer Ergebnisse von einer Verbesserung ausging. Eine separate Untersuchung von Tests mit ChatGPT, Microsoft Copilot, Google Gemini und Perplexity AI ergab zudem, dass fast die Hälfte der Antworten signifikante Mängel aufwies, darunter Zitationsprobleme und schwerwiegende sachliche Fehler. Experten warnen, dass narrative Antwortstile Abhängigkeiten erzeugen, während sokratische Fragestellungen das kritische Denken und die Informationsintegrität im Medienumfeld besser unterstützen.

Signal analysieren
Large Language Models & Agent Safety18. März 2026

Einzelner Satz verändert KI-Diagnose um das Zwölffache

Eine unabhängige Evaluation von OpenAI’s ChatGPT Health offenbart gravierende Sicherheits- und Logikfehler. Obwohl das System mit über 260 Ärzten, mehr als 600.000 Feedback-Runden und einem eigenen Sicherheitsrahmen entwickelt wurde, zeigten sich kritische Mängel: So erkannte die interne Logik frühzeitig ein respiratorisches Versagen, empfahl im Endfazit jedoch das Abwarten auf einen Termin. In Fällen, die drei unabhängige Ärzte einstimmig als Notfall einstuften, riet das System in 52 Prozent der Fälle von der Notaufnahme ab. Suizid-Sicherheitsvorkehrungen griffen zudem stärker bei vagem Distress als bei konkreten Absichten. Ein einzelner, abwἱesender Satz eines Familienmitglieds verschob die Triage mit einer Odds Ratio von 11,7 weg von der Notfallversorgung. Der Autor betont, dass diese strukturellen Fehler universelle Eigenschaften von LLM Agents sind und fordert faktorielle Evaluationsansätze sowie mehrschichtige Gegenmaßnahmen.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.