Beobachtetes Signal · 26. Apr. 2026 · Technical Release · Quelle: t3n · Relevanz: 3/5 · Sentiment: Positiv
MIT-Methode RLCR trainiert Sprachmodelle zur Verifikation von Unsicherheit
Forscher des MIT CSAIL um Mehul Damani und Isha Puri haben Reinforcement Learning with Calibration Rewards (RLCR) vorgestellt, eine Trainingsmethode zur messbaren und trainierbaren Konfidenz von Sprachmodellen. RLCR integriert einen Brier-Score in die Belohnungsfunktion, wodurch Modelle numerische Schätzungen ihrer Unsicherheit abgeben müssen und falsch-positive Antworten mit hoher Konfidenz bestraft werden. Laut eines arXiv-Preprints reduziert die Technik den Kalibrierungsfehler um bis zu 90 Prozent bei gleichbleibender Gesamtgenauigkeit, wobei insbesondere kleinere Modelle profitieren. Die Autoren verzeichnen einen moderaten Anstieg des Trainingsaufwands und betonen, dass eine verbesserte Kalibrierung zwar nicht alle faktischen Fehler eliminiert, jedoch ein verlässlicheres Signal für notwendige menschliche Verifikationen in sensiblen Bereichen wie dem Gesundheitswesen oder dem Finanzwesen liefert.
Eine reproduzierbare Trainingstechnik zur präziseren Modellkalibrierung reduziert Halluzinationen und liefert verlässlichere Unsicherheitssignale für Human-in-the-Loop-Workflows. Dies ist von hoher Relevanz für Conversational AI und die Verlässlichkeit generativer Inhalte, stellt jedoch primär ein Forschungsergebnis und keine plattformseitige Richtlinienänderung dar.
Marktsignale zu MIT in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- MIT CSAIL-Forscher Mehul Damani und Isha Puri entwickelten Reinforcement Learning with Calibration Rewards (RLCR).
- RLCR integriert den Brier-Score in die Belohnungsfunktion, um Abweichungen zwischen angegebener Konfidenz und tatsächlicher Korrektheit zu bestrafen.
- Das arXiv-Preprint (arXiv:2507.16806) verzeichnet eine Reduktion des Kalibrierungsfehlers um bis zu 90 Prozent bei stabiler Gesamtgenauigkeit der Aufgaben.
- Die Methode erhöht den Trainingsaufwand geringfügig und erweist sich insbesondere bei kleineren Modellen als vorteilhaft.
- RLCR liefert ein präziseres Signal für menschliche Verifikationen, garantiert jedoch keine vollständige Elimination von Halluzinationen.
Verknüpfte Unternehmen
3 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
RLHF Trained Claude to Be Verbose — Experiment
A developer published an experiment showing how Reinforcement Learning from Human Feedback (RLHF) can produce a verbosity bias in Anthropic’s Claude model. Using the Anthropic Python SDK, the author generated paired responses (unconstrained vs. concise) for many prompts and built a reward-model simulation that scores helpfulness, conciseness, honesty and safety. The simulated reward model systematically preferred more elaborate responses, suggesting that RLHF compresses diverse human judgments into a scalar signal that can amplify annotator heuristics (e.g., “more thorough = better”). The post warns of sycophancy risks in domain-specific apps (e.g., financial advice) and recommends domain-specific evaluations rather than relying solely on broad reward models or system prompts. A full notebook is linked on GitHub. Publication date: 2026-05-14.
KI halluziniert selbstbewusst: UX-Design muss Unsicherheiten zwingend transparent machen
Aktuelle Large Language Models (LLMs) liefern regelmäßig falsche Antworten mit hohem Selbstbewusstsein. Ursache hierfür sind Trainings- und Evaluierungsmethoden, die spekulative Behauptungen gegenüber dem Eingeständnis von Unsicherheit belohnen. Um diese Halluzinationsrisiken zu minimieren, wird die Implementierung eines „Harness“-Frameworks empfohlen. Diese Schutzschicht aus UI- und Runtime-Guardrails visualisiert Step-by-Step-Reasoning, zwingt Modelle zur Kennzeichnung von Unsicherheiten und ermöglicht selektive Vorhersagen, bei denen das System bei unzureichender Konfidenz die Antwort verweigert. Aktuelle Studien und Branchenanalysen belegen eine riskante, ungeprüfte Nutzung von KI-Outputs in Unternehmen bei gleichzeitig steigenden Halluzinationsraten in neueren Reasoning-Modellen. Produktteams sollten daher auf Design-Patterns wie kognitive Prüfschleifen setzen. Runtime-Toolkits wie NeMo Guardrails von NVIDIA ermöglichen die Durchsetzung solcher Sicherheitsregeln auf Systemebene, ohne dass Modifikationen am zugrundeliegenden Basismodell erforderlich sind.
Study: AI Models Learn to Refuse Answers When Uncertain
Researchers at Google DeepMind conducted a study on large language models (LLMs) including GPT-4o, Gemma 3 27B, Deepseek-V3, and Qwen3-Next-80B-A3B-Instruct to investigate how these models decide whether to answer a query or abstain due to uncertainty. Using an experimental paradigm with four phases, they found that models apply implicit confidence thresholds, and that steering their internal confidence levels causally affects abstention rates. The findings suggest that models can be made to refuse answers when their confidence is low, potentially reducing hallucinations. This ability is considered crucial for autonomous AI agents that must recognize their own uncertainty. The study was published in Nature Machine Intelligence.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
