Beobachtetes Signal · 25. Juni 2026 · Vulnerability Disclosure · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Negativ
Bleeding Llama: Ollama-Schwachstelle legt lokalen LLM-Speicher offen
Im Mai 2026 hat Cyera Research „Bleeding Llama“ aufgedeckt, eine kritische Speicherleck-Schwachstelle in Ollama, die prozessinterne Daten von lokalen LLM-Servern exfiltrieren kann. Unter CVE-2026-7482 geführt und von Echo CNA mit 9.1 (Kritisch) bewertet, handelt es sich um einen Heap Out-of-Bounds Read im GGUF-Modellladeepfad (CWE-125). Laut Cyera können Angreifer die Schwachstelle mit drei unauthentifizierten API-Aufrufen ausnutzen: Hochladen einer manipulierten GGUF-Dateis, Auslösen der Modellerstellung und Pushen des Artefakts in eine Angreifer-Registry, wodurch durchgesickerte Heap-Daten in eine unauffällige Modelloperation verpackt werden. Betreiber sollten auf Ollama 0.17.1 oder neuer aktualisieren, sicherstellen, dass Dienste nicht öffentlich exponiert sind, Authentifizierung verlangen sowie Secrets und Egress-Kontrollen für die Modellinfrastruktur überprüfen.
Eine kritische CVE (9.1) mit Auswirkungen auf beliebte lokale LLM-Infrastrukturen stellt Annahmen über lokale Datenschutzvorteile in Frage und erfordert Patching sowie operative Anpassungen für Teams, die Modellserver betreiben. Es handelt sich zwar nicht um eine plattformweite Richtlinienänderung, aber um ein wichtiges Signal für die Sicherheit von AI-Infrastrukturen.
Marktsignale zu Ollama in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Cyera Research hat im Mai 2026 die Schwachstelle „Bleeding Llama“ in Ollama aufgedeckt.
- Das Problem wird als CVE-2026-7482 geführt und von Echo CNA mit 9.1 (Kritisch) bewertet.
- Technisch handelt es sich um einen Heap Out-of-Bounds Read (CWE-125) im GGUF-Modellladeepfad von Ollama, der den Prozess Arbeitsspeicher leaken kann.
- Ollama-Versionen vor 0.17.1 sind betroffen; Betreiber sollten auf 0.17.1 oder höher aktualisieren und den Dienst nicht ohne Authentifizierung freigeben.
Verknüpfte Unternehmen
1 verknüpfte Unternehmen“Ollama is one of the most popular ways to run open-source models locally....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Ollama bietet kostenlosen lokalen LLM-Runner für Open-Source-Modelle
Ollama ist ein kostenloser lokaler LLM-Runner, mit dem Entwickler Open-Source-KI-Modelle mit einem einzigen Befehl auf ihren eigenen Rechnern ausführen können. Die Plattform unterstützt zahlreiche Modelle wie Llama 3, Mistral, Gemma, Phi und CodeLlama. Sie stellt eine OpenAI-kompatible API als direkten Ersatz für GPT-Aufrufe bereit und ermöglicht benutzerdefinierte Modelfiles, Embedding-Modelle sowie Multi-Modell-Anwendungen. Ollama unterstützt GPU-Beschleunigung für NVIDIA, AMD und Apple Silicon und funktioniert nach dem Download vollständig offline. Zu den wesentlichen Vorteilen für Entwickler gehören verbesserte Datensicherheit durch lokale Verarbeitung und der Wegfall von Token-Kosten. Ein Beispiel im Artikel beschreibt, wie ein Entwickler einen monatlichen GPT-4-Workflow im Wert von 200 US-Dollar für Code-Reviews durch Ollama und CodeLlama ersetzte und die Kosten auf null reduzierte. Der Beitrag enthält Installationsanweisungen sowie API-Beispiele für die lokale Bereitstellung.
Claude-Code-Schwachstelle offenbart fundamentale Risiken autonomer KI-Agenten
Ein aktueller Sicherheitsbericht warnt vor CVE-2025-59536 (CVSS 8.7), einer kritischen Schwachstelle in Claude Code, bei der der autonome KI-Coding-Agent Repository-Code mit Root-Rechten ohne ausdrückliche Nutzerfreigabe ausführen kann. Der Artikel beschreibt fünf reale Vektoren: schädliche Dokumente, manipulierte Pull Requests, kompromittierte MCP-Server, trojanisierte Skills sowie Memory Poisoning. Ein Snyk-Scan von 3.984 öffentlichen Skills ergab Prompt Injection in 36 Prozent der Fälle, während Microsoft entsprechende Vorfälle bei 31 Organisationen dokumentierte. Empfohlene Gegenmaßnahmen umfassen Sandboxing, strikte Dateizugriffsfilter, Input-Sanitization, menschliche Freigabeschwellen sowie die Begrenzung persistentem Speichers. Das Grundproblem liegt darin, dass LLMs Daten als Instruktionen interpretieren, was mehrschichtige Abwehrmechanismen und das Prinzip der minimalen Privilegien zwingend erfordert.
Lokaler MCP-Server mit Ollama und ChromaDB für Codebase-Memory
Ein technischer Post-Mortem-Bericht analysiert die Entwicklung eines lokalen MCP-Servers zur Codebase-Speicherung unter Nutzung von Ollama für lokales LLM-Hosting und ChromaDB für den Vektorabruf im Rahmen des Open-Source-Projekts zerikai_memory. Der Autor testete die Modelle mistral:7b und ornith:9b auf einem System mit einer 8GB RTX 3050 und bewertete Latenz, Synthesequalität sowie Betriebsstabilität. Die Ergebnisse zeigen, dass mistral:7b schneller arbeitet und in den VRAM passt, während ornith:9b bei angereicherten Docstrings präzisere Ergebnisse liefert, jedoch längere Startzeiten und mehr VRAM erfordert. Zur Vermeidung von GPU-Überlastungen implementierte das Team eine Semaphor-Steuerung für parallele Synthesen. Als praxisnahe Empfehlung für lokale Produktivbereitstellungen gilt eine RTX 3060 mit 12GB VRAM.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
