Beobachtetes Signal · 14. Apr. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 1/5 · Sentiment: Neutral
Lokale Evaluierungsloop für KI-Assistenten: Erkenntnisse aus 800 Interaktionen
Ein Entwickler hat eine lokale Evaluationsschleife in einen selbstgehosteten AI Assistant integriert, die jede Interaktion mithilfe eines lokalen Ollama-Modells hinsichtlich Genauigkeit, Relevanz und Konfidenz bewertet. Interaktionen unterhalb eines Schwellenwerts lösen eine automatisierte Reflexion aus, die Fehler analysiert. Diese Reflexionen werden gebatcht, um System-Prompts über DSPy regelmäßig zu optimieren. Nach rund 800 bewerteten Interaktionen zeigte sich, dass der Assistent bei Schätzungen zu Aufwand, Zeitplänen und Mengen systematisch überkonfident agierte und zu Untertreibungen neigte. Gleichzeitig erzielten kürzere, direktere Antworten höhere Scores als ausführliche Ausarbeitungen. Der Autor warnt jedoch, dass das Ollama-Scoring-Modell fehleranfällig ist und DSPy bei Single-User-Datensätzen nur langsam konvergiert. Das Projekt und der Quellcode wurden auf GitHub unter dem Repository sliamh11/Deus veröffentlicht.
Technisch interessantes Entwicklerexperiment zur lokalen Evaluierung und Prompt-Optimierung für einen persönlichen AI Assistant, das jedoch keine breite Relevanz für den kommerziellen Markt aufweist.
Marktsignale zu Ollama in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Jede Interaktion des AI Assistant wird lokal durch ein Ollama-Modell hinsichtlich Genauigkeit, Relevanz und angemessener Konfidenz bewertet.
- Interaktionen unterhalb eines Qualitäts-Schwellenwerts generieren automatisch eine Reflexionsanalyse über aufgetretene Fehler.
- Die generierten Fehleranalysen fließen in DSPy ein, um die zugrundeliegenden System-Prompts periodisch zu optimieren.
- Nach rund 800 bewerteten Interaktionen zeigte der Assistent eine systematische Überkonfidenz bei Schätzungen und eine Neigung zur Untertreibung.
- Kürzere und direktere Antworten schnitten konsistent besser ab; der Autor verweist auf methodische Grenzen des Scoring-Modells und von DSPy bei Single-User-Daten.
Verknüpfte Unternehmen
2 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Entwickler baut selbst gehosteten KI-Assistenten via Telegram-Integration
Ein Entwickler berichtet über sechs Monate Praxiserfahrung mit einem selbst gehosteten KI-Assistenten auf Basis von Telegram. Die Architektur setzt auf einen Python-Bot (python-telegram-bot) auf einem Mac Mini M4, der Anfragen dynamisch über drei lokale Ollama-Endpunkte (Mac, Windows-GPU-PC, Ubuntu-Fallback) verteilt. Das System unterstützt Sprachtranskription (Whisper via Ollama), Bilderkennungsmodelle sowie ein lokales RAG-Setup (Chroma und nomic-embed-text) für Dokumenten-Q&A. Der Autor erläutert typische Workflows wie Ad-hoc-Recherchen, Sprachnotizen und mobile Code-Reviews, adressiert jedoch auch Herausforderungen bezüglich Zuverlässigkeit und Halluzinationen. Zudem beschreibt er ein Intent-basiertes Routing und betriebliche Best Practices wie Health-Checks, Logging und Graceful Degradation. Im Fokus stehen die praktischen Vorteile von Systemverfügbarkeit, Datensouveränität und Modellflexibilität gegenüber proprietären Cloud-Chat-Diensten.
Autarker KI-Assistent: Privates lokales RAG-System auf Standard-Hardware realisiert
Nach Kündigung eines ChatGPT-Plus-Abonnements (240 USD/Jahr) entwickelte der Autor einen vollständig privaten KI-Assistenten namens NEXUS, der autark auf einem Intel-i7-Laptop von 2018 ohne dedizierte GPU läuft. Das Setup nutzt Ollama zum Hosten lokaler LLMs (llama3.2:3b und mistral:7b), ein nomic-embed-text-Modell (274 MB) für 768-dimensionale Embeddings sowie Qdrant als lokale Vektordatenbank in Docker-Containern. Über eine vierstufige Pipeline (Parse, Chunk, Embed, Store) wird persistentes semantisches Gedächtnis mittels Retrieval-Augmented Generation (RAG) bereitgestellt. Ergänzt durch LangGraph-basierte autonome Agenten, automatisierte Ingestion-Watcher und strikte Sicherheitsvorgaben (rein lokale Embeddings, Timeouts, Human-in-the-Loop) demonstriert das Projekt, wie First-Party-Data und sensibles Wissen ohne Cloud-Abhängigkeit auf Standard-Hardware geschützt und verarbeitet werden können.
Lokale KI Arwanos v10 integriert Mental State Monitor
Ein Entwickler hat Arwanos v10 veröffentlicht, einen lokal ausgeführten KI-Assistenten, der komplett auf dem Rechner des Nutzers läuft und einen "Mental State Monitor" einführt. Dabei handelt es sich um eine offline basierte Machine Learning Pipeline, die persönliche Tagebücher ausliest, ein psychologisches Profil erstellt und zunehmend tiefgründigere therapeutische Fragen generiert. Das System gleicht Tagebuchmuster mit einem Datensatz aus 7.557 echten Therapiesitzungen ab, nutzt eine dreistufige NLP-Duplikatsprüfung gegen Wiederholungen und arbeitet nach einem einmaligen Datensatz-Build vollständig offline. Der Autor stellt eine technische Analyse auf seiner Website bereit und hat den Quellcode auf GitHub unter GMMB1/Transmitted-Ai als Open Source veröffentlicht. Der Beitrag erschien am 19.06.2026 auf der DEV Community.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
