Beobachtetes Signal · 15. Juni 2026 · Interview / Podcast Episode · Quelle: Lennys Newsletter · Relevanz: 2/5 · Sentiment: Positiv
Braintrust nutzt AI Agents, Evals und CI für Softwareentwicklung
Ankur Goyal, Gründer und CEO von Braintrust, erläutert, wie sein Unternehmen AI Agents, automatisierte Evals und eine verbesserte CI einsetzt, um die Entwicklungsgeschwindigkeit und Produktqualität zu steigern. Er beschreibt tagelange Benchmarking-Experimente mit Coding Agents (unter Verwendung von Codex) über Datenbankindizes, Column-Store-Formate und Execution Engines hinweg. Zudem stellt er das „Agent Line“-Framework vor, um zu bestimmen, welche Aufgaben an Agents delegiert werden können, und erklärt, wie Evals als moderne PRDs und Bewertungsfunktionen dienen, um Qualität messbar zu machen. Das Gespräch behandelt operationelle Muster wie Foreground- und Background-Agents, parallele Agents, das Erfassen von Designtäuschung durch wiederholbare Evals, Prompt-Iteration in sicheren Playgrounds sowie die strategische Bedeutung von Investitionen in CI/CD für KI-beschleunigte Engineering-Teams.
Die praxisnahe Diskussion über AI Agents, automatisierte Evals und CI liefert konkrete operationelle Muster für Engineering-Teams zur Beschleunigung von Entwicklung und Qualität. Die Inhalte sind für KI- und LLM-Praktiker hochrelevant, stellen jedoch keine branchenverändernde Plattformankündigung dar.
Marktsignale zu Vercel in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Ankur Goyal ist Gründer und CEO von Braintrust, einer Plattform für AI Evals und Observability.
- Braintrust wird unter anderem von Teams bei Notion, Stripe, Vercel und Zapier eingesetzt.
- Goyal beschrieb den Einsatz von Codex für einwöchige Benchmarking-Experimente bei Datenbankindizes, Column-Store-Formaten und Execution Engines.
- Er präsentierte das „Agent Line“-Framework zur Entscheidung, welche Aufgaben und Interaktionen an AI Agents delegiert werden.
- Die Episode zeigt, dass automatisierte Evals als moderne PRDs dienen können und die Optimierung von CI/CD für die Entwicklungsgeschwindigkeit bei KI-Workflows entscheidend ist.
Verknüpfte Unternehmen
5 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Evals Become the Modern PRD for AI Product Teams
A podcast episode and live demo with Ankur Goyal (Founder & CEO of Braintrust) argues that structured "evals"—datasets, task definitions and scoring functions—should replace traditional PRDs for AI product development. Braintrust, which announced a Series B at an $800 million valuation, powers eval workflows for customers including Replit, Vercel, Airtable, Ramp, Zapier and Notion. In the demo the hosts connected to Linear’s MCP server, auto-generated test data with Opus, iterated prompts and scoring functions, and improved a model score from 0 to 0.75. The piece explains offline vs. online evals, the data-task-scores framework, and recommends PMs own evals and scoring functions to create durable, model-agnostic product specifications.
Wie KI-Tools von Anthropic das Software Engineering grundlegend verändern
Ein Vor-Ort-Bericht von The Pragmatic Engineer bei Anthropic beleuchtet, wie fortschrittliche KI-Toolings die Softwareentwicklung transformieren. Das Claude-Platform-Team entwickelte die Claude Managed Agents in sechs Monaten und migrierte seine Plattformschicht von Python zu Rust. Bun-Schöpfer Jarred Sumner portierte die Codebasis in nur 11 Tagen von Zig auf Rust – unterstützt durch 64 parallele KI-Agenten und Token-Kosten von rund 165.000 US-Dollar, gefolgt von intensiver Verifikation und Testing. Der Bericht dokumentiert fundamentale Veränderungen der Teamabläufe: Agenten-getriebenes Prototyping, der massive Einsatz von automatisierter KI-Code-Review und Security-Scannern sowie eine höhere personelle Flexibilität zwischen Teams. Dennoch bleiben klassische Planungsprozesse und Product Requirement Documents (PRDs) für komplexe Architekturprojekte weiterhin essenziell.
Coinbase skaliert KI-Einsatz für über 1.000 Software-Ingenieure
Chintan Turakhia, Senior Director of Engineering bei Coinbase, erläutert, wie sein Team durch den Einsatz von KI-Tools und benutzerdefinierten Agenten eine Organisation mit über 1.000 Ingenieuren transformierte und die Produktentwicklung beschleunigte. Vor die Aufgabe gestellt, die Self-Custody-Wallet von Coinbase innerhalb von sechs bis neun Monaten in eine Consumer-Social-App umzubauen, nutzte das Team KI als Multiplikator. Dadurch sank die PR-Prüfzeit von 150 auf 15 Stunden, Feedback-Zyklen wurden komprimiert und bei einem „PR Speed Run“ schoben 100 Ingenieure 70 Pull Requests in nur 15 Minuten durch. Der Bericht behandelt Führung und praktische Einführung, Metriken zur Entwicklungsgeschwindigkeit, die Integration von Tools wie Cursor, Linear, Slack, GitHub Copilot, ChatGPT und Claude, die Entwicklung eigener Slack-Bots und Agenten sowie Echtzeit-Demos zur Feature-Bereitstellung.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
