Beobachtetes Signal · 13. Juli 2026 · Technical Guidance · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Neutral
Spaltenorientierte Dateiformate vom Lesepfad aus rückwärts auswählen
Dieser technische Blogbeitrag vom 13. Juli 2026 empfiehlt, spaltenorientierte Dateiformate anhand tatsächlicher Lese-, Schreib- und Wiederherstellungsworkloads statt reiner Funktionslisten auszuwählen. Der Autor rät dazu, zunächst Workload-Parameter wie Datensatzgröße, Zeilenanzahl, Append-Rate, Projektion, Selektivität, Konkurrenz, Objektspeicher-Latenz und Änderungsrate zu definieren. Anschließend wird ein Gesamt-Query-Kostenmodell vorgestellt, das Metadatenanfragen, gelesene Bytes, Dekompprimierung sowie CPU-Kosten für Filterung und Materialisierung berücksichtigt. Der Artikel betont die Wichtigkeit von Benchmarks mit realen Engines – inklusive p50/p99-Latenzen, abgerufenen Bytes, CPU- und Speicherauslastung sowie Schreibkosten – sowie das Testen von Fehler- und Änderungsszenarien. Zudem wird klar zwischen Dateiformaten und Tabellenformaten wie Snapshots oder Katalogen differenziert.
Praxisnaher Leitfaden für Data Engineers zur Auswahl von Spaltenformaten und Benchmarks, der direkte Auswirkungen auf Speicher- und Query-Performance in der Analyse-Infrastruktur hat, jedoch keine marktumwälzende Ankündigung darstellt.
Marktsignale zu DEV Community in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Artikel veröffentlicht am 13.07.2026 von Autor 'Robin' auf DEV Community.
- Empfiehlt die Definition von Workload-Parametern vor der Auswahl eines spaltenorientierten Formats.
- Präsentiert ein mathematisches Modell zur Berechnung der Gesamt-Query-Kosten aus Metadaten, Durchsatz und CPU.
- Rät zu Benchmarks mit realen Read/Write-Engines unter Messung von p50/p99-Latenz, Bytes, CPU, Speicher und Schreibkosten.
- Fordert das Testen von Ausfallszenarien, Updates/Deletes, Kompaktierung, Schema-Evolution und Reader-Kompatibilität.
Verknüpfte Unternehmen
7 verknüpfte Unternehmen“DEV Community — A space to discuss and keep up software development and manage your software career...”
“Algolia is the official search partner of DEV...”
“Sentry Promoted...”
“MongoDB Promoted...”
“Google AI is the official AI Model and Platform Partner of DEV...”
“Neon is the official database partner of DEV...”
“Built on Forem — the open source software that powers DEV (and other inclusive communities)....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Tabellenformate erklärt: Warum sie für das moderne Lakehouse unerlässlich sind
Dieser Artikel (Teil 1 einer 15-teiligen Apache Iceberg Masterclass vom 30.04.2026) erläutert, wie Tabellenformate eine Sammlung von Dateien im Objektspeicher in zuverlässige, transaktionale analytische Tabellen verwandeln. Er definiert Kernfunktionen wie Dateiverfolgung, atomare Commits, Schema- und Partitionsverwaltung sowie Snapshot-Historie und vergleicht fünf moderne Formate: Apache Iceberg, Delta Lake, Apache Hudi, Apache Paimon und DuckLake. Der Beitrag beleuchtet die Ursprünge der Formate – von Iceberg bei Netflix 2017 bis hin zu DuckLake im Jahr 2025 – und zeigt auf, warum sich Iceberg als De-facto-Standard für Multi-Engine-Interoperabilität etabliert hat. Die Analyse verdeutlicht, wie diese Schicht die Grundlage für performante Analytics- und Measurement-Stacks bildet.
Praxisnahe Analyseformate für strukturierte JSON-Logs im Benchmark
Eine technische Evaluierung vergleicht Exportgeschwindigkeit, Dateigröße und Abfrageperformance verschiedener Analyseformate für strukturierte JSON-Logs. Mithilfe des Two-Pass-Tools flatjsonl testet der Autor CSV, Parquet (Snappy und Zstd), DuckDB sowie SQLite anhand von drei realistischen Datenstrukturen (schmal, normal, breit). Die Ergebnisse zeigen, dass CSV am schnellsten geschrieben wird, aber die größten Dateien erzeugt. Parquet mit Zstd liefert die geringste Dateigröße bei moderater CPU-Last. DuckDB CLI erstellt direkt abfragbare Datenbanken mit starker Performance für spaltenbasierte Scans, während direkte zeilenbasierte DB-Inserts langsam und für breite, sparse JSON-Formate ungeeignet sind. Abschließend gibt der Beitrag praxisnahe Empfehlungen: CSV für rohe Geschwindigkeit, Parquet für portable Analyse-Artefakte und DuckDB CLI bei direktem Datenbankbedarf.
Entwickler baut winziges Spaltenformat in purem Python
Ein Entwickler hat Columna veröffentlicht, eine zu Lehrzwecken entwickelte spaltenbasierte Storage Engine und ein Dateiformat in purem Python gänzlich ohne pandas, pyarrow oder numpy. Das Projekt umfasst rund 3.000 Zeilen Code mit 81 Tests und bietet ein Footer-Last-Layout, Row Groups, chunk-basierte Min/Max-Statistiken für Predicate Pushdown sowie fünf Kodierungen (PLAIN, DICTIONARY, RLE, DELTA, BITPACK). Der Writer wendet alle anwendbaren Kodierungen an, wählt das kleinste Ergebnis und komprimiert Seiten optional per DEFLATE. Bei einem Datensatz mit 50.000 Bestellungen erzeugte Columna eine 225 KB große Datei (91 % kleiner als CSV) und las bei einer gefilterten Abfrage 98 % weniger Bytes. Der Quellcode sowie ein Live-DateI-Inspector sind auf GitHub und einer Demo-Website verfügbar.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
