Beobachtetes Signal · 8. Juni 2026 · Technical Release · Quelle: DEV Community · Relevanz: 1/5 · Sentiment: Positiv
Entwickler baut winziges Spaltenformat in purem Python
Ein Entwickler hat Columna veröffentlicht, eine zu Lehrzwecken entwickelte spaltenbasierte Storage Engine und ein Dateiformat in purem Python gänzlich ohne pandas, pyarrow oder numpy. Das Projekt umfasst rund 3.000 Zeilen Code mit 81 Tests und bietet ein Footer-Last-Layout, Row Groups, chunk-basierte Min/Max-Statistiken für Predicate Pushdown sowie fünf Kodierungen (PLAIN, DICTIONARY, RLE, DELTA, BITPACK). Der Writer wendet alle anwendbaren Kodierungen an, wählt das kleinste Ergebnis und komprimiert Seiten optional per DEFLATE. Bei einem Datensatz mit 50.000 Bestellungen erzeugte Columna eine 225 KB große Datei (91 % kleiner als CSV) und las bei einer gefilterten Abfrage 98 % weniger Bytes. Der Quellcode sowie ein Live-DateI-Inspector sind auf GitHub und einer Demo-Website verfügbar.
Ein Open-Source-Bildungsprojekt mit begrenzter direkter Relevanz für die breitere AdTech- und MarTech-Branche; es dient vor allem Dateningenieuren als wertvolle Lernressource, stellt jedoch keinen marktrelevanten Release dar.
Marktsignale zu GitHub in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Columna ist eine spaltenbasierte Storage Engine in purem Python ohne externe Abhängigkeiten wie pandas oder pyarrow.
- Die Codebasis umfasst etwa 3.000 Zeilen und 81 Tests.
- Das Format nutzt ein Footer-Last-Layout mit Row Groups, Spalten-Chunks, CRC32-Checksummen und einem zlib-komprimierten JSON-Footer.
- Es implementiert fünf Kodierungen (PLAIN, DICTIONARY, RLE, DELTA, BITPACK), wobei der Writer das jeweils kleinste Ergebnis auswählt.
- Benchmarks zeigen eine Dateigrößenreduktion um 91 % gegenüber CSV und eine Einsparung von 98 % bei gelesenen Bytes für gefilterte Abfragen.
Verknüpfte Unternehmen
1 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Spaltenorientierte Dateiformate vom Lesepfad aus rückwärts auswählen
Dieser technische Blogbeitrag vom 13. Juli 2026 empfiehlt, spaltenorientierte Dateiformate anhand tatsächlicher Lese-, Schreib- und Wiederherstellungsworkloads statt reiner Funktionslisten auszuwählen. Der Autor rät dazu, zunächst Workload-Parameter wie Datensatzgröße, Zeilenanzahl, Append-Rate, Projektion, Selektivität, Konkurrenz, Objektspeicher-Latenz und Änderungsrate zu definieren. Anschließend wird ein Gesamt-Query-Kostenmodell vorgestellt, das Metadatenanfragen, gelesene Bytes, Dekompprimierung sowie CPU-Kosten für Filterung und Materialisierung berücksichtigt. Der Artikel betont die Wichtigkeit von Benchmarks mit realen Engines – inklusive p50/p99-Latenzen, abgerufenen Bytes, CPU- und Speicherauslastung sowie Schreibkosten – sowie das Testen von Fehler- und Änderungsszenarien. Zudem wird klar zwischen Dateiformaten und Tabellenformaten wie Snapshots oder Katalogen differenziert.
Entwickler baut Mini-Python-Message-Broker zum Verständnis von Kafka
Ein Softwareentwickler hat eine technische Analyse veröffentlicht, die die Funktionsweise von Apache Kafka anhand eines kompakten, rein in Python geschriebenen In-Process-Message-Brokers namens „brokelite“ veranschaulicht. Auf Basis von rund 120 Zeilen Code demonstriert der Beitrag die drei Kernfunktionen von Kafka: das Anhängen von Schreibvorgängen an ein unveränderliches Log, das Lesen von Consumer-Instanzen ab einem beliebigen Offset sowie die Nachverfolgung von Committed Offsets in Consumer-Groups. Der Autor erläutert Garantien zur Partitionsreihenfolge durch schlüsselbasierte Routings, die Mechanismen von Consumer-Groups für unabhängigen Fortschritt und Replays sowie die Erweiterungen im produktiven Einsatz von Kafka, darunter Replication, Rebalancing, Retention, Compaction und das Netzwerkprotokoll. Der Artikel enthält ausführbare Beispiele für Produce-, Consume- und Commit-Prozesse sowie Vorschläge für Erweiterungen des Test-Brokers. Veröffentlicht wurde der Beitrag am 16. Juni 2026.
Entwicklung eines Text-to-SQL-Datenbankassistenten mit natürlicher Sprache
Ein praxisorientiertes Entwickler-Tutorial zeigt, wie sich mithilfe eines leichten Python-Stacks ein Text-to-SQL-Datenbankassistent auf Basis natürlicher Sprache realisieren lässt. Der Ansatz nutzt ein vortrainiertes T5-Modell über die Hugging Face Inference API, um englische Fragestellungen in funktionale SQL-Abfragen zu übersetzen. Diese werden anschließend über pandas in einer SQLite-In-Memory-Datenbank ausgeführt und die Ergebnisse über eine Streamlit-Benutzeroberfläche ausgegeben. Der Beitrag beschreibt den vollständigen Daten- und Ausführungsfluss, stellt Code-Snippets bereit und verweist auf ein Open-Source-GitHub-Repository. Das Tutorial demonstriert einen pragmatischen Weg zur Datendemokratisierung, der es technischen wie nicht-technischen Anwendern ermöglicht, Datenbanken ohne manuelle SQL-Kenntnisse effizient abzufragen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
