Beobachtetes Signal · 8. Juni 2026 · Technical Release · Quelle: DEV Community · Relevanz: 1/5 · Sentiment: Positiv

Entwickler baut winziges Spaltenformat in purem Python

Zusammenfassung des Signals

Ein Entwickler hat Columna veröffentlicht, eine zu Lehrzwecken entwickelte spaltenbasierte Storage Engine und ein Dateiformat in purem Python gänzlich ohne pandas, pyarrow oder numpy. Das Projekt umfasst rund 3.000 Zeilen Code mit 81 Tests und bietet ein Footer-Last-Layout, Row Groups, chunk-basierte Min/Max-Statistiken für Predicate Pushdown sowie fünf Kodierungen (PLAIN, DICTIONARY, RLE, DELTA, BITPACK). Der Writer wendet alle anwendbaren Kodierungen an, wählt das kleinste Ergebnis und komprimiert Seiten optional per DEFLATE. Bei einem Datensatz mit 50.000 Bestellungen erzeugte Columna eine 225 KB große Datei (91 % kleiner als CSV) und las bei einer gefilterten Abfrage 98 % weniger Bytes. Der Quellcode sowie ein Live-DateI-Inspector sind auf GitHub und einer Demo-Website verfügbar.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Ein Open-Source-Bildungsprojekt mit begrenzter direkter Relevanz für die breitere AdTech- und MarTech-Branche; es dient vor allem Dateningenieuren als wertvolle Lernressource, stellt jedoch keinen marktrelevanten Release dar.

SIGNAL RADAR

Marktsignale zu GitHub in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Columna ist eine spaltenbasierte Storage Engine in purem Python ohne externe Abhängigkeiten wie pandas oder pyarrow.
  • Die Codebasis umfasst etwa 3.000 Zeilen und 81 Tests.
  • Das Format nutzt ein Footer-Last-Layout mit Row Groups, Spalten-Chunks, CRC32-Checksummen und einem zlib-komprimierten JSON-Footer.
  • Es implementiert fünf Kodierungen (PLAIN, DICTIONARY, RLE, DELTA, BITPACK), wobei der Writer das jeweils kleinste Ergebnis auswählt.
  • Benchmarks zeigen eine Dateigrößenreduktion um 91 % gegenüber CSV und eine Einsparung von 98 % bei gelesenen Bytes für gefilterte Abfragen.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 8. Juni 2026
Ursprünglicher Berichttitel: “I Built a Columnar File Format in Pure Python — a tiny, readable Parquet”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Infrastructure13. Juli 2026

Spaltenorientierte Dateiformate vom Lesepfad aus rückwärts auswählen

Dieser technische Blogbeitrag vom 13. Juli 2026 empfiehlt, spaltenorientierte Dateiformate anhand tatsächlicher Lese-, Schreib- und Wiederherstellungsworkloads statt reiner Funktionslisten auszuwählen. Der Autor rät dazu, zunächst Workload-Parameter wie Datensatzgröße, Zeilenanzahl, Append-Rate, Projektion, Selektivität, Konkurrenz, Objektspeicher-Latenz und Änderungsrate zu definieren. Anschließend wird ein Gesamt-Query-Kostenmodell vorgestellt, das Metadatenanfragen, gelesene Bytes, Dekompprimierung sowie CPU-Kosten für Filterung und Materialisierung berücksichtigt. Der Artikel betont die Wichtigkeit von Benchmarks mit realen Engines – inklusive p50/p99-Latenzen, abgerufenen Bytes, CPU- und Speicherauslastung sowie Schreibkosten – sowie das Testen von Fehler- und Änderungsszenarien. Zudem wird klar zwischen Dateiformaten und Tabellenformaten wie Snapshots oder Katalogen differenziert.

Signal analysieren
Infrastructure16. Juni 2026

Entwickler baut Mini-Python-Message-Broker zum Verständnis von Kafka

Ein Softwareentwickler hat eine technische Analyse veröffentlicht, die die Funktionsweise von Apache Kafka anhand eines kompakten, rein in Python geschriebenen In-Process-Message-Brokers namens „brokelite“ veranschaulicht. Auf Basis von rund 120 Zeilen Code demonstriert der Beitrag die drei Kernfunktionen von Kafka: das Anhängen von Schreibvorgängen an ein unveränderliches Log, das Lesen von Consumer-Instanzen ab einem beliebigen Offset sowie die Nachverfolgung von Committed Offsets in Consumer-Groups. Der Autor erläutert Garantien zur Partitionsreihenfolge durch schlüsselbasierte Routings, die Mechanismen von Consumer-Groups für unabhängigen Fortschritt und Replays sowie die Erweiterungen im produktiven Einsatz von Kafka, darunter Replication, Rebalancing, Retention, Compaction und das Netzwerkprotokoll. Der Artikel enthält ausführbare Beispiele für Produce-, Consume- und Commit-Prozesse sowie Vorschläge für Erweiterungen des Test-Brokers. Veröffentlicht wurde der Beitrag am 16. Juni 2026.

Signal analysieren
Large Language Models & Conversational Text-to-SQL27. Juni 2026

Entwicklung eines Text-to-SQL-Datenbankassistenten mit natürlicher Sprache

Ein praxisorientiertes Entwickler-Tutorial zeigt, wie sich mithilfe eines leichten Python-Stacks ein Text-to-SQL-Datenbankassistent auf Basis natürlicher Sprache realisieren lässt. Der Ansatz nutzt ein vortrainiertes T5-Modell über die Hugging Face Inference API, um englische Fragestellungen in funktionale SQL-Abfragen zu übersetzen. Diese werden anschließend über pandas in einer SQLite-In-Memory-Datenbank ausgeführt und die Ergebnisse über eine Streamlit-Benutzeroberfläche ausgegeben. Der Beitrag beschreibt den vollständigen Daten- und Ausführungsfluss, stellt Code-Snippets bereit und verweist auf ein Open-Source-GitHub-Repository. Das Tutorial demonstriert einen pragmatischen Weg zur Datendemokratisierung, der es technischen wie nicht-technischen Anwendern ermöglicht, Datenbanken ohne manuelle SQL-Kenntnisse effizient abzufragen.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.