dbt Core v2: 77 crate Rust, 18 file Python, nessun runtime Python

dbt si è riscritto in Rust. La velocità è la parte noiosa.

Ho aperto una segnalazione di bug su dbt e ho trovato una codebase di cui nessuno mi aveva parlato: 77 crate Rust dove prima c’era il Python. Questo è a cosa serve davvero la riscrittura, perché il marketing la sottovende, e cosa ho smosso frugandoci dentro — due fix, entrambi per bug che non hanno mai stampato un errore.

4 agosto 2026 · 17 minuti · 3593 parole · Andrea Bozzo
Nephtys su un Raspberry Pi 5: 19.51 MB contro 128.47 MB, 3.610 W contro 3.584 W

Nephtys su un Raspberry Pi: 6.6× meno memoria, esattamente gli stessi watt

Non avevo mai scritto pubblicamente di Nephtys, e la prima cosa che devo riportare su hardware reale è un risultato nullo: il vantaggio di memoria si è riprodotto su un Raspberry Pi 5, il vantaggio energetico non è mai esistito.

25 luglio 2026 · 11 minuti · 2320 parole · Andrea Bozzo
Zerobus Ingest, Rust producer, Unity Catalog sink

Zerobus Ingest: quando Unity Catalog diventa il sink

Nel post dlt+dbt il contratto era uno schema Unity Catalog. Con Zerobus Ingest ho spostato la stessa domanda al bordo producer: quando il sink è già una tabella Delta governata, serve davvero un bus nel mezzo?

5 luglio 2026 · 11 minuti · 2281 parole · Andrea Bozzo
dlt + dbt su un solo Unity Catalog

dlt + dbt su un Solo Unity Catalog (e Perché Non Sono 'Due DLT')

Ingestion Python-native con dlt (dlthub), trasformazione SQL con dbt e un singolo schema Unity Catalog come contratto tra i due. Note dal cablarli insieme su un workspace Databricks reale — inclusa la collisione di nomi che mi ha morso nel codice vero.

22 giugno 2026 · 9 minuti · 1835 parole · Andrea Bozzo
Brain e Brain UI

Brain e Brain UI: una Knowledge Base che è Davvero Tua

Brain è una knowledge base Markdown versionata in Git. Brain UI è il control plane Rust/Leptos che ci sta sopra. Questo è il sistema, il legame tra le due metà, una tassonomia reale config-driven, e le ragioni oneste per cui metto il core in chiaro.

6 giugno 2026 · 12 minuti · 2373 parole · Andrea Bozzo
Un sito, fatto a mano - cover del walkthrough

Costruire il Mio Mini-Sito Personale come un Progetto Vero

Come ho ricostruito il mio sito personale come un sistema statico versionato e riproducibile, con una separazione chiara fra landing page, blog, generatori e una piccola API Go companion.

20 maggio 2026 · 9 minuti · 1912 parole · Andrea Bozzo
FinOps per Piattaforme Dati AI 2026

FinOps per Piattaforme Dati AI nel 2026: Databricks vs AWS-Native vs Iceberg DIY sul Tuo Warehouse

Tre stack lakehouse per aggiungere AI/ML e streaming sopra un warehouse esistente, confrontati con una lente FinOps: DBU, DPU, TB scansionati, S3 GB-mese ed egress, applicati a workload reali con i prezzi 2026.

7 maggio 2026 · 20 minuti · 4189 parole · Andrea Bozzo
Logo Zero Grappler

Zero Grappler: Pensare per Data-Pipeline su un Microcontrollore (Appunti Bozza prima dell'arrivo dell'hardware)

Zero Grappler è un piccolo crate no_std che applica la mentalità delle pipeline di dati all’ML embedded: tre tratti, due task async, dimensionamento dei buffer a tempo di compilazione, zero allocazioni. Questo post riguarda le scelte di design — non è ancora un report sull’hardware. Lo smoke test su silicio reale con il Pico 2 W è ancora davanti a me.

21 aprile 2026 · 12 minuti · 2436 parole · Andrea Bozzo
Lance Format e LanceDB

Lance Format e LanceDB: Storage Columnar per l'Era degli Embedding

Lance è un formato di storage columnar costruito per i workload di machine learning — accesso casuale veloce, indicizzazione vettoriale nativa e integrazione Arrow zero-copy. Questo articolo esplora il formato stesso, come LanceDB ci costruisce sopra, e come l’ho collegato a uno stream NATS live per costruire un layer di ricerca semantica su eventi in tempo reale.

7 aprile 2026 · 8 minuti · 1616 parole · Andrea Bozzo

Guardrail per il ML Tabulare: la prospettiva di un Data Engineer su Data Leakage, Poisoning e Pipeline Fragili

La maggior parte dei fallimenti nelle pipeline ML non nasce da bug esotici del modello, ma da problemi di dati mai codificati come controlli. In questo articolo vediamo come costruire guardrail con pandas, Apache DataFusion, contratti dati e Arrow C Data Interface.

23 marzo 2026 · 13 minuti · 2673 parole · Andrea Bozzo