Plataforma online · offline-first · roda em hardware modesto

Um Modern Data Stack completo, rodando como um motor de Fórmula 1 numa máquina modesta.

A Orbit projeta e opera plataformas de dados ELT de ponta a ponta — headless, containerizadas e orquestradas — sobre a arquitetura Medallion. Sem interfaces pesadas, sem JVM, sem custo de licenciamento: a engenharia de uma stack de nuvem, num único servidor.

+0M
linhas processadas por mês
R$ 0
custo de licenciamento
0%
tempo de atualização
0%
fila de atualização
§ 01O desafio

Empresas desperdiçam dados — porque a alternativa é cara, pesada ou ambas.

Ferramentas de mercado resolvem pedaços do problema cobrando caro por eles. O gargalo real nunca foi a extração; foi a cola — a orquestração resiliente que amarra tudo sem exigir um cluster.

SaaS por volume
Plataformas que cobram por linha ou por crédito transformam uma tabela de milhões de linhas/mês em milhares por ano.
Plataformas pesadas
Algumas ferramentas pedem 16 GB de RAM só para subir a interface; conectores customizados dão mais trabalho que um script enxuto.
Dinossauros de GUI
Suítes gráficas antigas carregam a JVM, notória por devorar memória, e viram diagramas difíceis de versionar e auditar.
A resposta da Orbit
Headless e code-first: o que a GUI faz num prato de espaguete, aqui são poucas linhas — versionáveis, testáveis e portáveis para a nuvem.
§ 02Arquitetura Medallion

Do bruto ao ouro, em camadas de material.

O dado bruto é extraído para um Data Lake; camada a camada, é refinado e ganha pureza — Bronze, Prata, Ouro — até virar a vitrine analítica que o negócio consome.

FONTESAPIs · portaisextract · Python01 · LANDINGraw02 · BRONZE.parquet03 · SILVERcleaned04 · GOLDenrichedVITRINEClickHouse · Superset
04 · Gold

Enriquecido e agregado para o negócio. Servido na vitrine (ClickHouse + Superset) — a camada que a diretoria realmente consome, com medidas padronizadas.

Clique nas camadas para explorar →

§ 03O diferencial de engenharia

Resiliência de sistema industrial, aplicada a dados.

Pipelines tratados como linhas de produção: idempotentes, observáveis e à prova de falha. Onde outros veem código, aqui há tubulações, válvulas de pressão e reservatórios.

01

Processamento vetorizado

Polars e DuckDB processam milhões de linhas por segundo com execução vetorizada e leituras zero-copy — sem alocação desnecessária de memória.

PolarsDuckDBParquet
02

Memória em linha reta

Fatiamento incremental diário e coleta de lixo ativa nivelam o consumo de RAM: o motor fica imune a estouro de memória mesmo em cargas massivas.

micro-batchingGC ativo
03

Idempotência

Rodar o mesmo fluxo dez vezes produz o mesmo estado — sem duplicar dados — via sobrescrita de partições. Reprocessar é seguro por construção.

partition overwrite
04

Concorrência sem colisão

Lock distribuído, fila, retry e recuperação de desastre impedem que dois fluxos corrompam o Data Lake — um semáforo à prova de falhas.

Redis mutexretry
05

Portátil e cloud-ready

Tudo por URIs S3 e variáveis de ambiente. O mesmo código roda no laptop de desenvolvimento e num servidor na nuvem — sem caminhos fixos.

S3 / MinIOcontainers
06

Qualidade como portão

Portões de qualidade, tipagem estrita e testes automatizados barram o dado ruim na fronteira entre camadas, antes de contaminar a análise.

dbt teststhresholds
§ 04Observabilidade

A plataforma sabe como está — e avisa antes de você perguntar.

Saúde de host, de cada container e dos motores de dados em tempo real, sem expor nada para fora. Alertas roteados por domínio e um relatório consultável por IA.

Métricas ponta a ponta

Saúde de host, de cada container por nome e dos motores de dados (banco analítico, cache, storage) em tempo real — tudo offline, sem sign-in de nuvem.

Netdatacollectors

Alertas por domínio

Falhas e limiares viram mensagens instantâneas roteadas por área — o problema chega a quem resolve, sem ninguém ficar olhando painel.

Telegrampor papel

Saúde consultável por IA

Um endpoint local deixa um assistente de IA perguntar "há algum alarme? como está o banco?" e responder com os números reais da operação.

MCPlocal
§ 04.1Prova real

Uma consulta pesada cruzou o limiar — e o sistema avisou sozinho.

Uma consulta longa na tabela de vendas ultrapassou o tempo máximo. O Netdata detectou, alertou no Telegram e avisou de novo quando normalizou — sem ninguém olhando painel. Falhas de pipeline e cargas concluídas chegam pelo mesmo canal, roteadas por domínio.

  • Cargas concluídas confirmadas em tempo real
  • Limiares (ex.: consulta longa) disparam warning
  • Recuperação automática confirmada quando normaliza
  • Falha crítica de pipeline capturada com contexto
🤖
ETL Alerts
bot · online
ETL CONCLUÍDO COM SUCESSO
22:00
Pipeline IPCA · Medallion
Processamento concluído e vitrine de dados atualizada.
Atenção — clickhouse long running query
14:07
clickhouse.longest_running_query_time
Consulta longa detectada = 00:10:02 — acima do limiar configurado.
Recuperado — clickhouse long running query
14:16
clickhouse.longest_running_query_time
Normalizou (esteve em warning por 3 minutos e 30 segundos).
FALHA CRÍTICA NO PIPELINE
03:33
Pipeline (cliente) · Carga Incremental
RuntimeError: timed out waiting for connection. Traceback no painel.

Recriação do canal real · dados anonimizados

§ 05Camada de inteligência

Construir o cano — e a inteligência que sai na ponta dele.

● Em desenvolvimento

Classificação automática de clientes por Machine Learning

Cadastros manuais colocam clientes no grupo de produto errado e distorcem a análise. A solução híbrida combina o código de atividade econômica com embeddings semânticos do nome e recuperação sobre a base já classificada — decidindo, por confiança calibrada, entre classificar sozinha ou enviar à revisão humana. Cada correção realimenta o modelo.

atividade (determinístico)embeddings + kNNconfiança calibradaauto · ou revisão
human-in-the-loopactive learningmonitoramento de driftgovernançadados in-house
§ 06Economia

O trabalho de um cluster, sem a fatura de um cluster.

Ajuste o volume e veja a ordem de grandeza do que uma ferramenta paga por linha custaria — contra licenciamento zero.

11 milhões de linhas / mês
1M5M11M30M80M150M
SaaS pago por volume
~R$ 10.692 /ano
Plataforma thot (open-source)
R$ 0 licenciamento

Estimativa ilustrativa de FinOps (ordem de grandeza), assumindo cobrança por linha processada em ferramentas SaaS. A plataforma roda em um único servidor modesto, sem licenças — o custo real fica na infraestrutura que você já tem.

§ 07Stack

Open-source, do metal ao dashboard.

PythonPolarsDuckDBdbtPrefectMinIO · S3Apache ParquetRedisClickHouseApache SupersetContainersNetdataCI/CDpytest · ruff

Sua empresa tem os dados. Falta a plataforma que os transforma em decisão.

A Orbit constrói do zero ao dashboard — ou moderniza o que você já tem — com custo de infraestrutura mínimo e engenharia de nível industrial.