jcloud.ia.br
infraestrutura própria · sem nuvem pública

Um chat com IA que roda inteiramente aqui dentro.

Nada de API paga de terceiro. O modelo de linguagem, o servidor de inferência e o site que você está lendo agora rodam em servidores físicos próprios, orquestrados por OpenStack e Kubernetes, com núcleos de CPU reservados só pra isso.

Abrir o chat modelo: qwen3-8b · inferência: cpu dedicada · rede: privada
o que é isso

Um experimento sério de soberania sobre a própria infraestrutura de IA.

A maioria dos chats com IA depende de uma assinatura de nuvem pública e de GPUs que a gente não controla. Esse projeto testa o caminho oposto: montar, do zero, uma nuvem privada em cima de hardware próprio — via OpenStack — reservar um pedaço isolado e dedicado de CPU dentro de um cluster Kubernetes, e usar essa fatia pra rodar um modelo de linguagem de peso aberto, localmente, através do Ollama.

O resultado é um chat funcional, com resposta em streaming, onde nenhuma mensagem sai da nossa rede. Sem GPU, sem provedor externo, sem dado trafegando pra fora.

como funciona

Do texto que você digita até a resposta na tela.

Você escreve

A interface do chat, em Blazor Server, envia sua mensagem via SignalR pro backend assim que você aperta enviar.

O modelo processa

Um backend em ASP.NET Core encaminha a conversa pro Ollama, que roda o modelo Qwen3-8B num node com núcleos de CPU reservados exclusivamente pra inferência.

A resposta chega em streaming

Cada token gerado é transmitido em tempo real pra tela, sem esperar a resposta inteira ficar pronta.

tecnologia

Ficha técnica da infraestrutura.

OpenStack
Nuvem privada própria, rodando em servidores físicos, com pinning dedicado de CPU pro node de inferência.
Kubernetes
Cluster provisionado via Magnum/Cluster API, com CPU Manager em modo estático e taint dedicado pro workload de IA.
Ollama + Qwen3-8B
Servidor de inferência local, sem GPU, rodando um modelo de peso aberto quantizado pra caber em CPU.
ASP.NET Core
Backend que faz a ponte entre o chat e o Ollama, com streaming, health-check e observabilidade estruturada.
Blazor Server
Interface do chat, com atualização de tela em tempo real via SignalR conforme os tokens chegam.