Um chat com IA que roda inteiramente aqui dentro.
Nada de API paga de terceiro. O modelo de linguagem, o servidor de inferência e o site que você está lendo agora rodam em servidores físicos próprios, orquestrados por OpenStack e Kubernetes, com núcleos de CPU reservados só pra isso.
Um experimento sério de soberania sobre a própria infraestrutura de IA.
A maioria dos chats com IA depende de uma assinatura de nuvem pública e de GPUs que a gente não controla. Esse projeto testa o caminho oposto: montar, do zero, uma nuvem privada em cima de hardware próprio — via OpenStack — reservar um pedaço isolado e dedicado de CPU dentro de um cluster Kubernetes, e usar essa fatia pra rodar um modelo de linguagem de peso aberto, localmente, através do Ollama.
O resultado é um chat funcional, com resposta em streaming, onde nenhuma mensagem sai da nossa rede. Sem GPU, sem provedor externo, sem dado trafegando pra fora.
Do texto que você digita até a resposta na tela.
Você escreve
A interface do chat, em Blazor Server, envia sua mensagem via SignalR pro backend assim que você aperta enviar.
O modelo processa
Um backend em ASP.NET Core encaminha a conversa pro Ollama, que roda o modelo Qwen3-8B num node com núcleos de CPU reservados exclusivamente pra inferência.
A resposta chega em streaming
Cada token gerado é transmitido em tempo real pra tela, sem esperar a resposta inteira ficar pronta.
Ficha técnica da infraestrutura.
- OpenStack
- Nuvem privada própria, rodando em servidores físicos, com pinning dedicado de CPU pro node de inferência.
- Kubernetes
- Cluster provisionado via Magnum/Cluster API, com CPU Manager em modo estático e taint dedicado pro workload de IA.
- Ollama + Qwen3-8B
- Servidor de inferência local, sem GPU, rodando um modelo de peso aberto quantizado pra caber em CPU.
- ASP.NET Core
- Backend que faz a ponte entre o chat e o Ollama, com streaming, health-check e observabilidade estruturada.
- Blazor Server
- Interface do chat, com atualização de tela em tempo real via SignalR conforme os tokens chegam.