Skip to content

IA / ML · Em profundidade

O seu hardware. Os seus modelos. Os seus dados.

Desenhamos e implementamos IA que corre em máquinas que controla. Modelos locais de pesos abertos, sem APIs de terceiros, para que os dados sensíveis fiquem no seu ambiente e os custos se mantenham previsíveis.

O que significa, na prática, IA local (on-premise)?

Significa que o modelo corre em hardware que controla, em vez de ficar atrás da API de outra empresa. Modelos de pesos abertos como o Llama e o Gemma já chegam para a maioria das tarefas de produção que não exigem raciocínio de fronteira, e runtimes como o Ollama e o llama.cpp tornam o serving uma questão de um comando. A quantização, correr um modelo a 4-bit em vez de 16-bit, reduz a memória necessária para cerca de um quarto, pelo que um modelo de 27 mil milhões de parâmetros cabe numa única GPU prosumer ou num Mac com memória unificada suficiente. Uma máquina intermédia trata de classificação, extração e redação a velocidade interativa. Não é um laboratório. É uma secretária.

Também não tem de significar uma sala de servidores. Alguns modelos correm em hardware seu; outros podem correr em infraestrutura privada ou em GPUs na nuvem, em contas que controla. Em qualquer dos casos, os seus dados nunca passam por uma API de IA de terceiros.

Que problemas resolve?

01

Os seus dados ficam no seu ambiente

No momento em que um registo de cliente, um contrato ou uma nota médica sai da sua rede para uma API externa, criou uma superfície de conformidade pela qual terá de responder. A inferência local elimina a questão: nada sai. Para trabalho abrangido pelo RGPD, e para clientes que não querem os seus dados a treinar o próximo modelo de outra empresa, isto não é uma funcionalidade. É o requisito.

02

Os custos passam a ser fixos e conhecidos

O preço por token funciona até o volume crescer, e depois torna-se um imposto que escala com o seu sucesso. A inferência local custa o que custam o hardware e a eletricidade. A partir de um certo uso, ser dono da computação fica mais barato, e a curva de custos é plana em vez de crescente.

03

Nenhum fornecedor lhe tira o chão

As APIs alojadas descontinuam modelos, mudam preços, impõem limites no pior momento e, de vez em quando, ficam em baixo. Um modelo no seu hardware comporta-se hoje como há seis meses, porque são os mesmos pesos no mesmo silício. Essa reprodutibilidade conta quando está a construir algo que pretende manter.

Quais são os compromissos, com honestidade?

Os modelos alojados de fronteira continuam à frente no raciocínio mais difícil, no contexto mais longo e no conhecimento mais obscuro. Se o seu produto vive ou morre nessa fatia de capacidade, uma API é a ferramenta certa, e dir-lhe-emos isso mesmo.

Também fica com o hardware a seu cargo. Algo tem de correr, manter-se atualizado e ser monitorizado. É trabalho operacional real, embora muito menor do que a maioria das equipas receia, depois de bem montado.

E os modelos locais mais pequenos recompensam boa engenharia. Um modelo 7B com retrieval limpo, prompts precisos e uma tarefa restrita supera um modelo gigante apontado a uma tarefa vaga. O trabalho passa de pagar por um modelo maior para desenhar bem o sistema, que é o trabalho que preferimos.

Onde é que isto já corre?

O nosso laboratório é a prova permanente: quatro máquinas numa mesh privada Tailscale, sem IPs públicos, a correr modelos das famílias Gemma e Llama através do Ollama em Apple Silicon, mais um desktop com GPU que só acorda para rendering pesado. Os nós ativos ficam em repouso entre poucos watts e a casa das dezenas baixas.

Ver o hardware

Também chega a projetos reais. Um trabalho recente serve um site 3D em tempo real em cinco línguas, todas traduzidas por um modelo a correr localmente através do Ollama, com custo de API zero.

Ler o caso de estudo

Quando é a escolha certa?

Um teste simples. A IA local tende a ganhar quando pelo menos uma destas condições se verifica:

  • Os dados são sensíveis, regulados ou, por contrato, não podem sair do seu ambiente.
  • O volume é suficiente para o custo por token ser uma rubrica real.
  • Precisa de comportamento estável e reprodutível ao longo do tempo.
  • A tarefa é bem definida (extração, classificação, pesquisa, tradução, redação, encaminhamento) e não raciocínio de fronteira em aberto.

Se nenhuma se verificar, use uma API e siga em frente; dir-lhe-emos isso na primeira conversa. Se uma ou mais se verificarem, correr os modelos por conta própria costuma ser o caminho mais calmo, mais barato e mais defensável, e é o que sabemos construir.

Onde a maioria dos clientes começa

O Piloto de IA Soberana

Em duas a três semanas, pegamos num fluxo de trabalho real do seu negócio e pomo-lo a correr em IA que é sua. Âmbito fechado, um fluxo, uma resposta clara.

Os seus dados nunca saem do seu controlo, desde o primeiro dia do piloto.

Âmbito fechado · 2–3 semanas · A proposta diz o número

1

Um protótipo funcional no seu hardware, ou temporariamente no nosso

2

Um relatório em linguagem simples do que resultou e do que custaria pôr a correr a sério

3

Uma recomendação de avançar ou não avançar em que pode confiar, incluindo "não faça isto" se essa for a resposta honesta

Começar com um piloto

FAQ

Perguntas frequentes.

Que hardware exige a IA local?

Na prática: uma máquina dimensionada para o modelo (uma torre com GPU ou Apple Silicon com memória unificada suficiente), o Ollama como runtime, uma pequena fila à frente e modelos abertos quantizados com margem de sobra. A pesquisa sobre os seus próprios documentos e uma API interna fina completam o quadro; o resto do seu sistema nunca precisa de saber onde vive o modelo.

IA local significa ter uma sala de servidores?

Não. Os modelos podem correr em hardware seu, ou em infraestrutura privada e GPUs na nuvem, em contas que controla. Em qualquer dos casos, os seus dados nunca passam por uma API de IA de terceiros, e é essa a parte que conta.

Quem fica dono do sistema que constroem?

É seu. O código, a configuração dos modelos, as contas e os dados são-lhe entregues por inteiro no lançamento, pelo que o sistema nunca depende de nós para continuar a funcionar.

Tem dados que não podem sair de casa?