Como rodar IA no seu PC: guia local com Ollama e llama.cpp

outubro 10, 2026

Se você quer saber como rodar IA no PC sem depender de nuvem, a resposta curta é: instale o Ollama, baixe um modelo aberto com um comando e comece a conversar em minutos. O Ollama instala-se com um único comando em macOS, Windows e Linux e já executa modelos abertos como Gemma, Qwen e DeepSeek dentro da sua máquina. Para controle fino de memória e desempenho máximo, o motor por baixo é o llama.cpp; para escolher o modelo certo, o ponto de partida é o ecossistema do Hugging Face. Este guia separa o papel de cada peça, o que o seu hardware aguenta e onde a maioria das pessoas trava.

Por que rodar IA localmente

Três motivos práticos sustentam a decisão. Primeiro, privacidade: prompts e documentos ficam na sua máquina, sem transitar por servidores de terceiros — um cuidado relevante se você trata dados de clientes e quer reduzir exposição, o que conversa com as regras do AI Act que já valem para quem trabalha com IA. Segundo, custo previsível: depois do investimento em hardware, não há cobrança por token nem surpresa na fatura. Terceiro, funcionar offline, o que importa em conexões instáveis, viagens ou trabalho em campo.

O contraponto precisa ser dito com honestidade: um modelo que cabe confortavelmente num notebook não compete com os maiores modelos de fronteira em raciocínio longo e tarefas complexas. IA local compensa para resumo, rascunho, classificação, chat privado e automações internas — não para substituir tudo o que você faz hoje em servidores remotos.

Ollama: o caminho mais curto

O Ollama empacota o essencial: download de modelos, execução e API, tudo local. O procedimento básico tem três passos:

  1. Instale: no macOS e no Linux, rode curl -fsSL https://ollama.com/install.sh | sh; no Windows, use irm https://ollama.com/install.ps1 | iex.
  2. Execute o primeiro modelo com ollama run gemma4 — o download acontece na primeira execução e depois o modelo fica disponível offline.
  3. Converse pelo terminal ou aponte seus scripts para a API.

Para quem constrói aplicações, a API REST do Ollama responde localmente na porta 11434, o que permite conectar scripts e sistemas próprios sem enviar dados para fora da sua rede. Existem bibliotecas oficiais para Python e JavaScript, além de dezenas de integrações comunitárias, de interfaces web a editores de código. O erro clássico aqui é ignorar o consumo de memória: se o modelo não couber na RAM livre, o sistema recorre ao disco e a experiência degrada rápido.

llama.cpp: controle e desempenho

Quando a necessidade é ir além do empacotado, o llama.cpp é o motor de inferência em C/C++ por trás de boa parte do ecossistema local. O projeto é uma implementação sem dependências externas, com Apple Silicon tratada como cidadã de primeira classe via Metal, kernels próprios para GPUs NVIDIA via CUDA e suporte a placas AMD via HIP. Dois recursos importam para quem decide manualmente: a quantização em inteiros, que reduz o uso de memória e acelera a geração de texto, e a inferência híbrida de CPU e GPU, capaz de acelerar modelos maiores do que a memória de vídeo total da placa — em vez de simplesmente falhar por falta de VRAM.

O projeto traz linha de comando própria (llama cli) e um servidor com API compatível com a da OpenAI (llama serve), o que facilita trocar um backend em nuvem por um local sem reescrever a aplicação. A contrapartida é a curva de aprendizado: compilar, escolher o formato de quantização e ajustar parâmetros de execução exige mais experimentação do que o caminho pronto com Ollama.

Como escolher o modelo

Escolher modelo é onde tempo e dinheiro se ganham ou se perdem. O catálogo e a definição dos modelos vivem no Hugging Face, cuja documentação da biblioteca Transformers explica o papel central dessa peça: a biblioteca Transformers funciona como o pivô entre frameworks de treinamento e motores de inferência como vLLM e o próprio llama.cpp, então um modelo publicado nesse padrão tende a rodar em vários motores sem retrabalho. Antes de baixar, verifique a licença — nem todo conjunto de pesos abertos permite uso comercial — e compare o tamanho do modelo com a RAM disponível. O critério para escolher sem cair em marketing já foi detalhado no nosso guia sobre como escolher IA de pesos abertos sem openwashing.

Comparativo e checklist

FerramentaPapelMelhor paraBarreira
OllamaEmpacotador e API localComeçar hoje e usar no dia a diaBaixa
llama.cppMotor de inferência em C/C++Controle fino, servidores, hardware limitadoMédia
Transformers + HubDefinição e catálogo de modelosEscolher, converter e integrarMédia a alta

Antes de instalar, passe neste checklist (recomendação prática de uso, não benchmark medido):

  • RAM livre confortável para a categoria de modelo escolhida; modelos pequenos cabem em máquinas comuns, os maiores pedem estação de trabalho.
  • Espaço em disco suficiente: cada modelo baixado ocupa alguns gigabytes e eles se acumulam sem aviso.
  • Licença verificada no cartão do modelo, principalmente para uso comercial.
  • Uma tarefa concreta definida — trocar de modelo sem tarefa é o jeito mais rápido de perder tempo.

Feito isso, o caminho é iterativo: comece pelo menor modelo que resolve a sua tarefa, meça a qualidade nas suas próprias entradas e só então escale para modelos maiores ou quantizações mais agressivas.

Fontes