Inteligência artificial, sem ruído.
Tutoriais5 min

Como rodar o Qwen3.8-27B como agente de código local em 3 comandos

Aprenda a rodar o Qwen3.8-27B como agente de código local usando Ollama e OpenCode em apenas três comandos.

Como rodar o Qwen3.8-27B como agente de código local em 3 comandos

Por que isso importa agora

Rodar um modelo de código localmente costumava exigir configurar servidores de inferência, endpoints e conexões manuais. Com Qwen3.8-27B, Ollama e OpenCode, o processo ficou notavelmente simples — são apenas três comandos para ter um agente de código de IA funcionando na sua máquina, sem nuvem e sem enviar seu código para servidores de terceiros.

O Qwen3.8-27B é um dos modelos locais mais aguardados para programação: é forte em tarefas de código e funciona bem com projetos complexos e codebases grandes. Para quem se preocupa com privacidade do código, custo recorrente de API ou falta de conexão confiável, é uma alternativa concreta ao ChatGPT e ao Claude para tarefas de desenvolvimento.

Prós e contras

✅ O que você ganha:

  • Privacidade total: o modelo e o seu código nunca saem da sua máquina;
  • Sem custo por token: sem assinatura, sem cobrança por uso — só a energia da sua GPU;
  • Setup rápido: três comandos e você está pronto;
  • Ambiente agêntico: o OpenCode dá ao modelo a capacidade de ler, editar e executar código;
  • Funciona offline: depois do download, você não depende de internet.

⚠️ O que você NÃO ganha:

  • O topo do desempenho: modelos locais de 27B não batem os modelos de fronteira em tarefas muito complexas;
  • Controle fino: quem precisa de tuning profundo de inferência pode preferir o llama.cpp;
  • Velocidade de nuvem: a geração depende da sua GPU local.

Requisitos de hardware

ComponenteMínimoRecomendado
GPUNVIDIA com drivers instaladosNVIDIA com 24 GB+ de VRAM
VRAM~18 GB (modelo pode ser dividido com RAM)24 GB ou mais
RAM16 GB32 GB+ (se precisar offload)
SistemaLinux ou WindowsLinux ou Windows com NVIDIA
O modelo tem cerca de 18 GB. Com menos VRAM, o Ollama divide o modelo entre GPU e RAM — funciona, mas fica mais lento.

Passo a passo

Antes de começar: confira seu hardware

O Qwen3.8-27B é um modelo grande. No Linux ou Windows com drivers NVIDIA, rode:

nvidia-smi

Como regra geral, você quer 24 GB de VRAM ou mais para manter o modelo todo na GPU. Se a sua GPU não tiver VRAM suficiente, o Ollama pode dividir o modelo entre GPU e memória do sistema — ainda funciona, mas a geração fica mais lenta.

1. Instalando o Ollama

O Ollama cuida do download e do servidor local do modelo. Instale com:

curl -fsSL https://ollama.com/install.sh | sh

2. Iniciando o Ollama e baixando o Qwen3.8-27B

Inicie o servidor em segundo plano e baixe o modelo (o download de ~18 GB pode demorar):

ollama serve & ollama pull qwen3.8:27b

Mantenha esse terminal aberto para acompanhar os logs do servidor quando o modelo começar a rodar.

3. Lançando o Qwen3.8-27B no OpenCode

Abra um novo terminal e lance o OpenCode com o modelo já selecionado:

ollama launch opencode --model qwen3.8:27b

Se o OpenCode ainda não estiver instalado, o Ollama pergunta se você quer instalá-lo. Depois da instalação, o ambiente abre com o Qwen3.8-27B selecionado — é só dar uma tarefa de código.

No teste do autor, a primeira requisição demorou um pouco mais (o Ollama carrega o modelo em memória), mas, depois de carregado, a velocidade de geração impressiona. Ele pediu um app Python simples e o modelo construiu, testou e devolveu um resumo detalhado do projeto em uma única execução.

Casos de uso reais

  • Refatoração de código legado: peça ao agente para entender e reorganizar um módulo antigo;
  • Revisão de pull requests local: rode uma análise de PR sem enviar o diff para fora;
  • Geração de testes: crie testes unitários para funções existentes;
  • Prototipagem rápida: monte um CRUD ou um script de automação em minutos;
  • Aprendizado de codebases: peça explicações sobre trechos de um projeto grande.

Troubleshooting

  • ❌ “command not found: ollama” → O instalador não adicionou o binário ao PATH. Feche e reabra o terminal, ou adicione o diretório de instalação manualmente.
  • ❌ Download do modelo muito lento ou travado → São ~18 GB; verifique sua conexão e deixe o ollama pull rodando em um terminal dedicado.
  • ❌ Geração muito lenta → O modelo está sendo dividido entre GPU e RAM (offload). Reduza o contexto ou feche outros apps que usam VRAM.
  • ❌ Erro de VRAM insuficiente → Use uma GPU com mais memória ou aceite o offload (mais lento). Monitore com nvidia-smi.
  • ❌ OpenCode não abre → Verifique se o Ollama está rodando (ollama serve) e se o modelo foi baixado com ollama list.

FAQ

Preciso de internet para usar? Só para o download inicial do modelo e da instalação. Depois, o agente roda offline.

Funciona sem GPU NVIDIA? O guia é voltado a GPUs NVIDIA. Em CPU ou GPUs de outros fabricantes, o desempenho cai bastante.

Isso substitui o ChatGPT ou o Claude para programar? Para tarefas do dia a dia, sim — especialmente quando privacidade e custo importam. Para problemas muito complexos, os modelos de fronteira ainda lideram.

Por que não usar o llama.cpp direto? Você pode — o llama.cpp dá controle mais profundo. Este guia é para quem quer o caminho mais curto, sem compilar nada do zero.

O que é o OpenCode? É o ambiente de codificação agêntica que dá ao modelo ferramentas para ler, editar e executar código no seu projeto.

Tendência

A combinação “modelo local + ambiente agêntico + instalação de um comando” é a direção clara do mercado de agentes de código. Conforme os modelos abertos de 20-30B evoluem, a distância para os modelos de nuvem em tarefas de programação diminui — e o custo zero por token torna a opção local cada vez mais competitiva para desenvolvedores individuais e equipes pequenas no Brasil.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.