Inteligência artificial, sem ruído.
Tutoriais5 min

Como rodar o modelo de código Qwythos-9B localmente com llama.cpp e Pi

Tutorial completo: execute o modelo reforçado pelo Mythos 5 na sua GPU, conecte ao agente Pi e tenha um assistente de código 100% local.

Como rodar o modelo de código Qwythos-9B localmente com llama.cpp e Pi

Execute o modelo de código Qwythos localmente com llama.cpp e Pi

Rodar um modelo de IA decente para codificação no seu próprio computador já foi coisa de data center. Não mais. O Qwythos-9B-Claude-Mythos-5-1M, um modelo de raciocínio e código de 9 bilhões de parâmetros baseado no Qwen3.5, cabe em uma GPU de consumo e pode ser conectado ao agente de codificação Pi para um workflow de desenvolvimento local rápido e privado. Este guia mostra o passo a passo completo — da instalação ao primeiro commit assistido.

✅ O que você ganha

  • Execução 100% local — zero custo de API, zero latência de rede, zero telemetria
  • Qualidade de código reforçada por destilação do Mythos 5 da Anthropic
  • Compatibilidade com OpenAI API — qualquer ferramenta que fale com GPT pode falar com Qwythos
  • MTP speculative decoding para geração mais rápida de tokens
  • Privacidade total do código — nada sai da sua máquina

⚠️ O que você NÃO ganha

  • Não substitui modelos de 70B+ em tarefas de raciocínio complexo
  • GPU com pelo menos 8 GB de VRAM é recomendada (Q4_K_M)
  • O setup inicial exige familiaridade com terminal

Pré-requisitos

ComponenteMínimoRecomendadoIdeal
GPU VRAM8 GB (Q4_K_M)12 GB (Q5_K_M)16 GB (Q6_K_M)
RAM do sistema16 GB32 GB64 GB
Armazenamento10 GB livres20 GB50 GB (cache HF)
Conhecimento prévioTerminal básicoPython e GitLLM, quantização
Tempo estimado30 min20 min15 min
Sistema operacionalLinux / macOSWindows WSL2Linux nativo
Requisitos para rodar Qwythos-9B localmente

Passo 1: Instale o llama.cpp

O llama.cpp é o runtime mais maduro para rodar LLMs localmente. Suporta quantização GGUF, offloading de GPU e MTP speculative decoding. A instalação é um comando:

curl -LsSf https://llama.app/install.sh | sh

Adicione ao PATH para acesso global:

echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc
source ~/.bashrc

Verificação: execute llama help. Se aparecer a lista de comandos disponíveis, a instalação foi bem-sucedida.

Passo 2: Configure o cache do Hugging Face

Defina um diretório com espaço suficiente para os modelos. Em máquinas com pouco espaço no diretório home, redirecione o cache:

export HF_HOME="/workspace/huggingface"
mkdir -p "$HF_HOME"
echo 'export HF_HOME="/workspace/huggingface"' >> ~/.bashrc

Passo 3: Inicie o modelo Qwythos-9B

O comando abaixo baixa automaticamente o modelo GGUF quantizado do Hugging Face e inicia um servidor local com API compatível com OpenAI:

llama serve \
  -hf "empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:MTP-Q6_K" \
  --alias "qwythos-9b-mtp" \
  --host 0.0.0.0 \
  --port 8910 \
  --n-gpu-layers all \
  --ctx-size 100000 \
  --parallel 1 \
  --batch-size 1024 \
  --ubatch-size 512 \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --spec-type draft-mtp \
  --spec-draft-n-max 6 \
  --threads 12 \
  --threads-batch 24 \
  --temp 0.6 \
  --top-p 0.95 \
  --top-k 20 \
  --repeat-penalty 1.05 \
  --jinja \
  --perf

Flags mais importantes explicadas:

FlagFunção
--n-gpu-layers allCarrega todas as camadas na GPU para velocidade máxima
--ctx-size 100000Janela de contexto de 100K tokens (código de projetos grandes)
--spec-type draft-mtpAtiva MTP speculative decoding — acelera geração em ~30%
--flash-attn onAtenção otimizada que reduz uso de VRAM
--cache-type-k q8_0Cache KV quantizado em 8 bits — economiza VRAM
Principais flags do llama serve

Após iniciar, acesse a interface web em http://localhost:8910 e a API em http://localhost:8910/v1.

Passo 4: Conecte ao Pi (agente de codificação)

O Pi é um agente de codificação que suporta qualquer backend compatível com OpenAI API. Configure-o para usar seu modelo local:

# No arquivo de configuração do Pi (~/.config/pi/config.toml)
[model]
provider = "openai_compatible"
api_base = "http://localhost:8910/v1"
api_key = "not-needed"
model = "qwythos-9b-mtp"

Agora o Pi usará o Qwythos para sugestões de código, correções e explicações — tudo local, sem latência de rede.

Troubleshooting

  • ❌ VRAM insuficiente: reduza --ctx-size para 32768. Se ainda falhar, mude para Q4_K_M: -hf "empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:Q4_K_M"
  • ❌ Download do modelo falhou: verifique se o HF_HOME tem permissão de escrita e espaço em disco
  • ❌ Geração lenta: confirme que --spec-type draft-mtp está ativo e --flash-attn on está habilitado
  • ❌ API não responde: verifique se a porta 8910 está livre e se o servidor carregou completamente o modelo
  • ❌ Pi não conecta: teste a API diretamente: curl http://localhost:8910/v1/models

FAQ

Posso rodar sem GPU? Sim, mas a velocidade será de 1-2 tokens/segundo usando CPU. Remova --n-gpu-layers all e o modelo usará RAM do sistema.

Qual a diferença entre Q4_K_M e Q6_K? Q4 usa 4 bits por peso (~5 GB), Q6 usa 6 bits (~7 GB). Q6 tem melhor qualidade de raciocínio, Q4 é mais rápido e cabe em GPUs menores.

Funciona no Windows? Sim, via WSL2. O llama.cpp tem suporte nativo para CUDA no Windows, mas a instalação via script shell requer WSL2.

O MTP speculative decoding faz diferença real? Sim, acelera a geração em aproximadamente 30% em tarefas de código sem perda de qualidade. O modelo gera múltiplos tokens candidatos e valida em paralelo.

Posso usar em produção? Para desenvolvimento local e prototipação, sim. Para produção com múltiplos usuários, considere uma GPU dedicada (A100 ou superior) e balanceamento de carga.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.