Execute o modelo de código Qwythos localmente com llama.cpp e Pi
Rodar um modelo de IA decente para codificação no seu próprio computador já foi coisa de data center. Não mais. O Qwythos-9B-Claude-Mythos-5-1M, um modelo de raciocínio e código de 9 bilhões de parâmetros baseado no Qwen3.5, cabe em uma GPU de consumo e pode ser conectado ao agente de codificação Pi para um workflow de desenvolvimento local rápido e privado. Este guia mostra o passo a passo completo — da instalação ao primeiro commit assistido.
✅ O que você ganha
- Execução 100% local — zero custo de API, zero latência de rede, zero telemetria
- Qualidade de código reforçada por destilação do Mythos 5 da Anthropic
- Compatibilidade com OpenAI API — qualquer ferramenta que fale com GPT pode falar com Qwythos
- MTP speculative decoding para geração mais rápida de tokens
- Privacidade total do código — nada sai da sua máquina
⚠️ O que você NÃO ganha
- Não substitui modelos de 70B+ em tarefas de raciocínio complexo
- GPU com pelo menos 8 GB de VRAM é recomendada (Q4_K_M)
- O setup inicial exige familiaridade com terminal
Pré-requisitos
| Componente | Mínimo | Recomendado | Ideal |
|---|---|---|---|
| GPU VRAM | 8 GB (Q4_K_M) | 12 GB (Q5_K_M) | 16 GB (Q6_K_M) |
| RAM do sistema | 16 GB | 32 GB | 64 GB |
| Armazenamento | 10 GB livres | 20 GB | 50 GB (cache HF) |
| Conhecimento prévio | Terminal básico | Python e Git | LLM, quantização |
| Tempo estimado | 30 min | 20 min | 15 min |
| Sistema operacional | Linux / macOS | Windows WSL2 | Linux nativo |
Passo 1: Instale o llama.cpp
O llama.cpp é o runtime mais maduro para rodar LLMs localmente. Suporta quantização GGUF, offloading de GPU e MTP speculative decoding. A instalação é um comando:
curl -LsSf https://llama.app/install.sh | shAdicione ao PATH para acesso global:
echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc
source ~/.bashrcVerificação: execute llama help. Se aparecer a lista de comandos disponíveis, a instalação foi bem-sucedida.
Passo 2: Configure o cache do Hugging Face
Defina um diretório com espaço suficiente para os modelos. Em máquinas com pouco espaço no diretório home, redirecione o cache:
export HF_HOME="/workspace/huggingface"
mkdir -p "$HF_HOME"
echo 'export HF_HOME="/workspace/huggingface"' >> ~/.bashrcPasso 3: Inicie o modelo Qwythos-9B
O comando abaixo baixa automaticamente o modelo GGUF quantizado do Hugging Face e inicia um servidor local com API compatível com OpenAI:
llama serve \
-hf "empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:MTP-Q6_K" \
--alias "qwythos-9b-mtp" \
--host 0.0.0.0 \
--port 8910 \
--n-gpu-layers all \
--ctx-size 100000 \
--parallel 1 \
--batch-size 1024 \
--ubatch-size 512 \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--spec-type draft-mtp \
--spec-draft-n-max 6 \
--threads 12 \
--threads-batch 24 \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--repeat-penalty 1.05 \
--jinja \
--perfFlags mais importantes explicadas:
| Flag | Função |
|---|---|
--n-gpu-layers all | Carrega todas as camadas na GPU para velocidade máxima |
--ctx-size 100000 | Janela de contexto de 100K tokens (código de projetos grandes) |
--spec-type draft-mtp | Ativa MTP speculative decoding — acelera geração em ~30% |
--flash-attn on | Atenção otimizada que reduz uso de VRAM |
--cache-type-k q8_0 | Cache KV quantizado em 8 bits — economiza VRAM |
Após iniciar, acesse a interface web em http://localhost:8910 e a API em http://localhost:8910/v1.
Passo 4: Conecte ao Pi (agente de codificação)
O Pi é um agente de codificação que suporta qualquer backend compatível com OpenAI API. Configure-o para usar seu modelo local:
# No arquivo de configuração do Pi (~/.config/pi/config.toml)
[model]
provider = "openai_compatible"
api_base = "http://localhost:8910/v1"
api_key = "not-needed"
model = "qwythos-9b-mtp"Agora o Pi usará o Qwythos para sugestões de código, correções e explicações — tudo local, sem latência de rede.
Troubleshooting
- ❌ VRAM insuficiente: reduza
--ctx-sizepara 32768. Se ainda falhar, mude para Q4_K_M:-hf "empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:Q4_K_M" - ❌ Download do modelo falhou: verifique se o
HF_HOMEtem permissão de escrita e espaço em disco - ❌ Geração lenta: confirme que
--spec-type draft-mtpestá ativo e--flash-attn onestá habilitado - ❌ API não responde: verifique se a porta 8910 está livre e se o servidor carregou completamente o modelo
- ❌ Pi não conecta: teste a API diretamente:
curl http://localhost:8910/v1/models
FAQ
Posso rodar sem GPU? Sim, mas a velocidade será de 1-2 tokens/segundo usando CPU. Remova --n-gpu-layers all e o modelo usará RAM do sistema.
Qual a diferença entre Q4_K_M e Q6_K? Q4 usa 4 bits por peso (~5 GB), Q6 usa 6 bits (~7 GB). Q6 tem melhor qualidade de raciocínio, Q4 é mais rápido e cabe em GPUs menores.
Funciona no Windows? Sim, via WSL2. O llama.cpp tem suporte nativo para CUDA no Windows, mas a instalação via script shell requer WSL2.
O MTP speculative decoding faz diferença real? Sim, acelera a geração em aproximadamente 30% em tarefas de código sem perda de qualidade. O modelo gera múltiplos tokens candidatos e valida em paralelo.
Posso usar em produção? Para desenvolvimento local e prototipação, sim. Para produção com múltiplos usuários, considere uma GPU dedicada (A100 ou superior) e balanceamento de carga.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



