Inteligência artificial, sem ruído.
Tutoriais3 min

Como Construir Sistemas de IA Locais com Qwen3.6 e MCP: Guia Prático Passo a Passo

Tutorial prático mostra como construir um assistente de código local com Qwen3.6-35B-A3B e MCP: do hardware necessário ao agente que cria pull requests sem depender de nuvem.

Como Construir Sistemas de IA Locais com Qwen3.6 e MCP: Guia Prático Passo a Passo
Imagem de apoio. Fonte: KDnuggets.

Um tutorial detalhado publicado no KDnuggets mostra como construir um assistente de desenvolvimento local completo usando Qwen3.6-35B-A3B e o Model Context Protocol (MCP) — totalmente offline, sem dependência de nuvem. O guia cobre desde a arquitetura do modelo até a criação de um agente que lê issues do GitHub, analisa código, escreve correções e abre pull requests.

Por que MCP resolve o problema de ferramentas

O MCP, padrão aberto da Anthropic, elimina a necessidade de escrever wrappers Python customizados para cada ferramenta. Defina um servidor MCP uma vez e qualquer cliente compatível — qualquer modelo, qualquer framework — descobre e chama as ferramentas sem código de integração adicional. Para um agente que precisa consultar banco de dados, abrir issues no GitHub ou chamar APIs internas, isso elimina semanas de trabalho de glue code.

Qwen3.6-35B-A3B: o modelo certo para agentes locais

O Qwen3.6 tem 35 bilhões de parâmetros totais mas ativa apenas 3 bilhões por forward pass graças à arquitetura Mixture of Experts com 256 especialistas por camada. Na prática, você roda um modelo com capacidade de 35B ao custo computacional de um de 3B. A janela de contexto nativa é de 262 mil tokens, expansível para 1 milhão com YaRN scaling — essencial para agentes que leem centenas de arquivos de código mantendo histórico de ferramentas.

A arquitetura interna mescla camadas Gated DeltaNet (atenção linear, eficiente em sequências longas) com camadas Gated Attention (raciocínio relacional profundo) numa proporção de 3:1. Para um agente trabalhando em um repositório de 500 arquivos, isso significa processamento eficiente em contexto longo combinado com raciocínio preciso nas seções relevantes.

Hardware necessário

Três cenários realistas de deploy:

  • GPU dedicada: Q4 quantization cabe em uma RTX 4090 (24 GB) ou duas RTX 3090 com tensor parallelism. Uma A100 80 GB roda o modelo completo em bfloat16.
  • KTransformers: para quem não tem GPU de 24 GB, offload das camadas pesadas para GPU quando disponível e executa o resto em CPU. Com 64 GB de RAM, latência de 30-120 segundos por turno — aceitável para análise de repositórios em background.
  • llama.cpp: arquitetura GGUF para usuários sem GPU, embora o artigo alerte que o throughput é baixo para tarefas interativas.

Configurando o assistente GitHub

O tutorial monta um pipeline onde o agente: (1) descobre issues abertas via MCP servidor GitHub, (2) analisa o código relevante no repositório, (3) elabora um plano de correção, (4) implementa as mudanças, e (5) cria um pull request. A chave é que o Qwen3.6 retém reasoning traces entre turnos com um flag dedicado, mantendo o plano inicial no KV cache enquanto executa chamadas de ferramenta nos turnos seguintes.

Limitações e considerações

O artigo é honesto sobre onde o setup local ainda perde para APIs cloud: latência mais alta, necessidade de hardware dedicado e curadoria manual dos servidores MCP. Para tarefas interativas de coding, modelos hospedados ainda têm vantagem. Mas para automação assíncrona — revisão de PR, análise de repositório, geração de documentação — o stack Qwen3.6 + MCP é funcional, privado e não incorre em custo de API.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.