Inteligência artificial, sem ruído.
Ferramentas e Apps3 min

Hermes Desktop ganha configuração de modelos locais com um clique

Ferramenta open source da Nous Research lê o hardware, escolhe o modelo certo e configura o runtime de inferência automaticamente.

Hermes Desktop ganha configuração de modelos locais com um clique

O que mudou

A parte mais difícil de rodar um modelo de pesos abertos localmente nunca foi o modelo em si, mas tudo o que vem antes: ler especificações de VRAM, adivinhar qual quantização cabe, definir tamanho de contexto e camadas de GPU — e descobrir na hora de carregar que o arquivo é três gigabytes grande demais. A Nous Research condensou essa sequência em um único clique dentro do Hermes Desktop.

O novo fluxo de configuração lê o hardware, seleciona um modelo compatível, baixa os pesos e configura o runtime de inferência automaticamente. O Hermes Desktop é a versão gratuita e licenciada sob MIT do agente open source Hermes, roda em macOS 12+, Windows 10/11 e qualquer distribuição Linux, e não exige conta para modelos locais.

Como funciona na prática

O fluxo aparece automaticamente no primeiro lançamento e pode ser acessado depois em Configurações → Provedores → Modelos Locais. Por baixo dos panos, o Hermes gerencia o motor de inferência: baixa uma versão oficial do llama.cpp compatível com o hardware (algumas centenas de megabytes), verifica a integridade e mantém o runtime atualizado. Os backends cobrem CUDA, Metal, Vulkan, HIP e CPU.

Cada modelo do catálogo é avaliado contra a sua máquina antes do download. Cada linha mostra um veredito de encaixe de memória: verde roda totalmente em memória de GPU, âmbar transborda para a RAM do sistema (mais lento) e vermelho é grande demais para o equipamento. As linhas também exibem a janela de contexto inicial e máxima, além do tamanho do download.

As regras de memória que sustentam tudo

A inferência local vive ou morre pela alocação de memória, e o Hermes não expõe nenhum botão para isso. Os modelos começam com uma janela de contexto que cabe inteiramente na GPU e crescem em direção ao máximo nativo conforme a conversa exige. Todo modelo recomendado garante pelo menos 64K de janela de contexto.

A ordem de offload é a decisão de design mais interessante: quando um modelo excede a memória de GPU, o Hermes coloca o excedente na RAM na ordem que menos prejudica o desempenho — pesos de especialistas primeiro, nunca o cache de atenção. Ele troca vazão para proteger a garantia de contexto. A compressão de conversa só entra em ação quando o modelo atinge a janela máxima.

Na seleção de quantização, a regra é única: o Hermes escolhe a versão de maior qualidade que roda inteiramente na GPU. Há um piso rígido em 4 bits — abaixo disso, a perda de qualidade é considerada severa demais. Modelos que não cabem continuam visíveis, com o motivo anexado, para que você veja exatamente o que mais VRAM compraria. Modelos ociosos são descarregados após 15 minutos e recarregados na próxima mensagem.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.