A H Company anunciou em 28 de setembro de 2026 a família Holo4, modelos voltados a agentes que podem alternar entre clicar e digitar em interfaces gráficas, executar código e chamar ferramentas MCP ou APIs. O lançamento interessa menos por prometer um “agente universal” — uma promessa que ainda precisa de cautela — e mais por abrir uma variante comercialmente utilizável, a Holo4 35B-A3B sob licença Apache 2.0, com foco em execução em múltiplas interfaces.
A empresa disponibiliza dois modelos: Holo4 27B, denso e com licença CC BY-NC 4.0, e Holo4 35B-A3B, uma arquitetura mixture-of-experts com 35 bilhões de parâmetros totais e 3 bilhões ativos, licenciada em Apache 2.0. Ambos também podem ser acessados pela H Models API. Para equipes que avaliam automação local, a diferença entre “pesos abertos” e licença comercial é decisiva: apenas a variante 35B-A3B é apresentada pela H como adequada a uso comercial autohospedado.
O que o Holo4 tenta resolver
Agentes corporativos raramente trabalham em uma única superfície. Uma tarefa pode exigir consultar um painel web, ler uma planilha, chamar uma API, escrever um script e voltar à interface gráfica porque o sistema não oferece integração formal. Segundo a H Company, Holo4 foi treinado para escolher entre GUI, código, MCP e APIs usando o mesmo modelo e a mesma interface de chamada.
Essa integração de modalidades não remove a necessidade de arquitetura. Um modelo capaz de clicar em uma tela e chamar uma API tem um raio de ação maior; por isso, permissões, sandboxing, revisão de ações irreversíveis e registros de auditoria tornam-se mais importantes, não menos. A capacidade de atravessar interfaces não deve ser confundida com autorização para operar qualquer sistema.
Modelos, licenças e disponibilidade
| Modelo | Arquitetura | Licença dos pesos | Uso comercial local |
|---|---|---|---|
| Holo4 27B | Denso, 27B | CC BY-NC 4.0 | Não, conforme a licença não comercial |
| Holo4 35B-A3B | MoE, 35B totais / 3B ativos | Apache 2.0 | Sim, conforme a licença |
| Holotron4 Nano | Variante anunciada pela H | Verificar o repositório/model card antes de uso | Depende da licença específica |
A H Company informa contexto de 256 mil tokens na API e pesos em formatos BF16, FP8, NVFP4 e GGUF em sua coleção no Hugging Face. A disponibilidade de formatos não equivale a uma recomendação de hardware: memória, quantização, servidor de inferência, lote e tamanho de contexto definem o custo real. Antes de planejar uma implantação, é necessário testar o modelo e o agente completo no volume, no idioma, na latência e nas ferramentas que serão usados na operação.
Como foram obtidos os resultados divulgados
O treinamento combina fine-tuning supervisionado e reinforcement learning sobre tarefas de desktop, web, MCP/APIs e dispositivos móveis, de acordo com a página técnica da H. A empresa descreve uma “Agentic Task Factory” que produz ambientes, tarefas e verificadores a partir de documentação, capturas de tela e software. Ela afirma que uma tarefa só é mantida quando seu verificador rejeita aproximações e o agente precisa concluí-la pela interface real.
O detalhe metodológico importa porque benchmarks de agentes são sensíveis ao ambiente, ao harness — prompts, ferramentas, memória e controle de fluxo — e ao orçamento de inferência. A H também publicou trajetórias usadas nos resultados em benchmarks públicos. Isso melhora a auditabilidade, mas não substitui replicação independente nem teste em processos empresariais reais.
Benchmarks: resultado promissor, comparação ainda limitada
Na tabela da empresa, Holo4 27B obtém 85,2% no OSWorld, com custo informado de US$ 0,08 por tarefa, e 85,1% no AndroidWorld. No OSWorld 2.0, que mede fluxos de computador mais longos, a pontuação informada é 61,7%, contra 48,0% para a base Qwen3.8 27B na comparação apresentada pela H. O próprio anúncio registra que modelos fechados mais fortes aparecem acima nesse benchmark: Opus 5.5 com 81,8% e outros números obtidos em contextos distintos.
O contraponto mais importante está no AutomationBench. A H informa 45,4% no conjunto público de 600 tarefas, mas reconhece que 480 dessas tarefas pertencem à divisão da qual coletou dados de treinamento. Nos 120 casos descritos como retidos, o número divulgado para Holo4 27B é 49,3%, contra 40,3% para sua base Qwen3.8 27B. A empresa diz que ainda reporta a pontuação do conjunto público até que haja avaliação no conjunto privado oficial.
Essa transparência é melhor do que apresentar o placar público sem contexto, mas impede conclusões amplas sobre desempenho de produção. Resultados entre fornecedores usam harnesses, esforço de inferência, número de tentativas e custos de token diferentes. Eles devem orientar hipóteses de teste, não decidir uma compra ou migração sem validação independente.
Impacto prático para empresas brasileiras
Para empresas que dependem de softwares sem API, um agente que combina visão e controle de interface pode automatizar partes de rotinas de backoffice, suporte ou operações. Para times com exigência de dados locais ou personalização do ambiente, a licença Apache 2.0 do Holo4 35B-A3B abre uma alternativa de avaliação autohospedada. Nenhuma dessas possibilidades elimina o custo de adaptar o ambiente, manter observabilidade e lidar com mudanças de interface.
O teste responsável começa pequeno: escolha uma tarefa reversível, com dados sintéticos ou de baixo risco; defina ações permitidas; registre cada chamada de ferramenta e interação de GUI; e compare taxa de sucesso, duração, custo e intervenção humana com o processo atual. Só depois faça uma prova de conceito em dados reais, mantendo aprovação humana para pagamentos, exclusões, envio externo ou alterações cadastrais.
Limitações que não podem ser ignoradas
- Benchmark não é processo real: telas, permissões, dados inconsistentes e exceções humanas não aparecem integralmente em conjuntos controlados.
- Licenças variam por modelo: “open weight” não significa automaticamente uso comercial irrestrito.
- Agentes de interface são frágeis: uma mudança visual pode reduzir desempenho; uma API com escopo estreito costuma ser mais previsível quando existe.
- Segurança depende do sistema: o modelo não substitui autorização, isolamento, validação de parâmetros ou revisão humana.
Análise do NoticIA: o avanço está na integração, não no placar isolado
Na análise do NoticIA, Holo4 é relevante porque oferece uma alternativa aberta para a camada que orquestra interfaces heterogêneas. O interesse não está em declarar que um benchmark resolve automação empresarial, mas em tornar testável uma hipótese: um modelo menor e autohospedável pode atender parte dos fluxos que hoje exigem modelos proprietários caros.
O anúncio também ilustra por que avaliação de agentes precisa ser mais rigorosa. O valor de um score depende do conjunto, da exposição do treino, do harness e do custo para repetir a trajetória. A ressalva da própria H sobre AutomationBench deve acompanhar qualquer leitura do resultado. Para o comprador, a pergunta útil é “ele conclui meu fluxo, com minhas permissões e meu limite de custo?”, não “qual número ficou maior em uma tabela”.
Conclusão
Holo4 amplia as opções para agentes que precisam operar além de uma única API ou uma única tela, e a licença Apache 2.0 do modelo 35B-A3B é o elemento mais concreto para adoção comercial local. Os números publicados são um ponto de partida, não uma garantia. O próximo passo responsável é reproduzir tarefas próprias, com controles de segurança e critérios de sucesso definidos antes de conceder qualquer autonomia operacional.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



