
Muon: otimizador reduz interferência entre tarefas e melhora fusão de modelos em até 5 pontos
Estudo mostra que o otimizador Muon controla a norma espectral por construção e supera o AdamW em fusão de modelos e aprendizado…
Cobertura de modelos de linguagem (LLMs), IA generativa, benchmarks e as principais novidades em pesquisa e desenvolvimento de modelos de inteligência artificial.
257 publicações encontradas

Estudo mostra que o otimizador Muon controla a norma espectral por construção e supera o AdamW em fusão de modelos e aprendizado…

Técnica substitui a projeção densa de saída por busca aproximada em índice HNSW e acelera a decodificação em CPU sem perder qualidade.

Banach-KAN lidera em benchmarks limpos, mas se degrada mais rápido sob ruído do que as variantes ℓp-KAN e Tanh-KAN.

Modelos abertos jogam pior em alguns idiomas; inglês foi forte, hebraico fraco, e Qwen3-4B mostrou a hierarquia mais acentuada.

Audit com seis encoders mostra acordo intermediário dos VLMs sobre qualidades afetivas de objetos 3D, com variação por categoria.

MAGNITUDE, WANDA ou SparseGPT? Estudo mede qual método de poda preserva a interpretabilidade dos modelos de linguagem.

Autodestilação pode inflar o pass@1 e esconder a perda de diversidade funcional. Revisão mapeia as três alavancas do problema.

Estudo testou como empacotar o texto em grafos de conhecimento multimodais e descobriu que contexto no nível da frase supera parágrafos completos.

Difusão guiada por incerteza restaura detalhe só onde a reconstrução é duvidosa, melhorando o equilíbrio entre fidelidade e qualidade.

Sistema de síntese de dados que se autoavalia em loop fechado elevou o Qwen3.5-4B no benchmark MM-IFEval sem anotação humana.

Método de decodificação especulativa reduz o custo computacional de LLMs agentivos a 20–30% mantendo cerca de 90% da precisão.

Novo LLM de pesos abertos da Tencent tem 49 bilhões de parâmetros ativos e apenas dois níveis de esforço de raciocínio; salto…

MirroS lança abordagem que representa cenas físicas como código executável — não como pixels — e modelo aberto supera o Gemini 3.1…

Pipeline da Ant Group sintetiza casos de teste de programas com defeitos e usa recompensa densa; LiveCodeBench 68,39 e percentil 94,67 no…

Método ligado à Tencent roteia o sinal de aprendizado para as ações que de fato influenciaram o resultado; ganho de 12,57 pontos…

Antes de empilhar LLM com recuperação vetorial, pergunte se a tarefa não é classificação, correspondência ou leitura de tabela. Guia das técnicas…

Novo benchmark testa se LLMs conseguem induzir estratégias de raciocínio; método combinado com CoT liderou, mas a estratégia sozinha não superou.

ProViP poda tokens visuais e cabeças de atenção sem treino, acelerando modelos de visão-linguagem em 1,62x e mantendo 95,9% do desempenho.

Z.ai e Alibaba lançaram, com um dia de diferença, modelos de código aberto com receitas quase idênticas: atenção híbrida 3:1, indexador de…

Varejista testou modelos de séries temporais em 25 mil produtos; o Chronos-2 ajustado venceu e cortou a implantação de 6 para 2…

Quantização e poda reduzem em até 8x o tamanho de um LLM. Veja os cinco métodos que times usam em produção —…

Modelo de 2,3 bilhões de parâmetros transforma PDFs, slides e imagens em Markdown estruturado por US$ 1,50 a cada mil páginas, sem…

Modelo multimodal nativo roda em chips chineses e chega com licença MIT, custo de US$ 0,09 por tarefa e desempenho competitivo em…

Modelo MoE de 125B com apenas 6B de parâmetros ativos por token antecipa a arquitetura do Qwen4 e custa cerca de 1/9…