
RAG não é o kit completo: as técnicas de NLP que problemas reais ainda precisam
Antes de empilhar LLM com recuperação vetorial, pergunte se a tarefa não é classificação, correspondência ou leitura de tabela. Guia das técnicas…
Cobertura de modelos de linguagem (LLMs), IA generativa, benchmarks e as principais novidades em pesquisa e desenvolvimento de modelos de inteligência artificial.
266 publicações encontradas

Antes de empilhar LLM com recuperação vetorial, pergunte se a tarefa não é classificação, correspondência ou leitura de tabela. Guia das técnicas…

Novo benchmark testa se LLMs conseguem induzir estratégias de raciocínio; método combinado com CoT liderou, mas a estratégia sozinha não superou.

ProViP poda tokens visuais e cabeças de atenção sem treino, acelerando modelos de visão-linguagem em 1,62x e mantendo 95,9% do desempenho.

Z.ai e Alibaba lançaram, com um dia de diferença, modelos de código aberto com receitas quase idênticas: atenção híbrida 3:1, indexador de…

Varejista testou modelos de séries temporais em 25 mil produtos; o Chronos-2 ajustado venceu e cortou a implantação de 6 para 2…

Quantização e poda reduzem em até 8x o tamanho de um LLM. Veja os cinco métodos que times usam em produção —…

Modelo de 2,3 bilhões de parâmetros transforma PDFs, slides e imagens em Markdown estruturado por US$ 1,50 a cada mil páginas, sem…

Modelo multimodal nativo roda em chips chineses e chega com licença MIT, custo de US$ 0,09 por tarefa e desempenho competitivo em…

Modelo MoE de 125B com apenas 6B de parâmetros ativos por token antecipa a arquitetura do Qwen4 e custa cerca de 1/9…

Projeto explora runtime de inferência em CUDA para robôs VLA que decide o que lembrar, o que esquecer e quando não há…

Jie Tang, CEO da Z.ai, argumenta que contar bilhões de parâmetros deixou de ser a régua da IA. O progresso agora está…

Rastreamento de entidades emerge em modelos com 410 milhões de parâmetros e já supera humanos em narrativas naturalistas.

Startup Generalist AI, fundada por ex-DeepMind e Boston Dynamics, demonstra robôs que improvisam e aprendem tarefas novas sem treinamento específico — mas…

Experimento controlado compara um pipeline RAG com o contexto longo do Kimi K3 nas mesmas 12 perguntas. Contexto longo vence em qualidade,…

Um experimento independente colocou RAG e contexto de 1 milhão de tokens frente a frente no Kimi K3. O resultado — e…

Novo modelo TTS da Cartesia lidera os rankings da Artificial Analysis com 1.283 Elo. Latência abaixo de 90 ms e metade do…

Together AI rodou 904 tarefas do DeepSWE: Sol vence no primeiro tiro, mas Pro é 35x mais barato e a cascata Pro→Sol…

Modelo de 27 bilhões de parâmetros alcança a mesma pontuação do GPT-5.6 Luna e fica a um ponto de GLM-5.2 e DeepSeek…

MiniMax lança o MiniMax-Music3, modelo de música com pesos abertos que gera canções completas de até 5 minutos a partir de letra…

Modelo aberto da NVIDIA roda em uma única GPU, ativa só 3 bilhões de parâmetros e reduz o custo de workloads com…

Da estruturação de documentos à rotulagem em massa: três cenários práticos onde um modelo local de até 8 bilhões de parâmetros resolve…

A terceira camada depois de prompt e contexto: como projetar loops de recuperação, terminação e retry que evitam que seu RAG gire…

Pesquisa mostra que a capacidade de resolver problemas reais de código cresceu quase seis vezes por ano e que o custo despencou.

Modelo Apache 2.0 de 27 bilhões de parâmetros roda em hardware de consumo, mas padrão de raciocínio xhigh o faz gastar tempo…