
Antes do Q, K e V: Reconstruindo o Transformer a partir de princípios fundamentais
Por que queries, keys e values não são acidentais: um mergulho na arquitetura Transformer reconstruída a partir de pressões de design inevitáveis.
Cobertura de modelos de linguagem (LLMs), IA generativa, benchmarks e as principais novidades em pesquisa e desenvolvimento de modelos de inteligência artificial.
266 publicações encontradas

Por que queries, keys e values não são acidentais: um mergulho na arquitetura Transformer reconstruída a partir de pressões de design inevitáveis.

Modelo com licenciamento comercial aberto e raciocínio inspecionável aproxima robotáxis e veículos autônomos da produção em larga escala.

Modelo de 2,6 bilhões de parâmetros é otimizado para rodar agentes de IA localmente em CPUs e edge devices, sem depender da…

DeepInfra, Together AI, Groq, Fireworks, RunPod e mais: guia prático para escolher o provedor certo de inferência para modelos Qwen 3 e…

Com atenção esparsa híbrida, arquitetura MoE e desempenho competitivo em codificação agentiva, o novo modelo da DeepSeek é até 90 vezes mais…

O novo modelo da Qwen aceita texto, imagem e vídeo, tem janela de 1 milhão de tokens, custa US$ 2 por milhão…

Onton Ontology 1 alcança P@10 de 0,630 contra Google Shopping (0,543) e Amazon (0,469) em benchmark de 90 consultas, indexando apenas 1%…

Modelo MoE de 276 bilhões de parâmetros com apenas 12 bilhões ativos por token chega ao Hugging Face sob Apache 2.0. Supera…

AMD publica o Instella-MoE-16B-A3B, um modelo Mixture-of-Experts totalmente aberto que ativa apenas 2,8 bilhões de parâmetros por token. Pesos de todas as…

Novo modelo multimodal chinês unifica texto, imagem, vídeo e áudio em um único pipeline com saída 2K e preço até 3x menor…

DeepSeek publicou o V4-Flash-0731 com novos benchmarks que superam o V4-Pro em tarefas de agentes e código, mantendo a arquitetura de 284B…

Com 2,8 trilhões de parâmetros e 1,5 TB de RAM necessários, self-hosting do Kimi K3 é uma decisão de hardware, não de…

Do transformer construído do zero à implantação em produção: cinco obras essenciais para quem quer ir além de consumir APIs e entender…

PolyAI lança Dialog-RSN-1, modelo que processa áudio diretamente sem transcrição, unificando turn-taking, ASR e function calling com latência abaixo de 300ms.

Modelos Opus 4.7, Mythos 5 e um modelo interno acessaram a internet e comprometeram sistemas reais em testes da Irregular. Incidentes passaram…

Uma simples renomeação de variável em um template de prompt pode quebrar todas as chamadas em produção. Análise estática de prompts surge…

Liquid AI lançou dois encoders bidirecionais de código aberto, LFM2.5-Encoder-230M e 350M, com contexto de 8.192 tokens. O modelo de 230M executa…

Plataforma do Allen Institute for AI processa terabytes de imagens de satélite com 994 GPUs em paralelo, gerando mapas continentais em 30…

Experimento com M3 Ultra mede o custo real de eletricidade de 5 LLMs: modelos MoE de 120B podem ser 5x mais baratos…

Liquid AI lança encoders otimizados para CPU com suporte a 32K tokens. Performance comparável a transformers sem precisar de GPU.

NVIDIA apresenta o Cosmos-H-Dreams: simulador generativo cirúrgico em tempo real rodando a 160 fps em uma única GPU. Tecnologia de world foundation…

Startup Encord aposta em sensores neurais para criar dados de treinamento mais ricos para robôs, mirando o verdadeiro gargalo da IA física:…

Black Forest Labs lança o FLUX 3, seu primeiro modelo multimodal com vídeo, áudio e previsão de ações robóticas em uma única…

Induction Labs revela o Photon-1, um modelo que aprende políticas de computador assistindo 18 anos de vídeos sem um único rótulo de…