
Decodificação especulativa no vLLM: um guia prático de configuração e decisão
Guia prático sobre decodificação especulativa no vLLM: como escolher o modelo draft, calcular o custo de VRAM, entender o impacto da temperatura…
33 publicações encontradas

Guia prático sobre decodificação especulativa no vLLM: como escolher o modelo draft, calcular o custo de VRAM, entender o impacto da temperatura…

O design de proteínas é um processo intensivo em computação, especialmente quando se busca gerar milhares de candidatos a ligantes. O BoltzGen,…

A Outpost VFX, estúdio de efeitos visuais com operações no Reino Unido, Canadá e Índia, conseguiu reduzir o tempo de treinamento de…

Stack de inferência da NVIDIA reduz custo por token em 5x na plataforma Blackwell. Baseten, Cognition, Deep Infra e Together AI já…
MoonMath AI lança kernel de atenção open-source para AMD MI300X que supera o AITER v3 em todos os cenários Um time de…

A NVIDIA acaba de varrer o MLPerf Training 6.0 , o principal benchmark da indústria para treinamento de modelos de IA. A…

Pesquisadores acabam de lançar o Flash-KMeans , uma implementação exata do algoritmo k-means de Lloyd que roda mais de 200× mais rápido…
Para quem trabalha com grandes modelos de linguagem (LLMs) em instâncias GPU da AWS, o tempo de carregamento do modelo na memória…
Novas soluções da AWS para garantir capacidade GPU de curto prazo para workloads de Machine Learning A crescente demanda por GPUs para…
A Amazon Web Services (AWS) anunciou uma novidade importante para usuários do Amazon SageMaker AI: a introdução do recurso capacity aware instance…
O desafio dos modelos de IA em larga escala Os modelos de inteligência artificial (IA) têm crescido rapidamente em tamanho e complexidade.…
Meta aposta em CPUs ARM da Amazon para impulsionar suas demandas em IA A Meta firmou um acordo significativo com a Amazon…
Demanda crescente por GPUs na astronomia impulsionada por telescópios espaciais A NASA anunciou o lançamento antecipado do telescópio espacial Nancy…
Transcrição automática de áudio com custo reduzido e alta escala Empresas que gerenciam grandes bibliotecas de mídia, analisam gravações de centrais…
De marca de calçados a provedor de serviços de IA: a transformação da Allbirds A tradicional empresa de calçados Allbirds, conhecida por…
Amazon SageMaker HyperPod: inovação para inferência em IA generativa A AWS lançou o Amazon SageMaker HyperPod, uma solução completa para executar…
Pesquisadores da Universidade da Califórnia em San Diego (UC San Diego) desenvolveram um novo chip que pode revolucionar a eficiência energética dos…
A Hugging Face, por meio do projeto Overworld, lançou o Waypoint-1.5, uma evolução significativa em modelos de vídeo gerativos em tempo real…
A CoreWeave, empresa inicialmente focada em GPU-as-a-service e com forte ligação à Nvidia, está passando por uma nova transformação estratégica ao…
Desafios dos data centers tradicionais para IA Os data centers convencionais protegem seus equipamentos caros por meio de estruturas robustas de aço…
Contexto do investimento e desafio do mercado de IA O crescimento acelerado da inteligência artificial tem impulsionado uma demanda sem precedentes…
Introdução à reserva de capacidade GPU para inferência no SageMaker Executar inferência com grandes modelos de linguagem (LLMs) exige capacidade GPU…
Durante o evento NVIDIA GTC 2026, a Amazon Web Services (AWS) e a NVIDIA anunciaram uma expansão significativa na sua colaboração estratégica,…
A Amazon Web Services (AWS) anunciou uma atualização importante para o Amazon SageMaker AI Endpoints: o lançamento das métricas aprimoradas com…