
Claude Sonnet 5: Anthropic lança modelo intermediário com desempenho de agente próximo ao Opus 4.8
Anthropic lança Claude Sonnet 5 com benchmarks próximos ao Opus 4.8 por um terço do preço: 63,2% no SWE-bench Pro, 81,2% no…
5 publicações encontradas

Anthropic lança Claude Sonnet 5 com benchmarks próximos ao Opus 4.8 por um terço do preço: 63,2% no SWE-bench Pro, 81,2% no…

A avaliação de modelos de IA é um campo notoriamente fragmentado. Um mesmo modelo pode apresentar pontuações radicalmente diferentes no mesmo…
Desafios na Avaliação de Modelos em Árabe Embora o árabe seja falado por mais de 400 milhões de pessoas em diversas regiões…
O desafio dos dados especializados para IA O avanço acelerado dos modelos de IA generalistas tem sido impulsionado pela enorme quantidade de…
Nos últimos anos, a avaliação do progresso em inteligência artificial aplicada à programação tem sido um desafio constante para pesquisadores e…