Inteligência artificial, sem ruído.
Infraestrutura4 min

Treinar um modelo de difusão do zero em 3,5 dias: o custo real desmistificado

Análise reconstrói a matemática de um modelo de 210M treinado em uma única GPU: de US$ 13 em energia a US$ 340 na nuvem.

Treinar um modelo de difusão do zero em 3,5 dias: o custo real desmistificado

Treinar um modelo de difusão do zero já foi sinônimo de fatura de cluster e uma equipe de pesquisa inteira. Uma análise publicada no Pastagi mostra que isso mudou: uma construção individual de Ivan Mikhnenkov comprimiu o processo para uma única placa de workstation — um modelo de difusão transformer de 210 milhões de parâmetros, treinado por 3,5 dias numa RTX PRO 6000, com pesos e documentação publicados.

Os três números brutos

A análise trata o experimento como um problema de medição, não como mais um passo a passo de código. Os números declarados são:

  • Parâmetros: 210 milhões.
  • Dataset: 4,2 milhões de imagens a 256².
  • Tempo: 3,5 dias (84 horas) em uma única placa.

A ambiguidade que sustenta toda a análise está no “4,2 milhões de imagens”: lido como número de amostras vistas, o dado contradiz a própria aritmética do autor. Lido como tamanho do dataset, tudo se reconcilia. O treinamento consumiu na prática cerca de 102,4 milhões de amostras vistas — cerca de 24 épocas sobre o dataset.

Quanto custa de verdade

A matemática é direta. O treinamento de um transformer segue a regra de 6ND (cerca de 2ND no forward e 4ND no backward). Para difusão, D conta amostras vistas vezes tokens por imagem. O resultado: cerca de 3,3 × 10¹⁹ FLOPs, ou 109 TFLOPS sustentados por 3,5 dias — uma utilização de 20% a 25% do teto de precisão densa, algo “pouco glamouroso e totalmente típico” para um modelo pequeno.

Traduzido para dinheiro:

  • Energia elétrica (hardware próprio): cerca de 84 kWh, o que a taxas residenciais de US$ 0,15 a 0,25/kWh dá US$ 13 a US$ 21.
  • Nuvem alugada: 84 GPU-horas a US$ 2 a 4/hora, totalizando US$ 170 a US$ 340.

Ou seja: treinar um modelo de difusão de classe 200M custa dezenas de dólares em hardware próprio contra algumas centenas alugado. A placa em si é uma compra de milhares de dólares que se amortiza ao longo de várias execuções — a eletricidade é o custo marginal que realmente limita a iteração.

Escalando para 1B de parâmetros

O cálculo escala com os parâmetros: um modelo de 1B multiplica o orçamento por cerca de 4,8×, chegando a ~1,6 × 10²⁰ FLOPs — aproximadamente 17 dias na mesma placa. O multiplicador mais agressivo, porém, é o dataset: 40 milhões de imagens em ~24 épocas levariam o mesmo modelo 210M a cerca de um mês, e o modelo 1B a ~5 meses.

A análise também alerta contra extrapolações ingênuas. As curvas de FID versus FLOPs do paper DiT são aproximadamente log-lineares — cada salto de 4× em computação compra um ganho de qualidade cada vez menor. E as regras de tokens-por-parâmetro do estilo Chinchilla não se transferem da linguagem para a difusão, porque cada token de difusão é reponderado em muitos níveis de ruído.

Pré-treinar, ajustar ou chamar a API

Com o orçamento resolvido, a decisão vira uma questão de “distância de distribuição”:

  • Pré-treinar do zero: quando seus dados divergem muito de imagens da web (médico, industrial, ativos de jogos) ou você precisa de uma base compacta e controlável.
  • Ajustar (fine-tune): quando o alvo está próximo de imagens naturais — um modelo pré-treinado herda priors construídos com muito mais dados do que qualquer execução solo pode pagar.
  • Chamar uma API: quando o teto de qualidade domina e o volume é baixo. Em alto volume, o preço por imagem inverte a conta de volta para a propriedade do modelo.

Por que isso importa

Para pesquisadores e empresas brasileiras, a mensagem é animadora: treinar um modelo de difusão pequeno deixou de ser questão de orçamento. O dinheiro não é mais a razão para fazer ou evitar o treinamento. A decisão real é estratégica — treinar do zero para obter priors que você não consegue baixar, ajustar para o resto e alugar o teto de qualidade apenas enquanto o volume permanecer baixo.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.