Inteligência artificial, sem ruído.
Open Source5 min

Interfaze Lança diffusion-gemma-asr-small: Primeiro Modelo Open-Source de ASR por Difusão Multilíngue

Startup Interfaze (YC) lança o primeiro modelo open-source de ASR multilíngue por difusão. Com apenas 42M de parâmetros treináveis sobre um backbone de 26B, o modelo transcreve seis idiomas com decodificação paralela via DiffusionGemma.

Interfaze Lança diffusion-gemma-asr-small: Primeiro Modelo Open-Source de ASR por Difusão Multilíngue
Imagem de apoio. Fonte: MarkTechPost.

A startup Interfaze, apoiada pelo Y Combinator, acaba de liberar em código aberto o diffusion-gemma-asr-small, descrito como o primeiro modelo de ASR (reconhecimento automático de fala) multilíngue baseado em difusão do mercado open-source. O modelo transcreve áudio usando um decodificador de difusão — e não um decodificador autorregressivo tradicional — com um único adaptador de cerca de 42 milhões de parâmetros cobrindo seis idiomas.

TL;DR

  • Primeiro modelo open-source de ASR multilíngue por difusão: seis idiomas com um adaptador de ~42M de parâmetros
  • Usa o decodificador de difusão do DiffusionGemma (Google) com difusão uniforme de tokens aleatórios — não o esquema de <mask> comum em outros modelos
  • Custo de transcrição escala com o número de passos de denoising, não com a duração do áudio
  • Lidera entre pares de difusão no LibriSpeech (6,6% WER vs 8,3% do Whisfusion), mas fica atrás do Whisper autorregressivo
  • Adaptador sob licença Apache 2.0; DiffusionGemma (termos Gemma) e whisper-small (MIT) são carregados separadamente

O que é o diffusion-gemma-asr-small?

O modelo é nativamente de áudio e converte fala em texto usando um decodificador de difusão discreta. Esse decodificador pertence ao DiffusionGemma, o modelo MoE (mistura de especialistas) de 26 bilhões de parâmetros do Google, que ativa 4 bilhões de parâmetros por inferência usando 128 especialistas com roteamento top-8. O DiffusionGemma gera texto por difusão discreta em vez de autorregressão.

O detalhe técnico é relevante: a maioria dos LLMs de difusão usa um esquema de absorção com token <mask>. O DiffusionGemma adota difusão uniforme de tokens aleatórios — preenche uma tela de tamanho fixo com tokens aleatórios do vocabulário e, a cada passo, mantém as previsões mais confiantes e re-randomiza o resto. Após alguns passos (tipicamente 8 a 16), o ruído se organiza em texto coerente.

Como funciona

A Interfaze adicionou áudio a este modelo originalmente apenas textual. O DiffusionGemma lida com texto, imagem e vídeo, mas não com áudio. O repositório contém apenas o adaptador treinado (~42M de parâmetros); os backbones congelados são baixados separadamente.

O design não alimenta formas de onda brutas ao LLM — uma tentativa inicial nessa direção falhou porque o espaço de embeddings do modelo não tem noção de formantes ou fonemas. Em vez disso, o pipeline usa:

  1. Um encoder whisper-small congelado que transforma 30 segundos de áudio em 1500 frames de features acústicas de 768 dimensões
  2. Um projetor treinável pequeno que comprime esses frames com camadas convolucionais (subamostragem 8×) e um mapa linear, gerando 188 “tokens de áudio” de 2816 dimensões
  3. Adaptadores LoRA que permitem ao backbone atender a essa nova modalidade
  4. O decodificador de difusão que faz denoising bidirecional em ~16 passos sobre uma tela de transcrição de 192 tokens

O truque de treinamento

As primeiras execuções de treinamento estagnaram com loss em torno de 8. O problema era circular: o projetor começava aleatório, sua saída era ruído, a atenção aprendia a ignorá-la, e quase nenhum gradiente chegava ao projetor.

A solução foi supervisionar o projetor diretamente com uma perda CTC (Connectionist Temporal Classification) sobre os 188 tokens de áudio passados pelo lm_head congelado do DiffusionGemma. Isso alinha features acústicas a texto sem precisar de atenção. A perda CTC caiu de 24 para 8,6 em apenas 300 passos. No LibriSpeech test-clean, o WER em inglês despencou de 90% → 52% → 14,6% → 6,6% ao longo de dez épocas.

Performance e benchmarks

O modelo lidera entre ASRs de difusão e não autorregressivos no LibriSpeech, com 6,6% de WER contra 8,3% do Whisfusion. Contra o Whisper autorregressivo, porém, fica atrás — uma diferença que a equipe atribui mais ao volume de dados de treinamento do que à arquitetura.

A curva de passos de denoising é quase plana: ir de 8 para 48 passos ganha apenas ~0,1 ponto de WER, com custo de ~3× em latência. O modelo converge em cerca de 8 passagens paralelas, o que representa aproximadamente 0,7–1,5 segundos de tempo de modelo para um clipe de 10 segundos.

Casos de uso

  • Transcrição em lote: o custo é definido pelos passos de denoising, não pela duração do clipe — um áudio de 10 segundos exige aproximadamente os mesmos passos que um mais curto
  • Transcrição multilíngue com adaptador único: cobre inglês, alemão, francês, espanhol, hindi e mandarim sem precisar carregar modelos separados por idioma
  • Pesquisa em ASR não autorregressivo: oferece uma base reproduzível, com receita para ancorar um LLM congelado com um adaptador pequeno

Como começar

O modelo está disponível no Hugging Face Hub com o adaptador, model.py, audio.py e um inference.py executável. O suporte ao DiffusionGemma requer transformers da branch main. O argumento max_steps controla o trade-off entre velocidade e acurácia — 8 passos é quase ideal e mais rápido; o padrão é 16.

Os modelos base são carregados sob suas próprias licenças: DiffusionGemma sob os termos Gemma, whisper-small sob MIT, e o adaptador sob Apache 2.0.

O lançamento do diffusion-gemma-asr-small representa um passo importante para a pesquisa em ASR baseada em difusão, oferecendo uma alternativa open-source viável ao paradigma autorregressivo dominante — com a vantagem de custo de transcrição independente da duração do áudio e suporte multilíngue em um único adaptador compacto.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.