Inteligência artificial, sem ruído.
Infraestrutura3 min

SkyPilot e Hugging Face eliminam taxa de transferência de dados entre nuvens para treino de IA

Nova integração permite rodar workloads de IA em qualquer nuvem com zero custo de egresso: dados ficam no Hugging Face Hub e o SkyPilot aloca GPUs onde houver capacidade.

SkyPilot e Hugging Face eliminam taxa de transferência de dados entre nuvens para treino de IA

A Hugging Face e a SkyPilot (da UC Berkeley) anunciaram uma integração que resolve um dos maiores custos ocultos do treinamento de IA na nuvem: a taxa de transferência de dados entre provedores.

A maioria das equipes mantém modelos e datasets em um bucket de uma única nuvem, mas as GPUs disponíveis (seja para desenvolvimento, treinamento ou serving) frequentemente estão em outra nuvem diferente. O resultado é uma “taxa de transferência cross-cloud” — você paga caro só para ler seus próprios dados nas GPUs que conseguiu alocar.

Com essa integração, a conta fecha: seus modelos e datasets ficam no Hugging Face Hub, e o SkyPilot roda o treinamento ou serving em qualquer cluster que tiver GPUs disponíveis — sem custo de egresso.

Como funciona

O SkyPilot já era capaz de montar buckets S3, GCS, Azure e R2 como paths locais. Agora, o Hugging Face Storage entra como backend nativo via esquema hf://. Basta configurar seu token (o mesmo HF_TOKEN que você já tem) e definir os mounts no arquivo YAML:

file_mounts:
  # Bucket Hugging Face (leitura e escrita)
  /checkpoints:
    source: hf://buckets/minha-org/qwen-sft
    store: hf
    mode: MOUNT

  # Repositório de modelo (somente leitura)
  /base-model:
    source: hf://Qwen/Qwen3.5-4B
    store: hf
    mode: MOUNT

  # Dataset com revisão fixada
  /data:
    source: hf://datasets/minha-org/meu-dataset@main
    store: hf
    mode: MOUNT

Com isso, um único esquema cobre o ciclo completo: ler o modelo e dataset durante o treino, escrever checkpoints no bucket, publicar o modelo final no Hub e servir em inferência — tudo sem mover dados entre nuvens.

Quatro vantagens práticas

  • Zero egresso: o Hugging Face não cobra taxa de saída de dados, independentemente de onde o SkyPilot alocar as GPUs (CoreWeave, Nebius, GCP, AWS, Azure e mais de 20 provedores).
  • Deduplicação com Xet: os buckets usam o sistema Xet, que armazena e transfere apenas os chunks que mudaram entre checkpoints — ideal para fine-tuning iterativo com múltiplas versões de modelo.
  • Sem migração: se seus modelos e datasets já estão no Hub, não há etapa de migração nem necessidade de criar novas contas de storage.
  • Montagem FUSE nativa: o backend usa hf-mount, o mesmo FUSE filesystem do Hugging Face, com correções upstreamadas para rodar em containers sem privilégios.

Para quem isso importa

Times que treinam modelos em múltiplas nuvens ou que disputam GPUs spot em diferentes provedores são os maiores beneficiados. Em vez de manter cópias redundantes dos dados em cada provedor (pagando armazenamento + egresso), o dataset fica em um único lugar — o Hub — e o SkyPilot leva o job até as GPUs disponíveis.

A integração foi desenvolvida em parceria pelas duas equipes e já está disponível na versão mais recente do SkyPilot.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.