Inteligência artificial, sem ruído.
Ferramentas e Apps4 min

Adaption Labs lança recurso que gera dados de treino a partir de uma descrição de tarefa

Invent a Dataset cria datasets prontos para treino a partir da descrição de um comportamento, sem corpus inicial, esquema ou rotulagem — e fecha o loop com o AutoScientist.

Adaption Labs lança recurso que gera dados de treino a partir de uma descrição de tarefa

A Adaption Labs lançou o Invent a Dataset, um recurso que gera um conjunto de dados estruturado e pronto para treinamento a partir de uma simples descrição do comportamento que você quer que um modelo aprenda. A proposta é radical: você não chega com um corpus inicial, um esquema predefinido ou um guia de rotulagem — apenas descreve a tarefa.

Deployável agora, com uma ressalva

O recurso já está ativo no aplicativo da Adaption e por meio do Python SDK e da REST API. As linhas geradas são baixadas como JSONL, JSON, CSV ou Parquet — ou seja, o artefato é um arquivo portável que você possui e pode usar para treinar em qualquer lugar. A geração, porém, roda na plataforma hospedada da Adaption e consome créditos; não há caminho de geração self-hosted documentado.

O problema que ele ataca

A maioria dos fluxos de dados começa com dados que já existem. As equipes então passam semanas rotulando, filtrando e remodelando esse material para aproximá-lo da tarefa desejada. O argumento da Adaption é que isso limita a qualidade do modelo à proximidade entre os dados disponíveis e o comportamento pretendido. Para tarefas proprietárias e especializadas, o sinal relevante geralmente está em sistemas internos, texto não estruturado ou logs de fluxo de trabalho — e raramente se converte de forma limpa em um conjunto de treinamento focado.

Como a API funciona

A mecânica é concreta e documentada. Uma única chamada a datasets.invent cria o dataset e inicia a geração, retornando status running. Em seguida, você consulta datasets.get até o status mudar para succeeded ou failed e baixa as linhas.

Os códigos de domínio são o controle principal. Você busca os códigos atuais com datasets.invent_domains em vez de fixá-los no código, e então passa valores como medical, opcionalmente restritos por subdomínios como medical.symptoms_diagnosis. Ao menos um domínio ou subdomínio é obrigatório.

Dois formatos de saída são suportados: instruction_dataset (padrão) produz pares pergunta-resposta para fine-tuning supervisionado, enquanto preference_pairs gera respostas escolhidas e rejeitadas para treinamento baseado em preferência, como DPO.

Parâmetros que importam em produção

Três parâmetros merecem atenção. estimate=True precifica a requisição exata e retorna créditos estimados contra disponíveis sem criar nem cobrar nada. prompt aceita até 10.000 caracteres para direcionar o conteúdo das linhas. E idempotency_key (até 255 caracteres) torna retries de rede seguros, devolvendo o dataset original em vez de disparar uma segunda execução.

O loop “zero-dados”

O Invent a Dataset é a primeira metade de um ciclo. O ID do dataset vai direto para o autoscientist.create, que co-otimiza os dados e a receita de treinamento contra o seu objetivo. O AutoScientist foi lançado em maio de 2026 e é a contraparte de treinamento do pilar Adaptive Data. Segundo a Adaption, o AutoScientist supera o treinamento configurado pela própria equipe de pesquisa em média 35%, com taxas de vitória subindo de 48% para 64% em avaliações internas de oito verticais.

Por que isso importa agora

A escassez de dados de treinamento de qualidade — e o custo de rotulagem humana — é um dos maiores gargalos para empresas que querem ajustar modelos a tarefas próprias. Uma ferramenta que parte da descrição do comportamento e entrega um dataset portável muda o ponto de partida: em vez de “achar dados e adaptá-los”, você parte do que quer ensinar. Para o mercado brasileiro, onde dados de nicho em português são escassos, a expansão de idioma integrada é um atalho relevante.

Limitações a considerar

Os números do AutoScientist vêm de avaliações internas da própria Adaption, não de benchmarks independentes, e a geração depende de créditos na plataforma hospedada — não há self-hosting. Ainda não está claro como a qualidade dos dados gerados se compara a datasets curados por especialistas em domínios de alto risco, como saúde e jurídico.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.