Adaption Labs cria dados de treinamento a partir da descrição de uma tarefa

A Adaption Labs lançou nesta semana o Invent a Dataset, recurso que gera um conjunto de dados estruturado e pronto para treinamento a partir de uma descrição do comportamento que um modelo de inteligência artificial deve aprender. Diferentemente do fluxo tradicional, o usuário não precisa fornecer um conjunto inicial, um esquema predefinido nem um guia de rotulagem. A proposta é transformar diretamente a intenção da tarefa em exemplos para ajustar um modelo. O processo é executado na plataforma hospedada da Adaption e consome créditos.

Do zero ao dataset: Adaption Labs lança Invent a Dataset e transforma uma simples descrição de tarefa em dados de treinamento prontos para IA - Imagem complementar

O recurso está disponível no aplicativo da Adaption, em um kit de desenvolvimento para Python e por uma interface de programação. As linhas produzidas podem ser baixadas em JSONL, JSON, CSV ou Parquet, formatos que tornam o resultado um arquivo portátil para uso em diferentes ambientes de treinamento. Essa flexibilidade, porém, tem uma limitação: não há uma opção documentada para executar a geração localmente. A criação dos dados depende, portanto, do serviço da empresa e dos créditos disponíveis no plano.

PUBLICIDADE

A ferramenta procura resolver uma etapa custosa dos projetos de inteligência artificial. Muitas equipes começam com dados já existentes e passam semanas rotulando, filtrando e reorganizando essas informações para que se aproximem da tarefa desejada. Segundo a Adaption, esse processo limita a qualidade do modelo à semelhança entre os dados disponíveis e o comportamento que se pretende ensinar. Em aplicações proprietárias ou especializadas, os sinais relevantes часто aparecem em sistemas internos, textos não estruturados ou registros de fluxos de trabalho, sem se converterem diretamente em um conjunto de treinamento.

A empresa também diferencia o Invent a Dataset de outras ferramentas de dados sintéticos. Essas soluções normalmente automatizam a geração depois que uma pessoa já definiu o esquema dos dados, a distribuição das tarefas e a estratégia de produção. O novo recurso começa em uma etapa anterior, usando como ponto de partida o comportamento que o modelo precisa aprender. Com isso, a descrição da intenção ocupa o lugar de um corpus inicial e de grande parte do planejamento manual.

A operação por interface de programação é documentada de forma concreta. Uma chamada para datasets.invent cria o conjunto e inicia a geração, retornando imediatamente com o estado de execução em andamento. O sistema precisa ser consultado depois por meio de datasets.get até apresentar o estado de sucesso ou falha, momento em que as linhas podem ser baixadas. Os códigos de domínio são obtidos por datasets.invent_domains, evitando que o usuário precise conhecê-los ou mantê-los fixos no código.

A solicitação exige pelo menos um domínio ou subdomínio, e vários domínios podem participar da mesma geração. Quando um domínio é informado sem subdivisões, a ferramenta considera toda a sua abrangência. Também é possível usar categorias mais específicas, como um domínio médico associado ao subdomínio de sintomas e diagnósticos. A quantidade de linhas fica sujeita ao limite estabelecido para cada plano.

Dois formatos de saída são disponibilizados. O instruction_dataset, usado por padrão, produz pares de instrução e conclusão para ajuste supervisionado, técnica em que o modelo aprende a responder a partir de exemplos correspondentes. O preference_pairs gera conclusões escolhidas e rejeitadas para treinamento baseado em preferências, como o método DPO, no qual respostas mais adequadas são favorecidas em relação às demais.

Entre os recursos voltados ao uso em produção está a estimativa de custos. Com estimate=True, a ferramenta calcula o preço exato da solicitação e informa a quantidade estimada e disponível de créditos, sem criar o conjunto nem realizar cobrança. O campo prompt aceita até dez mil caracteres para orientar o conteúdo das linhas. Já a chave de idempotência, com limite de 255 caracteres, faz com que uma tentativa repetida devolva o conjunto original, em vez de iniciar uma segunda geração.

O Invent a Dataset também oferece expansão de idioma e adaptação regional. No modo translate, cada idioma de destino recebe uma nova variante das linhas, enquanto localize produz versões para combinações de país e idioma, com formulações próprias de cada região. Uma taxa entre 0,01 e 1 determina a proporção de linhas que será expandida. Os créditos são contabilizados com base na quantidade resultante, e não no número original de registros; códigos não aceitos provocam um erro com exemplos de valores válidos.

O conjunto gerado pode ser encaminhamento diretamente para o AutoScientist por meio de seu identificador e da função autoscientist.create. Lançado em maio de 2026, o AutoScientist otimiza em conjunto os dados e a receita de treinamento conforme o objetivo estabelecido. A Adaption apresenta o Invent a Dataset como a primeira metade desse ciclo, que começa na descrição do comportamento e segue até a preparação do modelo.

De acordo com avaliações internas realizadas em oito áreas especializadas, o AutoScientist teria superado, em média, configurações de treinamento preparadas pela própria equipe de pesquisa da Adaption. A empresa relata vantagem média de 35%, com taxas de vitória que passaram de 48% para 64%. Os testes usaram conjuntos de cinco mil a cem mil linhas e arquiteturas disponíveis para ajuste fino na Together AI. Os resultados indicam que a nova ferramenta pode reduzir a dependência de dados iniciais, mas sua geração continua vinculada à plataforma e ao consumo de créditos.