NVIDIA lança Nemotron 3.5 Lightning, modelo aberto otimizado para execução de tarefas em agentes de IA de longa duração
A NVIDIA apresentou o Nemotron 3.5 Lightning, um modelo de inteligência artificial aberto projetado especificamente para a camada de execução de agentes autônomos que operam de forma contínua. O anúncio amplia a família Nemotron 3 e posiciona o novo modelo como uma alternativa eficiente para lidar com o alto volume de chamadas de ferramentas, validação de resultados e delegação de subagentes que caracterizam os fluxos de trabalho agênticos modernos.
Agentes de IA de longa duração, aqueles sistemas capazes de raciocinar, manter contexto e utilizar ferramentas ao longo de múltiplas interações, dedicam a maior parte do seu tempo de operação a tarefas de execução repetitivas e de alto volume. Nessas etapas, cada ação envolve chamadas a ferramentas externas, verificação dos resultados obtidos e coordenação com subagentes. De acordo com a NVIDIA, utilizar um modelo de raciocínio de fronteira para cada uma dessas etapas de execução acrescenta custo e latência desnecessários, comprometendo a eficiência geral do sistema.
O Nemotron 3.5 Lightning foi desenhado justamente para assumir essa camada de execução. Trata-se de um modelo aberto baseado na arquitetura de mistura de especialistas, conhecida como MoE, com 30 bilhões de parâmetros totais e 3 bilhões de parâmetros ativos. Na prática, essa configuração permite que o modelo mobilize apenas parte de seus recursos a cada inferência, mantendo alta capacidade de processamento sem exigir o custo computacional de um modelo totalmente denso. O modelo adota a arquitetura híbrida Mamba-Transformer, a mesma utilizada em seu predecessor, o Nemotron 3 Nano, mas traz ganhos substanciais em inteligência e desempenho agêntico.
Entre os números divulgados pela NVIDIA, o modelo entrega até quatro vezes mais velocidade de saída em comparação com outros modelos de sua categoria, o que se traduz em conclusão de tarefas agênticas cerca de 30% mais rápida. O Nemotron 3.5 Lightning também oferece uma janela de contexto de um milhão de tokens, sendo voltado exclusivamente para tarefas de raciocínio baseadas em texto. Outra característica técnica relevante é a disponibilização em formato NVFP4, um esquema de quantização de quatro bits nativo da NVIDIA que preserva a precisão do modelo com degradação mínima em relação aos pesos em BF16, formato de precisão mais elevada.
A estratégia da NVIDIA para o Nemotron 3.5 Lightning se insere em uma abordagem mais ampla de sistemas compostos por múltiplos modelos. Nessa arquitetura, modelos de raciocínio de fronteira ficam responsáveis pela orquestração e pelo planejamento complexo, enquanto modelos mais eficientes, como o novo Nemotron, cuidam da execução de alto volume, da validação e das chamadas de ferramentas. A divisão permite equilibrar qualidade de raciocínio com velocidade e custo operacional.
Por se tratar de um modelo aberto e personalizável, o Nemotron 3.5 Lightning pode ser pós-treinado com o framework NVIDIA NeMo utilizando dados, ferramentas e fluxos de trabalho próprios de cada organização. Essa capacidade de ajuste fino é especialmente relevante para empresas que precisam adaptar o modelo a domínios específicos e otimizar a acurácia em tarefas especializadas. O modelo é distribuído sob a licença OpenMDW-1.1, de uso permissivo, o que facilita sua adoção em diferentes contextos.
Em termos de infraestrutura, o Nemotron 3.5 Lightning foi projetado para funcionar em uma ampla variedade de ambientes. Ele pode rodar localmente em computadores equipados com GPUs NVIDIA RTX, além de sistemas como o NVIDIA DGX Spark, o NVIDIA DGX Station e dispositivos NVIDIA Jetson. A solução também escala para estações de trabalho NVIDIA RTX PRO, data centers e ambientes de nuvem, atendendo desde casos que exigem processamento na borda até aplicações empresariais de grande porte. A possibilidade de execução local ou on-premises oferece às organizações maior controle sobre privacidade e implantação.
O lançamento do Nemotron 3.5 Lightning acompanha a evolução da família Nemotron 3, que já inclui os modelos Nano e Ultra, cada um voltado para frentes distintas do trabalho com agentes de IA. Com a chegada do novo modelo, a NVIDIA reforça sua aposta em modelos abertos como alternativa para empresas que buscam autonomia sobre onde, como e com quais dados a inteligência artificial é treinada e implantada, em um momento em que o setor migra de chatbots isolados para sistemas agênticos cada vez mais complexos e integrados.