A NVIDIA disponibilizou o Do Inference Now Deploy, uma coleção de código aberto com exemplos práticos em C++ destinada a desenvolvedores que desejam incorporar modelos de inteligência artificial em aplicativos executados localmente em PCs com GPUs da linha RTX. A iniciativa combina o ONNX Runtime, um mecanismo de inferência multiplataforma para modelos no formato ONNX, com o provedor de execução TensorRT RTX da NVIDIA, com o objetivo de simplificar o caminho entre um modelo treinado e uma aplicação nativa funcional.

A proposta do projeto surgiu da constatação de que adicionar modelos de IA a aplicações locais exige três elementos fundamentais: um formato de modelo portátil, um mecanismo de execução confiável e uma camada de aceleração que funcione de forma consistente nos sistemas de destino. O DIN Deploy foi criado justamente para preencher essa lacuna, oferecendo aos programadores um conjunto de amostras funcionais que demonstram como integrar esses componentes de maneira prática.

O TensorRT para RTX é descrito pela própria NVIDIA como uma solução dedicada de implantação de inferência otimizada para GPUs RTX. O componente se destaca por oferecer tempos de construção de motores de inferência na faixa de 15 a 30 segundos, viabilizando a geração desses motores diretamente nos PCs dos usuários finais durante a instalação do aplicativo ou na primeira execução. Todo o conjunto da biblioteca ocupa menos de 200 megabytes, o que reduz o impacto no espaço em disco e na memória do sistema.

IA 100% local: NVIDIA lança kit open source em C++ para rodar modelos de inteligência artificial direto no PC com GPUs RTX - Imagem complementar

Outro diferencial é a portabilidade dos motores gerados, que podem ser executados em diferentes sistemas operacionais e em diferentes modelos de placas RTX, permitindo um fluxo de trabalho de construção única e implantação ampla. A tecnologia também oferece suporte a precisões reduzidas, incluindo FP8 e FP4, que são formatos numéricos de menor precisão utilizados em hardware especializado para acelerar cálculos de inteligência artificial, especialmente em modelos generativos mais recentes.

Ao unir o ONNX Runtime ao provedor de execução TensorRT RTX, o DIN Deploy permite que desenvolvedores avancem desde um checkpoint de modelo — o arquivo que armazena os pesos aprendidos durante o treinamento — até uma aplicação nativa capaz de realizar inferência localmente. Isso elimina a necessidade de recorrer a serviços em nuvem para processamento de IA, o que traz benefícios de privacidade, redução de custos operacionais e funcionamento offline.

PUBLICIDADE

A abordagem é particularmente relevante para aplicações que rodam no Windows, onde a crescente variedade de hardware, incluindo CPUs, NPUs (unidades de processamento neural dedicadas) e GPUs, torna a escolha da camada de aceleração um desafio adicional. Com os exemplos do DIN Deploy, os programadores podem experimentar diferentes configurações e escolher a combinação mais adequada às suas necessidades.

A iniciativa faz parte de um movimento mais amplo da NVIDIA para facilitar o desenvolvimento de aplicações de IA local em PCs equipados com hardware RTX. Com mais de 100 milhões de unidades dessa família em uso no mundo, a empresa busca oferecer ferramentas que permitam a criadores de software aproveitar ao máximo o potencial de aceleração disponível nessas máquinas, abrangendo desde tarefas de visão computacional até modelos generativos de grande porte.

Com o DIN Deploy, a NVIDIA reforça a tendência de que a inferência de modelos de IA deixe de ser uma operação dependente exclusivamente de servidores remotos e passe a integrar de forma crescente o cotidiano de softwares desktop. A combinação de um formato de modelo padronizado, um mecanismo de execução consolidado e uma camada de aceleração otimizada representa, na prática, um caminho mais curto entre o desenvolvimento e a entrega de experiências inteligentes diretamente no dispositivo do usuário.