Hugging Face lança biblioteca com mais de 200 kernels WebGPU para execução local de inteligência artificial

A Hugging Face anunciou o lançamento do `@huggingface/kernels`, uma biblioteca minimalista destinada ao carregamento e à execução de kernels WebGPU otimizados diretamente a partir do Hugging Face Hub. O lançamento marca a primeira etapa de um esforço mais amplo da empresa para construir uma base sólida de inferência de inteligência artificial no navegador, reunindo uma coleção inicial de 207 kernels disponível no endereço huggingface.co/webgpu-kernels.

Hugging Face Libera Mais de 200 Kernels WebGPU e Coloca a IA para Rodar Direto no Seu Navegador com Velocidade Recorde - Imagem complementar

O WebGPU é o padrão moderno de acesso à unidade de processamento gráfico nos principais navegadores, permitindo que aplicações web utilizem recursos computacionais que antes estavam restritos a ambientes locais ou servidores dedicados. Os kernels são pequenas rotinas de execução que realizam operações matemáticas específicas, como adição de matrizes, softmax e normalização, fundamentais para o funcionamento de modelos de aprendizado de máquina. Com a biblioteca apresentada pela Hugging Face, desenvolvedores podem incorporar essas rotinas otimizadas em suas aplicações para acelerar a execução de modelos de IA diretamente no navegador, sem depender de servidores remotos.

PUBLICIDADE

Cada kernel disponibilizado no Hub é publicado como um pacote completo e versionado. Isso significa que sua interface, os modelos de shader, os casos de teste de correção, os benchmarks e as instruções de uso estão organizados juntos em um único repositório. A estrutura transforma um shader, o programa que define como a operação é executada na GPU, em um artefato de software reutilizável. Dessa forma, a interface pode ser inspecionada sem a necessidade de ler o código WGSL, a linguagem de shading utilizada pelo WebGPU, e versões específicas podem ser carregadas explicitamente, em vez de depender de URLs de arquivos sem controle de versão.

A coleção cobre operações utilizadas em uma ampla variedade de arquiteturas de aprendizado de máquina e cargas de trabalho. Segundo a Hugging Face, os kernels também podem servir como implementações de referência para desenvolvedores que estejam construindo seus próprios kernels WebGPU ou integrando essas operações em seus próprios runtimes, ou seja, os ambientes de execução responsáveis por processar os modelos.

Em comparação com o ONNX Runtime WebGPU, um dos ambientes mais utilizados para execução de modelos no navegador, os kernels da Hugging Face apresentaram desempenho superior em diferentes operações. Nos benchmarks divulgados, os kernels foram em média 2,57 vezes mais rápidos pela média geométrica e 1,90 vez mais rápidos pela mediana, totalizando 629 vitórias, 176 derrotas e 4 empates. Entre as operações avaliadas, a operação de adição apresentou加速 de 3,52 vezes, com tempo de execução de 0,064 milissegundos contra 0,227 milissegundos. A operação de multiplicação de matrizes registrou ganho de 1,14 vez, passando de 0,131 para 0,115 milissegundos. O softmax, função que converte valores em probabilidades, alcançou加速 de 2,11 vezes, com tempo de 0,114 milissegundos frente a 0,240 milissegundos. Já a normalização de camada obteve ganho de 2,22 vezes, reduzindo o tempo de 0,135 para 0,061 milissegundos.

O uso da biblioteca é direto. Por meio da função `getKernel`, desenvolvedores podem carregar um kernel específico passando o nome e a versão desejada. O exemplo divulgado pela empresa mostra como executar a operação de adição utilizando arrays de ponto flutuante de 32 bits, com especificação das formas dos tensores de entrada.

A Hugging Face destaca que a biblioteca representa a fundação de baixo nível para os próximos passos em sua pilha de inferência no navegador. A empresa pretende conectar os kernels a ferramentas de modelagem de nível mais alto, expandir a cobertura de operações e facilitar a inferência local rápida em todo o ecossistema WebAI. A companhia também convida a comunidade a contribuir com evidências de desempenho a partir de seus próprios dispositivos, ajudando a aprimorar os kernels para todos os usuários.