Multiverse Computing aplica conceitos da física para reduzir o tamanho de grandes modelos de linguagem
A empresa Multiverse Computing publicou em seu blog na plataforma Hugging Face um artigo que propõe uma nova forma de comprimir grandes modelos de linguagem, ou LLMs, usando princípios inspirados na física. Intitulada "Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem", a publicação apresenta uma abordagem que trata a remoção de blocos internos dos modelos como um problema de otimização binária, mapeável para um sistema físico conhecido como vidro de Ising, uma estrutura conceitual usada em estudos de sistemas desordenados.
A técnica se baseia na eliminação estratégica de blocos do transformador, que são as unidades fundamentais de processamento dentro de modelos como o Llama. Segundo a empresa, o método formula essa compressão como um problema de otimização binária com restrições, no qual as energias do sistema físico funcionam como um indicador indireto do desempenho do modelo após as remoções. Esse mapeamento permite avaliar de forma eficiente um grande número de configurações possíveis de exclusão de blocos, identificando soluções de alta qualidade que vão além das alternativas mais simples já conhecidas na literatura.
Um dos achados destacados pela pesquisa é que o algoritmo privilegia consistentemente a remoção de blocos localizados nas camadas finais do modelo. Esse padrão é compatível com resultados obtidos por outras abordagens anteriores de poda em nível de bloco. Para validar a estratégia, a equipe analisou especificamente o comportamento do método ao remover 16 dos 32 blocos do modelo Llama-3.1-8B-Instruct, observando que as primeiras vinte configurações de menor energia obtidas pelo sistema selecionavam majoritariamente blocos no final da arquitetura.
A proposta da Multiverse Computing se diferencia de técnicas tradicionais de compressão, como quantização, destilação e aproximações de baixa ordem, por apresentar ganhos de velocidade de inferência previsíveis e substanciais, decorrentes do encurtamento direto do modelo. Além disso, o método é compatível com outras técnicas de compressão, o que permite combiná-lo com estratégias já existentes para obter reduções ainda maiores de tamanho e consumo de recursos computacionais.
Apesar das vantagens, os próprios pesquisadores reconhecem que a poda em nível de bloco se torna cada vez mais desafiadora à medida que os modelos se tornam mais profundos e heterogêneos. O efeito de remover um bloco específico depende fortemente de quais outros blocos também são eliminados, o que transforma a tarefa em um problema combinatório difícil. Essa interdependência exige que os métodos de poda avaliem combinações inteiras de remoções, em vez de tratar cada bloco de forma isolada.
O trabalho se insere na linha de pesquisa mais ampla da Multiverse Computing voltada para a CompactifAI, sua tecnologia proprietária de compressão de modelos baseada em matemática de redes tensorais inspirada em mecânica quântica. A empresa, sediada em Donostia, na Espanha, atua há anos no desenvolvimento de soluções que reduzem o tamanho de modelos de inteligência artificial sem comprometer de forma significativa sua precisão. O método descrito no blog representa mais um passo nesse esforço, trazendo para a área de LLMs técnicas originárias do campo da otimização física.
Ao tratar a compressão de modelos como um problema de física estatística, a abordagem abre caminho para o uso de solvers especializados, incluindo hardware de recozimento quântico, na busca pelas melhores configurações de poda. Embora o artigo não detalhe aplicações específicas desses solvers, a formulação matemática proposta é compatível com diferentes métodos de resolução de problemas de otimização combinatória.
O trabalho foi publicado como parte da série de artigos da Multiverse Computing no Hugging Face e está disponível para consulta na plataforma, junto com outros estudos da empresa sobre compressão, quantização e destilação de modelos de linguagem. A iniciativa reflete o interesse crescente da comunidade de inteligência artificial em encontrar alternativas mais eficientes para lidar com o tamanho crescente dos modelos, tema que tem implicações diretas em custo computacional, consumo de energia e capacidade de implantação em dispositivos com recursos limitados.