Architect Financial Technologies lança Liquid Inference, um roteador que leiloa cada requisição de IA

A Architect Financial Technologies lançou o Liquid Inference, um roteador de inferência para modelos de linguagem de grande escala (os chamados LLM, sistemas de inteligência artificial capazes de gerar texto) que funciona como uma bolsa de valores em miniatura. Em vez de enviar cada requisição para um único fornecedor fixo, a plataforma realiza um leilão em tempo real a cada solicitação: provedores de inferência apresentam ofertas para atender o pedido, e o comprador paga o menor lance que respeita as regras que ele mesmo definiu. A proposta para desenvolvedores é direta: basta trocar a URL base na configuração, manter o código intacto e deixar que os fornecedores disputem o preço.

O produto tem origem incomum. Em vez de vir de um laboratório de inteligência artificial, nasceu dentro de uma empresa de negociação financeira que opera a AX, uma exchange de futuros perpétuos. Em maio de 2026, a companhia adquiriu um Designated Contract Market americano, registro regulatório que permite listar futuros e opções, com o objetivo de negociar contratos de computação em GPU, medida ainda pendente de revisão regulatória. Foi essa experiência em construir mercados financeiros que o time aplicou para criar descoberta de preços nos dois lados da cadeia de inferência, segundo a própria Architect, que apresenta o produto em seu site oficial.

Leilão em Tempo Real por Cada Requisição de IA: Conheça o Liquid Inference, a Bolsa de Valores dos Modelos de Linguagem - Imagem complementar

O funcionamento do leilão segue quatro etapas. Primeiro, o cliente envia uma chamada padrão nos formatos das APIs da OpenAI ou da Anthropic. Em seguida, as restrições definidas pelo comprador filtram quais ofertas são elegíveis. Na terceira etapa, todos os provedores que cotam aquele modelo específico competem, e vence a oferta de menor preço que atenda aos critérios. Por fim, o preço máximo é travado antes mesmo do início da geração da resposta, e a cobrança considera apenas o uso efetivamente medido, com recibo detalhado por trabalho executado.

Os compradores contam com controles granulares. É possível definir tetos de custo por tarefa, limites para o tempo até o primeiro token (o intervalo entre a requisição e o início da resposta) e uma vazão mínima aceitável. Também há opções para exigir regiões aprovadas de processamento, zero retenção de dados pelos fornecedores e listas de permissão que restringem quais provedores ou modelos podem ser utilizados. Um modo automático é capaz de escolher sozinho o modelo mais adequado para cada tipo de trabalho. Segundo um post de Harrison no LinkedIn, a plataforma ainda oferece configurações prontas de roteamento e suporte completo a conteúdos multimodais.

PUBLICIDADE

Um diferinal incomum em APIs desse tipo é a transparência de mercado. Titulares de conta podem consultar livros de ordens em tempo real, cotações por provedor e por modelo, além de todas as transações já liquidadas. Essa visibilidade sobre a formação de preços é praticamente inédita entre serviços de inferência de LLM, que normalmente escondem o detalhamento das negociações.

Para atrair desenvolvedores, o Liquid Inference oferece compatibilidade imediata com ferramentas de programação assistida por agentes, incluindo Claude Code, Codex, OpenCode, Cursor, Pi e Cline. O cadastro é gratuito, feito por e-mail, e os primeiros 500 usuários recebem 20 dólares de inferência sem custo. Há ainda um programa de indicação que devolve 20% das taxas pagas por contas indicadas em forma de crédito de inferência, além de 10% sobre indicações de segundo nível.

Do lado dos fornecedores, o cadastro é feito pelo aplicativo do Liquid Inference, com verificação prometida em minutos, e não em semanas, segundo Harrison. Todos os prompts seguem o padrão de API da OpenAI, e uma interface REST e WebSocket permite registrar modelos e cotações. Cada provedor pode atualizar seus preços com base nos próprios custos, o que viabiliza vender capacidade ociosa de GPU apenas quando for conveniente. Os pagamentos são processados pela Stripe, com registros detalhados de cada trabalho.

Diante de concorrentes consolidados, o roteamento é o que mais distingue a novidade. Enquanto o Liquid Inference promove um leilão por requisição entre todos os provedores que cotam o modelo, o OpenRouter faz balanceamento de carga ponderado por preço, usando o inverso do quadrado do valor, e a plataforma da Hugging Face escolhe por padrão o provedor mais rápido, com um sufixo opcional para priorizar o mais barato. Em variedade, o OpenRouter lista mais de 500 modelos com mais de 80 provedores, contra os 18 parceiros da Hugging Face e as "centenas" de modelos declaradas pela Architect, que não divulgou o número de provedores.

Em compatibilidade, o Liquid Inference aceita clientes no formato da OpenAI e da Anthropic, enquanto os rivais aderem apenas ao padrão OpenAI, com a Hugging Face restrita ao chat. Nos controles de dados, a Architect oferece zero retenção, regiões e listas de permissão; o OpenRouter trabalha com parâmetros próprios de retenção e coleta; e a Hugging Face permite ordenar a preferência entre provedores. Sobre taxas, os valores do Liquid Inference não foram divulgados, o OpenRouter cobra 5,5% em pagamentos com crédito de cartão, com mínimo de 80 centavos, e a Hugging Face afirma não aplicar adicional sobre o preço. Nos créditos gratuitos, a Hugging Face fornece 10 centavos mensais, ou 2 dólares no plano pago.

O resumo da proposta é que cada requisição de LLM passa por um leilão entre provedores concorrentes, com preço máximo travado antes do primeiro token e recibo por trabalho. A integração funciona com clientes OpenAI e Anthropic, incluindo Claude Code e Cursor, e os primeiros 500 usuários recebem 20 dólares de crédito, além de 20% de retorno em indicações. Restam lacunas: as taxas cobradas, a lista completa de provedores e os dados de latência ainda não são públicos. Quem quiser avaliar o serviço pode encontrar mais informações no site da Architect.