Cohere lança Embed 5 com dois modelos compatíveis para indexação e busca em tempo real

A Cohere anunciou nesta semana o Embed 5, sua nova família de modelos de embedding voltada para busca empresarial, sistemas de geração aumentada por recuperação (RAG) e fluxos de trabalho agenticos. O lançamento, realizado em 30 de setembro de 2026, apresenta duas variantes que compartilham o mesmo espaço vetorial, permitindo que corporações usem um modelo para indexar documentos e outro, mais rápido, para responder consultas em produção.

A família Embed 5 é dividida em dois níveis. O Embed 5 Pro tem como foco a máxima qualidade de recuperação durante a indexação de grandes volumes de dados. O Embed 5 Fast foi projetado para oferecer menor latência e menor custo no caminho da consulta ao vivo, o que é especialmente relevante para agentes que executam dezenas de buscas em uma mesma tarefa. Ambos aceitam entradas de texto, imagens e combinações fusionadas de texto e imagem, cobrem mais de cem idiomas e processam até 128 mil tokens por chamada.

Cohere Embed 5: a dupla Pro e Fast que promete acabar com o dilema entre precisão e velocidade na busca empresarial com IA - Imagem complementar

A principal decisão de arquitetura da Cohere foi fazer com que Pro e Fast produzam vetores dentro do mesmo espaço de embeddings. Isso significa que é possível indexar toda uma base de documentos com o Pro e, depois, realizar buscas usando o Fast, sem necessidade de reconstruir o índice. A única exigência é que ambos os lados utilizem a mesma dimensão de saída. Nos testes internos da empresa, realizados em 40 conjuntos de dados, a combinação de índice Pro com consulta Fast atingiu 98,4 pontos em uma escala normalizada onde Pro com Pro equivale a 100, enquanto a configuração totalmente Fast marcou 96,6.

No comparativo de desempenho, a Cohere destaca que o Embed 5 Pro registrou média de 85,8 pontos no benchmark ViDoRe V3, um ganho de 8,8 pontos em relação ao Embed 4. O Embed 5 Fast obteve 84,5. Os números superam os do Voyage 4 Large (83,7), do Gemini Embedding 2 (83,2) e do OpenAI text-embedding-3-large (75,5). Em documentos PDF processados, o Pro lidera com 84,8 pontos, contra 83,6 do Voyage 4 Large. A área financeira é o ponto mais forte da nova família: o Pro alcançou a primeira colocação nos testes FinanceBench (80,1), FinQA (90,0) e ViDoRe V3 Finance (85,0), com o Fast em segundo lugar nos três cenários.

PUBLICIDADE

Em relação ao suporte multilíngue, o Pro lidera a média para idiomas europeus com 77 pontos, mas o Gemini Embedding 2 supera o modelo da Cohere em nove das dez línguas adicionais avaliadas, incluindo japonês, árabe, hindi e telugu. A Cohere também introduziu uma nova métrica própria, chamada RCP-nDCG@10, que mede a qualidade de reordenação de um conjunto fixo de candidatos. A empresa publicou o código de avaliação, mas ainda não há replicações independentes dos resultados.

Os dois modelos estão disponíveis por meio da API da Cohere, do Model Vault, do Microsoft Foundry e do Amazon SageMaker. Implantações em nuvens privadas ou em ambientes on-premise podem ser feitas com o suporte ao framework vLLM. Os identificadores na API são embed-v5.0-pro e embed-v5.0-fast, e ambos podem gerar vetores em seis dimensões diferentes, de 256 até 2048, sendo 2048 o padrão. As saídas podem ser retornadas em formato float, int8 ou binário. O preço do Pro é de 0,12 dólar por milhão de tokens de texto, enquanto o Fast custa 0,08 dólar pela mesma quantidade. O processamento de imagens tem custo de 0,40 dólar por milhão de tokens em ambos os níveis.

A nova família também traz benefícios expressivos em termos de armazenamento. Graças ao uso de aprendizado de representação Matryoshka, que permite truncar dimensões sem perda significativa de qualidade, e à possibilidade de usar precisões mais baixas, o tamanho dos vetores varia de 8 quilobytes para um vetor float32 de 2048 dimensões até apenas 32 bytes para um vetor binário de 256 dimensões. Em uma base com cem milhões de blocos de conteúdo, o armazenamento bruto cai de aproximadamente 819 gigabytes para 3,2 gigabytes. A Cohere recomenda como padrão a configuração de 1024 dimensões em int8, por oferecer qualidade próxima à precisão máxima com um quarto do espaço.

Em testes de vazão, o Embed 5 Fast processou 377,3 documentos por segundo, contra 159,7 do Pro, uma diferença que se reflete diretamente no desempenho de sistemas agenticos que dependem de múltiplas buscas encadeadas. A escolha do Embed 5 marca a chegada da Cohere a um novo patamar em modelos de embedding voltados para empresas, apostando em flexibilidade entre qualidade de indexação e velocidade de consulta como principal diferencial frente a concorrentes como Voyage, Google e OpenAI.