Grok 4.7 chega ao Amazon Bedrock com janela de contexto de 500 mil tokens

A xAI disponibilizou o modelo Grok 4.7 no catálogo do Amazon Bedrock, plataforma da AWS para acesso a modelos de inteligência artificial. O lançamento amplia o portfólio de modelos disponíveis na nuvem da Amazon com uma opção voltada para programação, agentes de longa duração e tarefas de conhecimento. O modelo oferece uma janela de contexto de 500 mil tokens, recurso que define quanto texto o sistema consegue processar em uma única interação, e aceita entradas de texto e imagem, retornando apenas respostas textuais.

De acordo com a xAI, o Grok 4.7 é considerado o modelo mais avançado da empresa para programação e trabalho de conhecimento. O foco do desenvolvimento foi a persistência em tarefas difíceis, em vez da velocidade bruta de resposta. O modelo dedica mais tempo a problemas complexos e verifica seu próprio trabalho de forma mais cuidadosa antes de prosseguir, característica especialmente relevante para agentes automatizados que executam sequências longas de ações.

Grok 4.7 desembarca no Amazon Bedrock: a IA da xAI que pensa mais e desiste menos - Imagem complementar

No treinamento, a xAI informa que o Grok 4.7 utilizou uma nova base de modelo, maior do que a versão anterior. O processo envolveu uma rodada de aprendizado por reforço mais longa, aplicada a um conjunto de tarefas mais difícil, com peso para problemas que levam muitas horas para serem concluídos. Desse treinamento resultaram duas capacidades principais: melhor verificação do próprio trabalho e uso mais eficiente da janela de contexto de 500 mil tokens em tarefas extensas. A empresa também treinou o modelo para compreender nativamente o ambiente de execução Grok Bot, o que teria contribuído para melhorias em tarefas conversacionais e de conhecimento geral.

A xAI destaca ainda ganhos na geração de documentos e apresentações, além de evolução em atividades profissionais como as realizadas por advogados, enfermeiros e analistas financeiros. A empresa apresenta resultados em avaliações como CursorBench e DeepSWE, voltadas para engenharia de software, Terminal-Bench e AA Briefcase, para trabalho prolongado em terminais e escritório, EEBench, para engenharia elétrica, Harvey Legal Agent Benchmark, para atividades jurídicas, e HealthBench Professional, para raciocínio clínico.

PUBLICIDADE

A plataforma independente Artificial Analysis também conduziu suas próprias avaliações. No Índice de Inteligência, métrica composta que reúne testes de uso de ferramentas, raciocínio, confiabilidade e trabalho com contexto longo, o Grok 4.7 alcançou 46 pontos, contra 44 do Grok 4.6. No Índice de Agentes de Programação, a pontuação subiu de 47 para 56. Em trabalho de conhecimento de longa duração, avaliado pelo AA-Briefcase, a pontuação Elo, sistema de classificação relativo usado em testes comparativos, passou de 1.546 para 1.657. Já no GDPval-AA, que avalia produtos de trabalho profissional, a pontuação subiu de 1.605 para 1.695. O índice de alucinações, situação em que a ferramenta apresenta informações incorretas como se fossem verdadeiras, caiu de 34% para 29%. A contrapartida desses avanços está no volume de tokens de saída gerados por tarefa, que praticamente dobrou em relação à versão anterior.

No campo de segurança, a xAI afirma que o Grok 4.7 foi construído com uma pilha de salvaguardas inteiramente nova e apresenta o melhor desempenho já registrado pela empresa em recusas e resistência a tentativas de manipulação, conhecidas como jailbreaks. O objetivo em áreas de uso duplo, como cibersegurança e trabalho biológico, é manter a utilidade para tarefas legítimas ao mesmo tempo em que se recusa a executar pedidos perigosos. Segundo a empresa, o modelo permite a passagem de apenas uma pequena fração de prompts arriscados, enquanto raramente bloqueia atividades legítimas de segurança. A xAI também passou a oferecer acesso limitado, por convite, a parceiros selecionados de cibersegurança para uso das capacidades de equipe vermelha, isto é, grupos que simulam ataques para testar defesas, em pesquisas de defesa.

No Amazon Bedrock, o Grok 4.7 é disponibilizado por meio de perfis de inferência entre regiões, que distribuem as chamadas por diferentes data centers para garantir capacidade e desempenho. Os desenvolvedores podem optar entre o perfil geográfico, identificado como us.xai.grok-4.7, que mantém o processamento dentro do território americano, e o perfil global, chamado global.xai.grok-4.7, que distribui a carga por mais regiões da AWS, com custo menor, porém com menos controle sobre a localização exata do processamento. O modelo é compatível com as APIs Responses, Chat Completions e Converse, o que permite integração com diferentes estilos de código.

O nível de esforço de raciocínio é um dos principais controles disponíveis para desenvolvedores. Configurável em quatro níveis, baixo, médio, alto e xextra-alto, o parâmetro define quanto tempo o modelo dedica à análise antes de responder. O padrão é o nível alto, mas a recomendação é ajustá-lo de acordo com a tarefa, usando níveis mais baixos para extrações e classificações simples, e níveis mais altos para planejamentos complexos e trajetórias longas de agentes. A escolha do nível adequado é apontada como um fator determinante para equilibrar custo, latência e qualidade.

O Grok 4.7 também oferece recursos complementares do Bedrock, como cache automático de prompts repetidos, ferramentas de proteção de conteúdo, suporte a saídas estruturadas em formato JSON Schema e registro de invocações no Amazon CloudWatch. Esses recursos permitem auditar execuções longas de agentes e controlar formatos de resposta para integração com outros softwares.