Grok 4.7 aumenta o modelo, não o preço da API padrão
O novo Grok 4.7 da SpaceXAI traz um modelo de base maior e treino para tarefas longas, mas avaliações independentes ainda o colocam atrás do GPT-6 e do Claude Fable 5.1.

A SpaceXAI lançou o Grok 4.7 em 21 de setembro, com um modelo de base maior e um conjunto de alterações de treino e inferência orientadas para tarefas mais longas. O lançamento mantém inalterado o preço da API padrão, em 2 dólares por milhão de tokens de entrada e 6 dólares por milhão de tokens de saída. Chega também com uma janela de contexto de 500 000 tokens, quatro níveis de raciocínio e disponibilidade alargada através da API, Cursor, Grok Build, OpenRouter, Vercel e Cloudflare. A questão central não é saber se o Grok 4.7 é uma versão maior e mais capaz do que a anterior, mas até que ponto as provas publicadas sustentam essa afirmação quando se separam benchmarks do fornecedor e avaliação independente.
O que mudou no Grok 4.7
A principal alteração arquitetónica divulgada para o Grok 4.7 é a utilização de um modelo de base maior. A SpaceXAI afirma também que o modelo recebeu aprendizagem por reforço mais longa para tarefas extensas, autoverificação e treino de contexto longo. Estes não são detalhes menores de posicionamento: descrevem um modelo pensado para ter melhor desempenho quando o trabalho se prolonga por muitos passos, quando as respostas exigem verificação e quando grandes volumes de texto ou código têm de permanecer em contexto. O anúncio enquadra, por isso, o Grok 4.7 menos como uma atualização limitada de velocidade e mais como uma tentativa de melhorar raciocínio e persistência em fluxos de trabalho prolongados.
O preço inalterado da API padrão é uma parte relevante do lançamento. A SpaceXAI lista o preço padrão em 2 dólares por milhão de tokens de entrada e 6 dólares por milhão de tokens de saída, apesar de o modelo ser descrito como maior e treinado com métodos adicionais. Para programadores e equipas que já planeiam custos com base em tokens, a mensagem é que o nível de serviço por defeito não introduz um preço unitário superior para o novo modelo. Isto não significa que todos os custos de acesso fiquem inalterados: o nível de serviço mais rápido custa o dobro do preço padrão, criando uma distinção clara entre acesso de base e serviço de menor latência.
A janela de contexto de 500 000 tokens é outra mudança prática a considerar. Uma janela de contexto dessa dimensão pode, em princípio, permitir que um modelo processe grandes bases de código, documentação extensa, pedidos com múltiplos ficheiros ou históricos de tarefas prolongadas sem o mesmo grau de truncagem. Contudo, uma janela de contexto ampla é um valor de capacidade, não uma garantia de que o modelo usará todas as partes do contexto com igual eficácia. O facto de o Grok 4.7 ter recebido treino de contexto longo é relevante porque o comprimento do contexto, por si só, não prova recuperação, priorização ou raciocínio fiáveis ao longo de toda a janela.
Como o lançamento é posicionado
A SpaceXAI está a disponibilizar o Grok 4.7 por várias vias: a sua API, Cursor, Grok Build, OpenRouter, Vercel e Cloudflare. Essa distribuição é importante porque coloca o modelo não apenas atrás de uma API direta, mas também dentro de canais de desenvolvimento e implementação onde a troca de modelos pode fazer parte dos fluxos de trabalho diários. O lançamento é, portanto, dirigido tanto a integradores diretos como a utilizadores que chegam ao modelo através de plataformas já usadas para programar, construir ou encaminhar cargas de trabalho de IA. A lista de disponibilidade é um anúncio da empresa e deve ser tratada como tal, não como prova de desempenho.
Os quatro níveis de raciocínio dão a utilizadores ou programadores uma forma de escolher quanto esforço de raciocínio o modelo deve aplicar. A implicação prática é que nem todas as tarefas precisam de correr com a mesma configuração. Pedidos mais simples podem não exigir o nível mais alto, enquanto trabalho mais complexo pode receber mais raciocínio. Os factos verificados não especificam de que modo os quatro níveis diferem em latência, precisão ou custo, pelo que qualquer conclusão sobre a melhor configuração iria além das provas disponíveis. O que se pode dizer é que a SpaceXAI expõe o raciocínio como uma parte configurável do produto, em vez de o esconder totalmente atrás de um único modo por defeito.
A autoverificação também faz parte do método anunciado. Em termos gerais, a autoverificação indica que o modelo foi concebido para verificar aspetos da sua própria saída durante a geração ou o raciocínio. A informação do lançamento não fornece detalhe suficiente para avaliar exatamente como esse processo é implementado ou com que frequência evita erros. Deve, por isso, ser entendida como uma técnica divulgada, não como prova de que erros factuais, erros de programação ou falhas de raciocínio foram resolvidos. A mesma cautela aplica-se à aprendizagem por reforço mais longa para tarefas extensas: é relevante para o desenho do modelo, mas o seu efeito tem de ser avaliado através de resultados.
O que mostram os números
A SpaceXAI apresenta três resultados de benchmark para o Grok 4.7: CursorBench 46.3, DeepSWE 71 e EEBench 64. Estes valores pertencem à categoria dos benchmarks do fornecedor, porque são apresentados pela empresa responsável pelo modelo. Podem ser sinais úteis sobre as tarefas que a SpaceXAI pretende enfatizar, especialmente em torno de fluxos de trabalho de programação ou engenharia de software sugeridos pelos nomes dos benchmarks e pela distribuição através do Cursor. Mas benchmarks de fornecedor não têm o mesmo peso probatório que testes independentes. Mostram o que a empresa comunica nas condições que escolheu; por si só, não estabelecem liderança de mercado nem fiabilidade ampla.
O quadro independente é menos favorável. A Artificial Analysis atribui ao Grok 4.7 uma pontuação de inteligência de 46, em comparação com 53 para o GPT-6 e 53 para o Claude Fable 5.1. Na escala desse avaliador, o Grok 4.7 fica atrás dos dois modelos líderes mencionados na comparação. A Artificial Analysis também reporta uma diferença grande no Terminal Bench. Estas são medições independentes, distintas das alegações de benchmark da própria SpaceXAI. Não eliminam a relevância do modelo de base maior nem do preço padrão inalterado, mas limitam qualquer alegação de que o Grok 4.7 tenha alcançado os concorrentes mais fortes em inteligência medida.
A diferença entre os resultados do fornecedor e os resultados independentes é o ponto analítico central. Os números da SpaceXAI podem sustentar a leitura de que o Grok 4.7 melhora nas áreas que a empresa mede e promove. A Artificial Analysis sustenta uma conclusão diferente: nos seus testes independentes, o modelo continua atrás do GPT-6 e do Claude Fable 5.1, com uma diferença particularmente grande no Terminal Bench. Nenhum dos conjuntos de números prova tudo. Benchmarks de fornecedor não resolvem uma classificação independente. Pontuações independentes não descrevem todas as cargas de trabalho privadas possíveis. Em conjunto, sugerem uma versão com alterações técnicas significativas, mas não uma que, segundo as provas independentes citadas, lidere o mercado.
Implicações práticas
Para utilizadores da API, a implicação prática mais clara é que o Grok 4.7 altera as alegações de capacidade sem alterar o preço padrão por token. Uma equipa que use o acesso padrão veria a mesma tarifa listada de 2 dólares por milhão de tokens de entrada e 6 dólares por milhão de tokens de saída, ao mesmo tempo que ganha acesso ao modelo maior, à janela de contexto de 500 000 tokens e aos quatro níveis de raciocínio. Se for necessário o nível mais rápido, o custo muda de forma material, porque é o dobro do preço padrão. A estrutura de preços separa, assim, a atualização do modelo do prémio colocado no serviço mais rápido.
Para tarefas longas, o lançamento foi desenhado para ser mais relevante do que uma atualização de modelo orientada para pedidos curtos. Aprendizagem por reforço mais longa para tarefas extensas, treino de contexto longo e autoverificação apontam todos para casos de uso em que o modelo deve manter instruções, processar material extenso ou trabalhar através de operações com múltiplos passos. Ainda assim, os resultados independentes estabelecem um limite para as expectativas. Um modelo de base maior e um contexto mais longo podem ajudar em fluxos de trabalho complexos, mas a pontuação de 46 da Artificial Analysis contra 53 para o GPT-6 e o Claude Fable 5.1 indica que avaliadores independentes continuam a ver uma diferença de desempenho no topo.
O resultado é uma atualização medida, não uma substituição clara dos modelos líderes. O Grok 4.7 chega com disponibilidade mais ampla, um modelo de base maior, treino para tarefas longas, autoverificação, treino de contexto longo, preço padrão da API inalterado e um nível mais rápido de custo superior. Os resultados CursorBench, DeepSWE e EEBench comunicados pela SpaceXAI mostram o enquadramento de benchmark da própria empresa. A Artificial Analysis fornece o contraponto independente, colocando o Grok 4.7 atrás do GPT-6 e do Claude Fable 5.1 e assinalando uma grande diferença no Terminal Bench. O lançamento é relevante, mas as provas disponíveis não sustentam tratá-lo como o novo líder de benchmark.
Fontes
- SpaceXAI releases Grok 4.7MarkTechPost · 21 de setembro de 2026
- Grok 4.7 is xAI's strongest model yet, but trails Claude Fable 5.1 and GPT-6The Decoder · 21 de setembro de 2026



