Meta lança Muse Spark 1.3 com foco em agentes mais autônomos
A Meta atualiza seu modelo de IA para tarefas agênticas e de programação: melhor em instruções longas, mais barato por tarefa que a concorrência, e já líder em um benchmark bancário segundo a Artificial Analysis.

A Meta anunciou o Muse Spark 1.3, nova versão do seu modelo de IA voltado para tarefas agênticas e de programação. O modelo já está disponível no Muse Code e na API Meta Model, a interface que expõe os modelos da empresa a desenvolvedores externos. Segundo a Meta, esta versão foi projetada para lidar melhor com tarefas longas, de múltiplas etapas: diante de um objetivo aberto, o modelo usa ferramentas para reunir informação, identifica falhas no próprio planejamento e mantém registro do que descobre ao longo do caminho.
Como o modelo lida com o que não sabe
Quando uma instrução é ambígua, o Muse Spark 1.3 pode interromper o trabalho para pedir esclarecimentos, em vez de seguir adiante com uma suposição. Diante de um obstáculo que não consegue superar sozinho, ele pode pedir ajuda; e antes de executar uma ação de consequência importante, pede confirmação ao usuário. Quem opera o modelo também pode escolher entre receber atualizações frequentes sobre o andamento da tarefa ou deixar o sistema trabalhar em segundo plano até concluir.
Os avanços que a Meta destaca
A empresa lista uma série de ganhos em relação à versão anterior: maior precisão no cumprimento de instruções longas, preservação de exigências e restrições ao longo de toda a tarefa, melhor gestão de múltiplos pedidos dentro de uma mesma conversa, maior consciência sobre o que o modelo sabe ou não sabe, e menor tendência a inventar resultados. Na programação, a Meta afirma que o modelo ficou menos verboso e mais eficiente.
- Cerca de 20% menos chamadas de ferramentas do que o Muse Spark 1.2, em testes internos comparativos
- Cerca de 25% menos tokens consumidos na mesma comparação
- Modo de raciocínio máximo ('max') liberado apenas após testes de segurança adicionais, sem data definida pela Meta
O quarto modelo da série em cinco meses
O Muse Spark 1.3 é o quarto lançamento da série em cinco meses: a linhagem estreou em abril, ganhou a versão 1.1 em julho e a 1.2 em agosto, segundo o site alemão The Decoder, que cruzou os números com os benchmarks da Artificial Analysis. A nova versão chega em dois patamares: 'max', em pré-visualização limitada para parceiros, e 'xhigh', já disponível de forma geral. No Intelligence Index da Artificial Analysis, o patamar max marca 62 pontos e o xhigh 61 — contra 57 em agosto e 53 em julho.
O que mudou nos benchmarks de agentes
No τ³-Bench Banking, um teste que avalia agentes manipulando ferramentas em um cenário bancário simulado, o patamar max chega a 52%, hoje a melhor marca do ranking da Artificial Analysis; o xhigh atinge 47%, empatado com o Claude Fable 5.1 (max), da Anthropic, e com o GLM-5.3-Flash. A versão anterior, 1.2, havia marcado 35% no mesmo teste. Já no Terminal-Bench 2.1, voltado à programação em terminal, o xhigh subiu de 80% para 85% e o max chegou a 86% — ainda atrás do Claude Fable 5.1, líder da tabela com 91,4% no patamar max.
No GDPval-AA v2, um conjunto de 220 tarefas profissionais reais avaliadas em uma escala Elo calibrada pelo desempenho humano, a Meta avançou de 1615 para 1709 e depois para 1754 pontos entre as versões. O Claude Fable 5.1 (max) segue à frente, com 1853 pontos; para alcançar essa diferença, a variante max do Muse Spark consome 62% mais tokens de raciocínio do que a xhigh. Em GPQA Diamond, bateria de perguntas científicas de nível especialista, o Muse Spark foi de 90% para 94% — no grupo de ponta, mas atrás do Gemini 3.8 Flash (high, 95,3%) e do Grok 4.6 (high, 94,9%). Em CritPt, teste de física de pesquisa, a evolução foi de 18% para 26%, com a liderança ainda nas mãos do GPT-5.6 Sol (max, 32,3%) e do Claude Fable 5.1 (xhigh, 31,1%).
Nem tudo melhorou: o AA-LCR recuou de 83% para 79% em relação à versão 1.2, e a precisão factual no AA-Omniscience caiu até três pontos, porque o modelo passou a recusar responder com mais frequência quando está incerto.
Preço mais baixo, segurança reforçada
No preço, a Meta manteve US$ 1,25 por milhão de tokens de entrada e US$ 4,25 por milhão de tokens de saída — os mesmos valores da versão anterior. Uma tarefa do índice de inteligência custa, em média, US$ 0,55, o valor mais baixo entre os modelos que pontuam 59 ou mais no índice; a concorrência custa entre US$ 0,94 e US$ 1,23 pela mesma tarefa. Ainda assim, o Muse Spark 1.3 sai mais caro do que o 1.2, que custava US$ 0,40 por tarefa — a Meta ainda não anunciou o preço da variante max. A empresa também disse que modelos maiores estão a caminho, assim como uma futura versão em pesos abertos (open-weights).
Em segurança, a Meta afirma que o Muse Spark 1.3 resiste melhor a entradas adversárias e a tentativas de injeção de prompt, além de avaliar com mais precisão se uma ação é irreversível antes de executá-la. Por isso, o modo de raciocínio máximo só deve ser liberado depois de rodadas adicionais de testes de segurança — a empresa não deu prazo.
Para desenvolvedores e startups brasileiras que hoje escolhem entre o ecossistema mais aberto da Meta e os modelos fechados da Anthropic ou do Google para programação agêntica, o Muse Spark 1.3 muda a conta de duas formas. Primeiro, o preço por tarefa mais baixo entre os modelos de ponta reduz o custo de rodar agentes de longa duração — uma vantagem concreta para equipes brasileiras que operam em real e sentem o câmbio em cada fatura de API cobrada em dólar. Segundo, a promessa de uma futura versão em pesos abertos reforça um caminho que já atrai empresas locais preocupadas com soberania de dados e custo de infraestrutura: rodar o modelo na própria nuvem, sem depender de uma API fechada no exterior. A distância ainda existe — o Claude Fable 5.1 segue à frente em quase todos os benchmarks citados —, mas encolheu o suficiente para que a escolha deixe de ser óbvia.
Fontes
- Meta lança Muse Spark 1.3 com foco em agentes mais autônomosOlhar Digital · 3 de setembro de 2026
- Meta schließt mit Muse Spark 1.3 zur Spitze auf, lockt mit niedrigen PreisenThe Decoder · 2 de setembro de 2026



