Voltar às notícias
InovaçãoInstruções AI Understanding

TipRanks relata benchmark legal com foco em custos para Muse Spark 1.3 de Meta

TipRanks relatou que os benchmarks proprietários da Vals AI colocaram o Muse Spark 1.3 (Max) do Meta perto de Fable 5 e GPT 5.6 Sol, custando 4x-8x menos, de acordo com uma postagem Vals AI LinkedIn. Os resultados e as reivindicações de preços não foram confirmados de forma independente.

4 min readRead the linked source
Source-provided image accompanying TipRanks reports cost-focused legal benchmark for Meta’s Muse Spark 1.3
Referência de fonteFonte registrada
Editora
tipranks.com
Link da fonte
tipranks.comhttps://www.tipranks.com/news/private-companies/benchmark-data-suggests-cost-competitive-performance-for-metas-muse-spark-1-3-in-legal-ai
Tipo de fonte
Fonte vinculada — o status da fonte primária não foi estabelecido.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Referência
Um teste padronizado ou conjunto de dados usado para medir e comparar o desempenho do modelo.
API (Interface de Programação de Aplicativo)
Uma maneira estruturada de um sistema de software enviar solicitações e receber respostas de outro sistema.
Janela de contexto
A quantidade máxima de tokens de entrada que um modelo de linguagem pode processar de uma só vez.
Teste você mesmoQuestionário explicado sobre modelos de IA

O que aconteceu

TipRanks relatou que os testes internos da Vals AI classificaram Muse Spark 1.3 (Max) em primeiro lugar em seu de pesquisa jurídica e em segundo lugar no benchmark de agente jurídico de Harvey. O relatório disse que o modelo foi avaliado com o raciocínio máximo habilitado e uma janela de contexto de 1 milhão de tokens, mas não estabeleceu a disponibilidade geral nem verificou os testes de forma independente.

TipRanks relatou que Vals AI disse que Muse Spark 1.3 (Max) de Meta teve desempenho semelhante ao Fable 5 e GPT 5.6 Sol no Vals Index proprietário da Vals AI. A mesma postagem supostamente classificou Muse Spark 1.3 em primeiro lugar no de pesquisa jurídica interno da Vals AI e em segundo lugar no benchmark de agente jurídico de Harvey. TipRanks atribuiu a velocidade relatada do modelo a menos conversas e consultas individuais mais rápidas, mas a fonte não forneceu a metodologia de benchmark, distribuição de tarefas ou resultados comparativos com detalhes suficientes para avaliar essas afirmações de forma independente.

O relatório disse que os testes usaram raciocínio máximo, uma janela de contexto de 1 milhão de tokens, uma produção máxima de 131.000 tokens e configurações de amostragem padrão. Ele citou preços de US$ 1,25 e US$ 4,25 por milhão de tokens para diferentes níveis de uso e disse que Vals AI observou recusas em tópicos delicados, incluindo controles de exportação, prisões criminais e sanções comerciais em 10 das 1.327 tarefas. TipRanks atribuiu esses números à postagem LinkedIn de Vals AI; nem os termos de acesso do modelo nem os números foram confirmados de forma independente na fonte fornecida.

Detalhes da fonte: tipranks.com ↗

Por que isso importa

Se reproduzida de forma independente, a combinação relatada de desempenho comparável e preços simbólicos mais baixos poderia afetar a forma como as empresas de tecnologia jurídica escolhem modelos para investigação, análise de contratos e outros fluxos de trabalho de longo contexto. Custos de inferência mais baixos também poderiam melhorar o rendimento ou reduzir os preços para os clientes. No entanto, a evidência vem de um proprietário descrito em uma postagem LinkedIn e retransmitida pela redação gerada automaticamente pelo TipRanks, portanto, os resultados devem ser tratados como preliminares e não como uma comparação de mercado estabelecida.

Os sistemas jurídicos de IA muitas vezes processam registros de casos, contratos e materiais de pesquisa extensos, tornando os limites de contexto, a latência e os custos de token preocupações operacionais. Uma vantagem de custo credível com qualidade semelhante poderia tornar o raciocínio de grande contexto mais viável para empresas mais pequenas e exercer pressão sobre os preços ou margens dos fornecedores de modelos concorrentes. O significado prático permanece incerto porque a fonte relata testes proprietários em vez de uma avaliação revisada por pares ou auditada de forma independente.

As recusas comunicadas ilustram um compromisso entre os controlos de segurança e a cobertura de tarefas em ambientes profissionais regulamentados. Recusar algumas questões jurídicas sensíveis pode ser apropriado, mas as organizações precisariam de saber se as recusas são previsíveis, explicáveis ​​e compatíveis com as suas obrigações de conformidade. A fonte não fornece nenhuma avaliação independente de precisão factual, proteções de privacidade, segurança ou resultados jurídicos do mundo real.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

O que assistir a seguir

As principais questões são se os avaliadores independentes podem reproduzir a classificação e a vantagem de custo, se o preço citado é actual e sustentável, e se o modelo está disponível para os criadores de tecnologia jurídica em termos comparáveis. Os compradores também devem examinar as recusas relatadas sobre temas jurídicos sensíveis e testar a precisão, a latência, a privacidade e a conformidade em seus próprios fluxos de trabalho.

Os testes independentes devem comparar os mesmos prompts, ferramentas, comprimentos de contexto, configurações de amostragem e suposições de preços no Muse Spark 1.3, Fable 5 e GPT 5.6 Sol. A composição das tarefas e as regras de pontuação do não são fornecidas no relatório fornecido, limitando o que pode ser concluído a partir das classificações.

A fonte não documenta quem pode acessar o Muse Spark 1.3 (Max), por meio de qual API ou produto, sob quais restrições regionais ou contratuais, ou a que preço atual. Os relatórios de acompanhamento devem verificar a disponibilidade, os limites de tarifas, os termos de uso dos dados e se as taxas citadas de US$ 1,25 e US$ 4,25 se aplicam amplamente ou apenas a níveis específicos.

Os compradores legais devem testar as recusas de tópicos delicados, a qualidade das citações, a consistência em documentos longos, o comportamento de uso de ferramentas e os requisitos de revisão humana antes de confiar no modelo. As 10 recusas relatadas de 1.327 tarefas são uma afirmação da Vals AI transmitida pelo TipRanks, e não uma taxa de segurança ou confiabilidade validada de forma independente.

Guias e questionários relacionados

Modelos de IA explicadosChatGPT e LLMÉtica da IATeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?