Вернуться к новостям
ИнновацииAI Understanding брифинг

TipRanks сообщает о экономически ориентированном юридическом эталоне для Muse Spark 1.3 от Meta

Компания TipRanks сообщила, что собственные тесты Vals AI поставили Muse Spark 1.3 (Max) Meta рядом с Fable 5 и GPT 5.6 Sol, но при этом стоили в 4–8 раз меньше, согласно сообщению Vals AI LinkedIn. Заявления о результатах и ​​ценах не были независимо подтверждены.

4 min readRead the linked source
Source-provided image accompanying TipRanks reports cost-focused legal benchmark for Meta’s Muse Spark 1.3
Ссылка на источникИсточник записан
Издатель
tipranks.com
Ссылка на источник
tipranks.comhttps://www.tipranks.com/news/private-companies/benchmark-data-suggests-cost-competitive-performance-for-metas-muse-spark-1-3-in-legal-ai
Тип источника
Связанный источник — статус первоисточника не установлен.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
API (интерфейс прикладного программирования)
Структурированный способ отправки одной программной системой запросов и получения ответов от другой системы.
Контекстное окно
Максимальное количество входных токенов, которые языковая модель может обработать одновременно.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

TipRanks сообщил, что внутренние тесты Vals AI поставили Muse Spark 1.3 (Max) на первое место в рейтинге юридических исследований и на второе место в тесте юридических агентов Harvey. В отчете говорится, что модель оценивалась с включенным максимальным рассуждением и контекстным окном в 1 миллион токенов, но не была установлена ​​общедоступность или независимая проверка тестирования.

TipRanks сообщил, что Vals AI заявил, что Muse Spark 1.3 (Max) Meta работает аналогично Fable 5 и GPT 5.6 Sol на собственном Vals Index Vals AI. В том же сообщении Muse Spark, как сообщается, заняла первое место в рейтинге юридических исследований Vals AI и второе место в рейтинге юридических агентов Harvey. TipRanks объяснил заявленную скорость модели меньшим количеством разговоров и более быстрыми отдельными запросами, но источник не предоставил методологию тестирования, распределение задач или сравнительные результаты достаточно подробно, чтобы оценить эти утверждения независимо.

В отчете говорится, что при тестировании использовалось максимальное обоснование, контекстное окно в 1 миллион токенов, максимальный вывод в 131 000 токенов и настройки выборки по умолчанию. Он назвал цены в $1,25 и $4,25 за миллион токенов для разных уровней использования и сообщил, что Vals AI наблюдал отказы по деликатным темам, включая экспортный контроль, аресты за уголовные преступления и торговые санкции, в 10 из 1327 задач. Компания TipRanks приписала эти цифры публикации Vals AI LinkedIn; ни условия доступа к модели, ни цифры не были независимо подтверждены в предоставленном источнике.

Подробности об источнике: tipranks.com ↗

Почему это важно

При независимом воспроизведении сообщаемая комбинация сопоставимой производительности и более низкой цены на токены может повлиять на то, как компании, занимающиеся юридическими технологиями, выбирают модели для исследований, анализа контрактов и других долгосрочных рабочих процессов. Снижение затрат на вывод также может повысить пропускную способность или снизить цены для клиентов. Тем не менее, доказательства получены из собственного теста, описанного в сообщении LinkedIn и переданного автоматически созданной службой новостей TipRanks, поэтому результаты следует рассматривать как предварительные, а не как устоявшееся рыночное сравнение.

Юридические системы искусственного интеллекта часто обрабатывают длинные записи дел, контракты и исследовательские материалы, создавая оперативные проблемы с контекстными ограничениями, задержками и затратами на токены. Реальное ценовое преимущество при аналогичном качестве может сделать рассуждения в большом контексте более жизнеспособными для небольших фирм и оказать давление на цены или прибыль конкурирующих поставщиков моделей. Практическая значимость остается неопределенной, поскольку источник сообщает о патентованных тестах, а не об оценке, прошедшей рецензирование или независимый аудит.

Сообщения об отказах иллюстрируют компромисс между мерами безопасности и выполнением задач в регулируемых профессиональных условиях. Отказ от некоторых деликатных юридических вопросов может быть уместным, но организациям необходимо знать, являются ли отказы предсказуемыми, объяснимыми и совместимыми с их обязательствами по соблюдению требований. Источник не предоставляет независимой оценки фактической точности, защиты конфиденциальности, безопасности или реальных юридических результатов.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Ключевые вопросы заключаются в том, смогут ли независимые оценщики воспроизвести рейтинг и ценовое преимущество, являются ли указанные цены актуальными и устойчивыми, а также доступна ли модель разработчикам юридических технологий на сопоставимых условиях. Покупателям также следует изучить сообщения об отказах по деликатным юридическим темам и проверить точность, задержку, конфиденциальность и соответствие требованиям в своих собственных рабочих процессах.

Независимое тестирование должно сравнивать одни и те же подсказки, инструменты, длину контекста, настройки выборки и ценовые предположения в Muse Spark 1.3, Fable 5 и GPT 5.6 Sol. Состав задач эталонного теста и правила оценки не представлены в предоставленном отчете, что ограничивает выводы, которые можно сделать на основе рейтингов.

Источник не указывает, кто может получить доступ к Muse Spark 1.3 (Max), через какой API или продукт, при каких региональных или договорных ограничениях или по какой текущей цене. Последующие отчеты должны проверять доступность, ограничения ставок, условия использования данных, а также то, применимы ли указанные ставки в размере 1,25 доллара США и 4,25 доллара США в целом или только к определенным уровням.

Юридическим покупателям следует проверить отказы на деликатные темы, качество цитирования, согласованность длинных документов, поведение при использовании инструментов и требования к проверке человеком, прежде чем полагаться на модель. Сообщенные о 10 отказах из 1327 задач — это заявление Vals AI, переданное TipRanks, а не независимо подтвержденный уровень безопасности или надежности.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаChatGPT и LLMЭтика ИИПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?