Назад към Новини
ИновацияAI Understanding брифинг

TipRanks докладва юридически ориентир върху разходите, за Muse Spark 1.3 на Meta

TipRanks съобщи, че собствените бенчмаркове на Vals AI поставят Muse Spark 1.3 (Max) на Meta близо до Fable 5 и GPT 5.6 Sol, като струват 4–8 пъти по-малко, според публикация на Vals AI LinkedIn. Резултатите и твърденията за цените не са независимо потвърдени.

4 min readRead the linked source
Source-provided image accompanying TipRanks reports cost-focused legal benchmark for Meta’s Muse Spark 1.3
ИзточникИзточникът е записан
Издател
tipranks.com
Изходна връзка
tipranks.comhttps://www.tipranks.com/news/private-companies/benchmark-data-suggests-cost-competitive-performance-for-metas-muse-spark-1-3-in-legal-ai
Тип източник
Свързан източник — статусът на първичен източник не е установен.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Бенчмарк
Стандартизиран тест или набор от данни, използвани за измерване и сравняване на ефективността на модела.
API (интерфейс за програмиране на приложения)
Структуриран начин за една софтуерна система да изпраща заявки до и да получава отговори от друга система.
Контекстен прозорец
Максималното количество входни токени, които един езиков модел може да обработва наведнъж.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

TipRanks съобщи, че вътрешните тестове на Vals AI класираха Muse Spark 1.3 (Max) на първо място в своя бенчмарк за правни изследвания и на второ място в бенчмарка на правния агент на Harvey. В доклада се казва, че моделът е оценен с разрешени максимални разсъждения и контекстен прозорец от 1 милион токена, но не установява обща наличност или независимо проверява тестването.

TipRanks съобщи, че Vals AI каза, че Muse Spark 1.3 (Max) на Meta се представя подобно на Fable 5 и GPT 5.6 Sol в собствения Vals Index на Vals AI. Съобщава се, че същата публикация е класирала Muse Spark 1.3 на първо място в In-house Legal Research на Vals AI и на второ място в Harvey's Legal Agent Benchmark. TipRanks приписва докладваната скорост на модела на по-малко разговори и по-бързи индивидуални заявки, но източникът не предостави методологията за сравнение, разпределението на задачите или сравнителните резултати с достатъчно подробности, за да оцени тези твърдения независимо.

В доклада се казва, че тестването използва максимално разсъждение, контекстен прозорец от 1 милион токена, максимален изход от 131 000 токена и настройки за вземане на проби по подразбиране. Той цитира цени от $1,25 и $4,25 за милион токени за различни нива на използване и каза, че Vals AI е наблюдавал откази по чувствителни теми, включително контрол върху износа, арести за престъпления и търговски санкции в 10 от 1327 задачи. TipRanks приписва тези цифри на публикацията LinkedIn на Vals AI; нито условията за достъп на модела, нито цифрите бяха независимо потвърдени в предоставения източник.

Детайли за източника: tipranks.com ↗

Защо има значение

Ако се възпроизведе независимо, отчетената комбинация от сравнима производителност и по-ниска цена на токена може да повлияе на начина, по който компаниите за правни технологии избират модели за проучване, анализ на договори и други работни потоци с дълъг контекст. По-ниските разходи за изводи също биха могли да подобрят производителността или да намалят цените на клиентите. Въпреки това, доказателствата идват от патентован бенчмарк, описан в публикация на LinkedIn и предадени от автоматично генерираното бюро за новини на TipRanks, така че резултатите трябва да се третират като предварителни, а не като установено пазарно сравнение.

Правните системи с изкуствен интелект често обработват дълги записи на дела, договори и изследователски материали, което прави контекстни ограничения, латентност и оперативни разходи за токени. Достоверно предимство в разходите при подобно качество може да направи разсъжденията в широк контекст по-жизнеспособни за по-малките фирми и да окаже натиск върху цените или маржовете на конкурентните доставчици на модели. Практическото значение остава несигурно, тъй като източникът съобщава за патентовани тестове, а не за рецензирана или независимо одитирана оценка.

Докладваните откази илюстрират компромис между контрола за безопасност и покриването на задачите в регулирани професионални условия. Отказът на някои чувствителни правни въпроси може да е подходящ, но организациите ще трябва да знаят дали отказите са предвидими, обясними и съвместими с техните задължения за съответствие. Източникът не предоставя независима оценка на фактическата точност, защитата на поверителността, сигурността или правните резултати в реалния свят.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Ключовите въпроси са дали независимите оценители могат да възпроизведат класирането и ценово предимство, дали цитираното ценообразуване е актуално и устойчиво и дали моделът е достъпен за разработчиците на правни технологии при сравними условия. Купувачите също трябва да проучат докладваните откази по чувствителни правни теми и да тестват точността, забавянето, поверителността и съответствието в собствените си работни процеси.

Независимото тестване трябва да сравнява едни и същи подкани, инструменти, дължини на контекста, настройки за вземане на проби и предположения за ценообразуване в Muse Spark 1.3, Fable 5 и GPT 5.6 Sol. Съставът на задачите на бенчмарка и правилата за точкуване не са предоставени в предоставения отчет, което ограничава това, което може да се направи от класирането.

Източникът не документира кой има достъп до Muse Spark 1.3 (макс.), чрез кой API или продукт, при какви регионални или договорни ограничения или на каква текуща цена. Последващият отчет трябва да провери наличността, ограниченията на скоростта, условията за използване на данни и дали цитираните тарифи от $1,25 и $4,25 се прилагат широко или само за определени нива.

Законните купувачи трябва да тестват отказите по чувствителни теми, качеството на цитирането, последователността в дългите документи, поведението при използване на инструменти и изискванията за преглед от човек, преди да разчитат на модела. Докладваните 10 отказа от 1327 задачи са твърдение от Vals AI, предадено от TipRanks, а не независимо валидиран процент на безопасност или надеждност.

Свързани ръководства и викторини

Обяснени модели на AIChatGPT и LLMЕтика на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?