ماذا حدث
أفادت TipRanks أن الاختبارات الداخلية لشركة Vals AI صنفت Muse Spark 1.3 (Max) في المرتبة الأولى في معيار البحث القانوني الخاص بها والثانية في معيار وكيل Harvey القانوني. قال التقرير إن النموذج تم تقييمه مع تمكين الحد الأقصى من الاستدلال ونافذة سياق مكونة من مليون رمز، لكنه لم يحدد التوفر العام أو التحقق بشكل مستقل من الاختبار.
ذكرت TipRanks أن Vals AI قالت إن أداء Muse Spark 1.3 (Max) من Meta مشابه لأداء Fable 5 وGPT 5.6 Sol على مؤشر Vals المملوك لشركة Vals AI. وبحسب ما ورد، صنف المنشور نفسه Muse Spark 1.3 في المرتبة الأولى على معيار البحث القانوني الداخلي لشركة Vals AI والثاني على مقياس Harvey's Legal Agent . أرجعت TipRanks سرعة النموذج المبلغ عنها إلى عدد أقل من المنعطفات المحادثة والاستعلامات الفردية الأسرع، لكن المصدر لم يقدم المنهجية المعيارية أو توزيع المهام أو النتائج المقارنة بتفاصيل كافية لتقييم تلك الادعاءات بشكل مستقل.
قال التقرير إن الاختبار استخدم الحد الأقصى من الاستدلال، ونافذة سياق مكونة من مليون رمز، والحد الأقصى للإنتاج 131000 رمز، وإعدادات أخذ العينات الافتراضية. واستشهدت بأسعار 1.25 دولارًا و4.25 دولارًا لكل مليون رمز مميز لمستويات الاستخدام المختلفة وقالت إن Vals AI لاحظت رفضًا لمواضيع حساسة بما في ذلك ضوابط التصدير والاعتقالات الجنائية والعقوبات التجارية في 10 من أصل 1327 مهمة. أرجعت TipRanks هذه الأرقام إلى منشور LinkedIn الخاص بشركة Vals AI؛ لم يتم تأكيد شروط الوصول للنموذج ولا الأرقام بشكل مستقل في المصدر المقدم.
لماذا يهم
إذا تم استنساخها بشكل مستقل، فإن المزيج المبلغ عنه من الأداء المقارن وانخفاض أسعار الرمز المميز يمكن أن يؤثر على كيفية اختيار شركات التكنولوجيا القانونية لنماذج البحث، وتحليل العقود، وغير ذلك من سير العمل طويل السياق. يمكن أن تؤدي تكاليف الاستدلال المنخفضة أيضًا إلى تحسين الإنتاجية أو تقليل أسعار العملاء. ومع ذلك، فإن الدليل يأتي من معيار الملكية الموضح في منشور LinkedIn وتم نقله بواسطة مكتب الأخبار الذي تم إنشاؤه تلقائيًا في TipRanks، لذلك يجب التعامل مع النتائج على أنها أولية وليس على أنها مقارنة سوقية ثابتة.
غالبًا ما تقوم أنظمة الذكاء الاصطناعي القانوني بمعالجة سجلات القضايا والعقود والمواد البحثية الطويلة، مما يجعل حدود السياق وزمن الوصول والتكاليف الرمزية بمثابة مخاوف تشغيلية. إن ميزة التكلفة الموثوقة بجودة مماثلة يمكن أن تجعل التفكير في السياق الكبير أكثر قابلية للتطبيق بالنسبة للشركات الأصغر حجما، وتفرض ضغوطا على أسعار أو هوامش مقدمي النماذج المتنافسين. تظل الأهمية العملية غير مؤكدة لأن المصدر يذكر اختبارات الملكية بدلاً من التقييم الخاضع لمراجعة النظراء أو التقييم المدقق بشكل مستقل.
توضح حالات الرفض المبلغ عنها المفاضلة بين ضوابط السلامة وتغطية المهام في البيئات المهنية المنظمة. قد يكون رفض بعض الأسئلة القانونية الحساسة أمرًا مناسبًا، ولكن المنظمات ستحتاج إلى معرفة ما إذا كانت حالات الرفض يمكن التنبؤ بها وقابلة للتفسير ومتوافقة مع التزامات الامتثال الخاصة بها. لا يقدم المصدر أي تقييم مستقل لدقة الوقائع، أو حماية الخصوصية، أو الأمن، أو النتائج القانونية في العالم الحقيقي.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
Which component of an AI application is the machine-learning model itself?
ماذا تشاهد بعد ذلك
وتتمثل الأسئلة الرئيسية في ما إذا كان المقيِّمون المستقلون قادرين على إعادة إنتاج التصنيف وميزة التكلفة، وما إذا كان التسعير المذكور حاليًا ومستدامًا، وما إذا كان النموذج متاحًا لمطوري التكنولوجيا القانونية بموجب شروط قابلة للمقارنة. يجب على المشترين أيضًا فحص حالات الرفض المبلغ عنها بشأن الموضوعات القانونية الحساسة ودقة الاختبار وزمن الوصول والخصوصية والامتثال في سير العمل الخاص بهم.
يجب أن يقارن الاختبار المستقل نفس المطالبات والأدوات وأطوال السياق وإعدادات العينات وافتراضات التسعير عبر Muse Spark 1.3 وFable 5 وGPT 5.6 Sol. لا يتم توفير تكوين مهمة المعيار وقواعد التسجيل في التقرير المرفق، مما يحد مما يمكن استخلاصه من التصنيفات.
لا يوثق المصدر من يمكنه الوصول إلى Muse Spark 1.3 (Max)، ومن خلال أي واجهة برمجة تطبيقات أو منتج، وتحت أي قيود إقليمية أو تعاقدية، أو بأي سعر حالي. يجب أن تتحقق تقارير المتابعة من التوفر، وحدود الأسعار، وشروط استخدام البيانات، وما إذا كانت الأسعار المذكورة 1.25 دولارًا و4.25 دولارًا تنطبق على نطاق واسع أو على مستويات معينة فقط.
يجب على المشترين القانونيين اختبار حالات رفض المواضيع الحساسة، وجودة الاستشهاد، والاتساق عبر المستندات الطويلة، وسلوك استخدام الأدوات، ومتطلبات المراجعة البشرية قبل الاعتماد على النموذج. إن حالات الرفض العشرة المبلغ عنها من أصل 1327 مهمة هي مطالبة من Vals AI تم ترحيلها بواسطة TipRanks، وليست معدل أمان أو موثوقية تم التحقق منه بشكل مستقل.