Apa yang berlaku
TipRanks melaporkan bahawa ujian dalaman Vals AI meletakkan Muse Spark 1.3 (Max) pertama pada penanda aras penyelidikan undang-undangnya dan kedua pada penanda aras ejen sah Harvey. Laporan itu berkata model itu dinilai dengan penaakulan maksimum didayakan dan tetingkap konteks 1 juta token, tetapi ia tidak mewujudkan ketersediaan umum atau mengesahkan ujian secara bebas.
TipRanks melaporkan bahawa Vals AI berkata Muse Spark 1.3 (Max) Meta berprestasi serupa dengan Fable 5 dan GPT 5.6 Sol pada Indeks Vals proprietari Vals AI. Jawatan yang sama dilaporkan meletakkan Muse Spark 1.3 pertama pada Penanda Aras Penyelidikan Undang-undang dalaman Vals AI dan kedua pada Penanda Aras Agen Undang-undang Harvey. TipRanks mengaitkan kelajuan model yang dilaporkan kepada lebih sedikit giliran perbualan dan pertanyaan individu yang lebih pantas, tetapi sumber itu tidak memberikan metodologi penanda aras, pengagihan tugas atau hasil perbandingan dengan cukup terperinci untuk menilai tuntutan tersebut secara bebas.
Laporan itu berkata ujian menggunakan penaakulan maksimum, tetingkap konteks 1 juta token, output maksimum 131,000 token, dan tetapan pensampelan lalai. Ia memetik harga token $1.25 dan $4.25 bagi setiap juta untuk peringkat penggunaan yang berbeza dan berkata Vals AI memerhatikan penolakan terhadap topik sensitif termasuk kawalan eksport, penangkapan jenayah dan sekatan perdagangan dalam 10 daripada 1,327 tugasan. TipRanks mengaitkan angka ini kepada siaran LinkedIn Vals AI; baik syarat akses model mahupun angka tidak disahkan secara bebas dalam sumber yang dibekalkan.
Butiran sumber: tipranks.com ↗
Mengapa ia penting
Jika diterbitkan semula secara bebas, gabungan prestasi setanding yang dilaporkan dan harga token yang lebih rendah boleh menjejaskan cara syarikat teknologi undang-undang memilih model untuk penyelidikan, analisis kontrak dan aliran kerja konteks panjang yang lain. Kos inferens yang lebih rendah juga boleh meningkatkan daya pengeluaran atau mengurangkan harga pelanggan. Walau bagaimanapun, bukti itu datang daripada penanda aras proprietari yang diterangkan dalam siaran LinkedIn dan disampaikan oleh meja berita jana automatik TipRanks, jadi hasilnya harus dianggap sebagai permulaan dan bukannya sebagai perbandingan pasaran yang mantap.
Sistem AI undang-undang sering memproses rekod kes, kontrak dan bahan penyelidikan yang panjang, membuat had konteks, kependaman dan kos token kebimbangan operasi. Kelebihan kos yang boleh dipercayai pada kualiti yang sama boleh menjadikan alasan konteks besar lebih berdaya maju untuk firma yang lebih kecil dan memberi tekanan pada harga atau margin pembekal model yang bersaing. Kepentingan praktikal masih tidak pasti kerana sumber melaporkan ujian proprietari dan bukannya penilaian yang disemak rakan sebaya atau diaudit secara bebas.
Penolakan yang dilaporkan menggambarkan pertukaran antara kawalan keselamatan dan liputan tugas dalam tetapan profesional terkawal. Menolak beberapa soalan undang-undang yang sensitif mungkin sesuai, tetapi organisasi perlu mengetahui sama ada penolakan boleh diramal, boleh dijelaskan dan serasi dengan kewajipan pematuhan mereka. Sumber itu tidak memberikan penilaian bebas tentang ketepatan fakta, perlindungan privasi, keselamatan atau hasil undang-undang dunia sebenar.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Soalan utama ialah sama ada penilai bebas boleh menghasilkan semula kedudukan dan kelebihan kos, sama ada harga yang disebut adalah semasa dan mampan, dan sama ada model itu tersedia untuk pembangun teknologi undang-undang di bawah syarat yang setanding. Pembeli juga harus meneliti penolakan yang dilaporkan mengenai topik undang-undang yang sensitif dan ketepatan ujian, kependaman, privasi dan pematuhan dalam aliran kerja mereka sendiri.
Ujian bebas harus membandingkan gesaan, alatan, panjang konteks, tetapan pensampelan dan andaian harga yang sama merentas Muse Spark 1.3, Fable 5 dan GPT 5.6 Sol. Komposisi tugasan penanda aras dan peraturan pemarkahan tidak disediakan dalam laporan yang dibekalkan, mengehadkan apa yang boleh disimpulkan daripada kedudukan.
Sumber itu tidak mendokumenkan siapa yang boleh mengakses Muse Spark 1.3 (Max), melalui API atau produk mana, di bawah sekatan serantau atau kontrak, atau pada harga semasa. Pelaporan susulan harus mengesahkan ketersediaan, had kadar, syarat penggunaan data dan sama ada kadar $1.25 dan $4.25 yang disebut digunakan secara meluas atau hanya untuk peringkat tertentu.
Pembeli sah harus menguji penolakan topik sensitif, kualiti petikan, konsistensi merentas dokumen panjang, tingkah laku penggunaan alat dan keperluan semakan manusia sebelum bergantung pada model. 10 penolakan yang dilaporkan daripada 1,327 tugasan adalah tuntutan daripada Vals AI yang disampaikan oleh TipRanks, bukan kadar keselamatan atau kebolehpercayaan yang disahkan secara bebas.