Ne oldu?
TipRanks, Vals AI'nin dahili testlerinin Muse Spark 1.3'ü (Max) yasal araştırma değerlendirmesinde birinci, Harvey'in yasal temsilci değerlendirmesinde ise ikinci sırada sıraladığını bildirdi. Raporda, modelin maksimum akıl yürütme etkinleştirilmiş ve 1 milyon jetonluk bağlam penceresiyle değerlendirildiği ancak genel kullanılabilirlik sağlamadığı veya testi bağımsız olarak doğrulamadığı belirtildi.
TipRanks, Vals AI'nin, Meta'nin Muse Spark 1.3'ünün (Max), Vals AI'nin tescilli Vals Index'inde Fable 5 ve GPT 5.6 Sol'a benzer performans gösterdiğini söylediğini bildirdi. Aynı gönderinin, Muse Spark 1.3'ü Vals AI'nin kurum içi Yasal Araştırma Karşılaştırmasında birinci, Harvey'in Yasal Ajan Karşılaştırmasında ise ikinci sıraladığı bildirildi. TipRanks, modelin bildirilen hızını daha az konuşma dönüşüne ve daha hızlı bireysel sorgulara bağladı, ancak kaynak, bu iddiaları bağımsız olarak değerlendirmek için kıyaslama metodolojisini, görev dağılımını veya karşılaştırmalı sonuçları yeterli ayrıntıda sunmadı.
Raporda, testlerde maksimum muhakeme, 1 milyon jetonluk bağlam penceresi, maksimum 131.000 jeton çıktısı ve varsayılan örnekleme ayarları kullanıldığı belirtildi. Farklı kullanım katmanları için milyon başına 1,25 dolar ve 4,25 dolarlık fiyatlara değinildi ve Vals AI'nin 1.327 görevin 10'unda ihracat kontrolleri, ağır suç tutuklamaları ve ticari yaptırımlar gibi hassas konularda reddedilmeler gözlemlediği belirtildi. TipRanks bu rakamları Vals AI'nin LinkedIn gönderisine bağladı; sağlanan kaynakta ne modelin erişim koşulları ne de rakamlar bağımsız olarak doğrulandı.
Kaynak ayrıntıları: tipranks.com ↗
Neden önemli?
Bağımsız olarak çoğaltılırsa, karşılaştırılabilir performans ve daha düşük token fiyatlandırmasının bildirilen kombinasyonu, yasal teknoloji şirketlerinin araştırma, sözleşme analizi ve diğer uzun bağlamlı iş akışları için modelleri nasıl seçtiğini etkileyebilir. Daha düşük çıkarım maliyetleri aynı zamanda verimi artırabilir veya müşteri fiyatlarını düşürebilir. Ancak kanıtlar, LinkedIn gönderisinde açıklanan ve TipRanks'ın otomatik olarak oluşturulan haber masası tarafından aktarılan özel bir kıyaslamadan geliyor; bu nedenle, sonuçlar yerleşik bir pazar karşılaştırması yerine ön hazırlık olarak değerlendirilmelidir.
Yasal yapay zeka sistemleri genellikle uzun vaka kayıtlarını, sözleşmeleri ve araştırma materyallerini işleyerek bağlam sınırlamaları, gecikme ve belirteç maliyetlerini operasyonel kaygılara dönüştürür. Benzer kalitede inandırıcı bir maliyet avantajı, geniş bağlamlı akıl yürütmeyi küçük firmalar için daha uygulanabilir hale getirebilir ve rakip model sağlayıcıların fiyatlandırması veya marjları üzerinde baskı oluşturabilir. Kaynak, hakemli veya bağımsız olarak denetlenen bir değerlendirme yerine özel testleri rapor ettiğinden, pratik önemi belirsizliğini koruyor.
Bildirilen retler, düzenlenmiş mesleki ortamlarda güvenlik kontrolleri ile görev kapsamı arasında bir dengeyi göstermektedir. Bazı hassas hukuki soruların reddedilmesi uygun olabilir ancak kuruluşların, retlerin öngörülebilir, açıklanabilir ve uyumluluk yükümlülükleriyle uyumlu olup olmadığını bilmeleri gerekir. Kaynak, olgusal doğruluk, mahremiyetin korunması, güvenlik veya gerçek dünyadaki hukuki sonuçlara ilişkin bağımsız bir değerlendirme sunmuyor.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
Which component of an AI application is the machine-learning model itself?
Bundan sonra ne izlenecek?
Anahtar sorular, bağımsız değerlendiricilerin sıralamayı ve maliyet avantajını yeniden üretip üretemeyeceği, belirtilen fiyatlandırmanın güncel ve sürdürülebilir olup olmadığı ve modelin benzer koşullar altında hukuk teknolojisi geliştiricilerinin kullanımına açık olup olmadığıdır. Alıcılar ayrıca hassas yasal konularla ilgili bildirilen retleri de incelemeli ve doğruluğunu, gecikmeyi, gizliliği ve uyumluluğu kendi iş akışlarında test etmelidir.
Bağımsız testler, Muse Spark 1.3, Fable 5 ve GPT 5.6 Sol'da aynı istemleri, araçları, bağlam uzunluklarını, örnekleme ayarlarını ve fiyatlandırma varsayımlarını karşılaştırmalıdır. Karşılaştırmalı değerlendirmenin görev kompozisyonu ve puanlama kuralları, sağlanan raporda sunulmamaktadır ve bu durum, sıralamalardan çıkarılabilecek sonuçları sınırlamaktadır.
Kaynak, Muse Spark 1.3'e (Max) kimin, hangi API veya ürün aracılığıyla, hangi bölgesel veya sözleşmeye bağlı kısıtlamalar kapsamında veya hangi geçerli fiyatla erişebileceğini belgelemiyor. Takip raporları kullanılabilirliği, ücret sınırlarını, veri kullanım koşullarını ve belirtilen 1,25 ABD Doları ve 4,25 ABD Doları oranlarının genel olarak mı yoksa yalnızca belirli katmanlar için mi geçerli olduğunu doğrulamalıdır.
Yasal alıcılar, modele güvenmeden önce hassas konu retlerini, alıntı kalitesini, uzun belgelerdeki tutarlılığı, araç kullanım davranışını ve insan incelemesi gerekliliklerini test etmelidir. 1.327 görevden rapor edilen 10 reddedilme, bağımsız olarak doğrulanmış bir güvenlik veya güvenilirlik oranı değil, TipRanks tarafından aktarılan Vals AI'den gelen bir iddiadır.