เกิดอะไรขึ้น
TipRanks รายงานว่าการทดสอบภายในของ Vals AI จัดอันดับ Muse Spark 1.3 (สูงสุด) เป็นอันดับแรกในเกณฑ์มาตรฐานการวิจัยทางกฎหมาย และอันดับสองในเกณฑ์มาตรฐานตัวแทนทางกฎหมายของ Harvey รายงานกล่าวว่าแบบจำลองได้รับการประเมินโดยเปิดใช้งานการให้เหตุผลสูงสุดและหน้าต่างบริบท 1 ล้านโทเค็น แต่ไม่ได้สร้างความพร้อมใช้งานทั่วไปหรือตรวจสอบการทดสอบโดยอิสระ
TipRanks รายงานว่า Vals AI กล่าวว่า Muse Spark 1.3 (สูงสุด) ของ Meta ทำงานคล้ายกับ Fable 5 และ GPT 5.6 Sol บน Vals Index ที่เป็นกรรมสิทธิ์ของ Vals AI มีรายงานว่าโพสต์เดียวกันนี้จัดอันดับ Muse Spark 1.3 เป็นอันดับแรกในเกณฑ์มาตรฐานการวิจัยทางกฎหมายภายในองค์กรของ Vals AI และอันดับสองในเกณฑ์มาตรฐานตัวแทนทางกฎหมายของ Harvey TipRanks ถือว่าความเร็วที่รายงานของโมเดลเกิดจากการเปลี่ยนการสนทนาน้อยลงและการสืบค้นแต่ละรายการที่เร็วขึ้น แต่แหล่งที่มาไม่ได้ให้วิธีการวัดประสิทธิภาพ การกระจายงาน หรือผลลัพธ์เชิงเปรียบเทียบโดยละเอียดเพียงพอที่จะประเมินการกล่าวอ้างเหล่านั้นอย่างเป็นอิสระ
รายงานกล่าวว่าการทดสอบใช้เหตุผลสูงสุด หน้าต่างบริบท 1 ล้านโทเค็น ผลลัพธ์สูงสุด 131,000 โทเค็น และการตั้งค่าการสุ่มตัวอย่างเริ่มต้น โดยอ้างถึงราคาที่ 1.25 ดอลลาร์และ 4.25 ดอลลาร์ต่อล้านโทเค็นสำหรับระดับการใช้งานที่แตกต่างกัน และกล่าวว่า Vals AI สังเกตเห็นการปฏิเสธในหัวข้อที่ละเอียดอ่อน รวมถึงการควบคุมการส่งออก การจับกุมทางอาญา และการคว่ำบาตรทางการค้าใน 10 งานจาก 1,327 งาน TipRanks ระบุตัวเลขเหล่านี้มาจากโพสต์ LinkedIn ของ Vals AI; ทั้งเงื่อนไขการเข้าถึงของโมเดลและตัวเลขไม่ได้รับการยืนยันอย่างเป็นอิสระจากแหล่งที่ให้มา
รายละเอียดที่มา: tipranks.com ↗
ทำไมมันถึงสำคัญ
หากทำซ้ำอย่างอิสระ รายงานการรวมกันของประสิทธิภาพที่เทียบเคียงได้และราคาโทเค็นที่ต่ำกว่าอาจส่งผลต่อวิธีที่บริษัทเทคโนโลยีทางกฎหมายเลือกแบบจำลองสำหรับการวิจัย การวิเคราะห์สัญญา และเวิร์กโฟลว์ที่มีบริบทยาวอื่น ๆ ต้นทุนการอนุมานที่ลดลงยังสามารถปรับปรุงปริมาณงานหรือลดราคาของลูกค้าได้อีกด้วย อย่างไรก็ตาม หลักฐานดังกล่าวมาจากเกณฑ์มาตรฐานที่เป็นกรรมสิทธิ์ซึ่งอธิบายไว้ในโพสต์ของ LinkedIn และถ่ายทอดโดยโต๊ะข่าวที่สร้างขึ้นโดยอัตโนมัติของ TipRanks ดังนั้นผลลัพธ์ควรถือเป็นข้อมูลเบื้องต้นมากกว่าเป็นการเปรียบเทียบตลาดที่กำหนดไว้
ระบบ AI ทางกฎหมายมักจะประมวลผลบันทึกคดี สัญญา และเอกสารการวิจัยที่มีความยาว ทำให้มีการจำกัดบริบท เวลาแฝง และต้นทุนโทเค็น ข้อกังวลในการดำเนินงาน ความได้เปรียบด้านต้นทุนที่น่าเชื่อถือในคุณภาพใกล้เคียงกันอาจทำให้การใช้เหตุผลในบริบทขนาดใหญ่เป็นไปได้มากขึ้นสำหรับบริษัทขนาดเล็ก และสร้างแรงกดดันต่อการกำหนดราคาหรือส่วนต่างของผู้ให้บริการโมเดลที่แข่งขันกัน นัยสำคัญในทางปฏิบัติยังคงไม่แน่นอน เนื่องจากแหล่งข่าวรายงานการทดสอบที่เป็นกรรมสิทธิ์มากกว่าการประเมินโดยผู้ทรงคุณวุฒิหรือการตรวจสอบโดยอิสระ
การปฏิเสธที่รายงานแสดงให้เห็นถึงการแลกเปลี่ยนระหว่างการควบคุมความปลอดภัยและความครอบคลุมของงานในสภาพแวดล้อมทางวิชาชีพที่ได้รับการควบคุม การปฏิเสธคำถามทางกฎหมายที่ละเอียดอ่อนบางข้ออาจมีความเหมาะสม แต่องค์กรจำเป็นต้องรู้ว่าการปฏิเสธนั้นสามารถคาดเดาได้ อธิบายได้ และสอดคล้องกับภาระหน้าที่ในการปฏิบัติตามข้อกำหนดหรือไม่ แหล่งที่มาไม่ได้ให้การประเมินความถูกต้องของข้อเท็จจริง การคุ้มครองความเป็นส่วนตัว ความปลอดภัย หรือผลลัพธ์ทางกฎหมายในโลกแห่งความเป็นจริงโดยอิสระ
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
คำถามสำคัญคือผู้ประเมินอิสระสามารถสร้างอันดับและความได้เปรียบด้านต้นทุนอีกครั้งได้หรือไม่ ราคาที่อ้างถึงนั้นเป็นปัจจุบันและยั่งยืนหรือไม่ และโมเดลดังกล่าวพร้อมใช้งานสำหรับนักพัฒนาเทคโนโลยีทางกฎหมายภายใต้เงื่อนไขที่เทียบเคียงได้หรือไม่ ผู้ซื้อควรตรวจสอบรายงานการปฏิเสธในหัวข้อทางกฎหมายที่ละเอียดอ่อน และทดสอบความถูกต้อง เวลาแฝง ความเป็นส่วนตัว และการปฏิบัติตามข้อกำหนดในขั้นตอนการทำงานของตนเอง
การทดสอบอิสระควรเปรียบเทียบข้อความแจ้ง เครื่องมือ ความยาวบริบท การตั้งค่าการสุ่มตัวอย่าง และสมมติฐานด้านราคาที่เหมือนกันใน Muse Spark 1.3, Fable 5 และ GPT 5.6 Sol องค์ประกอบงานของเกณฑ์มาตรฐานและกฎการให้คะแนนไม่ได้ระบุไว้ในรายงานที่ให้มา ซึ่งเป็นการจำกัดสิ่งที่สามารถสรุปได้จากการจัดอันดับ
แหล่งที่มาไม่ได้บันทึกว่าใครสามารถเข้าถึง Muse Spark 1.3 (สูงสุด) ผ่าน API หรือผลิตภัณฑ์ใด ภายใต้ข้อจำกัดภูมิภาคหรือสัญญาใด หรือในราคาปัจจุบันเท่าใด การรายงานการติดตามผลควรตรวจสอบความพร้อม ขีดจำกัดอัตรา เงื่อนไขการใช้ข้อมูล และอัตราที่อ้างถึง $1.25 และ $4.25 มีผลในวงกว้างหรือเฉพาะกับระดับบางระดับเท่านั้น
ผู้ซื้อตามกฎหมายควรทดสอบการปฏิเสธหัวข้อที่ละเอียดอ่อน คุณภาพการอ้างอิง ความสอดคล้องของเอกสารขนาดยาว พฤติกรรมการใช้เครื่องมือ และข้อกำหนดในการตรวจสอบโดยมนุษย์ ก่อนที่จะใช้แบบจำลอง การปฏิเสธ 10 รายการที่รายงานจากงาน 1,327 รายการเป็นการอ้างสิทธิ์จาก Vals AI ที่ส่งต่อโดย TipRanks ไม่ใช่อัตราความปลอดภัยหรือความน่าเชื่อถือที่ได้รับการตรวจสอบโดยอิสระ