กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

TipRanks รายงานเกณฑ์มาตรฐานทางกฎหมายที่เน้นต้นทุนสำหรับ Muse Spark 1.3 ของ Meta

TipRanks รายงานว่าเกณฑ์มาตรฐานที่เป็นกรรมสิทธิ์ของ Vals AI วาง Muse Spark 1.3 (สูงสุด) ของ Meta ไว้ใกล้กับ Fable 5 และ GPT 5.6 Sol ขณะที่มีราคาถูกกว่า 4x–8x ตามโพสต์ของ Vals AI LinkedIn ผลลัพธ์และการอ้างสิทธิ์ด้านราคายังไม่ได้รับการยืนยันอย่างเป็นอิสระ

4 min readRead the linked source
Source-provided image accompanying TipRanks reports cost-focused legal benchmark for Meta’s Muse Spark 1.3
แหล่งอ้างอิงแหล่งที่มาบันทึกไว้
สำนักพิมพ์
tipranks.com
ลิงค์แหล่งที่มา
tipranks.comhttps://www.tipranks.com/news/private-companies/benchmark-data-suggests-cost-competitive-performance-for-metas-muse-spark-1-3-in-legal-ai
ประเภทแหล่งที่มา
แหล่งที่มาที่เชื่อมโยง — ยังไม่ได้สร้างสถานะแหล่งที่มาหลัก
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

เกณฑ์มาตรฐาน
การทดสอบหรือชุดข้อมูลที่เป็นมาตรฐานที่ใช้ในการวัดและเปรียบเทียบประสิทธิภาพของโมเดล
API (อินเทอร์เฟซการเขียนโปรแกรมแอปพลิเคชัน)
วิธีการที่มีโครงสร้างสำหรับระบบซอฟต์แวร์หนึ่งในการส่งคำขอและรับการตอบกลับจากอีกระบบหนึ่ง
หน้าต่างบริบท
จำนวนโทเค็นอินพุตสูงสุดที่โมเดลภาษาสามารถประมวลผลได้ในคราวเดียว
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

TipRanks รายงานว่าการทดสอบภายในของ Vals AI จัดอันดับ Muse Spark 1.3 (สูงสุด) เป็นอันดับแรกในเกณฑ์มาตรฐานการวิจัยทางกฎหมาย และอันดับสองในเกณฑ์มาตรฐานตัวแทนทางกฎหมายของ Harvey รายงานกล่าวว่าแบบจำลองได้รับการประเมินโดยเปิดใช้งานการให้เหตุผลสูงสุดและหน้าต่างบริบท 1 ล้านโทเค็น แต่ไม่ได้สร้างความพร้อมใช้งานทั่วไปหรือตรวจสอบการทดสอบโดยอิสระ

TipRanks รายงานว่า Vals AI กล่าวว่า Muse Spark 1.3 (สูงสุด) ของ Meta ทำงานคล้ายกับ Fable 5 และ GPT 5.6 Sol บน Vals Index ที่เป็นกรรมสิทธิ์ของ Vals AI มีรายงานว่าโพสต์เดียวกันนี้จัดอันดับ Muse Spark 1.3 เป็นอันดับแรกในเกณฑ์มาตรฐานการวิจัยทางกฎหมายภายในองค์กรของ Vals AI และอันดับสองในเกณฑ์มาตรฐานตัวแทนทางกฎหมายของ Harvey TipRanks ถือว่าความเร็วที่รายงานของโมเดลเกิดจากการเปลี่ยนการสนทนาน้อยลงและการสืบค้นแต่ละรายการที่เร็วขึ้น แต่แหล่งที่มาไม่ได้ให้วิธีการวัดประสิทธิภาพ การกระจายงาน หรือผลลัพธ์เชิงเปรียบเทียบโดยละเอียดเพียงพอที่จะประเมินการกล่าวอ้างเหล่านั้นอย่างเป็นอิสระ

รายงานกล่าวว่าการทดสอบใช้เหตุผลสูงสุด หน้าต่างบริบท 1 ล้านโทเค็น ผลลัพธ์สูงสุด 131,000 โทเค็น และการตั้งค่าการสุ่มตัวอย่างเริ่มต้น โดยอ้างถึงราคาที่ 1.25 ดอลลาร์และ 4.25 ดอลลาร์ต่อล้านโทเค็นสำหรับระดับการใช้งานที่แตกต่างกัน และกล่าวว่า Vals AI สังเกตเห็นการปฏิเสธในหัวข้อที่ละเอียดอ่อน รวมถึงการควบคุมการส่งออก การจับกุมทางอาญา และการคว่ำบาตรทางการค้าใน 10 งานจาก 1,327 งาน TipRanks ระบุตัวเลขเหล่านี้มาจากโพสต์ LinkedIn ของ Vals AI; ทั้งเงื่อนไขการเข้าถึงของโมเดลและตัวเลขไม่ได้รับการยืนยันอย่างเป็นอิสระจากแหล่งที่ให้มา

รายละเอียดที่มา: tipranks.com ↗

ทำไมมันถึงสำคัญ

หากทำซ้ำอย่างอิสระ รายงานการรวมกันของประสิทธิภาพที่เทียบเคียงได้และราคาโทเค็นที่ต่ำกว่าอาจส่งผลต่อวิธีที่บริษัทเทคโนโลยีทางกฎหมายเลือกแบบจำลองสำหรับการวิจัย การวิเคราะห์สัญญา และเวิร์กโฟลว์ที่มีบริบทยาวอื่น ๆ ต้นทุนการอนุมานที่ลดลงยังสามารถปรับปรุงปริมาณงานหรือลดราคาของลูกค้าได้อีกด้วย อย่างไรก็ตาม หลักฐานดังกล่าวมาจากเกณฑ์มาตรฐานที่เป็นกรรมสิทธิ์ซึ่งอธิบายไว้ในโพสต์ของ LinkedIn และถ่ายทอดโดยโต๊ะข่าวที่สร้างขึ้นโดยอัตโนมัติของ TipRanks ดังนั้นผลลัพธ์ควรถือเป็นข้อมูลเบื้องต้นมากกว่าเป็นการเปรียบเทียบตลาดที่กำหนดไว้

ระบบ AI ทางกฎหมายมักจะประมวลผลบันทึกคดี สัญญา และเอกสารการวิจัยที่มีความยาว ทำให้มีการจำกัดบริบท เวลาแฝง และต้นทุนโทเค็น ข้อกังวลในการดำเนินงาน ความได้เปรียบด้านต้นทุนที่น่าเชื่อถือในคุณภาพใกล้เคียงกันอาจทำให้การใช้เหตุผลในบริบทขนาดใหญ่เป็นไปได้มากขึ้นสำหรับบริษัทขนาดเล็ก และสร้างแรงกดดันต่อการกำหนดราคาหรือส่วนต่างของผู้ให้บริการโมเดลที่แข่งขันกัน นัยสำคัญในทางปฏิบัติยังคงไม่แน่นอน เนื่องจากแหล่งข่าวรายงานการทดสอบที่เป็นกรรมสิทธิ์มากกว่าการประเมินโดยผู้ทรงคุณวุฒิหรือการตรวจสอบโดยอิสระ

การปฏิเสธที่รายงานแสดงให้เห็นถึงการแลกเปลี่ยนระหว่างการควบคุมความปลอดภัยและความครอบคลุมของงานในสภาพแวดล้อมทางวิชาชีพที่ได้รับการควบคุม การปฏิเสธคำถามทางกฎหมายที่ละเอียดอ่อนบางข้ออาจมีความเหมาะสม แต่องค์กรจำเป็นต้องรู้ว่าการปฏิเสธนั้นสามารถคาดเดาได้ อธิบายได้ และสอดคล้องกับภาระหน้าที่ในการปฏิบัติตามข้อกำหนดหรือไม่ แหล่งที่มาไม่ได้ให้การประเมินความถูกต้องของข้อเท็จจริง การคุ้มครองความเป็นส่วนตัว ความปลอดภัย หรือผลลัพธ์ทางกฎหมายในโลกแห่งความเป็นจริงโดยอิสระ

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

คำถามสำคัญคือผู้ประเมินอิสระสามารถสร้างอันดับและความได้เปรียบด้านต้นทุนอีกครั้งได้หรือไม่ ราคาที่อ้างถึงนั้นเป็นปัจจุบันและยั่งยืนหรือไม่ และโมเดลดังกล่าวพร้อมใช้งานสำหรับนักพัฒนาเทคโนโลยีทางกฎหมายภายใต้เงื่อนไขที่เทียบเคียงได้หรือไม่ ผู้ซื้อควรตรวจสอบรายงานการปฏิเสธในหัวข้อทางกฎหมายที่ละเอียดอ่อน และทดสอบความถูกต้อง เวลาแฝง ความเป็นส่วนตัว และการปฏิบัติตามข้อกำหนดในขั้นตอนการทำงานของตนเอง

การทดสอบอิสระควรเปรียบเทียบข้อความแจ้ง เครื่องมือ ความยาวบริบท การตั้งค่าการสุ่มตัวอย่าง และสมมติฐานด้านราคาที่เหมือนกันใน Muse Spark 1.3, Fable 5 และ GPT 5.6 Sol องค์ประกอบงานของเกณฑ์มาตรฐานและกฎการให้คะแนนไม่ได้ระบุไว้ในรายงานที่ให้มา ซึ่งเป็นการจำกัดสิ่งที่สามารถสรุปได้จากการจัดอันดับ

แหล่งที่มาไม่ได้บันทึกว่าใครสามารถเข้าถึง Muse Spark 1.3 (สูงสุด) ผ่าน API หรือผลิตภัณฑ์ใด ภายใต้ข้อจำกัดภูมิภาคหรือสัญญาใด หรือในราคาปัจจุบันเท่าใด การรายงานการติดตามผลควรตรวจสอบความพร้อม ขีดจำกัดอัตรา เงื่อนไขการใช้ข้อมูล และอัตราที่อ้างถึง $1.25 และ $4.25 มีผลในวงกว้างหรือเฉพาะกับระดับบางระดับเท่านั้น

ผู้ซื้อตามกฎหมายควรทดสอบการปฏิเสธหัวข้อที่ละเอียดอ่อน คุณภาพการอ้างอิง ความสอดคล้องของเอกสารขนาดยาว พฤติกรรมการใช้เครื่องมือ และข้อกำหนดในการตรวจสอบโดยมนุษย์ ก่อนที่จะใช้แบบจำลอง การปฏิเสธ 10 รายการที่รายงานจากงาน 1,327 รายการเป็นการอ้างสิทธิ์จาก Vals AI ที่ส่งต่อโดย TipRanks ไม่ใช่อัตราความปลอดภัยหรือความน่าเชื่อถือที่ได้รับการตรวจสอบโดยอิสระ

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIChatGPT และ LLMจริยธรรม AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?