เกิดอะไรขึ้น
llama.cpp เปิดตัวเวอร์ชัน 0.4.0 บน GitHub เมื่อวันที่ 4 กันยายน เวอร์ชันนี้เพิ่มการรองรับเบื้องต้นสำหรับ Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark สำหรับ Nemotron 3.5, nanbeige4.2-3B และ DeepSeek-V4-Flash-Vision-Exp นอกจากนี้ยังเพิ่มพารามิเตอร์อินพุตวิดีโอ การจำกัดบริบทของเซิร์ฟเวอร์ต่อสล็อต การอ่านเทนเซอร์แบบขี้เกียจ การเปลี่ยนแปลงการกำหนดเส้นทางโดยผู้เชี่ยวชาญ การปรับปรุงแคช KV และการเพิ่มประสิทธิภาพแบ็กเอนด์หลายรายการ การเปิดตัวอัปเดต ggml จาก 0.22.0 เป็น 0.23.0 โปรเจ็กต์ระบุว่าเวอร์ชันดังกล่าวเพิ่มความสนใจแบบแฟลชแบบกระจาย, การดำเนินการแบบอะซิงโครนัสและ API ที่ขึ้นอยู่กับการจัดสรร, เหตุการณ์ RPC และ API แบบอะซิงก์ และการสนับสนุนการขนส่ง Apple RDMA หน้านี้แสดงรายการบิลด์ต่อคืนที่ระบุว่าเป็น b10809 ไม่ได้บันทึกความพร้อมใช้งานแบบแพ็กเกจไบนารี ข้อกำหนดการติดตั้ง การกระจายน้ำหนักโมเดล หรือราคา
หน้าเผยแพร่ GitHub ระบุ v0.4.0 เป็นรุ่นล่าสุด และบันทึกเวลาเผยแพร่ในวันที่ 4 กันยายน เวลา 19:56 น. โดยไม่ระบุเขตเวลาในข้อความที่ให้มา การเปิดตัวนี้รวมถึงการเปลี่ยนแปลง API เช่น llama_lazy_mode, การควบคุมขนาดบัฟเฟอร์ของควอนไทเซอร์, เวอร์ชันเซสชันและสถานะที่อัปเดต และผู้ช่วยเหลือโทเค็นหลายรูปแบบใหม่
การเปลี่ยนแปลงโมเดลและแกนหลัก ได้แก่ การสนับสนุนสถาปัตยกรรม Qwen3.8-Flash-Next เริ่มต้น, การสนับสนุน NVIDIA Nemotron-3-Puzzle-75B-A9B, การสนับสนุน DSpark สำหรับ Nemotron 3.5, การสนับสนุน nanbeige4.2-3B, การอ่านเทนเซอร์แบบ Lazy, การกำหนดเส้นทางผู้เชี่ยวชาญต่อเลเยอร์, การค้นหาประวัติ n-gram, การปรับปรุงการกู้คืนแคช KV และการป้องกัน RAM สูงสุดในระหว่างการโหลดแบบจำลอง
การเปลี่ยนแปลงหลายรูปแบบและเซิร์ฟเวอร์ประกอบด้วยการสนับสนุน DeepSeek-V4-Flash-Vision-Exp, ตัวเลือกบรรทัดคำสั่งวิดีโอ, ขีดจำกัดบริบทต่อสล็อต, URL ข้อมูลสำหรับสื่อ, การเก็บรักษาค่าเริ่มต้นของเอาท์พุตการให้เหตุผล และการปฏิเสธการเรียกเครื่องมือผู้ช่วยที่กรอกไว้ล่วงหน้า UI ยังเปลี่ยนนโยบายเครื่องมือและลักษณะการทำงานของการตั้งค่าด้วย แต่แหล่งที่มาไม่ได้ให้ข้อมูลการใช้งานหรือประสิทธิภาพของผู้ใช้
ทำไมมันถึงสำคัญ
นี่เป็นการอัปเดตที่สำคัญสำหรับรันไทม์โอเพ่นซอร์สที่นักพัฒนาใช้ในการสร้างการอนุมาน AI และแอปพลิเคชันต่อเนื่องหลายรูปแบบ ความครอบคลุมของโมเดลที่ขยายออกไปทำให้โมเดลที่เปิดตัวล่าสุดสามารถทดสอบได้ภายในระบบที่ใช้ llama.cpp ในขณะที่การรองรับอินพุตวิดีโอจะขยายประเภทของสื่อที่ระบบเหล่านั้นสามารถประมวลผลได้กว้างขึ้น แหล่งที่มาอธิบายถึงประสิทธิภาพและงานที่เกี่ยวข้องกับหน่วยความจำ แต่ไม่มีการวัดประสิทธิภาพที่แยกจากกัน ดังนั้นประโยชน์ที่ได้รับจริงจะขึ้นอยู่กับฮาร์ดแวร์ รูปแบบโมเดล และการกำหนดค่าการใช้งาน
การเปิดตัวครั้งนี้เชื่อมโยงสถาปัตยกรรมรุ่นใหม่หลายตัวเข้ากับโค้ดเบสการอนุมานที่ใช้กันอย่างแพร่หลาย รวมถึงการรองรับ Qwen3.8-Flash-Next และ Nemotron-3-Puzzle เริ่มต้น ซึ่งอาจลดการทำงานบูรณาการสำหรับนักพัฒนาที่ทดลองใช้โมเดลเหล่านั้น แม้ว่าแหล่งที่มาจะไม่สร้างความเข้ากันได้ในทุกแพลตฟอร์มหรือการกำหนดค่าก็ตาม
การอัปเดต ggml เพิ่มโครงสร้างพื้นฐานสำหรับความสนใจแบบกระจาย แบ็กเอนด์แบบอะซิงโครนัส เหตุการณ์การเรียกขั้นตอนระยะไกล และ Apple RDMA การเปลี่ยนแปลงเหล่านี้อาจมีความสำคัญสำหรับการปรับใช้ที่สามารถใช้แบ็กเอนด์เฉพาะเหล่านั้นได้ แต่หน้าการเผยแพร่ไม่ได้วัดปริมาณเวลาแฝง ปริมาณงาน การใช้หน่วยความจำ หรือการปรับปรุงความน่าเชื่อถือ
พารามิเตอร์วิดีโอ การสนับสนุน data-URL สำหรับสื่อ และการเปลี่ยนแปลงการประมวลผลล่วงหน้าหลายรูปแบบ มอบเส้นทางที่เป็นรูปธรรมมากขึ้นสำหรับแอปพลิเคชันที่จัดการวิดีโอและสื่ออื่นๆ แหล่งที่มาไม่ได้ระบุว่าความสามารถเหล่านี้พร้อมใช้งานในแพ็คเกจบิลด์หรือภายใต้ข้อจำกัดเฉพาะรุ่นใด
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
การติดตามผล การทดสอบเฉพาะแบ็กเอนด์ และเอกสารประกอบควรชี้แจงว่าโมเดลใหม่และฟีเจอร์วิดีโอทำงานอย่างไรในฮาร์ดแวร์ที่รองรับ ความไม่แน่นอนที่เกิดขึ้นทันทีที่สุดคือการใช้งาน Qwen3.8-Flash-Next เริ่มต้นจะได้รับงานเพิ่มประสิทธิภาพตามที่สัญญาไว้หรือไม่ และการเปลี่ยนแปลงของความสนใจและหน่วยความจำที่กระจัดกระจายจะช่วยปรับปรุงปริมาณงานจริงได้มากน้อยเพียงใด
ติดตามการอัปเดตการปรับให้เหมาะสมของ Qwen3.8-Flash-Next และการแก้ไขเพิ่มเติมสำหรับพาธโมเดลหลายรูปแบบที่เพิ่มเข้ามาใหม่
คอยดูผลลัพธ์การวัดประสิทธิภาพที่แยกการอ้างสิทธิ์การใช้งานของหน้าเผยแพร่ออกจากการเพิ่มความเร็ว การใช้หน่วยความจำ และการทำงานพร้อมกันที่วัดได้
ดูเอกสารประกอบเกี่ยวกับการเข้าถึงแบบแพ็กเกจ ไฟล์โมเดลที่รองรับ ข้อกำหนดด้านฮาร์ดแวร์ และความพร้อมในการผลิต รายละเอียดเหล่านั้นไม่ได้ระบุไว้ในหน้าเผยแพร่