กลับไปที่ข่าว
สินค้าAI Understanding บรรยายสรุป

llama.cpp 0.4.0 เพิ่มการรองรับสำหรับโมเดล AI ใหม่และอินพุตวิดีโอ

การเปิดตัว llama.cpp 0.4.0 เพิ่มการรองรับเบื้องต้นสำหรับ Qwen3.8-Flash-Next และ NVIDIA Nemotron-3-Puzzle ตัวเลือกอินพุตวิดีโอ การจำกัดบริบทของเซิร์ฟเวอร์ต่อสล็อต การอ่านเทนเซอร์แบบ Lazy และการเปลี่ยนแปลง ggml 0.23.0

4 min readRead the primary source
Source-page capture accompanying llama.cpp 0.4.0 adds support for newer AI models and video input
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
github.com
ลิงค์แหล่งที่มา
github.comhttps://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
อ้างด้วย

เรื่องราวที่แก้ไขครั้งล่าสุด

บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

API (อินเทอร์เฟซการเขียนโปรแกรมแอปพลิเคชัน)
วิธีการที่มีโครงสร้างสำหรับระบบซอฟต์แวร์หนึ่งในการส่งคำขอและรับการตอบกลับจากอีกระบบหนึ่ง
หน่วยความจำ (หน่วยความจำตัวแทน)
บริบทที่จัดเก็บไว้ซึ่งตัวแทน AI ใช้ในขั้นตอนหรือเซสชันเพื่อปรับปรุงความต่อเนื่อง
โมเดลต่อเนื่องหลายรูปแบบ
โมเดลที่สามารถประมวลผลหรือสร้างข้อมูลหลายประเภท เช่น ข้อความ รูปภาพ และเสียง
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

สิ่งที่เปลี่ยนแปลงไปนับตั้งแต่ตีพิมพ์

  1. เผยแพร่ครั้งแรก
  2. รายการ llama.cpp ก่อนหน้านี้ครอบคลุมการสนับสนุนก่อนเผยแพร่สำหรับ Nemotron-3-Puzzle ของ NVIDIA ขณะนี้เวอร์ชัน 0.4.0 รวมการสนับสนุน Nemotron-3-Puzzle-75B-A9B ในการเปิดตัวแท็กที่กว้างขึ้น ซึ่งยังเพิ่มสถาปัตยกรรมโมเดลที่ใหม่กว่า อินพุตวิดีโอ การควบคุมบริบทของเซิร์ฟเวอร์ การอ่านเทนเซอร์แบบ Lazy และงานแบ็กเอนด์ ggml 0.23.0

เกิดอะไรขึ้น

llama.cpp เปิดตัวเวอร์ชัน 0.4.0 บน GitHub เมื่อวันที่ 4 กันยายน เวอร์ชันนี้เพิ่มการรองรับเบื้องต้นสำหรับ Qwen3.8-Flash-Next, NVIDIA Nemotron-3-Puzzle-75B-A9B, DSpark สำหรับ Nemotron 3.5, nanbeige4.2-3B และ DeepSeek-V4-Flash-Vision-Exp นอกจากนี้ยังเพิ่มพารามิเตอร์อินพุตวิดีโอ การจำกัดบริบทของเซิร์ฟเวอร์ต่อสล็อต การอ่านเทนเซอร์แบบขี้เกียจ การเปลี่ยนแปลงการกำหนดเส้นทางโดยผู้เชี่ยวชาญ การปรับปรุงแคช KV และการเพิ่มประสิทธิภาพแบ็กเอนด์หลายรายการ การเปิดตัวอัปเดต ggml จาก 0.22.0 เป็น 0.23.0 โปรเจ็กต์ระบุว่าเวอร์ชันดังกล่าวเพิ่มความสนใจแบบแฟลชแบบกระจาย, การดำเนินการแบบอะซิงโครนัสและ API ที่ขึ้นอยู่กับการจัดสรร, เหตุการณ์ RPC และ API แบบอะซิงก์ และการสนับสนุนการขนส่ง Apple RDMA หน้านี้แสดงรายการบิลด์ต่อคืนที่ระบุว่าเป็น b10809 ไม่ได้บันทึกความพร้อมใช้งานแบบแพ็กเกจไบนารี ข้อกำหนดการติดตั้ง การกระจายน้ำหนักโมเดล หรือราคา

หน้าเผยแพร่ GitHub ระบุ v0.4.0 เป็นรุ่นล่าสุด และบันทึกเวลาเผยแพร่ในวันที่ 4 กันยายน เวลา 19:56 น. โดยไม่ระบุเขตเวลาในข้อความที่ให้มา การเปิดตัวนี้รวมถึงการเปลี่ยนแปลง API เช่น llama_lazy_mode, การควบคุมขนาดบัฟเฟอร์ของควอนไทเซอร์, เวอร์ชันเซสชันและสถานะที่อัปเดต และผู้ช่วยเหลือโทเค็นหลายรูปแบบใหม่

การเปลี่ยนแปลงโมเดลและแกนหลัก ได้แก่ การสนับสนุนสถาปัตยกรรม Qwen3.8-Flash-Next เริ่มต้น, การสนับสนุน NVIDIA Nemotron-3-Puzzle-75B-A9B, การสนับสนุน DSpark สำหรับ Nemotron 3.5, การสนับสนุน nanbeige4.2-3B, การอ่านเทนเซอร์แบบ Lazy, การกำหนดเส้นทางผู้เชี่ยวชาญต่อเลเยอร์, ​​การค้นหาประวัติ n-gram, การปรับปรุงการกู้คืนแคช KV และการป้องกัน RAM สูงสุดในระหว่างการโหลดแบบจำลอง

การเปลี่ยนแปลงหลายรูปแบบและเซิร์ฟเวอร์ประกอบด้วยการสนับสนุน DeepSeek-V4-Flash-Vision-Exp, ตัวเลือกบรรทัดคำสั่งวิดีโอ, ขีดจำกัดบริบทต่อสล็อต, URL ข้อมูลสำหรับสื่อ, การเก็บรักษาค่าเริ่มต้นของเอาท์พุตการให้เหตุผล และการปฏิเสธการเรียกเครื่องมือผู้ช่วยที่กรอกไว้ล่วงหน้า UI ยังเปลี่ยนนโยบายเครื่องมือและลักษณะการทำงานของการตั้งค่าด้วย แต่แหล่งที่มาไม่ได้ให้ข้อมูลการใช้งานหรือประสิทธิภาพของผู้ใช้

รายละเอียดที่มา: github.com ↗

ทำไมมันถึงสำคัญ

นี่เป็นการอัปเดตที่สำคัญสำหรับรันไทม์โอเพ่นซอร์สที่นักพัฒนาใช้ในการสร้างการอนุมาน AI และแอปพลิเคชันต่อเนื่องหลายรูปแบบ ความครอบคลุมของโมเดลที่ขยายออกไปทำให้โมเดลที่เปิดตัวล่าสุดสามารถทดสอบได้ภายในระบบที่ใช้ llama.cpp ในขณะที่การรองรับอินพุตวิดีโอจะขยายประเภทของสื่อที่ระบบเหล่านั้นสามารถประมวลผลได้กว้างขึ้น แหล่งที่มาอธิบายถึงประสิทธิภาพและงานที่เกี่ยวข้องกับหน่วยความจำ แต่ไม่มีการวัดประสิทธิภาพที่แยกจากกัน ดังนั้นประโยชน์ที่ได้รับจริงจะขึ้นอยู่กับฮาร์ดแวร์ รูปแบบโมเดล และการกำหนดค่าการใช้งาน

การเปิดตัวครั้งนี้เชื่อมโยงสถาปัตยกรรมรุ่นใหม่หลายตัวเข้ากับโค้ดเบสการอนุมานที่ใช้กันอย่างแพร่หลาย รวมถึงการรองรับ Qwen3.8-Flash-Next และ Nemotron-3-Puzzle เริ่มต้น ซึ่งอาจลดการทำงานบูรณาการสำหรับนักพัฒนาที่ทดลองใช้โมเดลเหล่านั้น แม้ว่าแหล่งที่มาจะไม่สร้างความเข้ากันได้ในทุกแพลตฟอร์มหรือการกำหนดค่าก็ตาม

การอัปเดต ggml เพิ่มโครงสร้างพื้นฐานสำหรับความสนใจแบบกระจาย แบ็กเอนด์แบบอะซิงโครนัส เหตุการณ์การเรียกขั้นตอนระยะไกล และ Apple RDMA การเปลี่ยนแปลงเหล่านี้อาจมีความสำคัญสำหรับการปรับใช้ที่สามารถใช้แบ็กเอนด์เฉพาะเหล่านั้นได้ แต่หน้าการเผยแพร่ไม่ได้วัดปริมาณเวลาแฝง ปริมาณงาน การใช้หน่วยความจำ หรือการปรับปรุงความน่าเชื่อถือ

พารามิเตอร์วิดีโอ การสนับสนุน data-URL สำหรับสื่อ และการเปลี่ยนแปลงการประมวลผลล่วงหน้าหลายรูปแบบ มอบเส้นทางที่เป็นรูปธรรมมากขึ้นสำหรับแอปพลิเคชันที่จัดการวิดีโอและสื่ออื่นๆ แหล่งที่มาไม่ได้ระบุว่าความสามารถเหล่านี้พร้อมใช้งานในแพ็คเกจบิลด์หรือภายใต้ข้อจำกัดเฉพาะรุ่นใด

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

การติดตามผล การทดสอบเฉพาะแบ็กเอนด์ และเอกสารประกอบควรชี้แจงว่าโมเดลใหม่และฟีเจอร์วิดีโอทำงานอย่างไรในฮาร์ดแวร์ที่รองรับ ความไม่แน่นอนที่เกิดขึ้นทันทีที่สุดคือการใช้งาน Qwen3.8-Flash-Next เริ่มต้นจะได้รับงานเพิ่มประสิทธิภาพตามที่สัญญาไว้หรือไม่ และการเปลี่ยนแปลงของความสนใจและหน่วยความจำที่กระจัดกระจายจะช่วยปรับปรุงปริมาณงานจริงได้มากน้อยเพียงใด

ติดตามการอัปเดตการปรับให้เหมาะสมของ Qwen3.8-Flash-Next และการแก้ไขเพิ่มเติมสำหรับพาธโมเดลหลายรูปแบบที่เพิ่มเข้ามาใหม่

คอยดูผลลัพธ์การวัดประสิทธิภาพที่แยกการอ้างสิทธิ์การใช้งานของหน้าเผยแพร่ออกจากการเพิ่มความเร็ว การใช้หน่วยความจำ และการทำงานพร้อมกันที่วัดได้

ดูเอกสารประกอบเกี่ยวกับการเข้าถึงแบบแพ็กเกจ ไฟล์โมเดลที่รองรับ ข้อกำหนดด้านฮาร์ดแวร์ และความพร้อมในการผลิต รายละเอียดเหล่านั้นไม่ได้ระบุไว้ในหน้าเผยแพร่

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIChatGPT และ LLMหม้อแปลงไฟฟ้าทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI

การปรับปรุงและแก้ไข

เรื่องราวตามรูปแบบบัญญัตินี้ได้รับการอัปเดตเมื่อเหตุการณ์ที่กำลังพัฒนาเปลี่ยนแปลงไปอย่างมาก URL และวันที่ตีพิมพ์ต้นฉบับไม่เคยเปลี่ยนแปลง

  • รายการ llama.cpp ก่อนหน้านี้ครอบคลุมการสนับสนุนก่อนเผยแพร่สำหรับ Nemotron-3-Puzzle ของ NVIDIA ขณะนี้เวอร์ชัน 0.4.0 รวมการสนับสนุน Nemotron-3-Puzzle-75B-A9B ในการเปิดตัวแท็กที่กว้างขึ้น ซึ่งยังเพิ่มสถาปัตยกรรมโมเดลที่ใหม่กว่า อินพุตวิดีโอ การควบคุมบริบทของเซิร์ฟเวอร์ การอ่านเทนเซอร์แบบ Lazy และงานแบ็กเอนด์ ggml 0.23.0
ดูบันทึกการแก้ไขสาธารณะ
พบว่าสิ่งนี้มีประโยชน์หรือไม่?