กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

นักวิจัย Apple เสนอ STARFlow2 สำหรับการสร้างข้อความและรูปภาพแบบครบวงจร

นักวิจัยของ Apple บรรยายถึง STARFlow2 ซึ่งเป็นสถาปัตยกรรมที่รวมโมเดลภาษาการมองเห็นที่ได้รับการฝึกไว้ล่วงหน้าเข้ากับโฟลว์การปรับมาตรฐานแบบ autoregressive เพื่อสร้างข้อความและรูปภาพที่แทรกผ่านกลไกเชิงสาเหตุเดียว

5 min readRead the primary source
Primary-source image accompanying Apple researchers propose STARFlow2 for unified text-and-image generation
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
machinelearning.apple.com
ลิงค์แหล่งที่มา
machinelearning.apple.comhttps://machinelearning.apple.com/research/starflow2-multimodal-generation
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

API (อินเทอร์เฟซการเขียนโปรแกรมแอปพลิเคชัน)
วิธีการที่มีโครงสร้างสำหรับระบบซอฟต์แวร์หนึ่งในการส่งคำขอและรับการตอบกลับจากอีกระบบหนึ่ง
โมเดลภาษาวิสัยทัศน์ (VLM)
โมเดลต่อเนื่องหลายรูปแบบที่ประมวลผลข้อมูลภาพและข้อความร่วมกัน
การเรียนรู้ของเครื่อง (ML)
วิธีการที่ช่วยให้ระบบเรียนรู้รูปแบบจากข้อมูลและปรับปรุงเมื่อเวลาผ่านไป
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

การวิจัยการเรียนรู้ของเครื่อง Apple ตีพิมพ์บทความที่อธิบาย STARFlow2 ซึ่งเป็นสถาปัตยกรรมแบบกำเนิดหลายรูปแบบที่สร้างขึ้นเพื่อทำความเข้าใจ ให้เหตุผล และสร้างลำดับข้อความและรูปภาพที่สอดประสานกัน ผู้เขียนกล่าวว่าระบบใช้โฟลว์การทำให้เป็นมาตรฐานแบบ autoregressive ควบคู่ไปกับโมเดลภาษาการมองเห็นที่ได้รับการฝึกมาล่วงหน้า โดยสตรีมทั้งสองทำงานภายใต้โครงสร้างสาเหตุเดียวกัน Apple รายงานผลลัพธ์ที่ชัดเจนในการวัดประสิทธิภาพการสร้างภาพและการวัดประสิทธิภาพความเข้าใจหลายรูปแบบ แต่แหล่งที่มาไม่ได้ระบุชื่อการวัดประสิทธิภาพ คะแนน หรือการเปรียบเทียบ

หน้าของการวิจัยการเรียนรู้ของเครื่อง Apple ซึ่งทำเครื่องหมายว่าเผยแพร่ในเดือนสิงหาคม 2026 นำเสนอ STARFlow2 เป็นงานวิจัยเกี่ยวกับการสร้างหลายรูปแบบแบบครบวงจร เอกสารระบุถึงระบบที่สามารถประมวลผลและสร้างลำดับซึ่งมีการแทรกข้อความและรูปภาพเข้าด้วยกัน ผู้เขียนของ Apple ให้เหตุผลว่าแนวทางในปัจจุบันมีโครงสร้างที่กระจัดกระจาย: บางส่วนอาศัยโทเค็นการมองเห็นแบบแยกซึ่งสามารถลดความแม่นยำของการมองเห็น บางส่วนผสมผสานการสร้างภาษาเชิงสาเหตุเข้ากับการลดสัญญาณรบกวนการแพร่กระจายซ้ำ และบางส่วนปรับแบบจำลองภาษาการมองเห็นสำหรับรุ่นในลักษณะที่อาจทำให้ความเข้าใจที่เตรียมไว้ล่วงหน้าลดลง สิ่งเหล่านี้เป็นลักษณะเฉพาะของงานวิจัยเกี่ยวกับแนวทางที่มีอยู่ ไม่ใช่ข้อค้นพบที่จัดทำโดยอิสระจากแหล่งข้อมูลนี้

ข้อเสนอหลักคือการใช้โฟลว์การทำให้เป็นมาตรฐานแบบ autoregressive เป็นเฟรมเวิร์กการสร้างทั่วไปสำหรับเอาต์พุตภาษาและภาพ สถาปัตยกรรมที่รายงานนั้นสร้างขึ้นจากสิ่งที่รายงานเรียกว่าการออกแบบเพรทเซล โดยจะแทรกสตรีมสองรายการในแนวตั้ง: สตรีมโมเดลภาษาการมองเห็นที่ได้รับการฝึกแบบแช่แข็ง และสตรีม TARFlow การเชื่อมต่อข้ามที่เหลือจะเชื่อมโยงสตรีม และทั้งสองทำงานภายใต้หน้ากากสาเหตุเดียวกัน แหล่งที่มาอธิบายโฟลว์การทำให้เป็นมาตรฐานแบบ autoregressive เป็น Transformers แบบ autoregressive ที่ใช้มาสก์เชิงสาเหตุ กลไกแคชคีย์-ค่า และโครงสร้างจากซ้ายไปขวาพร้อมกับโมเดลภาษาขนาดใหญ่

STARFlow2 ยังผสมผสานการออกแบบการไหลแบบลึกและตื้นเข้ากับพื้นที่แฝง FAE ที่เป็นหนึ่งเดียว Apple กล่าวว่าสิ่งนี้ช่วยให้ระบบสร้างเนื้อหาแบบแทรกในลักษณะที่เป็นมิตรต่อแคช โดยมีเอาต์พุตข้อความและภาพเข้าสู่แคชคีย์-ค่าโดยตรงแทนที่จะถูกเข้ารหัสอีกครั้ง หน้านี้กล่าวว่าการทดลองแสดงให้เห็นถึงประสิทธิภาพที่ยอดเยี่ยมในการสร้างภาพและเกณฑ์มาตรฐานความเข้าใจหลายรูปแบบ ซึ่ง Apple นำเสนอเป็นการตรวจสอบความถูกต้องว่าโฟลว์การถดถอยอัตโนมัติสามารถใช้เป็นรากฐานสำหรับการสร้างแบบจำลองหลายรูปแบบแบบครบวงจร อย่างไรก็ตาม แหล่งที่มาที่ให้มาไม่ได้ระบุเกณฑ์มาตรฐาน คะแนนรายงาน ระบบการเปรียบเทียบชื่อ อธิบายชุดข้อมูล หรือระบุต้นทุนการคำนวณ นอกจากนี้ยังไม่ได้ระบุว่ามีรุ่น รหัส น้ำหนัก หรือการสาธิตเชิงโต้ตอบหรือไม่ หน้านี้แสดงรายการงานที่เกี่ยวข้องกับการสร้างวิดีโอด้วยโฟลว์การทำให้เป็นมาตรฐาน แต่งานนั้นแยกจากประกาศ STARFlow2 ตามหลักฐานที่ให้มา นี่คือผลการวิจัยและข้อเสนอทางสถาปัตยกรรม ไม่ใช่การเปิดตัวผลิตภัณฑ์หรือการแสดงการบริการสาธารณะ

รายละเอียดที่มา: machinelearning.apple.com ↗

ทำไมมันถึงสำคัญ

งานนี้มุ่งเป้าไปที่ปัญหาเชิงโครงสร้างใน AI ต่อเนื่องหลายรูปแบบ โดยทั่วไปโมเดลภาษาจะสร้างโทเค็นแยกกัน ในขณะที่รูปภาพเป็นข้อมูลที่ต่อเนื่องกัน และมักสร้างผ่านระบบการแพร่กระจายหรือวนซ้ำที่แยกจากกัน หากการออกแบบที่รายงานยังคงอยู่ กลไกเชิงสาเหตุเดียวอาจทำให้การสร้างหลายรูปแบบง่ายขึ้น และทำให้ระบบข้อความและรูปภาพที่แทรกสลับกันง่ายต่อการให้บริการ มูลค่าในทางปฏิบัติยังไม่ได้รับการยืนยัน เนื่องจากแหล่งที่มาไม่ได้ให้ข้อมูลเวลาแฝง ต้นทุน คุณภาพ หรือความพร้อมใช้งาน

ความสำคัญในทางปฏิบัติของ STARFlow2 คือความพยายามในการจัดการกับความไม่ตรงกันระหว่างภาษาและการสร้างภาพภายในโครงสร้างแบบจำลองเดียว ในรายงานของรายงาน การสร้างภาษาจะได้รับการจัดการตามธรรมชาติเป็นกระบวนการจากซ้ายไปขวา ในขณะที่การสร้างภาพโดยทั่วไปจะได้รับการจัดการผ่านการนำเสนอที่แยกจากกันหรือขั้นตอนการลดสัญญาณรบกวนแบบวนซ้ำ แนวทางการไหลที่เสนอของ Apple มีวัตถุประสงค์เพื่อให้ทั้งสองวิธีอยู่ในลำดับสาเหตุอย่างต่อเนื่อง หากการประเมินโดยหน่วยงานอิสระยืนยันข้อกล่าวอ้าง สิ่งนี้อาจทำให้นักวิจัยมีการออกแบบที่สอดคล้องกันมากขึ้นสำหรับแอปพลิเคชันที่ต้องสลับระหว่างการอธิบายรูปภาพ การสร้างรูปภาพ การตีความ และดำเนินการต่อด้วยข้อความ

การออกแบบแคชเป็นอีกหนึ่งส่วนที่เป็นประโยชน์ที่อาจเป็นประโยชน์ Apple กล่าวว่าข้อความและภาพสามารถป้อนแคชคีย์-ค่าได้โดยตรงโดยไม่ต้องเข้ารหัสซ้ำ โดยหลักการแล้ว สิ่งนี้สามารถลดการประมวลผลที่ซ้ำกันเมื่อระบบเคลื่อนที่ซ้ำๆ ระหว่างรูปแบบต่างๆ โดยเฉพาะอย่างยิ่งในการสนทนาที่สลับกันยาวนานหรือการสร้างงาน อย่างไรก็ตามแหล่งที่มาไม่ได้ระบุจำนวนผลกระทบ ไม่มีการรายงานการวัดเวลาแฝง ตัวเลขหน่วยความจำ ผลลัพธ์ปริมาณงาน ต้นทุนการให้บริการ หรือการเปรียบเทียบกับระบบที่ใช้การแพร่กระจายหรือโทเค็นที่เทียบเท่ากัน ดังนั้นข้อได้เปรียบที่อ้างสิทธิ์จึงควรถือเป็นวัตถุประสงค์ทางสถาปัตยกรรมและการอ้างสิทธิ์ในการวิจัยมากกว่าผลประโยชน์ในการปฏิบัติงานที่กำหนดไว้

ข้อเสนอนี้มีความสำคัญเช่นกัน เนื่องจากพยายามรักษาความเข้าใจหลายรูปแบบของโมเดลที่ได้รับการฝึกไว้ล่วงหน้า ในขณะเดียวกันก็เพิ่มการสร้างภาพต่อเนื่องที่มีความแม่นยำสูง Apple กล่าวว่าสตรีมภาษาการมองเห็นที่แช่แข็งช่วยรักษาความเข้าใจที่มีอยู่ และสตรีมโฟลว์ช่วยให้สามารถสร้างภาพได้ การรวมกันดังกล่าวอาจเกี่ยวข้องกับระบบในอนาคตที่จำเป็นต้องมีทั้งการตีความและการสร้างสรรค์ แต่แหล่งที่มาไม่ได้กำหนดว่าจะสามารถรักษาความเข้าใจได้มากเพียงใด มีการวัดความถูกต้องของการมองเห็นอย่างไร หรือกำไรจากงานหนึ่งต้องแลกกับประสิทธิภาพในอีกงานหนึ่งหรือไม่ ผลลัพธ์ของบทความนี้อาจมีความสำคัญต่อการวิจัยแบบจำลองหลายรูปแบบ แต่ความสำคัญในวงกว้างนั้นขึ้นอยู่กับรายละเอียดที่ขาดหายไปจากประกาศ

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

หลักฐานสำคัญลำดับต่อไปคือการเผยแพร่ฉบับสมบูรณ์ รวมถึงรายละเอียดเกณฑ์มาตรฐาน เส้นพื้นฐาน การทำลาย ขนาดโมเดล ข้อกำหนดในการประมวลผล และโค้ดหรือน้ำหนักใดๆ นักวิจัยและนักพัฒนาควรทดสอบด้วยว่าข้อดีของ KV-cache ที่อ้างสิทธิ์ยังคงมีอยู่ในลำดับการสลับแบบยาวและเวิร์กโฟลว์ต่อเนื่องหลายรูปแบบจริงหรือไม่ Apple ไม่ได้ระบุในแหล่งข้อมูลนี้ว่า STARFlow2 เป็นผลิตภัณฑ์ รุ่นสาธารณะ หรือเครื่องมือที่มีจำหน่ายทั่วไป และไม่ได้ระบุวันที่เผยแพร่ที่แน่นอนภายในเดือนสิงหาคม 2026

จุดตรวจสอบจุดแรกคือรายงานฉบับสมบูรณ์และบันทึกการทดลอง หลักฐานการติดตามที่เป็นประโยชน์จะรวมถึงชื่อและเวอร์ชันของการสร้างภาพและเกณฑ์มาตรฐานความเข้าใจหลายรูปแบบ ผลลัพธ์เชิงตัวเลขสำหรับ STARFlow2 และเส้นพื้นฐานที่เกี่ยวข้อง การศึกษาการผ่าตัดแบบระเหยที่แยกสตรีมภาษาการมองเห็นที่แช่แข็ง สตรีม TARFlow การเชื่อมต่อที่เหลือและการออกแบบพื้นที่แฝง และรายละเอียดเกี่ยวกับข้อมูลการฝึกอบรม ขนาดของแบบจำลอง และการคำนวณ หากไม่มีรายละเอียดเหล่านั้น “ประสิทธิภาพที่แข็งแกร่ง” ก็กว้างเกินไปที่จะระบุได้ว่าการปรับปรุงนั้นใหญ่หรือน่าเชื่อถือเพียงใด

คำถามที่สองคือว่าโครงสร้างเชิงสาเหตุและเป็นมิตรกับแคชที่เสนอนั้นใช้งานได้นอกเหนือจากการทดสอบที่รายงานหรือไม่ นักวิจัยอิสระจะต้องตรวจสอบลำดับที่ยาวซึ่งมีการเปลี่ยนระหว่างข้อความและรูปภาพซ้ำๆ เนื่องจากการเติบโตของแคช การใช้หน่วยความจำ และการสะสมข้อผิดพลาดอาจส่งผลต่อประสิทธิภาพในทางปฏิบัติ พวกเขาควรเปรียบเทียบคุณภาพเอาต์พุต ความสม่ำเสมอ การควบคุม และต้นทุนการให้บริการกับระบบที่ใช้โทเค็นอิมเมจแยกหรือการแพร่กระจายซ้ำ แหล่งที่มายังไม่มีหลักฐานเกี่ยวกับการแลกเปลี่ยนเหล่านี้ และไม่ได้รายงานพฤติกรรมภายใต้การเปลี่ยนแปลงการจัดจำหน่ายหรือการแจ้งเตือนต่อเนื่องหลายรูปแบบที่ยากลำบาก

คำถามสุดท้ายคือการปรับใช้ แหล่งที่มาไม่ได้ระบุว่า STARFlow2 พร้อมใช้งานผ่านผลิตภัณฑ์ Apple, API, พื้นที่เก็บข้อมูลการวิจัย หรือจุดตรวจสอบที่ดาวน์โหลดได้ นอกจากนี้ยังไม่ได้ระบุวันที่เผยแพร่ที่แน่นอน ดังนั้นช่วงเวลาภายในกรอบข่าว 96 ชั่วโมงที่ระบุไว้จึงไม่สามารถจำกัดให้แคบลงเพิ่มเติมจากเนื้อหาที่ให้มาได้ การรายงานการติดตามผลควรกำหนดว่า Apple เผยแพร่รายละเอียดการใช้งานหรือสิ่งประดิษฐ์ของโมเดลหรือไม่ กลุ่มภายนอกสามารถสร้างผลลัพธ์ซ้ำได้หรือไม่ และสถาปัตยกรรมมีอิทธิพลต่อระบบหลายรูปแบบเชิงพาณิชย์หรือไม่ ก่อนหน้านั้น สิ่งที่ไม่ทราบที่มีความหมายได้แก่ ความพร้อมใช้งาน ความสามารถในการทำซ้ำ ความต้องการทรัพยากร และกำไรที่วัดได้โดยอิสระ

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIหม้อแปลงไฟฟ้าการฝึกอบรมเอไออนาคตของ AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?