กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

การศึกษาการจำลองแบบระบุว่า FLOP ยังคงคาดการณ์รันไทม์ AI ผิด และการแก้ไขที่เสนอล้มเหลวในฮาร์ดแวร์รุ่นใหม่

การพิมพ์ล่วงหน้าโดยนักวิจัยสองคนสร้างการศึกษาก่อนหน้านี้ว่าเหตุใดการนับ FLOP ที่เท่ากันไม่ได้หมายความว่าเวลาในการดำเนินการเท่ากัน เป็นการยืนยันการอ้างสิทธิ์ที่ซ่อนอยู่ แต่รายงานว่าสูตรการแก้ไข α-FLOPs โดยทั่วไปจะประเมินรันไทม์บนฮาร์ดแวร์รุ่นใหม่ต่ำเกินไป ซึ่งแสดงการกระโดดและการแกว่งที่สูตรไม่ได้บันทึก

7 min readRead the primary source
Source-page capture accompanying Replication Study Says FLOPs Still Mispredict AI Runtime, and the Proposed Fix Fails on Newer Hardware
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.14550
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

ปัญญาประดิษฐ์ (AI)
ระบบอาคารในสาขากว้างๆ ที่ทำงานซึ่งต้องใช้การจดจำรูปแบบ การใช้เหตุผล ภาษา หรือการตัดสินใจ
การเรียนรู้ของเครื่อง (ML)
วิธีการที่ช่วยให้ระบบเรียนรู้รูปแบบจากข้อมูลและปรับปรุงเมื่อเวลาผ่านไป
หน่วยความจำ (หน่วยความจำตัวแทน)
บริบทที่จัดเก็บไว้ซึ่งตัวแทน AI ใช้ในขั้นตอนหรือเซสชันเพื่อปรับปรุงความต่อเนื่อง
ทดสอบตัวเองแบบทดสอบการฝึกอบรม AI

เกิดอะไรขึ้น

การพิมพ์ล่วงหน้าที่โพสต์ไปที่ arXiv (2608.14550) โดย Enrique Barba Roque และ Luís Cruz พยายามจำลองการศึกษาก่อนหน้านี้ที่เสนอสูตร "α-FLOPs" สำหรับการประมาณค่าจำนวนจุดลอยตัวที่แปลเป็นเวลาดำเนินการ การจำลองแบบสนับสนุนการอ้างเชิงประจักษ์หลักของต้นฉบับ — ว่า FLOP แบบดิบนั้นเป็นพร็อกซีที่ไม่ดีสำหรับรันไทม์ เนื่องจากมิติเชิงพื้นที่จะขนานได้ง่ายกว่ามิติเคอร์เนล — แต่รายงานผลลัพธ์เชิงลบสำหรับสูตรนั้นบนฮาร์ดแวร์ที่ใหม่กว่าและมีประสิทธิภาพมากกว่า ผู้เขียนยังกล่าวอีกว่าเอกสารการจำลองแบบของการศึกษาต้นฉบับไม่สมบูรณ์ และพวกเขาก็เผยแพร่แพ็คเกจของตนเอง

การพิมพ์ล่วงหน้าที่ยื่นบน arXiv เป็น 2608.14550 โดย Enrique Barba Roque และ Luís Cruz ตั้งใจที่จะทำซ้ำการทดลองเบื้องหลังสูตรการประมาณค่า "α-FLOPs" ที่เผยแพร่ก่อนหน้านี้ รายการดังกล่าวแยกประเภทงานภายใต้ปัญญาประดิษฐ์ (cs.AI) พร้อมด้วยรายการข้ามไปยังประสิทธิภาพ (cs.PF) และแสดงเวอร์ชันเดียวที่ส่งเมื่อวันที่ 30 เมษายน 2026 เป้าหมายที่ระบุไว้นั้นแคบลง: ตรวจสอบว่าผลลัพธ์ของการศึกษาต้นฉบับยังคงมีฮาร์ดแวร์ที่ใหม่กว่าและมีประสิทธิภาพมากกว่าที่ทดสอบหรือไม่

ปัญหาที่งานต้นฉบับแก้ไขเป็นที่คุ้นเคยในวิศวกรรมการเรียนรู้ของเครื่อง การดำเนินการจุดลอยตัวหรือ FLOP เป็นวิธีดั้งเดิมในการรายงานว่าโมเดลหรือเลเยอร์ต้องใช้การคำนวณมากเพียงใด แต่ดังที่นามธรรมกล่าวไว้ ความสัมพันธ์ระหว่าง FLOP และเวลาดำเนินการ "ไม่ตรงไปตรงมา" เนื่องจากสองชั้นที่มีการนับ FLOP ที่เหมือนกันอาจใช้เวลาต่างกัน - การดำเนินการบางอย่างจะขนานกันพร้อมบนตัวเร่งความเร็วสมัยใหม่มากกว่าตัวอื่น ๆ มีการเสนอสูตร α-FLOPs เพื่อเป็นการแก้ไขที่แมป FLOP นับรวมเข้ากับสิ่งที่ใกล้เคียงกับงานจริงมากขึ้น

ในการเรียกร้องส่วนกลาง การจำลองแบบเห็นด้วย ผู้เขียนรายงานว่าผลลัพธ์ของพวกเขา "ตรวจสอบวิทยานิพนธ์ที่ว่า FLOP แบบดิบเพียงอย่างเดียวไม่ใช่ตัวชี้วัดที่เหมาะสมสำหรับเวลาดำเนินการ" และกลไกที่ระบุในการศึกษาดั้งเดิมยังคงใช้อยู่: มิติเชิงพื้นที่ยังคงขนานกันง่ายกว่ามิติเคอร์เนล ส่วนหนึ่งของการค้นพบก่อนหน้านี้ยังคงมีอยู่เมื่อมีการย้ายไปยังฮาร์ดแวร์รุ่นใหม่

สูตรการแก้ไขก็ไม่ได้ผลเช่นกัน ตามนามธรรม การวัดแบบละเอียดแสดงให้เห็นว่าความสัมพันธ์ระหว่าง FLOP กับเวลานั้น "ตรงไปตรงมาน้อยกว่าที่แสดงไว้ก่อนหน้านี้มาก" โดยที่ฮาร์ดแวร์รุ่นใหม่แสดงความไม่เสถียรและไม่ต่อเนื่อง — อธิบายว่าเป็นการกระโดดและการแกว่ง — ในเวลาดำเนินการ ผู้เขียนเขียนสูตร α-FLOPs โดยทั่วไปจะประเมินสิ่งเหล่านี้ต่ำไป บทสรุป: งานนี้จะตรวจสอบผลการค้นพบเชิงประจักษ์ของต้นฉบับ แต่รายงานผลลัพธ์เชิงลบสำหรับสูตรการประมาณค่า

การค้นพบครั้งที่สองเกี่ยวข้องกับกระบวนการมากกว่าฟิสิกส์ ในระหว่างการจำลองแบบ ผู้เขียนกล่าวว่าพวกเขาระบุข้อจำกัดในเนื้อหาที่การศึกษาต้นฉบับให้ไว้ รวมถึงการขาดรายละเอียดการพึ่งพาที่เฉพาะเจาะจงและความโปร่งใสเกี่ยวกับข้อมูลการถดถอย พวกเขาแย้งว่าการวิจัยเกี่ยวกับการประเมินประสิทธิภาพที่ขึ้นอยู่กับฮาร์ดแวร์จำเป็นต้องมีแพ็คเกจการจำลองที่สมบูรณ์และถูกต้องอย่างยิ่ง และกล่าวว่าพวกเขาได้จัดเตรียมแพ็คเกจที่สมบูรณ์สำหรับการใช้งานของตนเอง บทคัดย่อไม่ได้ระบุว่า: ชิปหรือผู้จำหน่ายรายใดที่ได้รับการทดสอบ, เลเยอร์หรือรุ่นใดที่ถูกวัด, การประเมินค่าต่ำไปมากเพียงใด หรือที่โฮสต์แพ็คเกจ รายชื่อไม่ได้บ่งชี้ถึงการตรวจสอบโดยผู้ทรงคุณวุฒิ การพิมพ์ล่วงหน้า arXiv จะไม่ได้รับการพิจารณาก่อนโพสต์

รายละเอียดที่มา: arxiv.org

ทำไมมันถึงสำคัญ

FLOP เป็นตัวย่อเริ่มต้นสำหรับต้นทุนการคำนวณในเอกสารวิจัย การ์ดแบบจำลอง การกล่าวอ้างด้านประสิทธิภาพ และการประมาณผลกระทบต่อสิ่งแวดล้อม หากการแมปจาก FLOP ไปจนถึงเวลาดำเนินการจริงไม่เพียงแต่ไม่แม่นยำแต่ไม่เสถียร โดยมีความไม่ต่อเนื่องที่สูตรการแก้ไขที่เผยแพร่ประเมินไว้ต่ำเกินไป การเปรียบเทียบประสิทธิภาพที่สร้างขึ้นจากการนับ FLOP เพียงอย่างเดียวก็สามารถจัดอันดับระบบที่ไม่ถูกต้องได้ เอกสารนี้ยังบันทึกปัญหาในทางปฏิบัติในภาคสนามด้วย: ผลลัพธ์ที่ขึ้นอยู่กับฮาร์ดแวร์นั้นตรวจสอบได้ยากเมื่อแพ็คเกจการจำลองแบบละเว้นเวอร์ชันการพึ่งพาและข้อมูลเบื้องหลังการถดถอยที่รายงาน

FLOPs ทำหน้าที่เป็นสกุลเงินทั่วไปของฟิลด์สำหรับต้นทุนการคำนวณ ปรากฏในเอกสารเปรียบเทียบสถาปัตยกรรม ในการกล่าวอ้างด้านประสิทธิภาพเกี่ยวกับโมเดลใหม่ๆ และในการประมาณการการใช้พลังงานและการปล่อยก๊าซคาร์บอนไดออกไซด์ด้านหลังซอง สิ่งที่น่าสนใจคือสามารถนับได้อย่างวิเคราะห์โดยไม่ต้องดำเนินการใดๆ บทความนี้เป็นเครื่องเตือนใจ และเพื่อเป็นหลักฐานโดยตรงว่าปริมาณที่นับไม่ใช่ปริมาณที่ผู้คนมักจะสนใจ ซึ่งก็คือเวลา พลังงาน และเงินที่ใช้ไปกับฮาร์ดแวร์จริง

ผลที่ตามมาในทางปฏิบัติตกอยู่ที่ใครก็ตามที่เลือกระหว่างการออกแบบบนกระดาษ หากการกำหนดค่าเลเยอร์ที่มี FLOP น้อยกว่าสามารถทำงานช้าลงได้ การตัดสินใจออกแบบที่ลด FLOP ลงอาจไม่ให้ความเร็วตามที่คาดหวัง และการจัดอันดับประสิทธิภาพที่ได้จากการนับ FLOP อาจไม่รอดจากการสัมผัสกับเครื่องเร่งความเร็วจริง มีสูตร α-FLOPs เพื่อปิดช่องว่างนั้น การค้นพบการจำลองแบบว่าประเมินรันไทม์บนฮาร์ดแวร์รุ่นใหม่ต่ำเกินไปอย่างเป็นระบบหมายความว่าอย่างน้อยที่สุดช่องว่างก็ไม่ได้ถูกปิดโดยวิธีการนั้น ข้อผิดพลาดที่บอกเป็นนัยในทางปฏิบัติมากน้อยเพียงใดนั้นไม่ได้วัดเป็นปริมาณในบทคัดย่อ และผู้อ่านไม่ควรถือว่าความคลาดเคลื่อนนั้นมีมากในทุกกรณี

ความไม่เสถียรที่รายงานมีความสำคัญพอๆ กับข้อผิดพลาดโดยเฉลี่ย การกระโดดและการแกว่งในเวลาดำเนินการแนะนำว่าความสัมพันธ์นั้นไม่ใช่เส้นโค้งที่ราบรื่นซึ่งสูตรที่พอดีเดียวสามารถติดตามได้ ซึ่งอาจขึ้นอยู่กับเกณฑ์ในวิธีการจัดกำหนดการงานบนฮาร์ดแวร์ นั่นยากกว่าการแก้ไขมากกว่าอคติที่สอดคล้องกัน บทคัดย่อไม่ได้ถือว่าความไม่ต่อเนื่องเกิดจากสาเหตุเฉพาะใดๆ และบทความที่สรุปไว้ไม่ได้อ้างว่าจะอธิบายสิ่งเหล่านั้น

มีนโยบายที่ใกล้เคียงกันที่ควรค่าแก่การระบุอย่างชัดเจน เพราะมันง่ายที่จะพูดเกินจริง หน่วยงานกำกับดูแลในเขตอำนาจศาลหลายแห่งได้ใช้เกณฑ์การประมวลผลการฝึกอบรมที่แสดงใน FLOP เพื่อตัดสินใจว่าโมเดลใดที่ต้องเผชิญกับภาระผูกพันเพิ่มเติม นั่นคือการใช้เมตริกที่แตกต่างจากที่ศึกษาที่นี่: เอกสารนี้เกี่ยวข้องกับการคาดการณ์เวลาดำเนินการของเลเยอร์ ไม่ใช่การวัดการประมวลผลการฝึกอบรมทั้งหมดสำหรับการจัดประเภททางกฎหมาย มันไม่ได้ทดสอบและไม่ได้อ้างใดๆ ว่าเกณฑ์ดังกล่าวมีการสอบเทียบอย่างดีหรือไม่ สิ่งที่สนับสนุนคือประเด็นทั่วไปที่ FLOP และการใช้ทรัพยากรจริงเชื่อมโยงกันอย่างหลวมๆ

ท้ายที่สุด การค้นหาวัสดุการจำลองแบบบ่งบอกถึงปัญหาที่ยั่งยืน ผลลัพธ์ที่ขึ้นอยู่กับเวอร์ชันฮาร์ดแวร์และซอฟต์แวร์เฉพาะจะมีอายุการเก็บรักษาสั้น และสามารถตรวจสอบได้อีกครั้งหากสิ่งประดิษฐ์ดั้งเดิมระบุการขึ้นต่อกันและเปิดเผยข้อมูลพื้นฐาน เอกสารนี้เป็นตัวอย่างของการตรวจสอบภาคสนาม และการตรวจสอบนั้นยากกว่าที่ควรจะเป็น

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Training Quiz

In AI training, what is an "epoch"?

จะดูอะไรต่อไป.

ไม่ว่าแพ็คเกจการจำลองแบบของผู้เขียนจะถูกหยิบขึ้นมาและความไม่เสถียรที่วัดได้นั้นจะเกิดขึ้นซ้ำในชิปและสแต็กซอฟต์แวร์อื่น ๆ หรือไม่ มีใครระบุสาเหตุของการกระโดดและการแกว่งซึ่งบทคัดย่อนี้ไม่ได้วินิจฉัยหรือไม่ ผู้เขียนงานวิจัยต้นฉบับตอบสนองหรือไม่ และการพิมพ์ล่วงหน้าจะล้างการตรวจสอบโดยผู้ทรงคุณวุฒิหรือไม่ นอกจากนี้ ให้ตรวจดูด้วยว่าบรรทัดฐานการรายงานประสิทธิภาพเคลื่อนไปสู่เวลาและพลังงานที่วัดได้ควบคู่ไปกับ FLOP หรือไม่ และการค้นพบระดับเลเยอร์จะยึดถือในระดับโมเดลทั้งหมดหรือไม่

สิ่งที่ต้องดูทันทีที่สุดคือแพ็คเกจการจำลองแบบที่ผู้เขียนบอกว่ามีให้ ประโยชน์ของมันขึ้นอยู่กับรายละเอียดที่บทคัดย่อไม่ได้ให้ไว้ ไม่ว่าจะเป็นการปักหมุดเวอร์ชันซอฟต์แวร์ รวมถึงการวัดเวลาดิบ และชื่อฮาร์ดแวร์ที่ใช้ หากเป็นเช่นนั้น นักวิจัยคนอื่นๆ จะสามารถทดสอบได้ว่าการกระโดดและการแกว่งที่รายงานนั้นปรากฏบนตัวเร่งความเร็ว เวอร์ชันไดรเวอร์ และไลบรารีเคอร์เนลที่ต่างกัน หรือไม่ว่าจะเฉพาะเจาะจงกับการตั้งค่าเดียวหรือไม่

คำถามเปิดที่สองคือการวินิจฉัย บทคัดย่อรายงานความไม่เสถียรแต่ไม่ได้อธิบาย คำอธิบายที่น่าเชื่อถือมีอยู่ในวรรณกรรมวิศวกรรมประสิทธิภาพ - วิธีการทำงานเรียงต่อกัน, ซึ่งเคอร์เนลที่ไลบรารีเลือกตามรูปร่างเฉพาะ, พฤติกรรมของหน่วยความจำที่ขอบเขตขนาด - แต่บทความนี้ไม่ได้ตัดสินในหมู่พวกเขา และไม่ควรนำมาประกอบกับมัน ติดตามการทำงานที่ระบุกลไก เนื่องจากสูตรการแก้ไขจะดีพอๆ กับแบบจำลองพฤติกรรมของฮาร์ดแวร์ที่อยู่เบื้องหลังเท่านั้น

จากนั้นจะมีการตอบกลับจากผู้เขียนการศึกษาต้นฉบับและสถานะของฉบับพิมพ์นี้เอง การจำลองแบบที่รายงานผลลัพธ์เชิงลบเกี่ยวกับวิธีการเผยแพร่มักจะพร้อมท์ให้มีการชี้แจงเกี่ยวกับขอบเขต: ผู้เสนอสูตรอาจแย้งว่าสูตรได้รับการปรับเทียบสำหรับการสร้างฮาร์ดแวร์หรือระบบการทำงานที่ไม่ใช้อีกต่อไป การทบทวนโดยผู้ทรงคุณวุฒิ หากบทความวิจัยผ่านก็อาจทำให้ความหมายของ "การประเมินต่ำไปโดยทั่วไป" ในเชิงปริมาณชัดเจนขึ้นด้วย

ให้กว้างขึ้น ดูว่าบรรทัดฐานการรายงานประสิทธิภาพมีการเปลี่ยนแปลงหรือไม่ หากการประมาณการตาม FLOP พิสูจน์แล้วว่าไม่น่าเชื่อถือสำหรับรันไทม์บนฮาร์ดแวร์ปัจจุบัน ทางเลือกในทางปฏิบัติคือการวัดเวลานาฬิกาแขวนและวัดพลังงานบนฮาร์ดแวร์ที่ระบุชื่อ ซึ่งให้ข้อมูลมากกว่า แต่เปรียบเทียบได้ยากกว่าในห้องปฏิบัติการและมีราคาแพงกว่าในการผลิต โปรแกรมการประเมินสิ่งประดิษฐ์ในการประชุมเป็นที่เดียวที่ข้อกำหนดที่เข้มงวดขึ้นสำหรับการอ้างประสิทธิภาพที่ขึ้นอยู่กับฮาร์ดแวร์จะปรากฏขึ้นก่อน

สุดท้ายนี้ขอบเขต งานที่อธิบายไว้มีความละเอียดและระดับชั้น ไม่ว่าผลกระทบเหล่านี้จะสะสม ยกเลิก หรือล้นหลามจากปัญหาคอขวดอื่นๆ ในระดับทั้งโมเดลหรือทั้งการฝึกอบรมและการดำเนินการนั้น ไม่ได้ระบุไว้ในบทคัดย่อ และเป็นคำถามที่จะกำหนดว่าการค้นพบนี้เปลี่ยนแปลงแนวทางปฏิบัติของใครก็ตามไปมากน้อยเพียงใด

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

การฝึกอบรมเอไออธิบายโมเดล AIอนาคตของ AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเรา
พบว่าสิ่งนี้มีประโยชน์หรือไม่?