เกิดอะไรขึ้น
BigGo Finance รายงานว่า OpenRouter เปิดตัว "การวัดประสิทธิภาพรูปภาพ" ซึ่งเป็นไซต์ที่เรียกใช้พร้อมท์ที่เหมือนกันในโมเดลการสร้างรูปภาพหลายแบบและแสดงผลแบบเคียงข้างกัน รายงานระบุว่าการทดสอบเริ่มต้นพบว่ามีเพียง GPT Image 2 และ GPT-5.4 Image 2 เท่านั้นที่ปฏิบัติตามคำแนะนำโดยสมบูรณ์เพื่อแสดงแก้วทรงตั้งที่เต็มไปด้วยไวน์ขาว ไซต์นี้ยังมีการทดสอบการแสดงข้อความและการแก้ไขรูปภาพ โดยจัดเรียงตามต้นทุนหรือเวลาในการสร้าง
BigGo Finance รายงานว่า OpenRouter เปิดตัวไซต์ที่เรียกว่า "การวัดประสิทธิภาพรูปภาพ" เพื่อเปรียบเทียบโมเดลการสร้างภาพภายใต้เงื่อนไขที่เหมือนกัน มีรายงานว่าไซต์วางเอาต์พุตไว้ในตาราง ทำให้ผู้ใช้สามารถสลับระหว่างข้อความแจ้งและตรวจสอบว่าระบบต่างๆ ตีความคำสั่งเดียวกันอย่างไร รายงานระบุความเที่ยงตรงในทันที ความแม่นยำในการเรนเดอร์ข้อความ และความแม่นยำในการแก้ไขรูปภาพเป็นประเด็นหลักในการเปรียบเทียบ นอกจากนี้ยังกล่าวอีกว่าผู้ใช้สามารถจัดเรียงผลลัพธ์ตามต้นทุนการสร้างหรือเวลาในการสร้าง ซึ่งวางกรอบเกณฑ์มาตรฐานในฐานะเครื่องมือในการเลือกรุ่น แทนที่จะเป็นเพียงแกลเลอรีภาพ
ตัวอย่างเริ่มต้นของรายงานใช้องค์ประกอบโดยละเอียดเกี่ยวกับแก้วใสที่เต็มไปด้วยไวน์ขาวบนโต๊ะไม้เรียบง่าย BigGo Finance กล่าวว่ามีเพียง GPT Image 2 และ GPT-5.4 Image 2 เท่านั้นที่ตรงตามข้อกำหนดระดับการบรรจุและตำแหน่งตั้งตรงที่ระบุไว้ในการทดสอบนั้น มีรายงานว่าผลลัพธ์อื่นๆ มีความลาดเอียงของแก้ว ปริมาณไวน์ และองค์ประกอบโดยรวมแตกต่างกัน แหล่งที่มานำเสนอสิ่งนี้เป็นตัวอย่างของการยึดมั่นในทันที ไม่ใช่การประเมินคุณภาพของภาพหรือความสามารถของโมเดลอย่างครอบคลุม
BigGo Finance กล่าวว่าไซต์ดังกล่าวรวมการทดสอบ "ร่มปิด" ที่เกี่ยวข้องกับคนประมาณ 12 คนถือร่มปิดท่ามกลางฝนตกหนัก ตามรายงาน ข้อความดังกล่าวมีจุดมุ่งหมายเพื่อเปิดเผยความแตกต่างในการนับ สถานะของวัตถุ และการพรรณนาฝน เว็บไซต์ดังกล่าวยังรายงานว่ามีรูปภาพที่มีข้อความจำนวนมากและคำแนะนำในการแก้ไข รวมถึงการทดสอบที่ขอให้แบบจำลองถอดเฉพาะกระจกบานที่สองออกจากด้านซ้ายในขณะที่สร้างพื้นหลังใหม่อย่างเป็นธรรมชาติ แหล่งที่มาไม่ได้ระบุรายชื่อรุ่นที่เข้าร่วม วันที่ทดสอบ ผลการทดลองซ้ำ หรือขั้นตอนการให้คะแนนแบบอิสระ
รายงานเดียวกันแยกกันระบุว่า OpenAI ประกาศฟีเจอร์สติกเกอร์แบบกำหนดเองสำหรับแอปมือถือของ ChatGPT BigGo Finance รายงานว่าฟีเจอร์นี้สร้างขึ้นบน ChatGPT Images 2.0 ช่วยให้ผู้ใช้สามารถสร้างชุดสติ๊กเกอร์ได้สูงสุดเก้าชุดจากข้อความแจ้งหรือรูปถ่าย รองรับพื้นหลังโปร่งใส และอนุญาตให้แชร์ไปยัง iMessage ของ WhatsApp และ Apple โดยไม่มีค่าใช้จ่ายเพิ่มเติม นี่เป็นการอัปเดตผลิตภัณฑ์ที่แยกจากเกณฑ์มาตรฐานของ OpenRouter แม้ว่าการพัฒนาทั้งสองจะเกี่ยวข้องกับการใช้ระบบสร้างภาพที่เพิ่มขึ้นในงานสร้างสรรค์และการสื่อสารในชีวิตประจำวัน
รายละเอียดที่มา: finance.biggo.com ↗
ทำไมมันถึงสำคัญ
เกณฑ์มาตรฐานอาจช่วยให้นักพัฒนาและผู้สร้างมีวิธีที่เป็นประโยชน์มากขึ้นในการเปรียบเทียบโมเดลรูปภาพสำหรับงานเฉพาะ แทนที่จะอาศัยคะแนนพาดหัวเดียวหรือการอ้างสิทธิ์ของผู้ขาย ประโยชน์ของมันจะขึ้นอยู่กับความโปร่งใสของการแจ้งเตือน เวอร์ชันของโมเดล เงื่อนไขการสุ่มตัวอย่าง ข้อมูลราคา และวิธีการประเมิน ซึ่งรายละเอียดที่ BigGo Finance ไม่ได้ตรวจสอบหรือให้อย่างครบถ้วนโดยอิสระ
ค่ากลางของเกณฑ์มาตรฐานที่รายงานของ OpenRouter คือความสามารถในการเปรียบเทียบได้ ระบบการสร้างภาพมักจะปรากฏชัดเจนหรืออ่อนแอขึ้นอยู่กับการแจ้งที่แน่นอน เวอร์ชันของรุ่น ความละเอียด ขั้นตอนการแก้ไข และการเลือกเอาท์พุต การรันคำสั่งเดียวกันในหลายระบบสามารถสร้างความแตกต่างในการวางออบเจ็กต์ การนับ การแสดงข้อความ และการแก้ไขแบบเลือกได้ง่ายขึ้นในการตรวจสอบ สำหรับนักพัฒนาที่เลือกแบบจำลองสำหรับเวิร์กโฟลว์ที่แคบ ผลลัพธ์แบบเทียบเคียงกันอาจมีประโยชน์มากกว่าการกล่าวอ้างทั่วไปว่าระบบหนึ่ง "ดีกว่า"
ต้นทุนและเวลาแฝงมีความสำคัญเนื่องจากการสร้างภาพไม่ได้ตัดสินจากคุณภาพของภาพเท่านั้น แบบจำลองที่สร้างภาพที่แม่นยำยิ่งขึ้นอาจยังไม่เหมาะกับการใช้งานที่มีปริมาณมาก หากมีราคาแพงหรือช้า BigGo Finance กล่าวว่า OpenRouter ช่วยให้ผู้ใช้สามารถจัดเรียงผลลัพธ์ตามต้นทุนและเวลาในการผลิต ซึ่งอาจช่วยให้ผู้ใช้พิจารณาคุณภาพ ราคา และความเร็วร่วมกัน รายงานไม่ได้ยืนยันราคาที่แสดง วิธีวัดเวลาในการผลิต หรือการเปรียบเทียบจะพิจารณาถึงความแตกต่างในความละเอียด จำนวนผลผลิต หรือเงื่อนไขการบริการหรือไม่
ตัวอย่างแก้วไวน์ที่รายงานยังแสดงให้เห็นว่าเหตุใดประสิทธิภาพงานที่แคบจึงมีความสำคัญ แบบจำลองสามารถสร้างภาพที่สวยงามได้ในขณะที่ขาดคำแนะนำเชิงพื้นที่หรือเชิงปริมาณที่แม่นยำ เช่น การวางกระจกให้ตั้งตรงหรือเติมให้อยู่ในระดับที่กำหนด ความล้มเหลวที่คล้ายกันอาจมีความสำคัญในการผลิตโฆษณา การแสดงภาพผลิตภัณฑ์ สื่อการเข้าถึง และขั้นตอนการแก้ไขภาพ แหล่งที่มาไม่ได้ระบุว่าโมเดล GPT ทั้งสองที่รายงานมีประสิทธิภาพเหนือกว่าระบบอื่นๆ อย่างสม่ำเสมอ โดยจะอธิบายการทดสอบเริ่มต้นรายการเดียวและไม่มีผลลัพธ์ทางสถิติที่กว้างขึ้น
เกณฑ์มาตรฐานยังสามารถปรับปรุงความรับผิดชอบได้หากรักษาผลลัพธ์ที่ลงวันที่และทำให้มองเห็นเงื่อนไขได้ โมเดลรูปภาพเปลี่ยนแปลงบ่อยครั้ง และอันดับสามารถเปลี่ยนแปลงได้หลังจากการอัปเดตโมเดล การเปลี่ยนแปลงเส้นทาง หรือการปรับราคา หากไม่มีตัวระบุเวอร์ชัน ข้อความแจ้งที่ทำซ้ำได้ และบันทึกผลลัพธ์ก่อนหน้า ผู้ใช้อาจเข้าใจผิดว่าภาพรวมชั่วคราวเพื่อให้ได้ข้อสรุปที่คงทน แหล่งที่มาให้รายละเอียดเพียงพอที่จะระบุบริการเปรียบเทียบที่อาจเป็นประโยชน์ แต่ไม่เพียงพอที่จะประเมินความเป็นอิสระ ความครอบคลุม หรือความเข้มงวดด้านระเบียบวิธี
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
ดูว่า OpenRouter เผยแพร่วิธีการวัดประสิทธิภาพ รายการโมเดลทั้งหมด การประทับเวลา เอาต์พุตดิบ และข้อมูลความสามารถในการทำซ้ำหรือไม่ ผู้ใช้ควรถือว่าผลลัพธ์แก้วไวน์ที่รายงานเป็นเพียงตัวอย่างที่จำกัด ไม่ใช่การจัดอันดับทั่วไป นอกจากนี้ ดูด้วยว่าฟีเจอร์สติกเกอร์ ChatGPT ที่รายงานแยกออกมาพร้อมใช้งานในวงกว้างหรือไม่ และความสามารถในการสร้างภาพเปรียบเทียบกับรุ่นที่รวมอยู่ในการทดสอบของ OpenRouter เป็นอย่างไร
ขั้นตอนต่อไปที่สำคัญที่สุดคือการเปิดเผยข้อมูลตามระเบียบวิธี ผู้ใช้ควรมองหาสินค้าคงคลังของโมเดลที่สมบูรณ์ ตัวระบุเวอร์ชัน-โมเดลที่แน่นอน ขนาดรูปภาพ ข้อความแจ้ง กฎการสุ่มตัวอย่างหรือลองใหม่ พฤติกรรมการดูแล สมมติฐานด้านราคา และการประทับเวลา พวกเขาควรตรวจสอบด้วยว่าไซต์แสดงทุกผลลัพธ์ที่สร้างขึ้นหรือเฉพาะตัวอย่างที่เลือกเท่านั้น BigGo Finance รายงานคุณลักษณะของไซต์แต่ไม่ได้ตรวจสอบเงื่อนไขพื้นฐานเหล่านี้โดยอิสระ
การทดสอบการแก้ไขของเกณฑ์มาตรฐานสมควรได้รับการตรวจสอบอย่างละเอียดเป็นพิเศษ การลบวัตถุที่ระบุหนึ่งรายการออกในขณะที่ยังคงรักษาส่วนที่เหลือของรูปภาพเป็นความสามารถที่แตกต่างไปจากการสร้างฉากใหม่ และความสำเร็จอาจขึ้นอยู่กับอิมเมจต้นฉบับ มาสก์ อินเทอร์เฟซ และจำนวนความพยายามที่อนุญาตที่ให้มา แหล่งข่าวกล่าวถึงตัวอย่างที่เกี่ยวข้องกับแก้วที่สองจากด้านซ้าย แต่ไม่ได้บอกว่าคะแนนถูกกำหนดอย่างไร หรือการเปลี่ยนแปลงพื้นหลังนั้นตัดสินโดยบุคคล ซอฟต์แวร์ หรือผู้ให้บริการโมเดล รายละเอียดเหล่านี้จะเป็นตัวกำหนดว่าผู้ใช้ควรมีความมั่นใจมากน้อยเพียงใดในการเปรียบเทียบ
ผู้อ่านควรระวังการคาดเดาที่ทำให้เกิดความเข้าใจผิดจากตัวอย่างที่สะดุดตา ผลลัพธ์ที่ได้รับรายงานว่าโมเดลทั้งสองปฏิบัติตามคำสั่งแก้วไวน์นั้นเป็นรูปธรรม แต่ก็ไม่ใช่ข้อพิสูจน์ว่าโมเดลทั้งสองจะนำไปสู่งานด้านอิมเมจทั้งหมด ประสิทธิภาพอาจแตกต่างกันไปตามภาษา การพิมพ์ การนับ องค์ประกอบ ความซับซ้อนในการแก้ไข ตัวกรองความปลอดภัย ความละเอียด และต้นทุน ผู้ใช้อิสระควรทำซ้ำพร้อมท์และเปรียบเทียบผลลัพธ์หลายรายการก่อนตัดสินใจจัดซื้อหรือผลิต
สุดท้ายนี้ รายงานแยกต่างหากของ BigGo Finance เกี่ยวกับฟีเจอร์สติกเกอร์แบบกำหนดเองของ ChatGPT ควรแยกจากเกณฑ์มาตรฐาน ความสามารถของสติกเกอร์อาจขยายกลุ่มผู้ชมสำหรับการสร้างภาพ แต่แหล่งที่มาไม่ได้ให้การทดสอบคุณภาพผลงาน ความพร้อมใช้งานที่นอกเหนือไปจากการเปิดตัวบนมือถือที่อธิบายไว้ หรือพฤติกรรมการแบ่งปันกับผู้ใช้ทั้งหมด การเชื่อมโยงใดๆ ระหว่างการพัฒนาทั้งสองยังคงเป็นเรื่องสำหรับการสังเกตในอนาคต ไม่ใช่ผลลัพธ์ของตลาดที่กำหนดไว้