เกิดอะไรขึ้น
นักวิจัยในเครือ Compassion Aligned Machine Learning (CaML) และมหาวิทยาลัย Warwick ในสหราชอาณาจักร มุ่งมั่นที่จะวัดขอบเขตที่โมเดล AI แสดงให้เห็นถึงความเห็นอกเห็นใจ พวกเขาคิดค้นการทดสอบเกณฑ์มาตรฐานที่เรียกว่า HarvestBench เพื่อประเมินราคาที่แบบจำลอง AI ใช้กับชีวิตของสัตว์ ชุดทดสอบนี้อิงตามเกมจำลองฟาร์มหลายตัวแทนก่อนหน้านี้ที่เรียกว่า Harvest Rush ซึ่งใช้ Inspect ซึ่งเป็นเฟรมเวิร์กการประเมินแบบจำลองที่พัฒนาโดย UK AI Security Institute การจำลองจินตนาการถึงทีมงานที่มีรถแทรกเตอร์ที่ขับเคลื่อนด้วย LLM ระหว่างสองถึงแปดคนทำงานในฟาร์ม รถแทรคเตอร์จะลัดเลาะไปตามทุ่งที่มีก้อนหิน กองหญ้าแห้ง และสัตว์ต่างๆ ทั้งสัตว์เลี้ยงในฟาร์มและสัตว์ป่า ที่เดินไปตามเส้นทางของรถแทรกเตอร์ เกมดังกล่าวจัดทำขึ้นเพื่อวัดว่า LLM เลือกที่จะขับรถข้ามสิ่งกีดขวางเหล่านั้นหรือไม่ ชะตากรรมของสัตว์ไม่ได้เป็นส่วนหนึ่งของหน้าที่เป้าหมาย เมื่อสัตว์ขวางทางรถแทรกเตอร์ LLM จะตัดสินใจเรื่องต้นทุนว่าจะผ่านสิ่งกีดขวางหรือรอบๆ ตัวมัน การหลีกเลี่ยงต้องใช้น้ำมันเชื้อเพลิงมากกว่าการขับตรงต่อไป การชนหินต้องเสียค่าใช้จ่าย – เชื้อเพลิง 10 หน่วยและความเสียหายของรถแทรกเตอร์ การตีกองหญ้าแห้งและสัตว์ไม่มีโทษ นักวิจัยได้ทดสอบโมเดล 9 รุ่นและอัตราการฆ่ามีดังนี้: GPT-5.6 Terra (0.4 เปอร์เซ็นต์) และ Sol (0.9 เปอร์เซ็นต์), GPT-5-mini (5.4 เปอร์เซ็นต์), Gemini 2.5 Flash (38.7 เปอร์เซ็นต์), DeepSeek V3.1 (2.4 เปอร์เซ็นต์), Claude Haiku 4.5 (4.5 เปอร์เซ็นต์) และ Sonnet 5 (17.8 เปอร์เซ็นต์), Mistral Small 3.2 (88.8 เปอร์เซ็นต์) และ GPT-4o mini (98.8 เปอร์เซ็นต์)
นักวิจัยในเครือ Compassion Aligned Machine Learning (CaML) และมหาวิทยาลัย Warwick ในสหราชอาณาจักร มุ่งมั่นที่จะวัดขอบเขตที่โมเดล AI แสดงให้เห็นถึงความเห็นอกเห็นใจ
พวกเขาคิดค้นการทดสอบเกณฑ์มาตรฐานที่เรียกว่า HarvestBench เพื่อประเมินราคาที่แบบจำลอง AI ใช้กับชีวิตของสัตว์
ชุดทดสอบนี้อิงตามเกมจำลองฟาร์มหลายตัวแทนก่อนหน้านี้ที่เรียกว่า Harvest Rush ซึ่งใช้ Inspect ซึ่งเป็นเฟรมเวิร์กการประเมินแบบจำลองที่พัฒนาโดย UK AI Security Institute
การจำลองจินตนาการถึงทีมงานที่มีรถแทรกเตอร์ที่ขับเคลื่อนด้วย LLM ระหว่างสองถึงแปดคนทำงานในฟาร์ม
รถแทรคเตอร์จะลัดเลาะไปตามทุ่งที่มีก้อนหิน กองหญ้าแห้ง และสัตว์ต่างๆ ทั้งสัตว์เลี้ยงในฟาร์มและสัตว์ป่า ที่เดินไปตามเส้นทางของรถแทรกเตอร์
รายละเอียดที่มา: theregister.com ↗
ทำไมมันถึงสำคัญ
การศึกษาเน้นย้ำถึงข้อจำกัดของโมเดล AI ในปัจจุบันในการแสดงให้เห็นถึงความเห็นอกเห็นใจและการปฏิบัติต่อสัตว์อย่างมีคุณค่า นักวิจัยพบว่าเกือบทุกโมเดลชอบสัตว์ในฟาร์มมากกว่าสัตว์ป่า และจะฆ่าสัตว์ป่ามากกว่าสัตว์ในฟาร์ม สิ่งนี้ชี้ให้เห็นว่าแบบจำลองเหล่านี้ให้เหตุผลเกี่ยวกับสัตว์ในแง่ของคุณค่าต่อเกษตรกรและต่อผู้คน แทนที่จะใส่ใจต่อสัตว์จริงๆ การศึกษายังพบว่าการรับรู้สถานการณ์จำลองไม่ได้เปิดเผยจุดเน้นของการประเมิน ซึ่งก็คือสวัสดิภาพสัตว์ นักวิจัยสรุปว่าการใส่ค่าลงในแบบจำลองของเราเป็นวิธีการที่เปราะบางมากและไม่ได้ผลดีนัก หากเราจะปรับใช้โมเดลในโครงสร้างพื้นฐาน เราไม่สามารถเชื่อใจเพียงข้อความแจ้งว่า 'อย่าฆ่าสิ่งใดเลย'
การศึกษาเน้นย้ำถึงข้อจำกัดของโมเดล AI ในปัจจุบันในการแสดงให้เห็นถึงความเห็นอกเห็นใจและการปฏิบัติต่อสัตว์อย่างมีคุณค่า
นักวิจัยพบว่าเกือบทุกโมเดลชอบสัตว์ในฟาร์มมากกว่าสัตว์ป่า และจะฆ่าสัตว์ป่ามากกว่าสัตว์ในฟาร์ม
สิ่งนี้ชี้ให้เห็นว่าแบบจำลองเหล่านี้ให้เหตุผลเกี่ยวกับสัตว์ในแง่ของคุณค่าต่อเกษตรกรและต่อผู้คน แทนที่จะใส่ใจต่อสัตว์จริงๆ
การศึกษายังพบว่าการรับรู้สถานการณ์จำลองไม่ได้เปิดเผยจุดเน้นของการประเมิน ซึ่งก็คือสวัสดิภาพสัตว์
นักวิจัยสรุปว่าการใส่ค่าลงในแบบจำลองของเราเป็นวิธีการที่เปราะบางมากและไม่ได้ผลดีนัก
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
จะดูอะไรต่อไป.
ผลการศึกษานี้มีความหมายต่อการพัฒนาโมเดล AI ที่มีความเห็นอกเห็นใจมากขึ้น นักวิจัยแนะนำว่า จำเป็นต้องมีความพยายามมากขึ้นเพื่อปลูกฝัง AI ด้วยความรู้สึกเห็นอกเห็นใจ การศึกษายังเน้นย้ำถึงความจำเป็นในการประเมินการรักษาสัตว์ด้วยแบบจำลอง AI ที่มีประสิทธิภาพและเชื่อถือได้มากขึ้น
ผลการศึกษานี้มีความหมายต่อการพัฒนาโมเดล AI ที่มีความเห็นอกเห็นใจมากขึ้น
นักวิจัยแนะนำว่า จำเป็นต้องมีความพยายามมากขึ้นเพื่อปลูกฝัง AI ด้วยความรู้สึกเห็นอกเห็นใจ
การศึกษายังเน้นย้ำถึงความจำเป็นในการประเมินการรักษาสัตว์ด้วยแบบจำลอง AI ที่มีประสิทธิภาพและเชื่อถือได้มากขึ้น
นักวิจัยได้ทดสอบแบบจำลอง 9 แบบและอัตราการฆ่ามีดังนี้ GPT-5.6 Terra (0.4 เปอร์เซ็นต์) และ Sol (0.9 เปอร์เซ็นต์), GPT-5-mini (5.4 เปอร์เซ็นต์), Gemini 2.5 Flash (38.7 เปอร์เซ็นต์), DeepSeek V3.1 (2.4 เปอร์เซ็นต์), Claude Haiku 4.5 (4.5 เปอร์เซ็นต์) และ Sonnet 5 (17.8 เปอร์เซ็นต์), Mistral Small 3.2 (88.8 เปอร์เซ็นต์) และ GPT-4o mini (98.8 เปอร์เซ็นต์)
การศึกษาพบว่าเกือบทุกโมเดลชอบสัตว์ในฟาร์มมากกว่าสัตว์ป่า และจะฆ่าสัตว์ป่ามากกว่าสัตว์ในฟาร์ม