การรับรู้สถานะทางอารมณ์โดยอัตโนมัติที่อธิบายได้จากการแสดงออกทางสีหน้าของสุนัข: กรณีของความคาดหวังและความคับข้องใจในเชิงบวก

Aug 11, 2023

การใช้ Adam Optimizer ด้วยอัตราการเรียนรู้ {{0}}.0001 โมเดลที่ได้รับความแม่นยำสูงสุดในชุดข้อมูลการตรวจสอบความถูกต้องได้รับเลือกให้เป็นโมเดลที่ดีที่สุด ในช่วง 10 ยุคแรก น้ำหนักของเลเยอร์ทั้งหมดได้รับการปรับอย่างละเอียด ในช่วง 10 ยุคแรก น้ำหนักของเลเยอร์ทั้งหมดได้รับการปรับอย่างละเอียด ในช่วงยุคที่เหลือ ตุ้มน้ำหนัก ResNet50 จะถูกแช่แข็งและอัปเดตเฉพาะน้ำหนักของเลเยอร์บนสุดใหม่เท่านั้น สำหรับตัวแปรที่ไม่เกี่ยวข้องกับทิศทาง ('หูแบน', 'ส่วนริมฝีปาก', 'หูเสริม', 'หูไปข้างหน้า' และ 'เลียจมูก') เราใช้เทคนิคการเสริมโดยอาศัยการสุ่มภาพแนวนอนและการหมุนสูงสุด 20 องศา . สำหรับอินพุตสำหรับตัวเข้ารหัส เราใช้ตารางอินพุต โดยแต่ละแถวแสดงถึงการมีอยู่ (1)/ไม่มี (0) ของตัวแปร DogFACS ทั้ง 11 ตัวในแต่ละวิดีโอ เป้าหมายของโปรแกรมเปลี่ยนไฟล์คือตารางที่มีเงื่อนไข (ลบ(0)/บวก(1)) ของแต่ละวิดีโอ

ResNet50 เป็นสถาปัตยกรรมเครือข่ายประสาทเชิงลึกที่กลายเป็นหนึ่งในเครือข่ายคลาสสิกในด้านการมองเห็นคอมพิวเตอร์ เครือข่าย ResNet50 โดดเด่นด้วยหน่วยความจำที่แข็งแกร่งมากและความสามารถในการจดจำความรู้ที่เรียนรู้ก่อนหน้านี้ระหว่างการฝึกอบรม ซึ่งทำให้ทำงานได้ดีในงานจดจำภาพที่ซับซ้อน

ResNet50 บรรลุหน่วยความจำได้อย่างไร ใช้วิธีการเชื่อมต่อที่เหลือและเพิ่มการเชื่อมต่อทางลัดข้ามเลเยอร์ในแต่ละเลเยอร์แบบหมุนวน ซึ่งสามารถทำให้ข้อมูลไหลเวียนได้ดีขึ้นในเครือข่าย ในระหว่างกระบวนการฝึกอบรม เนื่องจากมีการเชื่อมต่อทางลัดเหล่านี้ เครือข่ายจึงสามารถเรียนรู้การแมปที่เหลือได้ง่ายขึ้น และไม่จำเป็นต้องใช้เวลามากเกินไปในการค้นหาการแมปที่เหลือเหล่านี้

ประสิทธิภาพของหน่วยความจำประเภทนี้ทำให้ ResNet50 ทำงานได้ดีในงานการรับรู้ภาพขนาดใหญ่ สำหรับปัญหาต่างๆ เช่น การจำแนกภาพ การตรวจจับเป้าหมาย และการจดจำใบหน้า ResNet50 ได้รับผลลัพธ์ที่ดีมาก ประสิทธิภาพของหน่วยความจำนี้คล้ายกับสมองของเราซึ่งเชื่อมโยงเซลล์ประสาทเพื่อเพิ่มความจำด้วย ดังนั้นเราจึงสามารถพูดได้ว่า ResNet50 เป็นโมเดลโครงข่ายประสาทเทียมระดับลึกที่ดีมาก ซึ่งมีหน่วยความจำที่แข็งแกร่งและสามารถจัดการงานการจดจำรูปภาพที่ซับซ้อนได้ดี ขณะเดียวกัน มันยังช่วยสร้างแรงบันดาลใจให้กับเราอีกด้วย เราสามารถเรียนรู้จากแนวคิดของ ResNet50 เพื่อออกแบบโมเดลโครงข่ายประสาทเทียมเชิงลึกที่มีประสิทธิภาพมากขึ้น เพื่อตอบสนองความต้องการของมนุษย์ได้ดียิ่งขึ้น จะเห็นได้ว่าเราต้องปรับปรุงความจำของเรา Cistanche สามารถปรับปรุงความจำได้เนื่องจาก Cistanche เป็นสมุนไพรจีนโบราณที่มีลักษณะพิเศษมากมาย หนึ่งในนั้นคือการปรับปรุงความจำ ประสิทธิภาพของเนื้อสับมาจากส่วนผสมออกฤทธิ์หลายชนิดในเนื้อสับ เช่น กรดคาร์บอกซิลิก โพลีแซ็กคาไรด์ ฟลาโวนอยด์ ฯลฯ ส่วนผสมเหล่านี้สามารถส่งเสริมสุขภาพสมองได้ผ่านช่องทางต่างๆ

increase memory

คลิกวิธีปรับปรุงการทำงานของสมอง

ในการวิจัยในสัตว์ จนถึงขณะนี้ ระบบอัตโนมัติของการรับรู้สภาวะทางอารมณ์ได้กล่าวถึงความเจ็บปวดในสัตว์บางชนิดเป็นหลัก สภาวะทางอารมณ์ยังคงเป็นพื้นที่ที่ไม่คุ้นเคย โดยเฉพาะในสุนัข เนื่องจากความซับซ้อนของสัณฐานวิทยาและการแสดงออกทางสีหน้า การศึกษาครั้งนี้มีส่วนช่วยเติมเต็มช่องว่างในสองด้าน ประการแรก เป็นคนแรกที่กล่าวถึงสภาวะทางอารมณ์ของสุนัขโดยใช้ชุดข้อมูลที่ได้รับในสภาพแวดล้อมการทดลองที่มีการควบคุม รวมถึงวิดีโอจาก (n=29) ลาบราดอร์ รีทรีฟเวอร์ที่สันนิษฐานว่าอยู่ในสภาวะทางอารมณ์ที่เกิดจากการทดลองสองสภาวะ: เชิงลบ (ความหงุดหงิด) และเชิงบวก (ความคาดหมาย). การแสดงออกทางสีหน้าของสุนัขถูกวัดโดยใช้ Dogs Facial Action Coding System (DogFACS)

มีการเปรียบเทียบสองแนวทางที่แตกต่างกัน จุดมุ่งหมายของ abator: (1) วิธีการที่ใช้ DogFACS พร้อมกับไปป์ไลน์สองขั้นตอนประกอบด้วย (i) เครื่องตรวจจับตัวแปร DogFACS และ (ii) ลักษณนามต้นไม้ตัดสินใจสถานะบวก/ลบ; (2) วิธีการที่ใช้เทคนิคการเรียนรู้เชิงลึกโดยไม่มีการเป็นตัวแทนระดับกลาง วิธีการดังกล่าวมีความแม่นยำมากกว่า 71% และ 89% ตามลำดับ โดยวิธีการเรียนรู้เชิงลึกมีประสิทธิภาพดีกว่า ประการที่สอง การศึกษานี้ยังเป็นครั้งแรกที่ศึกษาความสามารถในการอธิบายแบบจำลอง AI ในบริบทของอารมณ์ในสัตว์ต่างๆ วิธีการที่ใช้ DogFACS จัดให้มีแผนผังการตัดสินใจ ซึ่งเป็นการแสดงทางคณิตศาสตร์ที่สะท้อนการค้นพบก่อนหน้านี้โดยผู้เชี่ยวชาญที่เป็นมนุษย์เกี่ยวกับการแสดงออกทางสีหน้าบางอย่าง (ตัวแปร DogFACS) ซึ่งมีความสัมพันธ์กับสภาวะทางอารมณ์ที่เฉพาะเจาะจง แนวทางการเรียนรู้เชิงลึกนำเสนอรูปแบบการอธิบายที่แตกต่างและมองเห็นได้ในรูปแบบของแผนที่ความร้อนซึ่งสะท้อนถึงบริเวณที่จุดสนใจของเครือข่าย ซึ่งในบางกรณีจะแสดงจุดสนใจที่เกี่ยวข้องกับธรรมชาติของตัวแปร DogFACS โดยเฉพาะ แผนที่ความร้อนเหล่านี้อาจเป็นกุญแจสำคัญในการทำความเข้าใจเชิงลึกใหม่เกี่ยวกับความไวของเครือข่ายต่อรูปแบบพิกเซลที่เหมาะสมยิ่งซึ่งสะท้อนข้อมูลที่มองไม่เห็นด้วยตามนุษย์

ชาร์ลส์ ดาร์วิน บรรยายอย่างมีชื่อเสียงถึงการใช้การแสดงออกทางสีหน้าเพื่อแสดงสภาวะทางอารมณ์ในมนุษย์และสายพันธุ์ต่างๆ ที่ไม่ใช่มนุษย์ (ต่อไปนี้จะเรียกว่าสัตว์) ในงานเขียนของเขาเรื่อง 'The Expression of the Emotions in Man and Animals'1 ปัจจุบันเป็นที่ยอมรับกันอย่างกว้างขวางว่าการแสดงออกทางสีหน้าเป็นแหล่งข้อมูลสำคัญในการจดจำสภาวะทางอารมณ์ ในมนุษย์ การแสดงออกทางสีหน้าทำหน้าที่เป็นวิธีการหลักในการควบคุมปฏิสัมพันธ์2 และความสัมพันธ์ระหว่างการแสดงออกทางสีหน้าและสภาวะทางอารมณ์ได้รับการยอมรับมานานแล้วจากการศึกษาอย่างเป็นระบบในด้านจิตวิทยา3,4 ในสัตว์ต่างๆ การแสดงออกทางสีหน้าเกิดขึ้นจากสัตว์เลี้ยงลูกด้วยนมส่วนใหญ่5 และเช่นเดียวกับในมนุษย์ การแสดงออกทางสีหน้าถูกสันนิษฐานว่าถ่ายทอดข้อมูลเกี่ยวกับสภาวะทางอารมณ์6,7 ดังนั้น การแสดงออกทางสีหน้าจึงได้รับการศึกษามากขึ้นเรื่อยๆ เพื่อเป็นตัวบ่งชี้ถึงสภาวะเชิงอัตวิสัยในการวิจัยอารมณ์และสวัสดิภาพของสัตว์

มาตรฐานทองคำสำหรับการประเมินการเปลี่ยนแปลงในการแสดงออกทางสีหน้าอย่างเป็นกลางในการวิจัยอารมณ์ของมนุษย์คือ Facial Action Coding System—FACS8,9 เมื่อเร็วๆ นี้ FACS ได้รับการดัดแปลงสำหรับสายพันธุ์ที่ไม่ใช่มนุษย์หลายสายพันธุ์ รวมถึงไพรเมตที่ไม่ใช่มนุษย์หลายชนิด (เช่น อุรังอุตัง10 ลิงชิมแปนซี11 ลิงแสม12,13) ​​มาร์โมเซต14 สุนัข15 และแมว16 ระบบเหล่านี้เรียกว่า AnimalFACS เช่นเดียวกับในมนุษย์ มีการใช้มากขึ้นเพื่อศึกษาสภาวะทางอารมณ์ของสัตว์ (เช่น 17–19)

ความท้าทายที่สำคัญในการระบุการแสดงออกทางสีหน้าที่เป็นมาตรฐานในสุนัขเกี่ยวข้องกับความหลากหลายทางสัณฐานวิทยาของศีรษะ20,21 และโครงสร้างผิวหนังที่อยู่ด้านบน เช่น มีรอยยับถาวรในบางสายพันธุ์ เพื่อระบุการแสดงอารมณ์ทางใบหน้าในสุนัข Caeiro และคณะ ใช้ DogFACS เพื่อประเมินการตอบสนองที่เกิดขึ้นเองของบุคคลจากสายพันธุ์ต่างๆ และผสมผสานในสภาพแวดล้อมทางอารมณ์ที่เป็นธรรมชาติโดยใช้วิดีโอออนไลน์ มีการตรวจสอบอารมณ์ของความจุทั้งเชิงบวกและเชิงลบ รวมถึงการคาดหวังรางวัล (อารมณ์ที่มีความจุเชิงบวก) และความหงุดหงิด (อารมณ์ที่มีความจุเชิงลบ) ทั้งสองมีลักษณะโดดเด่นด้วยความคาดหวังของสิ่งเร้าที่ต้องการ ความคาดหวังเชิงบวกถูกกำหนดให้เกิดขึ้นในสถานการณ์ที่เกี่ยวข้องกับ "[v] การสร้างภาพอาหารหรือการได้ยินอาหาร/คำที่เกี่ยวข้องกับอาหาร [v] การสร้างภาพสายจูง คำที่เกี่ยวข้องกับการเดินการได้ยิน" และความหงุดหงิดถูกกำหนดให้เป็น ถูกชักจูงโดย "[v] การสร้างทรัพยากรที่ต้องการ (ของเล่น อาหาร อวกาศ) ที่เป็นหรือเข้าถึงไม่ได้"18 แม้ว่า Caeiro และคณะ พบว่าสุนัขแสดงสีหน้าที่แตกต่างกันอย่างมีนัยสำคัญในการแยกแยะสภาวะทางอารมณ์บางอย่าง แต่ก็ไม่มีคุณลักษณะที่โดดเด่นใดๆ ที่ระบุได้ในบริบทของความคับข้องใจ ดังนั้น Bremhorst และคณะ จึงตรวจสอบการแสดงออกทางสีหน้าของสุนัขเกี่ยวกับความคาดหวังและความคับข้องใจในเชิงบวกในสภาพแวดล้อมการทดลองที่มีการควบคุม ซึ่งแตกต่างจากของ Caeiro และคณะ 18 ซึ่งสร้างมาตรฐานให้กับสุนัขสายพันธุ์ (ลาบราดอร์ รีทรีฟเวอร์) นอกจากนี้ ผู้เขียนยังใช้บริบทที่ไม่เกี่ยวข้องกับสังคมเพื่อขจัดความเสี่ยงที่จะถูกรบกวนจากการตอบสนองที่ได้รับความสนใจจากการเรียนรู้ก่อนหน้านี้ ในการทดลองกระตุ้นสภาวะทางอารมณ์ทั้งสองที่ศึกษา รางวัลอาหารที่มีมูลค่าสูงถูกใช้เป็นตัวกระตุ้นในสองเงื่อนไข: สภาวะเชิงบวกถูกคาดการณ์ว่าจะกระตุ้นให้เกิดความคาดหวังเชิงบวก (ผ่านการคาดหวังอาหารแบบมีเงื่อนไข) และสภาวะเชิงลบควรกระตุ้นให้เกิดความคับข้องใจ (เช่น ผ่าน การป้องกันการเข้าถึงรางวัลอาหารที่คาดหวัง) การแสดงออกทางสีหน้าของสุนัขในสองรัฐนี้วัดโดยใช้ DogFACS ผู้เขียนพบว่าตัวแปร "Ears Adductor" พบได้บ่อยกว่าในสภาวะเชิงบวก ในขณะที่ตัวแปร "Blink", "Lips Part", "Jaw Drop", "Nose Lick" และ "Ears Flattener" พบได้บ่อยกว่าในสภาวะเชิงลบ เงื่อนไข22. ในการศึกษาติดตามผล Bremhorst และคณะ ทดสอบสุนัขกลุ่มใหม่โดยใช้รูปแบบที่คล้ายกัน อย่างไรก็ตาม ในการศึกษานี้ มีการใช้รางวัลสองประเภทที่แตกต่างกัน (อาหารและของเล่น) เพื่อทดสอบความสามารถในการสรุปผลทั่วไปของการค้นพบครั้งก่อนในบริบทที่กว้างขึ้น19

ผลลัพธ์ก่อนหน้านี้ได้รับการทำซ้ำ19 โดยมีตัวแปรอีก 4 ตัวที่พบบ่อยในสภาวะเชิงลบ ได้แก่ "หูลง" "ตัวดึงมุมปาก" "การแสดงลิ้น" และ "การยกริมฝีปากบน" การแสดงออกทางสีหน้าที่ระบุทั้งหมด ยกเว้น "การยกริมฝีปากบน" ไม่ขึ้นอยู่กับประเภทรางวัลที่สุนัขคาดหวังจะได้รับ19 นอกจากนี้ มาตรการพื้นฐานของความแม่นยำในการวินิจฉัยได้รับการประเมินสำหรับการแสดงออกทางสีหน้าที่ระบุว่าเป็นตัวบ่งชี้อารมณ์ที่อาจเกิดขึ้น รวมถึงความไว ความจำเพาะ และค่าทำนายเชิงบวกและเชิงลบ19 ผลการวิจัยพบว่า การแสดงออกทางสีหน้าเหล่านี้ไม่สามารถจำแนกอารมณ์ที่เกี่ยวข้องได้อย่างถูกต้องสม่ำเสมอ หากใช้เพียงอย่างเดียวเป็นตัวบ่งชี้อารมณ์ของแต่ละบุคคล19 สิ่งนี้ไม่ได้ลดคุณค่าที่เป็นไปได้ของพวกมันเป็นสัญญาณ แต่อาจเน้นไปที่การประมวลผลแบบองค์รวมตามปกติของการจัดโครงหน้า23 แทนที่จะมุ่งเน้นไปที่องค์ประกอบเดียวภายในนั้น

การปรากฏตัวของผู้ฟังในบริบททางอารมณ์เป็นองค์ประกอบสำคัญที่ต้องพิจารณาเมื่อตรวจสอบการแสดงออกทางสีหน้า (อารมณ์) ในสุนัข ดังที่แสดงไว้ในการศึกษาล่าสุดโดย Pedretti และคณะ 24 ในทำนองเดียวกันกับ 19,22 ผู้เขียนยังได้เปิดเผยให้สุนัขได้รับความคาดหวังเชิงบวก และความคับข้องใจที่ไม่เข้าสังคมและไม่เข้าสังคม ซึ่งกระตุ้นให้เกิดช่วงการทดสอบ พวกเขายังใช้ DogFACS เพื่อวิเคราะห์การแสดงออกทางสีหน้าของสุนัขในสถานการณ์เหล่านี้ นอกเหนือจากพฤติกรรมอื่นๆ เช่น การกระดิกหาง และการวัดความเข้มข้นของคอร์ติซอลในน้ำลายก่อนและหลังการทดสอบ พวกเขาพบว่า "หูไปข้างหน้า" เกิดขึ้นในสภาวะที่เป็นบวกมากกว่าเมื่อเปรียบเทียบกับสภาวะที่เป็นลบ นอกจากนี้ ตัวแปรนี้ได้รับอิทธิพลเชิงบวกจากการปรากฏตัวของผู้ฟัง และมีความสัมพันธ์เชิงลบกับความเข้มข้นของคอร์ติซอลก่อนการทดสอบ ซึ่งบ่งบอกว่าอาจเป็นตัวบ่งชี้ระดับความสนใจของสุนัขได้ดี "Ears Flattener", "Blink", "Nose Lick", "Tail Wagging" และ "Whining" (สองรายการหลังไม่รวมอยู่ในตัวแปร DogFACS) ก็เกี่ยวข้องกับการมีอยู่ของผู้ฟัง แต่ไม่มีความสัมพันธ์กับความเข้มข้นของคอร์ติซอล ซึ่งบ่งชี้ว่า องค์ประกอบด้านการสื่อสารของพฤติกรรมเหล่านี้

improve your memory

สิ่งนี้แสดงให้เห็นว่า DogFACS ยังทำหน้าที่ในการตรวจสอบการแสดงออกทางสีหน้าของสุนัขไม่เพียงแต่เป็นสัญญาณ (เช่น ทำให้เกิดการเปลี่ยนแปลงพฤติกรรมที่มาพร้อมกับสภาวะทางอารมณ์) แต่ยังเป็นสัญญาณด้วย (เช่น พฤติกรรมที่สร้างขึ้นโดยเฉพาะเพื่อสื่อสารอารมณ์ไปยังคู่สื่อสาร) ดูที่ 25 ด้วย ระบบ AnimalFACS จึงเป็นช่องทางสำคัญในการส่งเสริมความเข้าใจเกี่ยวกับการแสดงสีหน้าของสัตว์ อย่างไรก็ตาม การใช้ระบบเหล่านี้สำหรับการวิเคราะห์การแสดงออกทางสีหน้ามีความท้าทาย รวมถึงการพึ่งพาคำอธิบายประกอบด้วยตนเองซึ่งต้องมีการฝึกอบรมและการรับรองจากมนุษย์อย่างกว้างขวาง ซึ่งอาจใช้เวลานานในการดำเนินการ และอาจมีแนวโน้มที่จะเกิดข้อผิดพลาดหรืออคติจากมนุษย์26

ระบบอัตโนมัติมีศักยภาพในการเสริมความก้าวหน้าที่สำคัญให้กับกระบวนการนี้ โดยเฉพาะอย่างยิ่ง มีการโต้แย้งว่าเครื่องมืออัตโนมัติมีความเป็นกลางและความน่าเชื่อถือมากกว่าการเข้ารหัสด้วยตนเอง ซึ่งขจัดความเป็นตัวของตัวเองและความลำเอียง27,28 แต่เครื่องมือเหล่านั้นก็ไม่ได้ขึ้นอยู่กับการตรวจจับคุณลักษณะเดียวเพื่อความสำเร็จ ดังนั้นจึงไม่น่าแปลกใจที่การเข้ารหัสการแสดงออกทางสีหน้าอัตโนมัติเป็นสาขาที่มีชีวิตชีวาในการวิจัยอารมณ์ความรู้สึกของมนุษย์ โดยมีเครื่องมือซอฟต์แวร์เชิงพาณิชย์มากมาย เช่น FaceReader โดย Noldus29, Afdex30, EmoVu31 รวมถึงฐานข้อมูลที่กว้างขวาง เช่น CAS(ME)332

ในทางกลับกัน ในสัตว์ การวิเคราะห์การแสดงออกทางสีหน้าแบบอัตโนมัติยังอยู่ระหว่างการวิจัย นี่เป็นเพราะความท้าทายหลายประการ (ดังที่อภิปรายโดย 33,34) ซึ่งรวมถึงความใหม่ของการเจริญเติบโตหรือความสนใจในการวิจัยอารมณ์ของสัตว์ ซึ่งหมายความว่ามีข้อมูลน้อยกว่ามากเมื่อเทียบกับข้อมูลจำนวนมหาศาลในโดเมนของมนุษย์ ประการที่สอง โดยเฉพาะอย่างยิ่งในสายพันธุ์ที่เลี้ยงในบ้าน ความแปรผันอย่างมากของสัณฐานวิทยาของใบหน้าทำให้เกิดความท้าทายทางเทคนิค35 ประการสุดท้าย การขาดการรายงานตนเองด้วยวาจาทำให้การสร้างความจริงพื้นฐานเกี่ยวกับสภาวะทางอารมณ์ที่พบในสัตว์เป็นเรื่องท้าทาย ในขณะที่ในมนุษย์ การรายงานตนเองเป็นแนวทางมาตรฐานสำหรับจุดประสงค์นี้ ระเบียบวิธีในการรวบรวมข้อมูลสำหรับสัตว์จึงต้องมีการควบคุมและกฎระเบียบที่ครอบคลุม คำจำกัดความในการปฏิบัติงานของสภาวะทางอารมณ์ที่ศึกษา (ดูตัวอย่างที่ 18) หรืออาจเป็นไปได้ว่าการจัดระดับโดยผู้เชี่ยวชาญที่เป็นมนุษย์ แม้ว่าสิ่งนี้อาจทำให้เกิดอคติและการตัดสินตามอัตวิสัยก็ตาม

Broomé และคณะ ได้ทำการสำรวจการศึกษา 20 เรื่องอย่างครอบคลุม ซึ่งนำเสนอแนวทางที่ล้ำสมัยในการจดจำอารมณ์และความเจ็บปวดในสัตว์โดยอัตโนมัติ งานเหล่านี้ส่วนใหญ่เน้นไปที่การเกิดความเจ็บปวด ชนิดที่ได้รับการกล่าวถึงในบริบทนี้ ได้แก่ สัตว์ฟันแทะ37–39 แกะ40 ม้า33,41,42 และแมว43 งานทั้งหมดนี้จัดให้มีตัวแยกประเภทไบนารีสำหรับความเจ็บปวด/ไม่มีความเจ็บปวด โดยใช้เทคนิคการเรียนรู้ของเครื่อง

การทำงานเกี่ยวกับการจดจำอารมณ์ของสัตว์โดยอัตโนมัติอย่างกว้างขวางยิ่งขึ้นนั้นหายากกว่ามาก การศึกษาสองเรื่องเกี่ยวกับไพรเมตที่ไม่ใช่มนุษย์มุ่งเน้นไปที่หน่วยการกระทำ/การจดจำสีหน้าที่เกี่ยวข้อง โดยไม่ต้องกล่าวถึงสภาวะทางอารมณ์อย่างชัดเจน44,45 Blumrosen และคณะ 44 จดจำการแสดงออกทางสีหน้าของไพรเมตที่ไม่ใช่มนุษย์โดยอัตโนมัติ 4 แบบ ได้แก่ เป็นกลาง การตีริมฝีปาก การเคี้ยว และการเปิดปากแบบสุ่มโดยใช้ความพยายามในการอธิบายเพียงเล็กน้อย ในขณะที่ Morozov และคณะ 45 ได้ใช้ระบบต้นแบบสำหรับการเข้ารหัส MaqFACS อัตโนมัติสำหรับลิงแสม Rhesus ได้รับการฝึกอบรมเพื่อจำแนกตัวแปร MacFACS หกตัวแปร

มีการสำรวจเพียงสามงานเท่านั้นที่มีการจำแนกประเภทตั้งแต่ต้นจนจบสำหรับสภาวะทางอารมณ์ที่แตกต่างกันในBroomé และคณะ 36 Corujo และคณะ 46 ได้ให้คำจำกัดความของสภาวะทางอารมณ์ของม้าไว้ 4 สภาวะ ได้แก่ "ตื่นตระหนก" "รำคาญ" "อยากรู้อยากเห็น" และ "ผ่อนคลาย" โดยให้คำจำกัดความแต่ละสภาวะในแง่ของพฤติกรรมของตา หู จมูก และคอ ตัวอย่างเช่น "ผ่อนคลาย" หมายถึง ดวงตา: ปิดบางส่วนถึงส่วนใหญ่, หู: ผ่อนคลาย, เปิดชี้ไปด้านข้าง, จมูก: ปากและคอผ่อนคลาย: ขนานกันโดยประมาณ แบบจำลองเครือข่ายประสาทเทียม (CNN) ได้รับการฝึกฝนให้ทำนาย "คลาส" อารมณ์ทั้งสี่นี้ Ferres และคณะ ใช้การประมาณท่าทางอัตโนมัติโดยใช้ DeepLabCut48 เพื่อจำแนกประเภทอารมณ์สี่ประเภท ได้แก่ "ความโกรธ" "ความกลัว" "ความสุข" และ "การผ่อนคลาย" สำหรับสุนัข Franzoni และคณะ ยังใช้แบบจำลองของ CNN เพื่อจำแนกคุณลักษณะที่จำกัดที่เกี่ยวข้องกับสภาวะทางอารมณ์ ได้แก่ "รอยยิ้ม" (เกี่ยวข้องกับ "ความสุข") "คำราม" (เกี่ยวข้องกับ "ความโกรธ" ) และ "การนอนหลับ" (เกี่ยวข้องกับความเป็นกลาง สถานะ).

จากผลงานสามชิ้นที่เกี่ยวข้องกับสุนัข47,49,50 สองงานมุ่งเน้นไปที่ร่างกายเพื่อรับรู้สภาวะทางอารมณ์47 และความเจ็บปวด50 และงานหนึ่งเกี่ยวกับการแสดงออกทางสีหน้าของอารมณ์49 อย่างไรก็ตาม ชุดข้อมูลที่ใช้ในการศึกษาของ Ferres และคณะ 47 และ Franzoni และคณะ 49 มีภาพที่รวบรวมจากอินเทอร์เน็ตและมีคำอธิบายประกอบโดยผู้ที่ไม่ใช่ผู้เชี่ยวชาญ ดังนั้นจึงอาจมีความน่าเชื่อถือและความถูกต้องต่ำ งานของ Zhu50 ศึกษาการจดจำความเจ็บปวดโดยอิงจากภาษากาย ไม่ใช่การแสดงออกทางสีหน้า

การศึกษาที่นำเสนอในที่นี้เป็นครั้งแรกในการสำรวจการรับรู้อารมณ์ของสุนัขโดยอัตโนมัติจากการแสดงออกทางสีหน้า โดยใช้ชุดข้อมูลที่รวบรวมจากโปรโตคอลการทดลองที่ออกแบบมาอย่างพิถีพิถัน โดยที่บริบทจะปกป้องสถานะทางอารมณ์ ในระเบียบการนี้ สภาวะทางอารมณ์ของความคาดหวังเชิงบวก (อารมณ์เชิงบวก) และความหงุดหงิด (อารมณ์เชิงลบ) ถูกกำหนดไว้ในทางปฏิบัติ (ตามข้อ 18 และกระตุ้นการทดลองในตัวอย่างสุนัขลาบราดอร์ รีทรีฟเวอร์ 29 ตัว เพื่อลดความแปรปรวนของความแตกต่างทางสัณฐานวิทยาระหว่างสุนัขให้เหลือน้อยที่สุด การแสดงออกทางสีหน้าที่สุนัขสร้างขึ้นได้รับการเข้ารหัสอย่างเป็นกลางโดยใช้ระบบ DogFACS ที่ได้มาตรฐานโดยผู้เขียนโค้ด DogFACS ที่ได้รับการรับรอง ชุดข้อมูลนี้สร้างสภาพแวดล้อมการทดลองที่ไม่เหมือนใครสำหรับการสำรวจวิธีการต่าง ๆ ในการทำงานอัตโนมัติของการรับรู้อารมณ์โดยมีอคติน้อยที่สุดในคำจำกัดความของอารมณ์ ข้อมูลนี้ยังได้รับประโยชน์จาก ลดการเปลี่ยนแปลงทางสัณฐานวิทยาของใบหน้าของผู้เข้าร่วมเนื่องจากมาตรฐานของสายพันธุ์

ตามข้อมูลของ 36 มีสองเส้นทางมาตรฐานในการจำแนกสถานะทางอารมณ์หรือความเจ็บปวด: การใช้คุณลักษณะที่ประดิษฐ์ขึ้นด้วยมือ หรือใช้กระบวนทัศน์การเรียนรู้เชิงลึกตามคุณลักษณะที่เรียนรู้ 51 คุณลักษณะที่สร้างขึ้นด้วยมือสามารถแบ่งคร่าวๆ ได้เป็นคุณลักษณะระดับต่ำ ซึ่งขึ้นอยู่กับสถิติของภาพ (เช่น ฮิสโตแกรมของการไล่ระดับสีเชิง) ที่ใช้กันทั่วไปในวรรณกรรมคอมพิวเตอร์วิทัศน์ 51 และคุณลักษณะระดับสูงซึ่งมีพื้นฐานทางความหมายในสายพันธุ์ โครงสร้างทางกายวิภาคของใบหน้าและ/หรือร่างกายเฉพาะ ระดับการทำหน้าบูดบึ้ง หน่วยการกระทำ ฯลฯ ตัวอย่างของอย่างหลัง ได้แก่ จุดสังเกตที่ใบหน้าของแมว52 จุดสำคัญของร่างกายสุนัข47 หรือหน่วยแสดงอาการเจ็บปวดของแกะ40 คุณสมบัติเหล่านี้ส่งเสริมความสามารถในการอธิบายของอัลกอริธึมการเรียนรู้ของเครื่องโดยอาศัยการตัดสินใจของโมเดลในแนวคิดเชิงพฤติกรรม ในทางกลับกัน แนวทางการเรียนรู้เชิงลึกนั้นมีความยืดหยุ่นมากกว่าและคาดว่าจะทำงานได้ดีกว่า (โดยเฉพาะอย่างยิ่งเมื่อมีชุดข้อมูลขนาดใหญ่) แต่ยังต้องใช้ทรัพยากรการคำนวณที่มีราคาแพงและเป็น 'กล่องดำ' ในแง่ที่ว่ามันไม่ได้ให้ยืมตัวเองเพื่ออธิบาย ในแง่ที่มนุษย์เข้าใจได้ว่าทำไมจึงมีการตัดสินใจจำแนกประเภทโดยเฉพาะ

ในการศึกษานี้ เราตรวจสอบทั้งสองเส้นทางทางเลือกเหล่านี้ในการจำแนกสภาวะทางอารมณ์ในสุนัขโดยอัตโนมัติ เส้นทางแรกใช้ตัวแปร DogFACS เป็นคุณลักษณะระดับสูงที่อธิบายได้ ไปป์ไลน์การจำแนกประเภทมีสองขั้นตอนในกรณีนี้: ขั้นแรก การรับรู้รหัส DogFACS โดยอัตโนมัติ และขั้นที่สอง ใช้คำอธิบายประกอบเพื่อจำแนกอารมณ์ที่ศึกษา เราสาธิตประโยชน์ของการนำเสนอที่สามารถอธิบายได้ดังกล่าวเพื่อทำความเข้าใจว่าตัวแปร DogFACS ถูกนำมาใช้ในการตัดสินใจของเครื่องอย่างไร เส้นทางที่สองใช้วิธีการเรียนรู้เชิงลึก (ที่เรียบง่ายกว่าในขั้นตอนเดียว) โดยปล่อยให้เครื่องเรียนรู้โดยตรงจากฟีเจอร์ข้อมูลที่ไม่จำเป็นต้องเป็นที่มนุษย์เข้าใจได้ เรายังเปรียบเทียบแง่มุมต่างๆ ของการอธิบายได้ระหว่างทั้งสองวิธี และใช้เทคนิคการแสดงภาพแผนที่ความร้อนเพื่อเน้นความสัมพันธ์ของคุณลักษณะที่เรียนรู้กับวัตถุความหมายที่เกี่ยวข้องกับส่วนใบหน้าของสุนัข

ผลลัพธ์

ชุดข้อมูล

เราใช้ชุดข้อมูลและคำอธิบายประกอบ DogFACS ที่สร้างขึ้นโดยเป็นส่วนหนึ่งของการศึกษาก่อนหน้าโดย Bremhorst และคณะ เพื่อลดผลกระทบจากการเปลี่ยนแปลงทางสัณฐานวิทยา จึงได้ทำการทดสอบสัตว์ 29 ตัวจากหนึ่งสายพันธุ์ที่ไม่มีใบหน้าสุดโต่ง (ลาบราดอร์ รีทรีฟเวอร์) (ตัวเมีย 19 ตัว–ทำหมันแล้ว 13 ตัว ตัวผู้ 10 ตัว–ทำหมันแล้ว 9 ตัว ช่วงอายุ: 2–9.5 ปี อายุเฉลี่ย {{9} }.22 ปี) รูปที่ 1 แสดงให้เห็นถึงการกระจายอายุและเพศของอาสาสมัคร

ชุดข้อมูลประกอบด้วยตัวอย่างวิดีโอทั้งหมด 248 ตัวอย่างความยาว 3 วินาทีที่บันทึกที่อัตราเฟรม 25.25 เฟรม/วินาที โดยแต่ละเฟรมมีความละเอียดอยู่ที่ 1920 × 1080 พิกเซล กล้องที่ใช้ในการบันทึกคือ HIKVision, IR Mini Bullet Network Camera; เครื่องบันทึก: HIKVision, DS-7600 Series ผู้รับการทดลองตั้งอยู่ด้านหลังหน้าต่างโปร่งใสโดยใช้เกณฑ์วิธีซึ่งมีอธิบายไว้ใน Bremhorst และคณะ 22 แต่ละวิชาได้รับการทดสอบ 3 ครั้งในแง่บวก และ 6 ครั้งในสภาวะลบ โดยรวมแล้วสองในสามของวิดีโอได้รับการใส่คำอธิบายประกอบว่าเป็นเชิงลบ และหนึ่งในสามเป็นเชิงบวก ตลอดการศึกษาวิจัยนี้สันนิษฐานว่าสภาวะเชิงลบทำให้เกิดความคับข้องใจ และสภาวะเชิงบวกทำให้เกิดความคาดหวังเชิงบวก ดังนั้นต่อจากนี้ไปเราจะใช้ความจุเชิงบวก/เชิงลบเพื่ออ้างถึงสภาวะทางอารมณ์ทั้งสอง รูปที่ 2 แสดงการครอบตัดใบหน้าสุนัขที่ดึงมาจากชุดข้อมูล

boost memory

ชุดข้อมูลได้รับความสมดุลโดยใช้การสุ่มตัวอย่างด้านล่าง เหลือวิดีโอ 82 รายการที่มีเงื่อนไขเชิงบวก และวิดีโอ 82 รายการที่มีเงื่อนไขเชิงลบจากบุคคล (n = 29) รวม 164 วิดีโอ มีการปรับสมดุลโดยรักษาจำนวนตัวอย่างเชิงบวกและเชิงลบต่อบุคคลให้เท่ากัน

ตัวอย่างวิดีโอทั้งหมดได้รับการเข้ารหัสโดยใช้ตัวแปร DogFACS 39 ตัวตามคู่มือ DogFACS53 โดยผู้เขียนโค้ด DogFACS ที่ได้รับการรับรอง โดยการใส่คำอธิบายประกอบหนึ่งเฟรมต่อ 200 มิลลิวินาทีโดยใช้ Solomon Coder (เวอร์ชัน 15.03.15, Andràs Péter) จากตัวแปร 39 ตัวเหล่านี้ ตัวแปร 11 ตัวที่นำเสนอในตารางที่ 1 ถูกนำมาใช้ในการศึกษา Bremhorst22 โดยขึ้นอยู่กับความชุกอย่างน้อย 10% ในทุกตัวอย่างที่มีสภาวะเชิงบวกหรือเชิงลบ และอย่างน้อยมีจุดแข็งที่สำคัญของข้อตกลงระหว่างตัวเข้ารหัส (ดู 22 สำหรับรายละเอียดเพิ่มเติม)

10 ways to improve memory

ภาพรวมของทั้งสองแนวทาง

เรานำเสนอการเปรียบเทียบสองวิธีที่แตกต่างกันสำหรับการจำแนกประเภทอัตโนมัติของเงื่อนไขเชิงบวกและเชิงลบ: แบบอิง DogFACS กับแบบบริสุทธิ์ (วิธี DogFACS ยังมีโมดูลการเรียนรู้เชิงลึกสำหรับการตรวจจับตัวแปร DogFACS) วิธีการเรียนรู้เชิงลึก รูปที่ 3 นำเสนอภาพรวมระดับสูงของทั้งสองแนวทาง

ความพร้อมใช้งานของข้อมูลวิดีโอช่วยให้เราทำงานกับอินพุตได้ 2 ประเภท ได้แก่ เฟรมเดี่ยว หรือลำดับของเฟรม แบบแรกหมายถึงการสูญเสียข้อมูลมากขึ้น แต่ง่ายกว่าและควบคุมได้มากกว่า ในขณะที่มิติหลังรวมถึงมิติทางโลกซึ่งแสดงให้เห็นว่ามีความสำคัญสำหรับงานดังกล่าว เช่น ในบริบทของการตรวจพบความเจ็บปวดในม้า42,54 อย่างไรก็ตาม แนวทางที่แพร่หลายในบริบทของการจดจำสภาวะอารมณ์และความเจ็บปวดในสัตว์โดยอัตโนมัติคือการใช้กรอบเดียว (เช่น 33,39,41,55) เนื่องจากลักษณะเชิงสำรวจของการศึกษาวิจัยนี้ เราจึงตัดสินใจเลือกตัวเลือกนี้

ทัสทั้งสองวิธีทำงานบนพื้นฐานเฟรมเดียว กล่าวคือ การจัดหมวดหมู่จะดำเนินการในเฟรมเดียวที่ดึงมาจากวิดีโอ อย่างไรก็ตาม การรวมข้อมูลเฟรมเดียวจะดำเนินการแตกต่างกันในทั้งสองกรณี หลังจากขั้นตอนก่อนการประมวลผลในการแยกใบหน้าสุนัขที่ถูกครอบตัดออกจากเฟรม (ดูรูปที่ 2 เป็นตัวอย่าง) ในแนวทางเชิงลึก ใบหน้าที่ครอบตัดแบบดิบจะถูกนำไปใช้เป็นอินพุตโดยโครงข่ายประสาทเทียม เราทดลองที่นี่กับสถาปัตยกรรมเครือข่ายประสาทเทียมสองประเภท: เครือข่ายประสาทเทียมแบบหมุน (Resnet5056) และเครือข่ายการมองเห็น Transformer57 (ViT) ที่เพิ่งเปิดตัวเมื่อเร็ว ๆ นี้ จากนั้นการตัดสินใจของเครือข่ายที่เลือกจะถูกรวบรวมโดยใช้การลงคะแนนเสียงข้างมาก และถึงการตัดสินใจจัดหมวดหมู่ต่อวิดีโอ

ในทางกลับกัน แนวทางที่ใช้ DogFACS จะใช้ไปป์ไลน์ที่มีสองขั้นตอนติดต่อกัน อย่างแรกคือตัวตรวจจับตัวแปร DogFACS อัตโนมัติ ซึ่งจะตรวจจับชุดของตัวแปร DogFACS ในแต่ละเฟรม จากนั้น ตัวแปร DogFACS จะถูกรวมเข้าด้วยกันสำหรับวิดีโอทั้งหมด ขั้นตอนที่สองคือแผนผังการตัดสินใจ ซึ่งอินพุตคือชุดของตัวแปร DogFACS ที่ตรวจพบในวิดีโอซึ่งนำไปใช้ในการตัดสินใจจัดหมวดหมู่ขั้นสุดท้าย

ดังนั้น วิธีการที่ใช้ DogFACS จะทำการตัดสินใจจำแนกประเภทตามชุดของตัวแปร DogFACS ที่ระบุในวิดีโอ ในทางกลับกัน แนวทางการเรียนรู้เชิงลึกจะตัดสินใจในแต่ละเฟรมแยกกัน โดยแยกคุณสมบัติที่เรียนรู้จากรูปภาพดิบ จากนั้นจึงรวมการตัดสินใจสำหรับเฟรมทั้งหมดสำหรับวิดีโอ ดังนั้น เมื่อสำรวจความสามารถในการอธิบายของทั้งสองแนวทาง ในตอนแรกเราคาดว่าจะมี 'คำอธิบาย' ตามแนวทางของ Bremhorst และคณะ 22 (การระบุตัวแปรที่แพร่หลายในแต่ละเงื่อนไข หรือการรวมกันบางอย่าง) อย่างไรก็ตาม แนวทางหลังนี้คาดว่าจะให้คำอธิบายที่เป็นภาพมากขึ้นว่ารูปภาพใดที่โมเดลเน้นอยู่ ดังที่อธิบายไว้ด้านล่าง

สำหรับการประเมินประสิทธิภาพของแบบจำลองของเรา เราใช้เกณฑ์ชี้วัดมาตรฐานด้านความแม่นยำ ความแม่นยำ และการจดจำ ซึ่งเป็นวิธีมาตรฐานในบริบทของการเรียนรู้ของเครื่อง เป็นวิธีการตรวจสอบ เราใช้การตรวจสอบข้ามแบบทิ้งวิชาเดียวโดยไม่มีวิชาซ้อนทับกัน ซึ่งหมายถึงการใช้สุนัขแต่ละตัวเป็นชุดทดสอบแยกกัน วิธีนี้แนะนำสำหรับชุดข้อมูลที่บุคคลหนึ่งมีตัวอย่างที่เกี่ยวข้องกันมากกว่าหนึ่งตัวอย่าง ดูBroomé และคณะ 36 สำหรับการอภิปรายถึงความสำคัญของการเลือกวิธีการตรวจสอบที่เหมาะสม

short term memory how to improve

วิธีการที่ใช้ DogFACS

ชุดของตัวแปร DogFACS เราทดลองกับตัวแปร DogFACS สองชุดที่แตกต่างกัน:

1. ชุด Te ของตัวแปร 11 ตัวที่นำเสนอในตารางที่ 1 ซึ่งใช้ในการศึกษา Bremhorst และคณะ 22 เป็นตัวแปรที่มีแนวโน้มมากที่สุดหรืออาจมีความสำคัญมากที่สุด (ขึ้นอยู่กับความชุกอย่างน้อย 10% ในทุกตัวอย่างของ เงื่อนไขเชิงบวกหรือเชิงลบ) และสามารถเข้ารหัสได้อย่างน่าเชื่อถือ (อย่างน้อยก็มีจุดแข็งของข้อตกลงระหว่างตัวแปลงสัญญาณ ดูที่ 22)

2. ตัวแปร DogFACS ทั้งชุด 39 ตัวถูกเข้ารหัสในการศึกษาของ Bremhorst และคณะ 22

Classification results. To explore optimal performance, we used the manual DogFACS annotations from Bremhorst et al.22 to experiment with different machine learning techniques, including Decision Tree, XGBoost, and Random Forest. Table 2 presents a comparison of their performance, with Random Forest performing slightly better for the full set of DogFACS variables (39 variables), reaching accuracy > 71%. In the limited set (11 DogFACS variables), the three models converged to one tree, and thus are presented together, reaching a slightly lower accuracy of > 66%.

การลดโครงสร้างการตัดสินใจ ต่อไป เราทำการค้นหาอย่างเป็นระบบสำหรับชุดตัวแปร DogFACS ขั้นต่ำที่จะให้ประสิทธิภาพการจำแนกประเภทเดียวกันที่แสดงในตารางที่ 2 ตารางที่ 3 แสดงให้เห็นว่าการใช้ตัวแปร DogFACS เพียงตัวเดียวเป็นคุณลักษณะรับประกันประสิทธิภาพที่คล้ายคลึงกันดังที่แสดงในตารางที่ 2 ตัวแปร 'Ears Flattener' มีความสำคัญที่สุดสำหรับการจำแนกประเภทโดยใช้ชุดตัวแปร DogFACS 11 ชุดที่จำกัด ซึ่งการมีอยู่ของตัวแปรนี้จะทำนายสภาวะที่เป็นลบ รูปที่ 4 แสดงแผนผังการตัดสินใจแบบง่ายที่มีคุณลักษณะเดียวในการทำนายภาวะเชิงบวก ได้แก่ การไม่มี 'หูแบนราบ' และภาวะเชิงลบ ซึ่งได้แก่ การมีอยู่ (ด้วยความแม่นยำ > 66%)

โดยเฉพาะอย่างยิ่ง เมื่อพิจารณาตัวแปร DogFACS ทั้ง 39 ตัว 'Eyes Up' เป็นตัวแปรที่สำคัญที่สุดสำหรับการจำแนกประเภทโดยใช้ตัวแปรทั้ง 39 ตัว ซึ่งการมีอยู่ของตัวแปรจะทำนายสภาวะเชิงบวกด้วยความแม่นยำสูงที่ > 71%

การตรวจหาตัวแปร DogFACS โดยอัตโนมัติ จากการค้นพบของเรา การฝึกเครื่องตรวจจับสำหรับตัวแปร 'Ears Flattener' และ 'Eyes Up' DogFACS ก็เพียงพอแล้วสำหรับไปป์ไลน์การจำแนกประเภทอัตโนมัติเต็มรูปแบบ นอกจากนี้เรายังสำรวจการตรวจจับตัวแปรอื่น ๆ โดยใช้โครงข่ายประสาทเทียม ResNet50 ที่ได้รับการฝึกอบรมล่วงหน้าบนชุดข้อมูลที่สมดุล (บนจำนวนรูปภาพที่แตกต่างกันเนื่องจากความแปรปรวนในความถี่ตัวแปร DogFACS) ประสิทธิภาพของเครื่องตรวจจับที่ได้รับแสดงไว้ในตารางที่ 4

ways to improve memory

แนวทางที่ลึกซึ้ง

ในแนวทางนี้ เราใช้การตั้งค่า "การเรียนรู้แบบถ่ายโอน" ทั่วไป โดยฝึกโพรบเชิงเส้นที่ด้านบนของแกนหลักที่ได้รับการฝึกล่วงหน้าแบบตายตัวโดยใช้คำอธิบายประกอบของมนุษย์ เราสำรวจความเหมาะสมของแบ็คโบนที่แตกต่างกันสำหรับงานนี้โดยการทำซ้ำการทดลองกับแบ็กโบนที่ได้รับการฝึกอบรมล่วงหน้าสี่รายการ: ResNet และ ViT ที่ได้รับการฝึกอบรมในลักษณะที่มีการควบคุมดูแลสำหรับการจำแนกประเภทภาพ 57 หรือในลักษณะที่มีการควบคุมดูแลด้วยตนเองโดยใช้ DINO58

เราฝึกแบบจำลองที่แตกต่างกันสี่แบบ (บนชุดข้อมูลทั้งหมด) และทดสอบประสิทธิภาพโดยใช้เฟรมจากชุดข้อมูลที่สมดุลเดียวกันที่อธิบายไว้ข้างต้น (วิดีโอ 82 รายการเกี่ยวกับสภาวะเชิงลบ วิดีโอ 82 รายการเกี่ยวกับสภาวะเชิงบวกจาก (n = 29) บุคคล ทำให้ ทั้งหมด 164 วิดีโอ)

ตารางที่ 5 แสดงผลการจำแนกประเภทที่วิเคราะห์ตามวิดีโอ กล่าวคือ เราบอกว่าวิดีโอได้รับการจัดประเภทอย่างถูกต้องหากเฟรมส่วนใหญ่จัดประเภทอย่างถูกต้อง จะเห็นได้ว่าแบบจำลองที่ได้รับการฝึกด้วยแกนหลัก DINO-ViT แสดงประสิทธิภาพที่ดีที่สุดด้วยความแม่นยำมากกว่า 89% ตารางที่ 6 แสดงผลการจำแนกประเภทวิเคราะห์ตามเฟรม ตามที่คาดไว้ ในกรณีนี้ การวัดจะลดลงบ้างเมื่อเทียบกับการวิเคราะห์ที่ทำกับการรวมเฟรม ซึ่งส่งผลให้มีความแม่นยำ 85% สำหรับแบบจำลองที่ได้รับการฝึกด้วยแกนหลัก DINO-ViT

memory enhancement

การอภิปราย

The present study is the first to explore automated recognition of canine emotional states focusing on diverse facial expressions, whilst using a carefully designed controlled experimental setup for dataset creation and annotation. We present classifiers of two different types: deep learning-based and DogFACS-based, both having a performance that is comparable to and in some cases outperforms those presented in previous studies addressing recognition of pain or emotional state from facial expressions, including mice38,39 (> 89% and 93% respectively), cats43 (> 72%), horses42,46 (> 75% and 65% respectively) and sheep55 (> 64%).

The DogFACS-based approach described here reached an accuracy of > 71% using the full set (n =  39) of DogFACS variables, but a lower accuracy of > 66% when using only the eleven DogFACS variables which were utilized in the study of Bremhorst et al.22 ( this accuracy was achieved based on manual DogFACS annotations and is expected to drop even lower in an end-to-end pipeline). Of the full set of 39 DogFACS variables, 'Eyes Up' were of considerable importance for classification, and including them in the Decision Tree leads to higher accuracy (>71%) อย่างไรก็ตาม เมื่อตีความตัวแปรทิศทาง เช่น การเคลื่อนไหวของดวงตา และความสำคัญของตัวแปรดังกล่าวในฐานะตัวบ่งชี้อารมณ์ที่อาจเกิดขึ้น จะต้องพิจารณาขั้นตอนการทดลองของการศึกษาที่มีการรวบรวมข้อมูลอยู่เสมอ ใน Bremhorst และคณะ 22 ผู้ทดลองให้รางวัลอาหารโดยขยับเหนืออายไลเนอร์ของสุนัขเล็กน้อย สิ่งนี้อาจกระตุ้นให้สุนัขเงยหน้าขึ้นมอง (กระตุ้นให้เกิดตัวแปร 'Eyes Up') เพื่อรออาหาร ดังนั้นเราจึงต้องรับรู้ว่าตัวแปร DogFACS นี้อาจเป็นสิ่งประดิษฐ์ของขั้นตอนการทดลอง เมื่อเลือกตัวแปรซึ่งเป็นส่วนหนึ่งของการพัฒนาตัวชี้วัดทางอารมณ์ สิ่งสำคัญคือต้องชั่งน้ำหนักความเสี่ยงของข้อผิดพลาดประเภทที่ 1 (ผลบวกลวง) เทียบกับข้อผิดพลาดประเภทที่ 2 (ผลลบลวง) ซึ่งแทบจะหลีกเลี่ยงไม่ได้ ในการทำงานกับชุดตัวแปร DogFACS สิบเอ็ดชุดที่ลดลง เราได้จัดลำดับความสำคัญของการหลีกเลี่ยงผลลบลวงมากกว่าผลบวกลวง เพื่อไม่ให้แยกตัวแปรก่อนเวลาอันควรออกจากการตรวจสอบเพิ่มเติม เราคาดหวังได้ว่าตัวแปรที่ยอมรับอย่างไม่ถูกต้องจะถูกแยกออกจากการศึกษาครั้งต่อไป หากมีการระบุการขาดความถูกต้องในการทำนาย (ดังที่กล่าวไว้ใน 19)

As a byproduct of these results, we obtained automated detectors for nine DogFACS variables, of which five performed with an accuracy >70% แสดงให้เห็นถึงความเป็นไปได้ในการรับรู้ตัวแปร DogFACS โดยอัตโนมัติอย่างแม่นยำ ความท้าทายหลักในการฝึกตัวตรวจจับสำหรับตัวแปรแต่ละตัวคือความพร้อมใช้งานของข้อมูล กล่าวคือ ความถี่ต่ำในการปรากฏตัวของตัวแปร DogFACS บางตัว ซึ่งต้องใช้ความพยายามอย่างมุ่งเน้นในการรวบรวมชุดข้อมูลสำหรับตัวแปรเฉพาะ นอกจากนี้ ตัวแปรบางตัวมีมิติชั่วคราวและไม่สามารถจัดการได้ในเฟรมเดียว (เช่น การกะพริบตาหรือการหอบ) การพัฒนาเครื่องตรวจจับสำหรับเครื่องตรวจจับเหล่านี้จำเป็นต้องมีแบบจำลองที่ใช้ไดนามิกเชิงเวลาด้วย เช่น แนวทางของBroomé และคณะ 42

ควรสังเกตเพิ่มเติมด้วยว่าเนื่องจากชุดข้อมูลของเราจำกัดอยู่เพียงสายพันธุ์เดียว ความจำเป็นในการวิจัยในอนาคตอันใกล้คือการประเมินความสามารถทั่วไปของแบบจำลองกับสายพันธุ์อื่นๆ หากประสิทธิภาพลดลงอย่างมีนัยสำคัญเมื่อถ่ายโอนผลลัพธ์ไปยังสายพันธุ์อื่น จะมีการระบุแนวทางอื่นสำหรับแนวทางเชิงลึกที่ใช้ในที่นี้ เช่น ใน Feighelstein และคณะ 43

improve your memory

การสำรวจความสามารถทั่วไปของแบบจำลองที่นำเสนอในที่นี้มีความสำคัญไม่เพียงแต่ในบริบทของการตรวจจับตัวแปร DogFACS เท่านั้น แต่ยังรวมถึงการจำแนกอารมณ์ด้วย ชุดข้อมูลที่ใช้ในที่นี้ได้รับการควบคุมไม่เพียงแต่สำหรับสายพันธุ์เท่านั้น แต่ยังถูกบันทึกในสภาพแวดล้อมที่มีการควบคุมอย่างเข้มงวดอีกด้วย การทำให้เป็นภาพรวมจากสภาพแวดล้อมที่มีการควบคุมไปจนถึงสภาพแวดล้อมที่เป็นธรรมชาติถือเป็นความท้าทายที่ยากลำบากอย่างฉาวโฉ่เช่นกันในการประมวลผลทางอารมณ์ของมนุษย์60 Feng และคณะ 61 ให้การทบทวนขอบเขตของมนุษย์เกี่ยวกับวิธีการที่เทคนิคการเรียนรู้แบบถ่ายโอนสามารถเอาชนะความท้าทายที่เกี่ยวข้องกับตัวอย่างข้อมูลจำนวนจำกัด ป้ายกำกับที่หายาก และความแปรปรวนของสภาพแวดล้อม ส่งเสริมระบบอัตโนมัติที่แข็งแกร่งและทั่วไปสำหรับการจดจำอารมณ์ วิธีที่คล้ายกันสามารถสำรวจได้ในการคำนวณทางอารมณ์ของสุนัข ผลลัพธ์ที่นำเสนอนี้เป็นพื้นฐานสำหรับการสำรวจทิศทางนี้เพิ่มเติม

คำถามเช่น 'เครื่องจักรสามารถรับรู้สภาวะทางอารมณ์ของสัตว์ได้หรือไม่' มีความน่าสนใจในตัวเองและมีการประยุกต์ใช้ในทางปฏิบัติอย่างกว้างขวางสำหรับสวัสดิภาพสัตว์ ผลการศึกษาของเรามีข้อบ่งชี้บางประการสำหรับคำตอบเชิงบวก อย่างน้อยก็ในกรณีของความหงุดหงิดและความคาดหวังเชิงบวกในสุนัข อย่างไรก็ตาม การสร้างโมเดล AI ที่จดจำอารมณ์ของสุนัขนั้นมีคุณค่าเพิ่มอย่างมากในการช่วยให้เราเข้าใจว่าเครื่องจักรจำแนกอารมณ์อย่างไร ไม่ว่าพวกมันจะไวต่อความแตกต่างเล็กน้อยที่ผู้เชี่ยวชาญของมนุษย์มองไม่เห็นหรือไม่ และผลกระทบที่มีต่อความเข้าใจของเราเกี่ยวกับอารมณ์ของสัตว์ และการดำเนินการอย่างต่อเนื่อง การอภิปรายเกี่ยวกับความรู้สึกของสัตว์ ด้วยเหตุนี้ จึงเป็นเรื่องสำคัญและมีแนวโน้มที่จะสำรวจความสามารถในการอธิบาย (อะไรคือเหตุผลเบื้องหลังการตัดสินใจของเครื่องจักร) และความสามารถในการตีความ (โครงสร้างของแบบจำลองเกี่ยวข้องกับการตัดสินใจดังกล่าวอย่างไร)62 หัวข้อเหล่านี้เป็นพื้นฐานของ AI และได้รับการแก้ไขโดยงานวิจัยจำนวนมาก63–65 โดยความพยายามส่วนใหญ่มุ่งเน้นไปที่แนวทางการเรียนรู้เชิงลึก ซึ่งความสามารถในการตีความถูกจำกัดด้วยโครงสร้างที่ซับซ้อน66 วิธีการอธิบายนั้นมีลักษณะเฉพาะโดเมน: การให้คำอธิบายสำหรับการจดจำลักษณะบุคลิกภาพโดยอัตโนมัติในการสัมภาษณ์งานนั้นแตกต่างออกไป เช่น จากการให้เหตุผลทางคลินิกสำหรับการตัดสินใจทางการแพทย์62

increase brain power

การศึกษาของเราเป็นครั้งแรกที่กล่าวถึงแง่มุมของการอธิบายของแบบจำลอง AI สำหรับการจดจำอารมณ์ของสัตว์ เมื่อเราเปรียบเทียบสองวิธีที่แตกต่างกันในการจำแนกอารมณ์ มูลค่าเพิ่มจากความสามารถในการเปรียบเทียบความแตกต่างในด้านความสามารถในการอธิบายที่พวกเขากล่าวถึง วิธีการที่ใช้ DogFACS นำไปสู่แบบจำลองในรูปแบบของแผนผังการตัดสินใจอย่างง่าย ซึ่งจำลองการใช้เหตุผลเชิงตรรกะของมนุษย์ในรูปแบบของการรวมกันของเงื่อนไขบูลีนที่เกี่ยวข้องกับการมีหรือไม่มีตัวแปร DogFACS บางตัว ลักษณะที่อธิบายของแผนผังการตัดสินใจนั้นสะท้อนให้เห็นเป็นพิเศษในเวอร์ชันที่เรียบง่ายโดยมีเพียงโหนดเดียว ดังเช่นที่ศึกษาที่นี่ (ด้วย 'Ears Flattener') ต้นไม้ดังกล่าวมีความเกี่ยวข้องอย่างใกล้ชิดกับแนวคิดที่เป็นประโยชน์สำหรับผู้เชี่ยวชาญที่เป็นมนุษย์ โดยเฉพาะอย่างยิ่งสำหรับตัวบ่งชี้ทางอารมณ์ที่ศึกษาโดย Bremhorst และคณะ 19 ตัวบ่งชี้อารมณ์ที่ถูกต้องมีไว้เพื่อระบุสถานะทางอารมณ์ที่เฉพาะเจาะจงอย่างแม่นยำ โดยจะแสดงเมื่อใดก็ตามที่มีอารมณ์นั้น และไม่มีเลย

คุณลักษณะเหล่านี้อธิบายไว้ตามความไวและความจำเพาะ ซึ่งเป็นหน่วยเมตริกที่ใช้กันทั่วไปในการประเมินความแม่นยำของการทดสอบวินิจฉัย Bremhorst และคณะ พบว่าไม่มีตัวแปร DogFACS ใดที่พิจารณาในการศึกษานี้ที่สามารถพิจารณาเป็นตัวบ่งชี้เฉพาะสำหรับความคาดหวังหรือความหงุดหงิดเชิงบวกในสุนัขได้ โดยเฉพาะอย่างยิ่ง 'Ears Flattener' แสดงให้เห็นว่ามีความไวค่อนข้างสูง แต่มีความจำเพาะต่ำ จึงไม่น่าแปลกใจที่แบบจำลองที่อธิบายไว้ในการศึกษาของเรา ซึ่งเป็นแผนผังการตัดสินใจที่มี 'Ears Flattener' เป็นคุณลักษณะเดียว ไม่ได้รับประสิทธิภาพสูง อย่างไรก็ตาม ความสัมพันธ์ระหว่างหน่วยเมตริกของตัวบ่งชี้อารมณ์ที่ใช้โดย Bremhorst และคณะ 19 กับหน่วยเมตริกที่ใช้ในที่นี้เพื่อประเมินประสิทธิภาพของแบบจำลองของเรานั้นไม่ได้ตรงไปตรงมา ในขณะที่แบบแรกจะคำนวณความไว ความจำเพาะ และค่าการคาดการณ์ทั้งเชิงบวกและเชิงลบสำหรับข้อมูลที่ไม่สมดุลทั้งหมด ส่วนแบบหลังจะประเมินประสิทธิภาพในงานทำนาย ซึ่งหมายความว่าข้อมูลจะถูกแบ่งออกเป็นสองส่วน: การฝึกอบรม ซึ่งใช้ในการฝึกอบรมแบบจำลอง และการทดสอบเพื่อประเมินประสิทธิภาพ ตรงกันข้ามกับ Bremhorst และคณะ เรายังปรับสมดุลข้อมูลโดยใช้การสุ่มตัวอย่างต่ำเกินไป อย่างไรก็ตาม การเชื่อมโยงโดยสัญชาตญาณระหว่างทั้งสองคือ หากพบตัวบ่งชี้อารมณ์ที่ยอดเยี่ยมโดยใช้แนวทางเดิม เราสามารถคาดหวังได้ว่าแผนผังการตัดสินใจที่ใช้เป็นคุณลักษณะจะบรรลุประสิทธิภาพที่ยอดเยี่ยมเช่นกัน

นอกเหนือจากความสามารถในการอธิบายแล้ว วิธีการเรียนรู้ของเครื่องที่นำเสนอที่นี่เพื่อค้นหาแบบจำลองต้นไม้การตัดสินใจที่เหมาะสมที่สุดในการทำนายอารมณ์ของสุนัข มีศักยภาพที่จะนำไปสู่ข้อมูลเชิงลึกใหม่ๆ เกี่ยวกับตัวบ่งชี้อารมณ์ ตามที่กล่าวไว้ข้างต้น การค้นพบตัวบ่งชี้อารมณ์ที่แม่นยำในแง่ของ Bremhorst และคณะ มีความสัมพันธ์อย่างใกล้ชิดกับปัญหาในการค้นหาตัวแยกประเภทแผนผังการตัดสินใจด้วยตัวแปร DogFACS เพียงตัวเดียวสำหรับการทำนายอารมณ์ แม้ว่าตัวแยกประเภทดังกล่าวไม่ได้แสดงให้เห็นว่ามีความแม่นยำสูงในการศึกษาของเรา (และแท้จริงแล้ว ไม่มีการค้นพบตัวบ่งชี้อารมณ์ที่แม่นยำในปี 19) ประสิทธิภาพการจำแนกประเภทสามารถปรับปรุงได้โดยการพิจารณารูปแบบต้นไม้การตัดสินใจที่ซับซ้อนมากขึ้น เช่น โดยการจัดกลุ่มตัวแปร DogFACS ออกเป็นคู่ สามเท่า ฯลฯ การทดลองเบื้องต้นของเราโดยใช้คู่ของตัวแปร DogFACS เป็นโหนด ดังแสดงในรูปที่ 5 แสดงให้เห็นว่าสิ่งนี้ปรับปรุงประสิทธิภาพของแบบจำลองในแง่ของการเรียกคืน ที่สำคัญ การตรวจสอบว่าตัวแปร DogFACS ใดบ้างที่อาจปรับปรุงการจำแนกประเภทได้ สามารถทำได้โดยอัตโนมัติ ละเอียดถี่ถ้วน และเป็นระบบ ซึ่งอาจนำไปสู่แนวคิดที่ละเอียดมากขึ้นเกี่ยวกับตัวบ่งชี้ทางอารมณ์ นี่เป็นแนวทางที่มีแนวโน้มสำหรับการวิจัยในอนาคต

ในทางกลับกัน วิธีการเรียนรู้เชิงลึกมีประสิทธิภาพสูงกว่า 89% อย่างเห็นได้ชัด ซึ่งแสดงให้เห็นถึงศักยภาพของวิธีการดังกล่าวในการจำแนกอารมณ์ นอกจากนี้ แกนหลัก DINO-ViT ดูเหมือนจะเหมาะสมที่สุดสำหรับงานจำแนกอารมณ์จากตัวเลือกที่ตรวจสอบทั้งสี่ตัวเลือก เราตั้งสมมติฐานว่านี่เป็นเพราะคุณสมบัติ DINO-ViT มีความไวต่อส่วนของวัตถุ ดังแสดงใน 67; และเนื่องจากลักษณะของงานจำแนกอารมณ์ซึ่งต้องใช้ความเข้าใจในระดับวัตถุ-ส่วนของ (ส่วนของใบหน้า เช่น ตา หู เป็นต้น) น่าประหลาดใจที่แบ็คโบนที่ได้รับการฝึกล่วงหน้ากับ DINO จะให้ผลลัพธ์ที่ดีกว่าแบ็คโบนที่ได้รับการดูแล

ควรสังเกตว่าตัวแยกประเภทการเรียนรู้เชิงลึกทำงานตามรูปภาพ จากนั้นจึงรวบรวมผลลัพธ์ต่อวิดีโอ นี่หมายความว่าแม้หลายเฟรมไม่ได้แสดงตัวแปร DogFACS อยู่ก็ตาม แต่แบบจำลองยังคงประสบความสำเร็จในการจำแนกประเภทที่ถูกต้อง สิ่งนี้อาจบ่งบอกถึงความไวของแบบจำลองต่อรายละเอียดที่ละเอียดในระดับพิกเซลซึ่งอาจเกินกว่าความสามารถของสายตามนุษย์ อย่างไรก็ตาม อาจเกี่ยวข้องกับข้อผิดพลาดที่อาจเกิดขึ้นในรูปแบบของอคติโดยธรรมชาติบางประการ นอกจากนี้ ตัวแปร 'Eyes Up' ที่กล่าวถึงข้างต้น อาจเป็นเครื่องมือสำหรับเครือข่าย และผลกระทบต่อการตัดสินใจนั้นไม่สามารถทำให้เป็นกลางได้อย่างง่ายดายในเครือข่ายการเรียนรู้เชิงลึก การตรวจสอบปัญหาเหล่านี้จำเป็นต้องมีการรวบรวมข้อมูลเพิ่มเติมในสภาวะการทดลองและสภาพแวดล้อมที่แตกต่างกันเพื่อขจัดข้อผิดพลาดดังกล่าว

ในทางกลับกัน ความสามารถในการอธิบายแนวทางการเรียนรู้เชิงลึกที่พิจารณาในที่นี้มีความแตกต่างอย่างสิ้นเชิงและมีการมองเห็นมากกว่าเมื่อเปรียบเทียบกับแนวทางที่ใช้ DogFACS ต่างจากแบบจำลองต้นไม้ตัดสินใจ มันเป็นเรื่องท้าทายอย่างยิ่งที่จะอธิบายการตัดสินใจของโครงข่ายประสาทเทียมในแง่ที่มนุษย์เข้าใจได้ เนื่องจากธรรมชาติของโครงข่ายประสาทเทียมนั้นมีความซับซ้อนสูง68 การใช้วิธี EigenCAM59 จะเน้นความแตกต่างระหว่างโมเดลต่างๆ ที่เราทดลองด้วย (ResNet/ViT, supervised/DINO) ดังแสดงในรูปที่ 6 มีความแตกต่างบางประการระหว่างโมเดลต่างๆ ดูเหมือนว่าโมเดล Te ViT จะมีการแปลเป็นภาษาท้องถิ่นได้ดีกว่าโมเดล ResNet เนื่องจากพื้นที่ที่มีการเปิดใช้งานสูง (ทำเครื่องหมายด้วยสีแดง) มีขนาดเล็กกว่าและวางไว้บนบริเวณที่มีความโดดเด่นมากกว่า (เช่น ตา หู จมูก มากกว่าผิวหนัง) ยิ่งไปกว่านั้น ดูเหมือนว่าแบบจำลอง DINO-ViT จะเปิดใช้งานได้ในหลายบริเวณที่สำคัญแทนที่จะเป็นบริเวณเดียว (เช่น เปิดใช้งานที่หู ตา และจมูก แทนที่จะเป็นเพียงหูในตัวอย่างด้านบนขวา) เราถือว่าความสำเร็จของโมเดลที่ใช้ ViT นั้นมาจากความสามารถของ ViT ในการส่งสัญญาณที่มีการแปลเป็นภาษาท้องถิ่นมากกว่าโมเดล ResNet สิ่งนี้เกิดจากสถาปัตยกรรม ความละเอียดของฟีเจอร์ ViT ยังคงคงที่ตลอดเลเยอร์ ในขณะที่ความละเอียดของฟีเจอร์ CNN จะลดลงเมื่อเลเยอร์ลึกขึ้น

แม้ว่าการบรรลุข้อสรุปขั้นสุดท้ายจำเป็นต้องมีการวิจัยเพิ่มเติม เราได้ทดลองด้วยวิธี EigenCAM โดยเน้นไปที่เฟรมที่ตรงตามเงื่อนไขต่อไปนี้: (i) เขียนโค้ดด้วยตนเองด้วยตัวแปร 'Ears Flattener' และ (ii) อยู่ในคลาสของตัวอย่างวิดีโอของ สภาพเชิงลบ และ (iii) จำแนกอย่างถูกต้องโดยเครือข่าย DINO-ViT ว่าเป็นเงื่อนไขเชิงลบ ในการวิเคราะห์ของเรา เราได้แบ่งตัวอย่างออกเป็นสามหมวดหมู่ ดังแสดงในรูปที่ 7 ตัวอย่างของหมวดหมู่ A คือแผนที่ความร้อนโดยเน้นที่หูอย่างชัดเจนเท่านั้น สิ่งนี้สามารถเห็นได้ว่าสอดคล้องกับคำอธิบาย 'Ears Flattener' ที่เกี่ยวข้องกับ DogFACS กล่าวคือ อาจเป็นกรณีที่แบบจำลองเรียนรู้รูปแบบที่เกี่ยวข้องกับการเคลื่อนไหวของหู หมวด B ก็สอดคล้องกับข้อนี้เช่นกัน โดยแสดงแผนที่ความร้อนโดยเน้นที่หูทั้งสองข้างและบริเวณอื่นๆ เช่น ตา หน้าผาก จมูก และปาก อย่างหลังอาจเกี่ยวข้องทางอ้อมกับการเคลื่อนไหว 'Ears Flattener' เช่นเดียวกับตัวแปร DogFACS อื่นๆ หรือลักษณะท่าทางอื่นๆ ที่อาจมีอยู่ในเฟรม อย่างไรก็ตาม หมวดหมู่ที่น่าสนใจที่สุดคือหมวดหมู่ C: โมเดลจะรับสัญญาณจากส่วนใบหน้าที่ไม่ใช่หู โดยยังคงจัดหมวดหมู่ที่ถูกต้อง กรณีเหล่านี้อาจเป็นกุญแจสำคัญในการทำความเข้าใจความอ่อนไหวของเครือข่ายต่อความแตกต่างที่ไม่สามารถมองเห็นได้ด้วยตามนุษย์ ไม่ว่าในกรณีใด ควรสังเกตว่าคำอธิบายประกอบ DogFACS ไม่สามารถครอบคลุมการเปลี่ยนแปลงพฤติกรรมใบหน้าที่เป็นไปได้ทั้งหมดได้อย่างละเอียดถี่ถ้วน ซึ่งอาจสะท้อนให้เห็นในรูปแบบพิกเซลที่เครือข่ายมีความละเอียดอ่อน จากนั้น เรายังแยกแผนที่ความร้อนออกจากวิดีโอที่ไม่มีตัวแปร DogFACS ที่มีคำอธิบายประกอบ มีวิดีโอเก้ารายการที่ไม่มีตัวแปร แปดรายการเป็น "เชิงบวก" และอีกรายการหนึ่งเป็น "เชิงลบ" น่าประหลาดใจที่วิดีโอเหล่านี้ส่วนใหญ่ (77%) ยังคงถูกจัดประเภทอย่างถูกต้องตามโมเดล นี่อาจเป็นข้อบ่งชี้อีกประการหนึ่งของแบบจำลองที่พิจารณาจากพฤติกรรมใบหน้าที่ละเอียดอ่อนซึ่ง DogFACS ไม่ได้บันทึกเอาไว้ เมื่อตรวจสอบแผนที่ความร้อนที่สร้างขึ้นสำหรับเฟรมของวิดีโอเหล่านี้ เราสังเกตเห็นว่าบริเวณจมูกและปากเป็นจุดสนใจหลักของแบบจำลอง เฟรมอื่นๆ บางเฟรมแสดงการโฟกัสไปที่ส่วนอื่นๆ ของใบหน้า ในขณะที่มีบางกรณีของเฟรมที่จำแนกอย่างถูกต้อง แต่มีแผนที่ความร้อนไม่ชัดเจนและไม่ชัดเจน ตัวอย่างจากสามหมวดหมู่เหล่านี้จะแสดงในรูปที่ 8 สิ่งที่น่าสนใจคือแผนที่ความร้อนเหล่านี้ขาดการเน้นไปที่ส่วนใบหน้าที่เฉพาะเจาะจง ซึ่งบ่งชี้ว่าแท้จริงแล้วในกรณีเหล่านี้ ตัวชี้นำที่มองเห็นได้ชัดเจนน้อยกว่าสำหรับแบบจำลอง

increase memory power

improve short term memory

ปัญหาที่น่าสังเกตอีกประการที่เกี่ยวข้องกับทั้งสองแนวทางเกี่ยวกับประสิทธิภาพคือความยาววิดีโอสั้น (3 วินาที) ในชุดข้อมูลปัจจุบัน การใช้วิดีโอที่ยาวขึ้นทำให้เกิดความท้าทายในการระบุกรอบเวลาที่เหมาะสมที่สุด ซึ่งในระหว่างนั้นสถานะภายในจะถือว่าคงที่ ปัญหานี้ได้รับการพิจารณาในบริบทของอาการปวดกระดูกและข้อระดับต่ำในม้า และเป็นทิศทางที่สำคัญสำหรับการวิจัยในอนาคตสำหรับสภาวะทางอารมณ์ของสุนัขด้วย

โดยสรุป การศึกษานี้แสดงให้เห็นถึงคุณค่าของวิธีการจำแนกประเภทอัตโนมัติที่แตกต่างกันสองวิธีสำหรับสภาวะทางอารมณ์สองแบบในสุนัข โดยพิจารณาจากการแสดงออกทางสีหน้า: สภาพเชิงบวกและเชิงลบ ทั้งสองมีความแม่นยำที่ดีเทียบได้กับวิธีการล้ำสมัยอื่นๆ ในการจดจำผลกระทบของสัตว์โดยอัตโนมัติ ผลลัพธ์เหล่านี้ไม่เพียงแต่ให้คำตอบที่ยืนยันได้เป็นครั้งแรกสำหรับคำถามที่ว่า "เครื่องจักรสามารถรับรู้อารมณ์สุนัขทั้งเชิงบวก/เชิงลบได้หรือไม่" แต่ยังเปิดเส้นทางการวิจัยใหม่ๆ ในการสำรวจว่าเครื่องจักรจดจำอารมณ์เหล่านี้ได้อย่างไร และจะทำให้การจดจำนี้สามารถอธิบายให้มนุษย์เข้าใจได้อย่างไร . การทดลองเพิ่มเติมกับชุดข้อมูลขนาดใหญ่ที่มีลักษณะเฉพาะของผู้เข้าร่วมที่กว้างขึ้นจะส่งเสริมความเข้าใจของเราเกี่ยวกับวิธีการพัฒนาตัวชี้วัดอารมณ์ของสัตว์ที่ดี แนวทางหนึ่งที่ดูเหมือนว่าจะมีแนวโน้มดีเป็นพิเศษคือการสำรวจศักยภาพของแนวทางที่เกี่ยวข้องกับการตรวจจับจุดสังเกตบนใบหน้า เช่น OpenFace70 และ Google MediaPipe71 แนวทางที่คล้ายกันนี้เพิ่งเริ่มมีการสำรวจสำหรับสัตว์ที่ไม่ใช่มนุษย์ เช่น การศึกษา Feighelstein และคณะ 43 บนใบหน้าของแมว เช่นเดียวกับในขอบเขตของมนุษย์ การพัฒนาของพวกเขาจะต้องใช้ความพยายามจากสหสาขาวิชาชีพอย่างกว้างขวางในการเก็บรวบรวมชุดข้อมูลขนาดใหญ่สำหรับสายพันธุ์ต่างๆ

วิธีการ

ชุดข้อมูล

ชุดข้อมูลที่เกี่ยวข้องกับสุนัขที่ใช้ในการศึกษานี้ถูกรวบรวมก่อนหน้านี้ภายใต้การอนุมัติทางจริยธรรมต่อไปนี้ของมหาวิทยาลัยลินคอล์น (UID: CoSREC252) ตาม Bremhorst และคณะ พร้อมการแก้ไขงานวิจัยนี้ได้มาจากมหาวิทยาลัยลินคอล์นสำหรับ โดยใช้ชุดข้อมูลดั้งเดิมในการศึกษาปัจจุบัน โปรโตคอลปัจจุบันที่ใช้ข้อมูลนี้ได้รับการตรวจสอบโดยคณะกรรมการจริยธรรมของมหาวิทยาลัยไฮฟา และไม่จำเป็นต้องได้รับการอนุมัติเพิ่มเติม

การครอบตัดและการประมวลผลล่วงหน้า

ขั้นตอนนี้เกี่ยวข้องกับทั้ง DogFACS และแนวทางเชิงลึก เฟรมวิดีโอต้นฉบับมีพื้นหลังที่ยุ่งเหยิง รวมถึงห้องโดยรอบ คน ศพสุนัข ฯลฯ เรามุ่งหวังที่จะมุ่งเน้นไปที่การแสดงออกทางสีหน้าของสุนัข และหลีกเลี่ยงการเรียนรู้ตัวทำนายสภาวะทางอารมณ์อื่นๆ (เช่น ท่าทางของร่างกายสุนัข) ดังนั้นเราจึงฝึก Mask-RCNN72 เพื่อระบุใบหน้าสุนัข และใช้มันเพื่อครอบตัดกรอบขอบเขตใบหน้าจากแต่ละภาพ เราได้ฝึกอบรม Mask-RCNN กับรูปภาพที่มีคำอธิบายประกอบประมาณ 200 ภาพจากชุดข้อมูลนี้ ทำให้เหมาะสมที่สุดสำหรับการตั้งค่าการทดลองเฉพาะนี้ ตัวอย่างของพืชคลุมหน้าที่ได้มาจากขั้นตอนก่อนการประมวลผลสามารถดูได้ในรูปที่ 2

วิธีการที่ใช้ DogFacs

จากวิดีโอไปจนถึงตัวแปร DogFACS ไปป์ไลน์แบบเต็มได้อธิบายไว้ในแผนภาพต่อไปนี้ ดูรูปที่ 9 ซึ่งมีขั้นตอนต่อไปนี้:

• สุนัขครอบตัดใบหน้าออกจากเฟรมโดยใช้วิธีการที่อธิบายไว้ข้างต้น

• การสร้างชุดข้อมูลตัวแปร DogFACS โดยใช้การเข้ารหัส DogFACS ด้วยตนเองของ Bremhorst และคณะ 22 สำหรับตัวแปร DogFACS ทุกตัว เราสร้างสองโฟลเดอร์ที่มีตัวอย่างเชิงบวกและเชิงลบ (หน้าสุนัขแสดงหรือไม่แสดงตัวแปร DogFACS นี้) สำหรับตัวอย่างที่เป็นบวก (มีตัวแปรอยู่) เราเลือกรูปภาพของเฟรมทั้งหมดที่เขียนโค้ดด้วยตนเองด้วยตัวแปรนี้ สำหรับตัวอย่างเชิงลบ เราเลือกเฟรมในวิดีโอที่ไม่มีตัวแปรทำเครื่องหมายไว้ในการเข้ารหัสจนกว่าจะปรากฏครั้งแรกของตัวแปรนั้น (หรือจนกว่าจะสิ้นสุดวิดีโอหากไม่มี) จากนั้นชุดข้อมูลจะได้รับความสมดุล โดยเหลือรูปภาพจำนวนเท่ากันสำหรับตัวอย่างเชิงบวกและเชิงลบสำหรับแต่ละตัวแปร ตารางที่ 4 แสดงขนาดของชุดข้อมูลสำหรับตัวแปร DogFACS ทั้งหมดที่ได้รับตัวตรวจจับ

จากตัวแปร DogFACS ไปจนถึงการจำแนกสภาวะทางอารมณ์ เราใช้การเรียนรู้แบบถ่ายโอนโดยยึดตามสถาปัตยกรรมเครือข่าย ResNet50 ที่ได้รับการฝึกอบรมล่วงหน้าซึ่งเริ่มต้นด้วยน้ำหนัก Imagenet เราแทนที่ชั้นบนสุดด้วยเลเยอร์พูลโดยเฉลี่ย เลเยอร์ออกกลางคัน 20 เปอร์เซ็นต์ และเลเยอร์ตัวแยกประเภท 2 คลาส โมเดลนี้ได้รับการฝึกฝนในช่วง 20 ยุคโดยใช้เครื่องมือเพิ่มประสิทธิภาพ Adam ด้วยอัตราการเรียนรู้ 0.0001 โมเดลที่ได้รับความแม่นยำสูงสุดในชุดข้อมูลการตรวจสอบความถูกต้องได้รับเลือกให้เป็นโมเดลที่ดีที่สุด ในช่วง 10 ยุคแรก น้ำหนักของเลเยอร์ทั้งหมดได้รับการปรับอย่างละเอียด ในช่วง 10 ยุคแรก น้ำหนักของเลเยอร์ทั้งหมดได้รับการปรับอย่างละเอียด ในช่วงยุคที่เหลือ ตุ้มน้ำหนัก ResNet50 จะถูกแช่แข็งและอัปเดตเฉพาะน้ำหนักของเลเยอร์บนสุดใหม่เท่านั้น สำหรับตัวแปรที่ไม่เกี่ยวข้องกับทิศทาง ('หูแบน', 'ส่วนริมฝีปาก', 'หูเสริม', 'หูไปข้างหน้า' และ 'เลียจมูก') เราใช้เทคนิคการเสริมโดยอาศัยการสุ่มภาพแนวนอนและการหมุนสูงสุด 20 องศา . สำหรับอินพุตสำหรับตัวเข้ารหัส เราใช้ตารางอินพุต โดยแต่ละแถวแสดงถึงการมีอยู่ (1)/ไม่มี (0) ของตัวแปร DogFACS ทั้ง 11 ตัวในแต่ละวิดีโอ เป้าหมายของโปรแกรมเปลี่ยนไฟล์คือตารางที่มีเงื่อนไข (ลบ(0)/บวก(1)) ของแต่ละวิดีโอ

supplements to boost memory

แนวทางที่ลึกซึ้ง

จนกระทั่งเมื่อไม่นานมานี้ โครงข่ายประสาทเทียมแบบหมุนวน (CNN) ได้รับการพิจารณาว่ามีความล้ำสมัยในงานด้านการมองเห็นของคอมพิวเตอร์ เมื่อเร็วๆ นี้สถาปัตยกรรม Vision Transformer (ViT)57 ได้กลายเป็นทางเลือก73 วิธีการฝึกอบรม DINO ได้รับการแนะนำในปี 2021 ในรูปแบบการเรียนรู้ด้วยการกลั่นตัวเองเท่านั้น การฝึกอบรมแบ็คโบน DNN หลายตัว (ResNet50, visit-small, vit-base ฯลฯ) ในการกำหนดค่านี้ แสดงให้เห็นว่าแกนหลัก ViT ที่ได้รับการฝึกด้วยวิธี DINO มีประสิทธิภาพเหนือกว่าผลลัพธ์การจำแนกประเภทก่อนหน้านี้ในชุดข้อมูลมาตรฐาน ImageNet74

เราใช้สถาปัตยกรรม ResNet50 สำหรับแบ็คโบนที่ได้รับการดูแลและผ่านการฝึกอบรม DINO ViT-S/16 ได้รับการฝึกอบรมในลักษณะที่ได้รับการดูแล และ ViT-S/8 ได้รับการฝึกอบรมกับ DINO เราใช้ตุ้มน้ำหนัก ViT ที่ผ่านการฝึกอบรมมาแล้วจาก Timm Library75 เราฝึกอบรมทั้งสี่โมเดลสำหรับ 30 ยุคโดยใช้ Adam Optimizer76 พร้อมเบต้า=(0, 0.999) และอัตราการเรียนรู้: 10−4 สำหรับ ResNet backbone และ 5 · 10−6 สำหรับ ViT backbone เส้นโค้งการสูญเสียของแบบจำลองที่ได้รับการฝึกจะแสดงในรูปที่ 10

การแสดงภาพแผนที่

เราเลือกใช้วิธี Eigen-CAM59 เพื่อแสดงภาพส่วนประกอบหลักของการเปิดใช้งานขั้นสุดท้ายสำหรับแต่ละรุ่น แสดงให้เห็นว่า Eigen-CAM ให้ผลลัพธ์ที่ตีความได้ง่ายกว่าและมีการคำนวณน้อยกว่าเมื่อเปรียบเทียบกับวิธี CAM อื่นๆ เช่น Grad-CAM77 ยอดนิยม ยิ่งไปกว่านั้น ไม่เหมือนกับวิธีการแสดงภาพอื่นๆ เช่น Grad-CAM59 และ Grad-CAM++78 Eigen-CAM เป็นเครื่องมือที่ไม่ขึ้นอยู่กับคลาส คุณสมบัตินี้ช่วยให้ Eigen-CAM สามารถมองเห็นรูปแบบที่เรียนรู้ได้ แม้ว่าการทำนายแบบจำลองจะผิด ตรงข้ามกับวิธี CAM แบบเก่าที่สร้างแผนที่ที่ไม่เกี่ยวข้องเมื่อการคาดการณ์ไม่ถูกต้อง คุณสมบัตินี้ของ EigenCAM ช่วยให้สามารถตีความสาเหตุของความล้มเหลวในการทำนายได้ มีความสอดคล้องกันมากกว่าและเลือกปฏิบัติในชั้นเรียนเมื่อเปรียบเทียบกับวิธีการแสดงภาพอันล้ำสมัยอื่นๆ นอกจากนี้ EigenCAM ไม่ได้เป็นแบบเฉพาะเจาะจง โดยสามารถใช้ได้กับทั้ง ViT และ CNN โดยไม่ต้องเปลี่ยนเลเยอร์

ความพร้อมใช้งานของข้อมูล

ชุดข้อมูลที่ใช้ในบทความนี้สามารถขอได้จากผู้เขียนที่เกี่ยวข้อง


อ้างอิง

ดาร์วิน, C. Te การแสดงออกของอารมณ์ในสัตว์และมนุษย์ฉบับที่ 11 ต.ค. 1872 (เมอร์เรย์ 1872)

2. Ekman, P. & Friesen, WV วัดการเคลื่อนไหวของใบหน้า สภาพแวดล้อม ไซโคล. พฤติกรรมอวัจนภาษา 1, 56–75 (1976)

3. Ekman, P. & Keltner, D. การแสดงออกทางสีหน้าของอารมณ์สากล ในการสื่อสารอวัจนภาษา: ที่ที่ธรรมชาติพบกับวัฒนธรรม (สหพันธ์ Segerstrale UP & Molnar, P.) เล่ม 1 27, 46 (1997)

4. รัสเซลล์ เจ.เอ. บาโชรอสกี้ เจ.-เอ. & เฟอร์นันเดซ-โดลส์, เจ.-เอ็ม. การแสดงสีหน้าและน้ำเสียงตามอารมณ์ แอน. สาธุคุณจิตล. 54, 329–349 (2546)

5. Diogo, R., Abdala, V., Lonergan, N. & Wood, B. จาก fsh ไปจนถึงกายวิภาคศาสตร์เปรียบเทียบของมนุษย์สมัยใหม่ ความคล้ายคลึงกัน และวิวัฒนาการของกล้ามเนื้อศีรษะและคอ เจ.อานนท์. 213, 391–424 (2008)

6. Descovic, KA และคณะ การแสดงออกทางสีหน้า: เครื่องมือที่ไม่ได้ใช้งานสำหรับการประเมินสวัสดิการในสัตว์เลี้ยงลูกด้วยนม (Altex, 2017)

7. Mota-Rojas, D. และคณะ ความก้าวหน้าในปัจจุบันในการประเมินอารมณ์ การแสดงออกทางสีหน้า และการใช้สุนัขเพื่อรับรู้ความเจ็บปวดทางคลินิก สัตว์ 11, 3334 (2021)

8. Ekman, P. & Friesen, WV Facial Action Coding System: Manual (สำนักพิมพ์นักจิตวิทยาที่ปรึกษา, 1978)

9. Ekman, P. & Friesen, W. ระบบการเข้ารหัสการกระทำบนใบหน้า: เทคนิคสำหรับการวัดการเคลื่อนไหวของใบหน้า (1978)


For more information:1950477648nn@gmail.com




คุณอาจชอบ