หน่วยความจำคู่ LSTM พร้อมโครงข่ายประสาทเทียมแบบ Dual Attention สำหรับการทำนายแบบ Spatiotemporal
Mar 21, 2022
ติดต่อ:joanna.jia@wecistanche.com/ WhatsApp: 008618081934791
เชิงนามธรรม
การคาดการณ์แบบ Spatiotemporal เป็นสิ่งที่ท้าทายเนื่องจากการดึงข้อมูลแทนค่าที่ไม่มีประสิทธิภาพและขาดการพึ่งพาบริบทที่หลากหลาย มีการเสนอแนวทางใหม่สำหรับการทำนายเชิงพื้นที่โดยใช้dualหน่วยความจำLSTM พร้อมโครงข่ายประสาทเทียมแบบคู่ (DMANet) มีการเสนอหน่วย LSTM แบบหน่วยความจำคู่ใหม่ (DMLSTM) เพื่อแยกการแสดงข้อมูลโดยใช้ประโยชน์จากการดำเนินการที่แตกต่างกันระหว่างภาพที่ต่อเนื่องกันและการนำภาพคู่มาใช้หน่วยความจำกลไกการเปลี่ยนแปลง เพื่อใช้ประโยชน์อย่างเต็มที่จากการนำเสนอทางประวัติศาสตร์ กลไกการเอาใจใส่แบบคู่ได้รับการออกแบบมาเพื่อจับภาพการพึ่งพาเชิงพื้นที่ในระยะยาวโดยการคำนวณความสัมพันธ์ระหว่างการแสดงแทนที่ซ่อนอยู่ในปัจจุบันและการเป็นตัวแทนที่ซ่อนทางประวัติศาสตร์จากมิติทางโลกและมิติเชิงพื้นที่ตามลำดับ จากนั้น ความสนใจแบบคู่จะถูกฝังลงในหน่วย DMLSTM เพื่อสร้าง DMANet ซึ่งช่วยให้โมเดลมีพลังในการสร้างแบบจำลองมากขึ้นสำหรับไดนามิกในระยะสั้นและการแสดงตามบริบทในระยะยาว มีการเสนอชุดข้อมูลแผนที่ความต้านทานที่ชัดเจน (AR Map) ในบทความนี้ วิธีการแก้ไข B-spline ถูกนำมาใช้เพื่อปรับปรุงชุดข้อมูล AR Map และทำให้เกิดการอนุพันธ์ของเส้นโค้งแนวโน้มความต้านทานที่ชัดเจนอย่างต่อเนื่องในมิติเวลา ผลการทดลองแสดงให้เห็นว่าวิธีการที่พัฒนาขึ้นมีประสิทธิภาพการทำนายที่ยอดเยี่ยมโดยเปรียบเทียบกับวิธีการที่ทันสมัยบางอย่าง
คำสำคัญ: การทำนายเชิงพื้นที่; คู่หน่วยความจำLSTM; ความสนใจคู่; การเป็นตัวแทนทางประวัติศาสตร์
1. บทนำ
การคาดการณ์แบบ Spatiotemporal คือการเรียนรู้การแทนค่าในลักษณะที่ไม่ได้รับการดูแลจากข้อมูลวิดีโอที่ไม่มีป้ายกำกับ และใช้ข้อมูลเหล่านี้เพื่อดำเนินการคาดการณ์ ซึ่งเป็นงานทั่วไปของการมองเห็นด้วยคอมพิวเตอร์ ในปัจจุบัน การคาดคะเนเชิงเวลาได้ถูกนำไปใช้กับงานบางอย่างที่ประสบความสำเร็จ เช่น การทำนายตำแหน่งของวัตถุในอนาคต [1,2] การตรวจจับสิ่งผิดปกติ [3] และการขับขี่อัตโนมัติ [4] โมเดลเชิงลึกที่ใช้การเรียนรู้เชิงลึกก้าวข้ามแนวทางแบบเดิมๆ เพราะพวกเขาได้เรียนรู้การแสดงตัวอย่างที่เพียงพอจากข้อมูลในมิติสูง วิธีการเรียนรู้เชิงลึกนั้นเข้ากันได้ดีกับงานการคาดคะเน spatiotemporal ซึ่งสามารถดึงความสัมพันธ์เชิงพื้นที่ออกจากข้อมูลวิดีโอในแบบที่ควบคุมตนเองได้ อย่างไรก็ตาม การคาดคะเนเชิงเวลายังคงเป็นงานที่ท้าทายเนื่องจากปัญหาในการดึงข้อมูลแทนค่าอย่างไม่มีประสิทธิภาพและขาดการพึ่งพาระยะยาว ตัวอย่างเช่น Convolutional LSTM (ConvLSTM) [5] ได้รับการพัฒนาเพื่อแยกการแสดงข้อมูลชั่วคราวเพิ่มเติม แต่จะละเว้นการแสดงเชิงพื้นที่ วิธีการบางอย่าง [6,7] บรรลุผลการทำนายที่แม่นยำ แต่ก็ทำให้สูญเสียการเป็นตัวแทน วิธีการของฝ่ายตรงข้ามถูกนำมาใช้ในงานทำนาย [8,9] อย่างไรก็ตาม พวกเขา [8,9] นั้นขึ้นอยู่กับกระบวนการฝึกอบรมที่ไม่เสถียรอย่างมีนัยสำคัญ
1 School of Communication and Information Engineering, Shanghai University, Shanghai 200444, China
ห้องปฏิบัติการหลัก 2 แห่งของการแสดงผลขั้นสูงและการประยุกต์ใช้ระบบ กระทรวงศึกษาธิการ เซี่ยงไฮ้ 200072 ประเทศจีน
นวนิยายคู่หน่วยความจำLSTM ที่มีโครงข่ายประสาทเทียมแบบสองจุด (DMANet) ได้รับการเสนอสำหรับการทำนายเชิงพื้นที่ในบทความนี้เพื่อแก้ปัญหาดังกล่าว หน่วย LSTM แบบหน่วยความจำคู่ (DMLSTM) ที่ใช้ ConvLSTM [5] ได้รับการพัฒนาสำหรับ DMANet เพื่อทำการคาดการณ์เชิงพื้นที่ สามารถใช้เพื่อแสดงภาพเคลื่อนไหวโดยแยกสถานะที่ซ่อนอยู่ที่อยู่ติดกันหรือภาพดิบให้เหมาะสม นอกจากนี้ยังมีโครงสร้างหน่วยความจำคู่เพื่อเก็บข้อมูลเชิงพื้นที่และข้อมูลชั่วคราว มีการเสนอกลไกสองความสนใจและฝังลงในหน่วย DMLSTM เพื่อแยกการพึ่งพาฟีเจอร์ระยะยาวจากมิติชั่วคราวและเชิงพื้นที่ ตามลำดับ ซึ่งช่วยให้โมเดลที่พัฒนาแล้วสามารถจับภาพไดนามิกของวิดีโอที่ซับซ้อนได้นานขึ้น เมื่อเทียบกับวิธีการทำนาย spatiotemporal ข้างต้น ผลงานหลักของบทความนี้มีดังนี้ ประการแรก มีการเสนอหน่วย DMLSTM ใหม่เพื่อแสดงการแทนค่าสารสกัด ซึ่งสามารถนำไปใช้กับการคาดการณ์เชิงพื้นที่โดยใช้ประโยชน์จากการดำเนินการที่แตกต่างกันระหว่างภาพที่ต่อเนื่องกันและการนำภาพคู่มาใช้หน่วยความจำกลไกการเปลี่ยนแปลง ประการที่สอง กลไกการเอาใจใส่แบบคู่ได้รับการพัฒนาเพื่อให้ได้ปฏิสัมพันธ์ของเฟรมในระยะยาว ปฏิสัมพันธ์ของเฟรมในระยะยาวถูกจับโดยการคำนวณความสัมพันธ์ระหว่างการแสดงแทนที่ซ่อนอยู่ในปัจจุบันและการเป็นตัวแทนที่ซ่อนอยู่ในอดีตจากมิติทางโลกและเชิงพื้นที่ตามลำดับ สุดท้าย การสนับสนุนที่สำคัญคือ DMANet รวมข้อดีทั้งสองอย่างเข้าด้วยกัน การออกแบบสถาปัตยกรรมดังกล่าวช่วยให้โมเดลมีพลังการสร้างแบบจำลองมากขึ้นสำหรับการเปลี่ยนแปลงในระยะสั้นและการนำเสนอตามบริบทในระยะยาว วิธีการที่เสนอจะได้รับการประเมินในชุดข้อมูลที่ท้าทายด้วยวิธีการที่แตกต่างกัน มันบรรลุประสิทธิภาพที่ยอดเยี่ยมโดยเปรียบเทียบกับวิธีการที่ทันสมัยบางอย่าง ผลการทดลองแสดงให้เห็นว่าวิธีการที่เสนอนั้นมีประสิทธิภาพการทำนายเชิงพื้นที่ที่ดีเยี่ยม

ประโยชน์ของซิสแทนเช่ในหน่วยความจำ
ส่วนที่เหลือของบทความนี้จัดเป็นดังนี้ งานที่เกี่ยวข้องจะกล่าวถึงในหัวข้อที่ 2 dualหน่วยความจำLSTM ที่มีกลไกการเอาใจใส่แบบคู่ได้อธิบายไว้ในส่วนที่ 3 ผลการทดลองและการวิเคราะห์จะกล่าวถึงในส่วนที่ 4 และตามด้วยข้อสรุปในส่วนที่ 5
2. การทบทวนวรรณกรรม
ในช่วงทศวรรษที่ผ่านมา มีการเสนอวิธีการมากมายสำหรับการทำนายเชิงพื้นที่ โครงข่ายประสาทกำเริบ (RNN) [10] กับระยะสั้นระยะยาวหน่วยความจำ(LSTM) [11] ถูกนำไปใช้กับงานการทำนายมากขึ้นเนื่องจากความสามารถในการเรียนรู้การแสดงลำดับวิดีโอ ในช่วงไม่กี่ปีที่ผ่านมา เฟรมเวิร์ก LSTM ที่อิงตามโมเดลแบบเรียงต่อกัน [12] ได้รับการปรับให้เข้ากับการคาดการณ์ของวิดีโอ ถึงกระนั้น ความแม่นยำของการทำนายก็มีจำกัดเนื่องจากวิธีการของกรอบงานเหล่านี้ [12] จับเฉพาะความแปรผันชั่วคราวเท่านั้น เพื่อแยกการแสดงภาพวิดีโอเพิ่มเติม ConvLSTM [5] จะแทนที่การดำเนินการที่เชื่อมต่ออย่างสมบูรณ์ด้วยการดำเนินการแบบบิดในการเปลี่ยนสถานะที่เกิดซ้ำ กรอบการเรียนรู้เชิงลึก [13] ถูกเสนอให้สร้างข้อมูลที่ขาดหายไปใหม่เพื่ออำนวยความสะดวกในการวิเคราะห์ด้วยอนุกรมเวลา อย่างไรก็ตาม จะเพิ่มค่าใช้จ่ายในการคำนวณเพิ่มเติมและลดประสิทธิภาพการทำนาย หน่วยการเกิดซ้ำแบบ bijective gated ถูกนำมาใช้ใน [14] ซึ่งใช้ประโยชน์จากตัวเข้ารหัสอัตโนมัติแบบวนซ้ำเพื่อทำนายเฟรมถัดไปในบางกรณี มีการเสนอวิธีการเรียนรู้ภายใต้การดูแล [15] หลายผลลัพธ์และหลายดัชนีด้วย LSTM [11] สำหรับการทำนายเชิงพื้นที่ ซึ่งสามารถจำลองไดนามิกในระยะยาวได้ ในการแสวงหาการบรรเทาการหายไปของเกรเดียนท์ LSTM แบบโค้งที่ขยายโดย [6,7] ได้แนะนำการไหลของหน่วยความจำซิกแซกและหน่วยทางหลวงไล่ระดับ (GHU) มีการใช้วิธีการเรียนรู้เชิงลึกที่ได้รับการปรับปรุงเพื่อปรับปรุงความสามารถในการคาดการณ์ มีการเสนอเวอร์ชันของ ASAP ที่เรียกว่า "ASAP deep system" ใน [16] การแปรปรวนของการไหลของแสงและอัลกอริธึมการสังเคราะห์พิกเซล RGB [17] ถูกนำมาใช้เพื่อทำนายระยะห่าง มีการเสนอเครือข่ายหน่วยความจำในหน่วยความจำ (MIM) สำหรับงานทำนายในปี [18] ความแตกต่างจากแบบจำลองที่เกิดซ้ำที่กล่าวถึงข้างต้นคือ MIM [18] ใช้กับความแตกต่างในการเปลี่ยนหน่วยความจำเพื่อแปลงพหุนามที่แปรผันตามเวลาให้เป็นค่าคงที่ ซึ่งช่วยให้สามารถคาดการณ์องค์ประกอบที่กำหนดได้ อย่างไรก็ตาม วิธีการเหล่านี้ [14–18] ยังคงท้าทายในการคาดการณ์ระยะยาว เนื่องจากการเปลี่ยนเกตที่มากเกินไปจะทำให้สูญเสียการเป็นตัวแทน

ประโยชน์ของ cistanche deserticolaในหน่วยความจำ
นอกจากแบบจำลองที่เกิดซ้ำแล้ว ยังมีการใช้แบบจำลองอื่นๆ สำหรับการทำนายเชิงเวลาด้วย มีการเสนอเครือข่ายการย้อนหลังในปี [19] ซึ่งแนะนำการสูญเสียการหวนกลับเพื่อผลักดันเฟรมการหวนกลับให้สอดคล้องกับเฟรมที่สังเกต เพื่อจัดการกับความไม่สมดุลของข้อมูล อัลกอริทึมการทำความสะอาดพื้นที่ใกล้เคียงได้รับการพัฒนาใน [20] อัลกอริธึมฟอเรสต์แบบสุ่มจะดึงคุณสมบัติที่เหมาะสมที่สุดเพื่อดำเนินการทำนาย มีการใช้ตัวเข้ารหัสอัตโนมัติแบบแปรผันเพื่อแยกคุณลักษณะไดนามิกที่ไม่เป็นเชิงเส้นใน [21] โมเดลนี้วิเคราะห์ความสัมพันธ์ระหว่างตัวแปรและความสัมพันธ์ระหว่างตัวอย่างในอดีตกับตัวอย่างในปัจจุบัน โมดูลที่มีความสนใจกว้างและโมดูลที่มีองค์ประกอบเชิงลึกถูกนำมาใช้ใน [22] เพื่อแยกคุณลักษณะของคีย์ทั่วโลกและคุณลักษณะของคีย์ในเครื่อง อย่างไรก็ตาม วิธีการเหล่านี้ [19–22] ขึ้นกับการแสดงแทนท้องถิ่นในระดับหนึ่ง ซึ่งไม่สามารถทำงานได้ดีเยี่ยมในงานทำนาย โครงข่ายประสาทเทียม [23] ได้รับการเสนอให้จำลองคุณสมบัติเฉพาะของข้อมูล spatiotemporal และได้รับความสามารถในการสร้างแบบจำลองที่มีประสิทธิภาพมากขึ้นสำหรับข้อมูล spatiotemporal ระบบการทำนายเชิงพื้นที่ [24] ได้รับการพัฒนาเพื่อมุ่งเน้นไปที่การสร้างแบบจำลองเชิงพื้นที่และสร้างสัญญาณเชิงเวลาทั้งหมดขึ้นใหม่ วิธีนี้แสดงประสิทธิผลของการสร้างแบบจำลองฟิลด์ Spatio-temporal ที่เชื่อมโยงกัน มีการเสนอโครงข่ายประสาทเทียมแบบผสมเพื่อสร้างแบบจำลองรูปแบบไดนามิกและเรียนรู้การแสดงลักษณะที่ปรากฏตามเฟรมวิดีโอที่กำหนดใน [25] 3D CNN ถูกใช้ใน RNN ใน [26] ซึ่งขยายการเป็นตัวแทนในมิติชั่วคราวและทำให้หน่วยความจำหน่วยเก็บดีกว่าระยะยาวแทน อย่างไรก็ตาม การดำเนินการ convolutional [24–26] ทำให้เกิดการพึ่งพาอินทราเฟรมระยะสั้นเนื่องจากช่องรับข้อมูลที่จำกัด และขาดความสามารถในการสร้างแบบจำลองระหว่างเฟรมอย่างชัดเจน เครือข่ายปฏิปักษ์กำเนิด [8] เป็นอีกแนวทางหนึ่งสำหรับการทำนายเชิงพื้นที่ มีการเสนอวิธีการเข้ารหัสอัตโนมัติแบบแปรผันตามเงื่อนไขใน [9] โดยสร้างวิถีมนุษย์ในอนาคตโดยกำหนดเงื่อนไขจากการสังเกตครั้งก่อนและการกระทำของหุ่นยนต์ในอนาคต วิธีการทำนาย [8,9] มีจุดมุ่งหมายเพื่อสร้างเฟรมที่เบลอน้อยลง แต่ประสิทธิภาพของมันขึ้นอยู่กับกระบวนการฝึกอบรมที่ไม่เสถียรอย่างมีนัยสำคัญ
มีการเสนอกลไกการเอาใจใส่ตนเองใน [27] ซึ่งสามารถนำไปใช้เพื่อจับภาพการพึ่งพาระยะยาวและได้รับการพิสูจน์แล้วว่ามีประสิทธิภาพในการรวมคุณลักษณะเด่นในทุกตำแหน่งเชิงพื้นที่ในงานวิชันซิสเต็ม [28–30] มีการเสนอบล็อกความสนใจสองครั้งใน [28] ซึ่งรวมคุณลักษณะของพื้นที่ทั้งหมดไว้ในชุดขนาดกะทัดรัด จากนั้นจึงเลือกและจัดสรรคุณลักษณะให้กับแต่ละสถานที่อย่างปรับเปลี่ยนได้ เพื่อที่จะใช้ประโยชน์จากข้อมูลตามบริบทได้อย่างมีประสิทธิภาพมากขึ้น เครือข่ายแบบกากบาท [29] ได้แนะนำโมดูลความสนใจแบบไขว้กันเพื่อรับข้อมูลตามบริบทของพิกเซลทั้งหมด ซึ่งจะเป็นประโยชน์สำหรับปัญหาการทำความเข้าใจด้วยภาพ นอกจากนี้ ไม่เหมือนวิธีการฟิวชั่นคุณสมบัติหลายสเกล เครือข่ายความสนใจแบบคู่ [30] ได้รับการเสนอให้รวมคุณลักษณะในพื้นที่กับการพึ่งพาทั่วโลกที่ปรับเปลี่ยนได้ อย่างไรก็ตาม ไม่สามารถใช้เพื่อจัดการกับงานการคาดคะเนเนื่องจากขาดการพึ่งพา spatiotemporal
โดยสรุป แบบจำลองการคาดการณ์ก่อนหน้านี้มีข้อเสียต่างกัน แตกต่างจากงานก่อนหน้านี้ เราออกแบบตัวแปรใหม่ของ ConvLSTM [5] เพื่อจัดเก็บการแสดงแทนสถานะและขยายกลไกความสนใจในงานของการคาดคะเน spatiotemporal สถาปัตยกรรมนี้รวบรวมความสัมพันธ์เชิงบริบทที่หลากหลายเพื่อการนำเสนอคุณลักษณะที่ดีขึ้นด้วยความกะทัดรัดภายในคลาส
ตารางที่ 1 แสดงคำย่อที่ใช้ในบทความพร้อมคำจำกัดความของแนวคิด

3. โครงข่ายประสาท DMA
ผังงานของ DMANet แสดงในรูปที่ 1 การแสดงจะถูกดึงออกมาจาก DMANet ที่กำหนดเฟรมอินพุต การแสดงข้อมูลแสดงถึงผลการทำนายและสามารถใช้เพื่อทำนายการแสดงครั้งต่อไปได้

ในส่วนนี้จะให้รายละเอียดของ DMANet ประการแรก มีการแนะนำหน่วย DMLSTM ใหม่ในส่วนที่ 3.1 หลังจากนั้น มีการเสนอกลไกการเอาใจใส่แบบคู่ในหัวข้อ 3.2 ซึ่งช่วยให้แบบจำลองสามารถได้รับประโยชน์จากการนำเสนอที่เกี่ยวข้องก่อนหน้านี้ ในที่สุด พวกมันจะถูกรวมเข้าด้วยกันเพื่อสร้าง DMANet สำหรับการทำนาย spatiotemporal ซึ่งมีรายละเอียดอยู่ในส่วนที่ 3.3
3.1.หน่วยความจำคู่LSTM
ได้รับการตรัสรู้โดย PredRNN plus plus [7] ซึ่งเพิ่มเลเยอร์ที่ไม่เป็นเชิงเส้นมากขึ้นเพื่อเพิ่มความลึกของเครือข่ายและเสริมสร้างความสามารถในการสร้างแบบจำลองสำหรับความสัมพันธ์เชิงพื้นที่และการเปลี่ยนแปลงชั่วคราว อย่างไรก็ตาม ปัญหาของการขยายพันธุ์แบบเกรเดียนท์เริ่มยากขึ้นเรื่อยๆ ด้วยการเพิ่มความลึกของเครือข่าย แม้ว่า GHU [7] จะบรรเทาได้ในระดับที่จำกัด งานบางอย่าง[6,7,14] ทำงานได้ไม่ดีในการแยกการแสดงของลำดับ spatiotemporal ในการเปลี่ยนเกตที่มากเกินไป เนื่องจากอาจทำให้สูญเสียการแสดงแทนอย่างหลีกเลี่ยงไม่ได้ ดังนั้น การขึ้นต่อกันเชิงพื้นที่ระยะยาวสามารถจับได้ด้วยเลเยอร์การบิดแบบซ้อน อย่างไรก็ตาม ประสิทธิผลของความสามารถในการสร้างแบบจำลองสำหรับไดนามิกเชิงพื้นที่นั้นถูกจำกัดเนื่องจากการเปลี่ยนผ่านระดับชั้นที่สลับซับซ้อน
หน่วยที่เกิดซ้ำใหม่ที่ชื่อว่า DMLSTM ได้รับการพัฒนาขึ้นเพื่อทำการคาดคะเน spatiotemporal เพื่อเอาชนะข้อจำกัดที่กล่าวถึงข้างต้น ดังแสดงในรูปที่ 2 ประการแรก มีการเพิ่มหน่วยหน่วยความจำเพิ่มเติมตาม ConvLSTM[5]; หน่วยนี้ใช้เพื่อเก็บสถานะเชิงพื้นที่ ซึ่งช่วยให้หน่วยเรียนรู้การแทนค่าเชิงพื้นที่เพิ่มเติม กลไกการเปลี่ยนผ่านแบบใหม่นี้ได้รับการออกแบบโดยการละทิ้งโครงสร้างเกทที่ซ้ำซ้อน เช่น ประตูอินพุต โครงสร้างที่ไม่เป็นเชิงเส้นต่างๆ จะสูญเสียการแสดงข้อมูลภายในที่มีประสิทธิภาพในการทำนายระดับพิกเซล ในทางกลับกัน การแสดงความแตกต่างของการดำเนินการได้ถูกนำมาใช้อย่างมีประสิทธิภาพเพื่อจับภาพการเป็นตัวแทนของวัตถุที่กำลังเคลื่อนที่ ดังนั้น ความแตกต่างสามารถใช้สำหรับงานทำนายเพื่อเสริมรายละเอียดการเป็นตัวแทนของวัตถุที่เคลื่อนไหว ในหน่วย DMLSTM การดำเนินการสร้างความแตกต่างได้รับการพัฒนาเพื่อให้ได้ภาพการเคลื่อนไหวโดยแยกสถานะที่ซ่อนอยู่ที่อยู่ติดกันหรือภาพดิบ ซึ่งทำให้หน่วยมีความสามารถในการสร้างแบบจำลองที่มีประสิทธิภาพมากขึ้นสำหรับไดนามิกเชิงพื้นที่

3.2. กลไกการเอาใจใส่แบบคู่
การทำนายแบบ Spatiotemporal สามารถทำนายเฟรมในอนาคตได้โดยการสังเกตการแทนค่าก่อนหน้า อย่างไรก็ตาม แบบจำลองการคาดการณ์ควรเน้นที่การนำเสนอทางประวัติศาสตร์ที่เกี่ยวข้องกับเนื้อหาที่คาดการณ์มากขึ้น กลไกการเอาใจใส่ [27] สามารถจับการพึ่งพาระยะยาวระหว่างการแสดงแทนระดับท้องถิ่นและระดับโลกในงานเชิงปฏิบัติบางอย่าง [32,33] นอกจากนี้ การคาดคะเน spatiotemporal เป็นสิ่งที่ท้าทายเนื่องจากการเปลี่ยนแปลงที่ซับซ้อนและการเปลี่ยนแปลงลักษณะที่ปรากฏ ซึ่งจำเป็นต้องมีการพึ่งพาทั้งโดเมนชั่วคราวและเชิงพื้นที่ มีการเสนอรูปแบบใหม่ของกลไกความสนใจที่มีชื่อว่ากลไกความสนใจแบบคู่ สถาปัตยกรรมนี้รวบรวมปฏิสัมพันธ์เชิงพื้นที่ระยะยาวจากมิติเวลาและมิติเชิงพื้นที่ ตามลำดับ จากนั้นการแทนค่าที่ได้รับจะถูกรวมสำหรับการทำนายในอนาคต

cistanche สำหรับขายในความทรงจำ
โมดูลความสนใจแบบคู่แสดงในรูปที่ 3 รวมถึงสถานะการประทับเวลาปัจจุบันที่ซ่อนอยู่ Ht ∈ RH × W × C และในอดีต {H1 . . Ht-1} ∈ Rn × H × W × C โดยที่ H และ W เป็นขนาดเชิงพื้นที่ C คือจำนวนช่องสัญญาณ และ n หมายถึงจำนวนการแทนค่าที่ซ่อนอยู่ซึ่งต่อกันตามมิติเวลาตามลำดับ

4. บทสรุป
มีการเสนอ DMANet สำหรับการทำนาย spatiotemporal ในบทความนี้ หน่วย DML-STM ใช้เพื่อแยกการแสดงภาพอย่างมีประสิทธิภาพโดยใช้ประโยชน์จากการดำเนินการที่แตกต่างกันระหว่างภาพที่ต่อเนื่องกันและใช้กลไกการเปลี่ยนหน่วยความจำคู่ กลไกการเอาใจใส่แบบคู่ได้รับการออกแบบมาเพื่อจับภาพการพึ่งพาเชิงพื้นที่ในระยะยาวโดยการคำนวณความสัมพันธ์ระหว่างการแสดงแทนที่ซ่อนอยู่ในปัจจุบันและการเป็นตัวแทนที่ซ่อนทางประวัติศาสตร์จากมิติชั่วคราวและเชิงพื้นที่ตามลำดับ DMANet ผสมผสานทั้งข้อดีและการออกแบบสถาปัตยกรรมดังกล่าวช่วยให้โมเดลมีพลังการสร้างแบบจำลองมากขึ้นสำหรับไดนามิกในระยะสั้นและการนำเสนอตามบริบทในระยะยาว ผลการทดลองแสดงให้เห็นว่าวิธีการของเรามีประสิทธิภาพที่ยอดเยี่ยมในการทำนายระยะห่าง

หาซื้อได้ที่ไหน cistanche ในหน่วยความจำ
การทำนาย Spatiotemporal เป็นหนทางที่มีแนวโน้มสำหรับการเรียนรู้ด้วยตนเองของสหสัมพันธ์ spatiotemporal ที่หลากหลาย สำหรับงานในอนาคต เราจะศึกษาวิธีแยกวัตถุที่เคลื่อนไหวออกจากพื้นหลังและให้ความสำคัญกับวัตถุที่เคลื่อนไหวมากขึ้น เราจะพยายามสร้างระบบการหล่อความต้านทานที่เห็นได้ชัดในตอนนี้เพื่อปกป้องถ้ำจีนจากน้ำ
อ้างอิง
1. เหยา Y.; แอตกินส์ อี.; จอห์นสัน-โรเบอร์สัน, ม.; Vasudevan, R.; Du, X. Bitrap: การทำนายเส้นทางเดินรถแบบสองทิศทางพร้อมการประมาณเป้าหมายหลายแบบ หุ่นยนต์ IEEE ออโตม. เลตต์. 2564, 2, 1463–1470. [ข้ามอ้างอิง]
2. เพลง Z.; ซุยเอช.; Li, H. วิธีการตรวจจับวัตถุแบบลำดับชั้นในภาพถ่ายดาวเทียมตรวจจับระยะไกลแบบออปติคัลขนาดใหญ่โดยใช้การตรวจจับความโดดเด่นและ CNN อินเตอร์ J. Remote Sens. 2021, 42, 2827–2847. [ข้ามอ้างอิง]
3. Li, Y.; ไค, วาย.; หลี่ เจ.; แลง, เอส.; Zhang, X. เครือข่ายความสามัคคีแบบ Spatio-temporal สำหรับการตรวจจับความผิดปกติของวิดีโอ การเข้าถึง IEEE 2019, 1, 172425–172432 [ข้ามอ้างอิง]
4. Yurtsever, E.; แลมเบิร์ต เจ.; Carballo, A.; Takeda, K. การสำรวจการขับขี่อัตโนมัติ: แนวปฏิบัติทั่วไปและเทคโนโลยีที่เกิดขึ้นใหม่ การเข้าถึง IEEE 2020, 8, 58443–58469 [ข้ามอ้างอิง]
5. ชิ, X.; เฉิน Z .; วัง H.; Yeung เครือข่าย DY Convolutional LSTM: วิธีการเรียนรู้ของเครื่องสำหรับการตกตะกอนตอนนี้ ในการดำเนินการประชุมครั้งที่ 29 เกี่ยวกับระบบประมวลผลข้อมูลประสาท, มอนทรีออล, ควิเบก, แคนาดา, 7–12 มิถุนายน 2015; หน้า 802–810.
6. วัง Y.; หลี่, ม.; วังเจ .; เกา Z.; Yu, P. PredRNN: โครงข่ายประสาทที่เกิดซ้ำสำหรับการเรียนรู้เชิงทำนายโดยใช้ LSTM แบบ spatiotemporal ในการดำเนินการประชุมครั้งที่ 31 เกี่ยวกับระบบประมวลผลข้อมูลประสาท, ลองบีช, บริติชโคลัมเบีย, แคนาดา, 4–9 ธันวาคม 2017; หน้า 879–888.
7. วัง Y.; เกา Z.; ยาว, ม.; วังเจ .; Yu, P. PredRNN plus plus : สู่การแก้ปัญหาที่กลืนไม่เข้าคายไม่ออกในเชิงลึกของเวลาในการเรียนรู้เชิงพยากรณ์เชิงพื้นที่ ในการดำเนินการของการประชุมนานาชาติครั้งที่ 35 ว่าด้วยการเรียนรู้ของเครื่อง สตอกโฮล์ม สวีเดน วันที่ 10–15 เมษายน 2019; หน้า 5123–5132.
8. Goodfellow, IJ; Pouget-Abadie, เจ.; มีร์ซา, ม.; ซู, บี.; Warde-Farley, D. เครือข่ายฝ่ายตรงข้ามกำเนิด ในการดำเนินการประชุมครั้งที่ 28 เกี่ยวกับระบบประมวลผลข้อมูลประสาท, มอนทรีออล, ควิเบก, แคนาดา, 8–13 ธันวาคม 2014; น. 2672–2680.
9. อิวาโนวิช บี.; กะเหรี่ยง L.; เอ็ดเวิร์ดเอส.; Pavone, M. แบบจำลองเชิงลึกเชิงลึกหลายรูปแบบสำหรับการทำนายวิถี: วิธีการเข้ารหัสอัตโนมัติแบบแปรผันตามเงื่อนไข หุ่นยนต์ IEEE ออโตม. เลตต์. 2021, 2, 295–302. [ข้ามอ้างอิง]
10. Rumelhart, D.; ฮินตัน, จี.; วิลเลียมส์ อาร์. การเรียนรู้การแทนด้วยข้อผิดพลาดในการเผยแพร่ย้อนหลัง ธรรมชาติ 2529, 1, 533–536. [ข้ามอ้างอิง]
11. Hochreiter, S.; Schmidhuber, J. ความจำระยะสั้นระยะยาว. คอมพิวเตอร์ประสาท. 1997, 8, 1735–1780. [ข้ามอ้างอิง]
12. ซัทสเคเวอร์ ฉัน.; Vinyals, O.; Le, Q. Sequence เพื่อจัดลำดับการเรียนรู้ด้วยโครงข่ายประสาทเทียม In Proceedings of the Advances in Neural Information Processing Systems, Montreal, QC, Canada, 8-13 ธันวาคม 2014; น. 3104–3112.
13. Das, M .; Ghosh, S. ชุดการคาดการณ์ตามการเรียนรู้เชิงลึกเพื่อทำนายข้อมูลที่ขาดหายไปสำหรับการวิเคราะห์การสำรวจระยะไกล IEEE เจ. เซล. สูงสุด. แอปพลิเค สังเกตการณ์โลก Remote Sens. 2017, 12, 5228–5236. [ข้ามอ้างอิง]
14. Oliu, M.; เซลวา เจ.; Escalera, S. พับโครงข่ายประสาทเทียมซ้ำสำหรับการทำนายวิดีโอในอนาคต ในการประชุม European Conference on Computer Vision ครั้งที่ 15 เมืองมิวนิก ประเทศเยอรมนี วันที่ 8-14 ธันวาคม 2561 น. 716–731.
15. เส็ง ด.; จาง Q.; จาง X.; เฉิน, จี.; Chen, X. การทำนายคุณภาพอากาศแบบ Spatiotemporal ตามโครงข่ายประสาทเทียม LSTM อเล็กซ์. อังกฤษ จ. 2021, 60, 2021–2032. [ข้ามอ้างอิง]
16. อาเบด, ก.; รามินทร์ คิว; Abed, A. การคาดคะเนการเกิดเปลวสุริยะโดยอัตโนมัติจากภาพ SDO โดยใช้การเรียนรู้เชิงลึก โฆษณา ความละเอียดของพื้นที่ 2564, 67, 2544–2557. [ข้ามอ้างอิง]
17. หลี่เอส.; ฝาง เจ.; Xu, H .; Xue, J. การทำนายเฟรมวิดีโอโดยเครือข่ายมาสก์หลายสาขาลึก IEEE ทรานส์ ระบบวงจร เทคโนโลยีวิดีโอ 2020, 4, 1–12. [ข้ามอ้างอิง]
18. วัง Y.; จางเจ.; จู, เอช.; ยาว, ม.; วังเจ .; Yu, P. Memory in memory: โครงข่ายประสาททำนายสำหรับการเรียนรู้ลำดับที่สูงกว่าที่ไม่คงที่จากพลวัตเชิงพื้นที่ ในการดำเนินการของการประชุม IEEE เกี่ยวกับการมองเห็นคอมพิวเตอร์และการจดจำรูปแบบ, ลองบีช, บริติชโคลัมเบีย, แคนาดา, 16–20 มิถุนายน 2020; หน้า 9146–9154
19. เฉิน X.; Xu, C .; ยาง X.; ยาง X.; เต๋า, ดี. การทำนายวิดีโอระยะยาวผ่านการวิพากษ์วิจารณ์และการหวนกลับ IEEE ทรานส์ กระบวนการสร้างภาพ 2020, 29, 7090–7103. [ข้ามอ้างอิง]
20. เนด้า อี.; Reza, F. AptaNet เป็นแนวทางการเรียนรู้เชิงลึกสำหรับการทำนายปฏิสัมพันธ์ระหว่าง aptamer-protein วิทย์. อีกครั้ง. 2021, 11, 6074–6093.
21. เชน บี.; Ge, Z. ระบบไดนามิกแบบไม่เชิงเส้นแบบถ่วงน้ำหนักสำหรับการสกัดเชิงลึกของตัวแปรแฝงแบบไดนามิกที่ไม่เป็นเชิงเส้นและการประยุกต์ใช้ในอุตสาหกรรม IEEE ทรานส์ อ.แจ้ง. 2021, 5, 3090–3098. [ข้ามอ้างอิง]
22. โจวเจ.; ได, เอช.; วัง H.; Wang, T. โมเดลที่มีความสนใจกว้างและซับซ้อนสำหรับการคาดการณ์การไหลของการจราจรในระบบไซเบอร์ - กายภาพการคมนาคมขนส่ง IEEE ทรานส์ อ.แจ้ง. 2564, 17, 3431–3440. [ข้ามอ้างอิง]
23. Patil, K.; Deo, M. การทำนายระดับลุ่มน้ำของอุณหภูมิผิวน้ำทะเลด้วยโครงข่ายประสาทเทียม เจ. แอตมอส. มหาสมุทร. เทคโนโลยี 2018, 7, 1441–1455. [ข้ามอ้างอิง]
24. อมตะ, เอฟ.; กีนาร์ด, เอฟ.; โรเบิร์ตเอส.; Kanevski, M. เฟรมเวิร์กใหม่สำหรับการทำนายข้อมูลสิ่งแวดล้อมเชิงพื้นที่ชั่วคราวโดยใช้การเรียนรู้เชิงลึก วิทย์. ตัวแทน. 2020, 10, 22243–22254. [ข้ามอ้างอิง]
25. ยัน เจ.; ฉิน, จี.; จ้าวอาร์.; เหลียง, วาย.; Xu, Q. Mixpred: การคาดคะเนวิดีโอที่เหนือกว่าโฟลว์ออปติคัล IEEE Access 2019, 1, 185654–185665. [ข้ามอ้างอิง]
26. วัง Y.; เจียงแอล.; ยาง, ม.; หลี่, แอล.; ยาว, ม.; Li, F. Eidetic 3D LSTM: แบบจำลองสำหรับการคาดคะเนวิดีโอและอื่นๆ ใน Proceedings of the International Conference on Learning Representations, New Orleans, LA, USA, 6–9 พฤษภาคม 2019; หน้า 1–14.
27. Vaswani, A.; Shazier, N.; ปาร์มาร์, N.; Uszkoreit, J.; Jones, L. ความสนใจคือสิ่งที่คุณต้องการ ในการดำเนินการประชุมครั้งที่ 31 เกี่ยวกับระบบประมวลผลข้อมูลประสาท, ลองบีช, บริติชโคลัมเบีย, แคนาดา, 4–9 ธันวาคม 2017; หน้า 5998–6008
28. เฉิน วาย.; Kalantidis, Y.; หลี่ เจ.; Feng, J. A2 nets: เครือข่ายความสนใจสองเท่า ในการดำเนินการประชุมครั้งที่ 32 เกี่ยวกับระบบประมวลผลข้อมูลประสาท, มอนทรีออล, ควิเบก, แคนาดา, 2–8 ธันวาคม 2018; น. 352–361.
29. หวง Z.; วัง X .; เหว่ย Y.; หวาง, L.; Shi, H. Ccnet: ความสนใจแบบกากบาทสำหรับการแบ่งส่วนความหมาย IEEE ทรานส์ แบบก้น. มัค อินเทล 2020, 1, 1–11. [ข้ามอ้างอิง]
30. ฟู เจ.; หลิว เจ.; เทียน, เอช.; Li, Y. เครือข่ายความสนใจแบบคู่สำหรับการแบ่งส่วนฉาก ในการดำเนินการของการประชุม IEEE เกี่ยวกับการมองเห็นคอมพิวเตอร์และการจดจำรูปแบบ, ลองบีช, บริติชโคลัมเบีย, แคนาดา, 16–20 มิถุนายน 2019; หน้า 3146–3154
31. วัง Z.; Bovik, A.; Sheikh, H. การประเมินคุณภาพของภาพ: จากการมองเห็นข้อผิดพลาดไปจนถึงความคล้ายคลึงกันของโครงสร้าง IEEE ทรานส์ กระบวนการสร้างภาพ 2547, 4, 600–612. [ข้ามอ้างอิง]
32. หลิว คิว; ลูเอส.; Lan, L. Yolov3 เครื่องตรวจจับใบหน้าแบบสนใจที่มีความแม่นยำสูงและมีประสิทธิภาพสูง คอมพ์ ระบบ วิทย์. อังกฤษ 2021, 37, 283–295.
33. หลี่ X.; Xu, F.; Xin, L. เครือข่ายการแบ่งส่วนความหมายของฟิวชั่นลึกความสนใจแบบคู่ของภาพการสำรวจระยะไกลผ่านดาวเทียมขนาดใหญ่ อินเตอร์ J. Remote Sens. 2021, 42, 3583–3610. [ข้ามอ้างอิง]
34. Srivastava, N.; Mansimov, E.; Salakhutdinov, R. การเรียนรู้การแสดงวิดีโอโดยใช้ LSTM โดยไม่ได้รับการดูแล ในการดำเนินการประชุมนานาชาติครั้งที่ 32 ว่าด้วยการเรียนรู้ของเครื่อง ลีลล์ ประเทศฝรั่งเศส วันที่ 6-11 มิถุนายน 2015; น. 843–852.
35. Geiger, A.; Lenz, P.; สติลเลอร์, C.; Urtasun, R. Vision พบกับวิทยาการหุ่นยนต์: ชุดข้อมูล KITTI อินเตอร์ เจ โรบอท. ความละเอียด 2013, 32, 1231–1237. [ข้ามอ้างอิง]
36. ดอลลาร์, ป.; Wojek, C.; Schiele, บี.; Perona, P. การตรวจจับคนเดินเท้า: เกณฑ์มาตรฐาน ในการดำเนินการของการประชุม IEEE Conference on Computer Vision and Pattern Recognition, Miami, FL, USA, 20–25 มิถุนายน 2552; หน้า 304–311.
37. หลิว เจ.; จิน, บี.; หยาง เจ.; Xu, L. การทำนายอุณหภูมิพื้นผิวทะเลโดยใช้การประมาณค่าลูกบาศก์ B-spline และกลไกการเอาใจใส่เชิงพื้นที่ รีโมทเซนส์. 2564, 12, 12478–12487. [ข้ามอ้างอิง]






