การรู้จำภาษามืออย่างต่อเนื่องเชิงพื้นที่และชั่วคราวโดยใช้เครือข่ายคุณสมบัติหลากหลายที่เอาใจใส่(2)
Jun 01, 2023
3.5. การเรียนรู้ลำดับ
Sequence Learning หลังจากได้ผลลัพธ์จากตัวแยกคุณลักษณะเชิงพื้นที่และเชิงเวลาในรูปแบบของคุณลักษณะเงาแล้ว เราจำเป็นต้องจัดเรียงให้เป็นประโยคที่สมบูรณ์ ดังนั้นเราจึงจำเป็นต้องใช้การเรียนรู้ตามลำดับเพื่อให้แน่ใจว่ามีการจัดการความเงาเพื่อสร้างประโยคที่ดี วิธีการที่แพร่หลายที่สุดในการวิจัยปัจจุบันหมายถึง Bidirectional Long Short Term Memory (Bi-LSTM) และ Connectionist temporal allocation (CTC) [17,23] สำหรับปัญหาที่สามารถแก้ไขได้โดยใช้ CTC และงานล่าสุดหลายชิ้น [17,23] เสนอ CTC เป็นกระบวนการฝึกอบรมแบบ end-to-end สำหรับ CSLR

ผงสกัด Cistanche
คลิกที่นี่เพื่อดูผลิตภัณฑ์ Cistanche
【สอบถามเพิ่มเติม】 อีเมล:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Long short-term memory (LSTM) [44] เป็นอีกรูปแบบหนึ่งของ recurrent neural network (RNN) และมีการใช้กันอย่างแพร่หลายในการสร้างแบบจำลองลำดับ LSTM สร้างแบบจำลองการพึ่งพาระยะยาวอย่างดีเยี่ยม มันสามารถประมวลผลลำดับทั้งหมดของอินพุตและใช้สถานะภายในเพื่อจำลองการเปลี่ยนสถานะ อย่างไรก็ตาม ข้อบกพร่องของ RNN ไปข้างหน้าเหล่านี้คือสถานะที่ซ่อนอยู่นั้นเรียนรู้จากทิศทางเดียวเท่านั้น RNN สร้างสถานะที่ซ่อนอยู่ตามที่อธิบายไว้ในสมการด้านล่างหลังจากได้รับลำดับคุณลักษณะเป็นอินพุต
ht=RNN(ht−1,ot),
โดยที่ ht แสดงถึงสถานะที่ซ่อนอยู่ โดยที่สถานะเริ่มต้น h0 คือเวกเตอร์ศูนย์ทั้งหมดคงที่ และ t คือขั้นตอนเวลา RNN ใช้เพื่อทำนายความเงาของเครื่องหมายตามการป้อนข้อมูลลำดับคุณลักษณะเชิงพื้นที่
นอกจากนี้ งาน SL ค่อนข้างซับซ้อน ดังนั้นจึงไม่เพียงต้องการคุณสมบัติที่ได้รับจากบริบททางเดียว แต่ยังต้องการความช่วยเหลือในการใช้ข้อมูลสองทางเพื่อเรียนรู้การเกิดขึ้นของคำที่อยู่ก่อนและหลังคำอื่นๆ ในประโยค ดังนั้นเราจึงใช้ Bi-LSTM [45] เพื่อเรียนรู้การพึ่งพาไดนามิกที่ซับซ้อนของลำดับภาพโดยการแปลงโดยใช้การแสดงเชิงพื้นที่และเชิงเวลาเป็นลำดับของคุณสมบัติเงา ตามคำอธิบายที่ระบุไว้ก่อนหน้านี้ วิธี Bi-LSTM สามารถทำงานสองทางด้วยวิธี LSTM ซึ่งหมายความว่าวิธี Bi-LSTM สามารถจำแนกข้อมูลตามลำดับได้ดีขึ้น การคำนวณ Bi-LSTM ที่ใช้สถานะซ่อนเร้นแบบสองทางสามารถมองได้ว่าเป็นการคำนวณซ้ำของ LSTM ที่ประมวลผลจากด้านหน้าไปด้านหลังและจากด้านหลังไปด้านหน้า หลังจากนั้น สถานะที่ซ่อนอยู่ของแต่ละขั้นตอนจะถูกส่งผ่านเลเยอร์ที่เชื่อมต่ออย่างสมบูรณ์และเลเยอร์ซอฟต์แม็กซ์ [17]

ผงซิสแตนช์
ที่=W(ht บวก b)
yt,j=e at,j ∑ke at,j ,
โดยที่ b เป็นเวกเตอร์อคติและ y(t,j) แสดงถึงความน่าจะเป็นของป้ายกำกับ j ที่ขั้นตอนเวลา t ในงาน TSL ของเรา label j คือคำศัพท์ที่ได้จากประโยค ในทางปฏิบัติ Bi-LSTM ช่วยปรับปรุงจำนวนข้อมูลที่เครือข่ายสามารถเข้าถึงได้อย่างมีนัยสำคัญ ซึ่งจะปรับปรุงบริบทของข้อมูลที่มีอยู่ในอัลกอริทึม ข้อมูลประกอบด้วยความรู้ของคำที่มาหลังหรือก่อนเฟรมปัจจุบันในการป้อนลำดับคุณลักษณะของประโยค
Bi-LSTM ส่งสถานะที่ซ่อนอยู่เป็นเอาต์พุตไปยังเลเยอร์ CTC สำหรับแต่ละขั้นตอน เนื่องจากผลลัพธ์ของ Bi-LSTM นี้ไม่ได้สนใจการจัดเรียงเงา เราจึงใช้ CTC เพื่อจัดการการแมปลำดับวิดีโอ o={ot} T 0 t=1 เพื่อสร้างสัญญาณ ลำดับความเงา `={` i} IL =1 (L น้อยกว่าหรือเท่ากับ T) ด้วยการจัดที่ดีกว่า CTC ถูกใช้ในหลายสาขา รวมถึงการรู้จำลายมือ [46] การรู้จำเสียงพูด [47] และการรู้จำภาษามือ [17,23] ในโดเมนนี้ ใช้เป็นฟังก์ชันให้คะแนนโดยไม่ต้องจัดลำดับอินพุตและเอาต์พุต ใน CSLR CTC เรียกว่าโมดูลที่พัฒนาขึ้นสำหรับงานแบบครบวงจรที่เกี่ยวข้องกับการจัดประเภทของข้อมูลชั่วคราวโดยไม่มีการแบ่งส่วน ด้วยการเขียนโปรแกรมแบบไดนามิก CSLR สามารถแก้ปัญหาการจัดตำแหน่งโดยการสร้างป้ายกำกับว่าง (-) ซึ่งอนุญาตให้ระบบสร้างผลลัพธ์ที่ดีที่สุดสำหรับการแสดงข้อมูลที่ไม่มีป้ายกำกับ (เช่น ข้อมูล epenthesis และส่วนของข้อมูลที่ไม่ใช่รูปแบบลายเส้น) โดยเฉพาะอย่างยิ่ง CTC สร้างป้ายกำกับว่าง "-" เพื่อขยายคำศัพท์ V โดยที่ V=Vorigin ∪ {-} จุดประสงค์ของป้ายกำกับเปล่านี้คือเพื่อแสดงถึงการเปลี่ยนแปลงและเพื่อแจ้งให้ทราบถึงการมีอยู่ของเงาเปล่าที่ไม่ได้ให้ข้อมูลสำหรับกระบวนการเรียนรู้ เช่น π={πt} T 0 t{{20 }} โดยที่ πt ∈ V ส่งผลให้ CTC สามารถจัดการพารามิเตอร์เอาต์พุตจากตัวแยกคุณลักษณะเชิงพื้นที่และเชิงเวลา และ Bi-LSTM เป็นโมดูลการจัดตำแหน่งโดยการสรุปความน่าจะเป็นของเส้นทางที่เป็นไปได้ทั้งหมด เส้นทางการจัดตำแหน่งทั้งหมด π มีความน่าจะเป็นที่กำหนดลำดับอินพุตดังนี้ [17]:

การทดลอง Cistanche Deserticola
p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, พาย
ในขั้นตอนถัดไป เรากำหนดการดำเนินการแมปแบบกลุ่มต่อหนึ่ง B ซึ่งจะลบช่องว่างและคำที่ซ้ำกันออกจากเส้นทางการจัดตำแหน่ง ตัวอย่างเช่น B (II-am- -a- -doctor)=I, am, a, doctor ด้วยเหตุนี้ เราสามารถคำนวณความน่าจะเป็นแบบมีเงื่อนไขของลำดับความเงาของเครื่องหมาย l เป็นผลรวมของความน่าจะเป็นของเส้นทางทั้งหมดที่สามารถจับคู่กับ l จาก B ด้วยวิธีที่อธิบายไว้ด้านล่าง [17]:
p(π|o) = ∑ π∈B−1 p(π|o)
โดยที่ B −1 (l)={π|B(π)=l} คือการดำเนินการผกผันของ B ในที่สุด การสูญเสีย CTC ของลำดับคุณลักษณะถูกกำหนดดังนี้ [17]:
Lctc=− ln p(` |o)
ความน่าจะเป็นแบบมีเงื่อนไข p(π|X) สามารถคำนวณได้ตามสมมติฐานความเป็นอิสระแบบมีเงื่อนไข
4. ผลการทดลองและการอภิปราย

Cistanche อาหารเสริมใกล้ฉัน-ปรับปรุงหน่วยความจำ
ในส่วนนี้ เราจะอธิบายรายละเอียดของการทดสอบของเราด้วยการกำหนดค่าที่เสนอตามที่อธิบายไว้ในส่วนก่อนหน้า
4.1. ชุดข้อมูล
ในส่วนนี้ เราจะอธิบายชุดข้อมูลที่เราใช้ในระหว่างการทดสอบนี้ เราใช้ชุดข้อมูลสองชุด ชุดแรกคือชุดข้อมูล CSL [8,40,41] และชุดที่สองคือชุดข้อมูล RWTH-PHOENIX [33,39] ชุดข้อมูลทั้งสองนี้เป็นชุดข้อมูลภาษามือแบบต่อเนื่อง ซึ่งใช้ในการแปลท่าทางบางชุดเป็นประโยคเต็ม
4.1.1. ชุดข้อมูล CSL
ชุดข้อมูล CSL ถูกใช้โดยงานหลายชิ้น [8,40,41] ชุดข้อมูลนี้มีทั้งหมด 100 ประโยคและ 178 คำ ซึ่งมักใช้ในการสื่อสารในชีวิตประจำวัน ชุดข้อมูลนี้มี 5 คำโดยเฉลี่ยต่อประโยค แต่ละประโยคดำเนินการโดยผู้ลงนาม 50 คน 5 ครั้ง ดังนั้น จำนวนวิดีโอทั้งหมดคือ 25 รายการ000 ทำให้เป็นหนึ่งในชุดข้อมูลที่ใหญ่ที่สุด ในการฝึกโมเดล CSL ของเรา เราแบ่งชุดข้อมูลออกเป็นข้อมูลสำหรับการฝึกกับวิดีโอ 20,{11}} รายการ และสำหรับการทดสอบกับวิดีโอ 5,000 รายการที่มีประโยคเดียวกันแต่มีผู้ลงนามต่างกัน
4.1.2. ชุดข้อมูล RWTH-PHOENIX
ชุดข้อมูล RWTH-PHOENIX [33,39] เป็นชุดข้อมูลภาษามือเยอรมัน ซึ่งเป็นชุดบันทึกการออกอากาศสภาพอากาศสาธารณะจากสถานีโทรทัศน์ในเยอรมนี วิดีโอนี้ได้รับการประมวลผลเพื่อให้มีขนาด 210 × 260 มีประโยคต่างๆ 6841 ประโยคที่ลงนามโดยผู้ลงนามที่แตกต่างกัน 9 คน ผู้ลงนามทุกคนสวมเสื้อผ้าสีเข้มบนพื้นสีอ่อน โดยรวมแล้วมีคำทั้งหมด 1232 คำที่มีเงาประมาณ 80,{11}} คำ ชุดข้อมูลนี้แบ่งตามรูปแบบที่กำหนดไว้ล่วงหน้า ประกอบด้วยตัวอย่างการฝึกอบรม 5672 ตัวอย่าง การตรวจสอบความถูกต้อง/ตัวอย่างการพัฒนา 540 ตัวอย่าง และตัวอย่างทดสอบ 629 ตัวอย่าง
4.2. การประมวลผลข้อมูลล่วงหน้า
สิ่งแรกที่เราต้องทำคือประมวลผลชุดข้อมูลล่วงหน้าเพื่อให้พอดีกับโมเดลที่เราเสนอ เราทำการปรับขนาดและครอบตัดตามที่แสดงในรูปที่ 3; ทางด้านซ้าย เราจะเห็นว่าข้อมูลต้นฉบับมีขนาดที่ความละเอียดระดับ Full HD หรือ 1920 × 1080 เราจำเป็นต้องครอบตัดและปรับขนาดเป็นความละเอียด 224 × 224 เนื่องจากโมดูลเชิงพื้นที่ของเราได้รับอินพุตที่มีขนาดเท่ากับอินพุต ResNet50 หลังจากนั้น เราป้อนข้อมูลลงในแบบจำลองเชิงพื้นที่ของเรา ซึ่งจะสร้างเทนเซอร์ขนาด 7 × 7 จากภาพเดียว
จากนั้นจึงใช้ภาพฟูลเฟรมที่ประมวลผลล่วงหน้าเพื่อสร้างฟีเจอร์จุดสำคัญ เราใช้โมเดล HRNet เพื่อทำนายจุดสำคัญ 133 จุดจากภาพ RGB เหล่านี้ อย่างไรก็ตาม เราใช้เพียง 27 จุดสำคัญของร่างกายส่วนบนในแบบจำลองที่เราเสนอ ขนาดอินพุตสำหรับคุณลักษณะจุดสำคัญคือ 27 × 3 เนื่องจากเรามีข้อมูลพิกัด 3-แกน (x, y และ z) ต่อจุด ขนาดอินพุตของโมเดลคือ N × 224 × 224 × 3 สำหรับฟีเจอร์ฟูลเฟรม และ N × 1 × 27 × 3 สำหรับอินพุตคีย์พอยต์ โดยที่ N คือจำนวนเฟรม เพื่อปรับปรุงรูปแบบต่างๆ ของชุดข้อมูล เราทำตามส่วนเสริมจาก [12] รวมถึงการครอบตัดแบบสุ่ม การพลิกแนวนอน และการปรับขนาดชั่วคราวแบบสุ่ม การครอบตัดแบบสุ่มยังใช้เป็นส่วนหนึ่งของขั้นตอนการประมวลผลล่วงหน้าเพื่อครอบตัดรูปภาพต้นฉบับ

Cistanche อาหารเสริมใกล้ฉัน-ปรับปรุงหน่วยความจำ
4.3. เมตริกการประเมินผล
ในการประเมินประสิทธิภาพการรู้จำของแบบจำลองที่เราเสนอ เราใช้เมตริกอัตราความผิดพลาดของคำ (WER) ซึ่งเป็นเมตริกที่ใช้กันทั่วไปใน CSLR เพื่อประเมินความแม่นยำในการรู้จำของประโยคที่คาดคะเน ดังแสดงโดยสมการด้านล่าง [17]:
WER=S บวก I บวก DT=S บวก I บวก DS บวก C บวก D
โดยที่ S คือจำนวนการแทนที่คำเดิม I คือจำนวนการแทรกที่ไม่ได้อยู่ในประโยคเดิม D คือจำนวนการลบที่ควรอยู่ในประโยคเดิม C คือจำนวนคำที่ถูกต้องที่ตรงกัน ของประโยคเดิม และ T คือจำนวนคำทั้งหมดในประโยคหรือที่หาได้จากการแทน ลบ และแก้ไขคำทั้งหมด สำหรับ CSL อักขระแต่ละตัวจะใช้แทนคำ
4.4. การทดลองเกี่ยวกับ Input Stream
การทดลองนี้มุ่งเน้นไปที่การเปรียบเทียบอินพุตแบบสตรีมเดียวและหลายสตรีมบนโมเดลของเราเป็นหลัก จุดมุ่งหมายคือการค้นหาการกำหนดค่าที่ดีที่สุดของสตรีมอินพุต เราใช้เฉพาะชุดข้อมูล RWTH-PHOENIX ในการทดสอบนี้ โมเดลของเราจะได้รับอินพุตแยกกันสองอินพุต ฟูลเฟรมและอินพุตคีย์พอยต์ อินพุตสตรีมเดียวใช้เฉพาะคุณสมบัติ RGB จากภาพฟูลเฟรม มีการทดลองอินพุตสตรีมเดียวสองครั้ง ฟีเจอร์แรกใช้เฉพาะฟีเจอร์ฟูลเฟรมจากภาพ RGB และฟีเจอร์ที่สองใช้ฟีเจอร์คีย์พอยต์จากการป้อนข้อมูลคีย์พอยต์ อินพุตแบบหลายสตรีมที่เราเสนอประกอบด้วยคุณสมบัติ RGB และคีย์พอยต์ ผลการเปรียบเทียบโดยใช้สตรีมเดียวและหลายสตรีมแสดงในตารางที่ 1 ที่นี่ เราจะเห็นว่าการใช้ฟีเจอร์หลายสตรีมทำให้เราได้ผลลัพธ์ที่ดีกว่าการใช้สตรีมเดียว สตรีมหลักได้มาจากฟีเจอร์ RGB ฟูลเฟรม และสตรีมเพิ่มเติมใช้ฟีเจอร์คีย์พอยต์ สตรีมจุดสำคัญเพิ่มเติมช่วยให้โมเดลเรียนรู้ได้ดีขึ้น โดยเฉพาะอย่างยิ่งในการจับรายละเอียดของรูปทรงมือ
ตารางที่ 1. การเปรียบเทียบประสิทธิภาพของ WER โดยใช้อินพุตสตรีมเดี่ยวและอินพุตหลายสตรีม

4.5. การทดลองเกี่ยวกับ Attention Module
จุดมุ่งหมายของการทดลองนี้คือการเลือกการกำหนดค่าที่ดีที่สุดของโมดูลความสนใจ ในการทดสอบนี้ เราใช้การกำหนดค่าของผลลัพธ์ที่ดีที่สุดจากผลการทดสอบก่อนหน้าและชุดข้อมูลเดียวกัน เราแสดงความสนใจเชิงพื้นที่เป็นแบบจำลองโดยมีชั้นความสนใจในตัวเองอยู่ที่ส่วนท้ายของโมดูลเชิงพื้นที่สำหรับแต่ละคุณลักษณะ ความสนใจทางโลกในช่วงแรกคือชั้นความสนใจตนเองหลังจากการรวมทางโลกครั้งแรก และความสนใจทางโลกช่วงปลายคือชั้นความสนใจตนเองหลังจากการรวมทางโลกครั้งที่สอง ที่นี่เราจะเปรียบเทียบการกำหนดค่าทั้งหมดข้างต้นและการรวมกันของความสนใจเชิงพื้นที่และทางโลก ผลลัพธ์แสดงในตารางที่ 2 ผลลัพธ์ของความสนใจเชิงพื้นที่นั้นแย่กว่าความสนใจชั่วคราว ระดับเชิงพื้นที่มีลำดับคุณลักษณะสำหรับแต่ละเฟรม ตามที่กล่าวไว้ใน [20] เลเยอร์การเอาใจใส่ตนเองนั้นง่ายต่อการเรียนรู้เส้นทางที่สั้นกว่าระหว่างการพึ่งพาที่ยาวนาน ดังนั้นความสนใจเชิงพื้นที่จึงล้มเหลวในการลด WER เนื่องจากลำดับที่ยาว ในทางกลับกัน เราสามารถได้รับผลลัพธ์ที่ดีขึ้นโดยใช้ความสนใจชั่วคราวโดยวางไว้หลังการรวมเพื่อให้ได้ลำดับความยาวที่สั้นลง ความสนใจล่าช้าที่มีความยาวลำดับสั้นที่สุดจะได้ผลลัพธ์ที่ดีที่สุด นอกจากนี้ การรวมกันของโมดูลความสนใจในเชิงพื้นที่และชั่วคราวนั้นแย่กว่าการใช้ความสนใจเพียงอย่างเดียว จากผลลัพธ์เหล่านี้ เราใช้การกำหนดค่าที่ดีที่สุดสำหรับการทดสอบเป็นต้นไป
ตารางที่ 2 การเปรียบเทียบประสิทธิภาพของ WER โดยใช้การกำหนดค่าความสนใจที่แตกต่างกัน

4.6. การทดลอง Ablation บนเครือข่าย STAMF
นอกจากนี้ เราทำการทดสอบการระเหยโดยใช้ชุดข้อมูลเดียวกันและการกำหนดค่าที่ดีที่สุดของสตรีมอินพุตและโมดูลความสนใจ ตารางที่ 3 ในการทดลองโดยใช้ความสนใจชั่วขณะช่วงปลายโดยไม่มีการรวมเข้าด้วยกัน พิสูจน์ว่าความยาวของลำดับส่งผลต่อประสิทธิภาพความสนใจ การทดลองที่ใช้การรวมเลเยอร์ที่มีความยาวลำดับที่สั้นกว่าจะได้ผลลัพธ์ที่ดีกว่า นอกจากนี้เรายังทำการทดลองการระเหยเพื่อทราบประสิทธิภาพโดยใช้แบบจำลองต่างๆ สำหรับการเรียนรู้ตามลำดับ ผลลัพธ์ในตารางที่ 4 แสดงว่าการใช้ LSTM ซึ่งมีข้อมูลทางเดียวมีประสิทธิภาพต่ำกว่าการใช้ Bi-LSTM ซึ่งมีข้อมูลสองทาง
ตารางที่ 3. การเปรียบเทียบประสิทธิภาพของ WER โดยใช้การกำหนดค่าความสนใจชั่วคราวช่วงปลายที่แตกต่างกัน

ตารางที่ 4. การเปรียบเทียบประสิทธิภาพของ WER โดยใช้การกำหนดค่าการเรียนรู้ลำดับต่างๆ

4.7. การทดลองบนเครือข่าย STAMF
ในส่วนนี้ เราจะอธิบายกระบวนการฝึกอบรมทั้งหมดสำหรับแบบจำลองที่เราเสนอที่เรียกว่า spatiotemporal attentive multi-feature (STAMF) ซึ่งจะครอบคลุมถึงวิธีที่เราใส่ข้อมูลอินพุตลงในโมดูลเชิงพื้นที่ โมดูลชั่วคราว และโมดูลการเรียนรู้ตามลำดับทีละขั้นตอน ในส่วนนี้ เราใช้อินพุตแบบหลายสตรีมและการกำหนดค่าความสนใจชั่วขณะ
4.7.1. รายละเอียดการดำเนินการ
เราดำเนินการฝึกอบรมและทดสอบแบบ end-to-end โดยใช้อินพุตเฟรมที่มีขนาด 224 × 224 สำหรับตัวเพิ่มประสิทธิภาพ เราใช้ตัวเพิ่มประสิทธิภาพ Adam โดยมี 10−4 เป็นอัตราการเรียนรู้ และหารด้วย 2 ที่ยุค 10 และ 15 สำหรับ CSL และ ยุค 30, 40 และ 60 สำหรับ RWTH PHOENIX เรากำหนดขนาดแบทช์เป็น 4 และดำเนินการ 80 epochs สำหรับ RWTH-PHOENIX และ 20 epochs สำหรับ CSL การฝึกอบรมและการทดสอบดำเนินการบน NVIDIA Tesla V100 และ 128G RAM
ในตอนแรก เราแยกคุณสมบัติจากสตรีม RGB โดยใช้ ResNet50 และใช้ HRNet เพื่อรับคีย์พอยต์ จากนั้นแยกคุณสมบัติคีย์พอยต์โดยใช้ ResNet50 โปรดทราบว่าเรากำลังจัดการกับข้อมูลต่อเนื่องหรือวิดีโอ ดังนั้นเราจึงจำเป็นต้องกำหนดค่าขนาดอินพุตของเราตามความยาวของวิดีโอ ด้วยเหตุผลทางเทคนิค ขนาดอินพุตสำหรับข้อมูลทั้งหมดจำเป็นต้องเหมือนกัน ดังนั้น เราต้องทราบวิดีโอที่ยาวที่สุดในชุดข้อมูลของเรา จากนั้นจึงเสริมความยาวเฟรมอินพุตของเราให้ตรงกับหมายเลขเฟรมที่ใหญ่ที่สุด
คุณสมบัติที่แยกออกมาตามลำดับเหล่านี้ถูกใช้โดยโมดูลชั่วคราว แต่ละสตรีมตามลำดับผ่านการรวมชั่วคราวแบบซ้อนกันสองครั้ง การรวมเวลาชั่วคราวแต่ละครั้งประกอบด้วย 1-เครือข่ายเชิงมิติและชั้นการรวมสูงสุด ซึ่งลดความยาวของลำดับลงครึ่งหนึ่ง จากนั้นเอาต์พุตของการรวมชั่วคราวจากสตรีมทั้งสองจะถูกเชื่อมต่อกับชั้นความสนใจและสำหรับการรวมชั่วคราวครั้งล่าสุด หลังจากชั้นความสนใจ จะถูกเชื่อมต่อที่ส่วนท้ายเป็นเอาต์พุตโมดูลชั่วคราว
เอาต์พุตชั่วคราวถูกประมวลผลโดยโมดูลการเรียนรู้ตามลำดับ กระบวนการนี้ใช้เลเยอร์ Bi-LSTM ที่เชื่อมต่อกับ CTC เพื่อจัดแนวขั้นสุดท้ายและเรียบเรียงความเงาเป็นประโยคสุดท้าย
4.7.2. ผลลัพธ์เชิงปริมาณ
ประโยคสุดท้ายถูกนำไปเปรียบเทียบกับความจริงพื้นฐานเพื่อคำนวณคะแนน WER เป็นผลเชิงปริมาณ สำหรับ CSL เราแบ่งชุดข้อมูลออกเป็น 80 เปอร์เซ็นต์สำหรับข้อมูลการฝึก และ 20 เปอร์เซ็นต์สำหรับข้อมูลการทดสอบ ดังที่แสดงในตารางที่ 5 โมเดลหลายคุณสมบัติ (STMF) ที่เราเสนอโดยใช้ฟูลเฟรมและฟีเจอร์คีย์พอยต์สามารถให้ผลลัพธ์ที่ดีกว่า และลด WER ลงเหลือ 0.8 เมื่อเทียบกับรุ่นที่ใช้ฟีเจอร์ฟูลเฟรมเท่านั้น [23] ผลลัพธ์ที่ดีที่สุดของเราได้รับจากโมเดลหลายคุณลักษณะที่เสนอโดยใช้กลไกการให้ความสนใจ (STAMF) ซึ่งได้ 0.7 สำหรับ WER เลเยอร์ความสนใจยังคงปรับปรุงผลลัพธ์เล็กน้อย แม้ว่าชุดข้อมูล CSL จะไม่มีเฟรมที่บกพร่อง นี่เป็นข้อพิสูจน์ว่าชั้นความสนใจมีผลกระทบต่อตัวแบบ ตัวแบบหลายคุณลักษณะที่นำเสนอนั้นเหนือกว่าวิธีการที่ทันสมัย และชั้นความสนใจมีส่วนทำให้คะแนน WER ในชุดข้อมูล CSL ลดลง ประเด็นสำคัญเกี่ยวกับ CSL มีผลอย่างมากเนื่องจากสามารถให้ข้อมูลที่มีประสิทธิภาพเมื่อเทียบกับวิธีการแบบหลายคุณลักษณะอื่นๆ [17] ซึ่งใช้ท่าทางของมือ ใบหน้า และลำตัว
สำหรับชุดข้อมูล RWTH-PHOENIX เราใช้การกำหนดค่าเทียมเพื่อแยกข้อมูลการฝึกอบรมและการทดสอบ ชุดข้อมูลแบ่งออกเป็นวิดีโอตัวอย่าง 5672 รายการสำหรับการฝึกอบรม วิดีโอตัวอย่าง 540 รายการสำหรับการตรวจสอบตนเอง และวิดีโอตัวอย่าง 629 รายการสำหรับการทดสอบ ดังที่แสดงในตารางที่ 6 ผลลัพธ์ของแบบจำลองหลายคุณลักษณะ (STMF) ที่เราเสนอโดยใช้ฟูลเฟรมและคุณลักษณะจุดสำคัญมี WER 24 เปอร์เซ็นต์ และผลลัพธ์ที่ดีที่สุดของเราคือ 20.5 เปอร์เซ็นต์ ที่ได้มาจากแบบจำลองที่เสนอโดยใช้โมดูลความสนใจ (STAMF) ในผลการฝึก ผลการทดสอบดีที่สุดเป็นอันดับสองเมื่อเทียบกับ [17] เนื่องจากใช้คุณสมบัติเป็นอินพุตมากกว่า อย่างไรก็ตาม โมดูลความสนใจได้พิสูจน์แล้วว่ามีส่วนสำคัญในการลดคะแนน WER สำหรับชุดข้อมูล RWTHPHOENIX แตกต่างจากผลลัพธ์ของเราสำหรับชุดข้อมูล CSL แบบจำลองที่เรานำเสนอแบบหลายสตรีมไม่ได้ผลลัพธ์ที่เหมาะสมที่สุด เนื่องจากชุดข้อมูล RWTH-PHOENIX มีเฟรมที่บกพร่องจำนวนมาก มีส่วนที่พร่ามัวโดยเฉพาะบริเวณมือ เฟรมนี้ให้ข้อมูลคีย์พอยต์ที่ไม่สอดคล้องกันเนื่องจากตำแหน่งคีย์พอยต์ขาดหายไปหรือไม่ถูกต้อง และทำให้โมเดลมีความเหมาะสมน้อยลง ปัญหานี้จัดการได้โดยการเพิ่มชั้นความสนใจให้กับโมเดลหลายคุณลักษณะที่เราเสนอ ซึ่งช่วยในการเลือกข้อมูลที่ถูกต้องและผลลัพธ์ในการปรับปรุงที่สำคัญเมื่อเทียบกับโมเดลหลายคุณลักษณะที่เสนอโดยปราศจากความสนใจ
ตารางที่ 5. การเปรียบเทียบประสิทธิภาพของ WER ในชุดข้อมูล CSL

ตารางที่ 6. การเปรียบเทียบประสิทธิภาพของ WER ในชุดข้อมูล RWTH-PHOENIX

4.7.3. ผลลัพธ์เชิงคุณภาพ
เรายังทำการประเมินเชิงคุณภาพสำหรับโมเดลของเรา โดยใช้การแสดงภาพผลลัพธ์การจดจำ รูปที่ 8 แสดงรายละเอียดของการประเมินเชิงคุณภาพของเราโดยใช้ตัวอย่างประโยคสามตัวอย่าง ประโยคแรกประกอบด้วย 10 คำ และจำนวนเฟรมทั้งหมดคือ 220 ประโยคที่สองประกอบด้วย 12 คำ และจำนวนเฟรมทั้งหมดคือ 168 ประโยคที่สามประกอบด้วย 9 คำ และจำนวนเฟรมทั้งหมดคือ 135
ผลลัพธ์จากตัวอย่างแสดงให้เห็นว่าโมเดลคาดการณ์ความเงาบางอย่างไม่ถูกต้อง และเราระบุด้วยเครื่องหมายสีแดง อย่างไรก็ตาม ยังสามารถคาดเดาคำที่ถูกต้องส่วนใหญ่ได้ จำนวนข้อผิดพลาดมากที่สุดอยู่ในประโยคแรก ซึ่งมีหมายเลขเฟรมที่ยาวที่สุด ในประโยคนี้ จุดเริ่มต้นของประโยคมีข้อผิดพลาดมากกว่า เนื่องจากลักษณะท่าทางต่างๆ ของคำต้นต่างกันเพียงเล็กน้อย จึงยากที่จะแยกแยะขอบเขต อย่างไรก็ตาม แบบจำลองที่เสนอซึ่งมีคุณลักษณะหลากหลายและความสนใจ (STAMF) สามารถระบุคำได้มากขึ้น แต่มีการติดฉลากผิด ยิ่งไปกว่านั้น การกำหนดค่าแบบจำลองที่ให้ความสนใจจะทำให้ได้ผลการจดจำที่ดีกว่าสำหรับอีกสองตัวอย่าง เมื่อเทียบกับแบบจำลองที่เสนอโดยไม่ให้ความสนใจ

รูปที่ 8 การประเมินเชิงคุณภาพของผลลัพธ์การรับรู้โดยใช้การกำหนดค่าที่แตกต่างกันของชุดข้อมูล RWTH-PHOENIX [33,39] เงาที่ทำนายผิดจะถูกทำเครื่องหมายด้วยสีแดง
5. สรุปผลการวิจัย
ในเอกสารนี้ เรานำเสนอคุณลักษณะเชิงพื้นที่เชิงพื้นที่หลายมิติ (STAMF) ที่แปลกใหม่สำหรับ CSLR ซึ่งมีจุดมุ่งหมายเพื่อเรียนรู้ความสัมพันธ์เชิงพื้นที่และเชิงเวลาและข้อมูลสำคัญจากลำดับของคุณลักษณะภาพและคุณลักษณะจุดสำคัญในแนวทางแบบ end-to-end ในเฟรมเวิร์กของเรา โมดูลเชิงพื้นที่ได้รับการพัฒนาด้วยคุณสมบัติฟูลเฟรมจากข้อมูล RGB และจุดสำคัญจากจุดสำคัญของตัวกล้อง รวมถึงเข็มเป็นคุณสมบัติหลายอย่าง ชุดค่าผสมเหล่านี้ใช้เป็นอินพุตคุณสมบัติหลายสตรีมให้ประสิทธิภาพที่เหนือกว่าเมื่อเทียบกับแนวทางล้ำสมัยที่ใช้เฉพาะฟูลเฟรมหรือเปรียบเทียบกับวิธีการรูปที่ 8 การประเมินเชิงคุณภาพของผลลัพธ์การรับรู้โดยใช้การกำหนดค่าที่แตกต่างกันของ RWTH - ชุดข้อมูล PHOENIX [33,39] เงาที่ทำนายผิดจะถูกทำเครื่องหมายด้วยสีแดง 5. บทสรุป ในเอกสารนี้ เรานำเสนอคุณลักษณะเชิงพื้นที่เชิงพื้นที่หลายมิติ (STAMF) ที่แปลกใหม่สำหรับ CSLR ซึ่งมีจุดมุ่งหมายเพื่อเรียนรู้ความสัมพันธ์เชิงพื้นที่และเชิงเวลาและข้อมูลสำคัญจากลำดับของคุณลักษณะด้านภาพและคุณลักษณะประเด็นสำคัญในตอนท้าย วิธีการสิ้นสุด ในเฟรมเวิร์กของเรา โมดูลเชิงพื้นที่ได้รับการพัฒนาด้วยคุณสมบัติฟูลเฟรมจากข้อมูล RGB และจุดสำคัญจากจุดสำคัญของตัวกล้อง รวมถึงเข็มเป็นคุณสมบัติหลายอย่าง ชุดค่าผสมเหล่านี้ใช้เป็นอินพุตคุณสมบัติหลายสตรีมให้ประสิทธิภาพที่เหนือกว่าเมื่อเทียบกับแนวทางล้ำสมัยที่ใช้เฉพาะฟูลเฟรม หรือเปรียบเทียบกับวิธีที่ใช้ชุดข้อมูลหลายคุณสมบัติอื่น โดยเฉพาะอย่างยิ่งสำหรับชุดข้อมูล CSL จากนั้น เราเสนอโมดูลชั่วคราวที่ประกอบด้วยการรวมข้อมูลชั่วคราวและความสนใจชั่วคราวเพื่อเก็บข้อมูลสำคัญในโดเมนชั่วคราว การเพิ่มความสนใจชั่วขณะทำให้ได้รับคุณสมบัติที่สำคัญจากลำดับที่มีข้อมูลที่ไม่ถูกต้อง และให้การปรับปรุงที่สำคัญเมื่อเทียบกับรูปแบบหลายคุณลักษณะที่เราเสนอ นอกจากนี้ยังช่วยให้ลำดับการเรียนรู้เรียนรู้ได้ดีขึ้นและเพิ่มประสิทธิภาพเช่นเดียวกับการทดลองชุดข้อมูล CSL การทดลองอย่างกว้างขวางในชุดข้อมูลที่ใช้กันทั่วไปแสดงให้เห็นถึงความเหนือกว่าของแบบจำลองที่เราเสนอเหนือแบบจำลองที่ทันสมัย โดยคะแนน WER ลดลงมากกว่า 50 เปอร์เซ็นต์สำหรับชุดข้อมูล CSL และลดลง 5 เปอร์เซ็นต์สำหรับชุดข้อมูล RWTH-PHOENIX ในอนาคต เราวางแผนที่จะใช้เทคนิคการเรียนรู้แบบถ่ายโอนกับโมเดลปัจจุบันของเรา รวมถึงนำงานที่กำลังดำเนินอยู่ไปใช้ในอุตสาหกรรมจริง
อ้างอิง
1. ดริว พี; ไรบัค, ด.; Deselaers, T.; ซาฮีดี ม.; Ney, H. เทคนิคการรู้จำเสียงสำหรับระบบการรู้จำภาษามือ ในการดำเนินการของ INTERSPEECH 2007, การประชุมประจำปีครั้งที่ 8 ของ International Speech Communication Association, Antwerp, Belgium, 27–31 สิงหาคม 2007; หน้า 2513–2516.
2. องอาจ วท.; Ranganath, S. การวิเคราะห์ภาษามืออัตโนมัติ: การสำรวจและอนาคตนอกเหนือจากความหมายคำศัพท์ IEEE ทรานส์ รูปแบบก้น. เครื่องจักร อินเทล. 2548, 27, 873–891. [ครอสรีฟ] [PubMed]
3. โวเกลอร์ ซี; Metaxas, D. กรอบการทำงานสำหรับการจดจำลักษณะต่างๆ พร้อมกันของภาษามืออเมริกัน คอมพิวเตอร์ เยี่ยม ภาพเข้าใจ 2544, 81, 358–384. [ครอสรีฟ]
4. โบว์เดน อาร์; วินด์ริดจ์, D.; คาดีร์, ท.; ซิสเซอร์แมน, อ.; Brady, M. A Linguistic Feature Vector for The Visual Interpretation of Sign Language. ในการประชุม European Conference on Computer Vision (ECCV), ปราก, สาธารณรัฐเช็ก, 11–14 พฤษภาคม 2547; หน้า 390–401
5. กาสุกูรธี น.; โรคาด, บี; บิดานี เอส; Dennisan, DA American Sign Language Alphabet Recognition using Deep Learning. arXiv 2019 arXiv:1905.05487
6. โคลเลอร์ โอ.; ซาร์การาน เอส; เนย์, เอช; Bowden, R. Deep Sign: การเปิดใช้งานการรู้จำภาษามืออย่างต่อเนื่องทางสถิติที่มีประสิทธิภาพผ่าน Hybrid CNN-HMM ภายใน เจ.คอมพิวเตอร์. เยี่ยม 2018, 126, 1311–1325. [ครอสรีฟ]
7. ปู เจ; โจว ว.; Li, H. Dilated Convolutional Network พร้อมการเพิ่มประสิทธิภาพแบบวนซ้ำเพื่อการจดจำภาษามืออย่างต่อเนื่อง ในการดำเนินการประชุมร่วมระหว่างประเทศครั้งที่ 27 เรื่องปัญญาประดิษฐ์, สตอกโฮล์ม, สวีเดน, 13–19 กรกฎาคม 2018; หน้า 885–891
8. ปู เจ; โจว ว.; Li, H. Iterative Alignment Network เพื่อการจดจำภาษามืออย่างต่อเนื่อง ในการดำเนินการประชุม IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 15–20 มิถุนายน 2019; หน้า 4160–4169.
9. Kumar, N. การติดตามการเคลื่อนไหวตามใบหน้าและมือของมนุษย์เพื่อการรู้จำภาษามือ ในการดำเนินการของ 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, India, 26–28 ตุลาคม 2017; หน้า 211–216.
10. บูยาน เอ็มเค; โกอาห์, ด.; Bora, PK กรอบการทำงานสำหรับการรู้จำท่าทางมือด้วยแอปพลิเคชันสำหรับภาษามือ ในรายงานการประชุมประจำปีของอินเดียประจำปี 2549, INDICON, นิวเดลี, อินเดีย, 15–17 กันยายน 2549; หน้า 1–6
11. ดาส เอสพี; ตะลักดาร์, AK; Sarma, KK การรู้จำภาษามือโดยใช้การแสดงออกทางสีหน้า ใน Proceedings of the Procedia Computer Science, Kerala, India, 10–13 สิงหาคม 2015; หน้า 210–216.
12. ราสท์กู อาร์.; เคียนี่, เค; เอสคาเลรา เอส; Saborou, M. การผลิตภาษามือ: บทวิจารณ์. ในการประชุมเชิงปฏิบัติการ 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), Nashville, TN, USA, 19–25 มิถุนายน 2021; หน้า 3446–3456.
13. ดง เอส; วังพี; Abbas, K. การสำรวจการเรียนรู้เชิงลึกและการประยุกต์ใช้ คอมพิวเตอร์ วิทย์ รายได้ 2021, 40, 100379 [CrossRef]
14. อทิตสฺส, ว.; นีเดิล ซี; สคลารอฟฟ์ เอส.; แนช, เจ; สเตฟาน, อ.; หยวน Q.; Thangali, A. ชุดข้อมูลวิดีโอคำศัพท์ภาษามืออเมริกัน ในการประชุมเชิงปฏิบัติการ 2008 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, CVPR Workshops, Anchorage, Alaska, 23–28 มิถุนายน 2551; หน้า 1–8
15. บังเกรอธ เจ; สไตน์ ด.; ดริว พี; เนย์, เอช; มอร์ริสซีย์ เอส; ทาง ก.; Zijl, LV คลังข้อมูลภาษามือของ ATIS ในการประชุมนานาชาติครั้งที่ 6 เกี่ยวกับแหล่งข้อมูลและการประเมินภาษา, LREC 2008, Marrakech, Morocco, 28–30 พฤษภาคม 2008; หน้า 2943–2946.
16. ปาปาสตราติส, I.; Chatzikonstantinou, C.; คอนสแตนตินิดิส, ด.; ดิมิโทรปูลอส เค; Daras, P. เทคโนโลยีปัญญาประดิษฐ์สำหรับภาษามือ เซ็นเซอร์ 2021, 21, 5843 [CrossRef] [PubMed]
17. โจว เอช; โจว ว.; โจว วาย; Li, H. เครือข่ายหลายคิวเชิงพื้นที่-ชั่วขณะเพื่อการจดจำภาษามืออย่างต่อเนื่อง ในการดำเนินการของ AAAI 2020—การประชุม AAAI ครั้งที่ 34 เรื่องปัญญาประดิษฐ์ นิวยอร์ก นิวยอร์ก สหรัฐอเมริกา 7–12 กุมภาพันธ์ 2020; หน้า 13009–13016.
18. Gündüz, C.; Polat, H. การรู้จำภาษามือของตุรกีขึ้นอยู่กับการรวมข้อมูลหลายกระแส เตอร์กิช เจ อิเลคเตอร์ อังกฤษ คอมพิวเตอร์ วิทย์ 2021, 29, 1171–1186 [ครอสรีฟ]
19. โบฮาเซก ม.; Hruz, M. Sign Pose-based Transformer สำหรับการรู้จำภาษามือระดับคำ ในรายงานการประชุม 2022 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops, WACVW, Waikoloa, HI, USA, 4–8 มกราคม 2022; หน้า 182–191.
20. Vaswani, A. ความสนใจคือสิ่งที่คุณต้องการ ใน Proceedings of the Conference on Neural Information Processing Systems, Long Beach, CA, USA, 4–9 ธันวาคม 2017; หน้า 1–11
21. โจว ม.; อึ้ง, ม.; ไค, ซี; Cheung, KC Self-attention Based Fully-Inception Networks เพื่อการรู้จำภาษามืออย่างต่อเนื่อง ด้านหน้า. อาร์ทิฟ อินเทล. แอป 2563, 325, 2832–2839.
22. แคมกอซ, นอร์ทแคโรไลนา; โคลเลอร์ โอ.; แฮดฟิฟิลด์ เอส; Bowden, R. Sign Language Transformers: การรับรู้และการแปลภาษามือแบบ end-to-end ในการประชุม IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA, 14–19 มิถุนายน 2020; หน้า 10020–10030.
23. มิน, ย.; เฮา, อ.; ชัย, เอ็กซ์; Chen, X. ข้อจำกัดในการจัดแนวภาพสำหรับการรู้จำภาษามืออย่างต่อเนื่อง ในการดำเนินการประชุม IEEE International Conference on Computer Vision (ICCV), มอนทรีออล, บริติชโคลัมเบีย, แคนาดา, 10–17 ตุลาคม 2021; หน้า 11542–11551.
24. กัว, ด.; โจว ว.; วัง ม.; Li, H. การรู้จำภาษามือขึ้นอยู่กับ HMM ที่ปรับเปลี่ยนได้พร้อมการเพิ่มข้อมูล ในการดำเนินการประชุม IEEE International Conference on Image Processing (ICIP), Phoenix, AZ, USA, 25–28 กันยายน 2016; หน้า 2876–2880.
25. หวาง เจ; โจว ว.; หลี่ เอช.; Li, W. การรู้จำภาษามือโดยใช้เครือข่ายประสาทเทียม 3 มิติ ในการดำเนินการประชุม IEEE International Conference on Multimedia and Expo (ICME), ตูริน, อิตาลี, 29 มิถุนายน–3 กรกฎาคม 2558; หน้า 1–6
26. กั่ว ด.; โจว ว.; หลี่ เอช.; Wang, M. ฟิวชั่นออนไลน์ช่วงต้นและปลายโดยใช้ HMM ที่ปรับเปลี่ยนได้สำหรับการจดจำภาษามือ ACM ทรานส์ มัลติ คอมพิวเตอร์ ชุมชน แอป 2017, 14, 1–18. [ครอสรีฟ]
27. อัลฮัมมาดี ม.; มูฮัมหมัด, G.; สมาชิก S. Hand Gesture Recognition สำหรับภาษามือโดยใช้ 3DCNN การเข้าถึง IEEE 2020, 8, 79491–79509 [ครอสรีฟ]
28. เรซา, เอช.; Joze, V. MS-ASL: ชุดข้อมูลขนาดใหญ่และเกณฑ์มาตรฐานสำหรับการทำความเข้าใจภาษามืออเมริกัน arXiv 2019, arXiv:1812.01053.
29. ลี่, ด.; โอปาโซ ซีอาร์ ; หยู เอ็กซ์; Li, H. การรู้จำภาษามือเชิงลึกระดับคำจากวิดีโอ: การเปรียบเทียบชุดข้อมูลขนาดใหญ่และวิธีการใหม่ ในรายงานการประชุม 2020 IEEE Winter Conference on Applications of Computer Vision, WACV, Snowmass Village, CO, USA, 1-5 มีนาคม 2020; หน้า 1448–1458
30. ปู เจ; โจว ว.; Li, H. การรู้จำภาษามือพร้อมคุณสมบัติหลายรูปแบบ ใน Proceedings of the Pacific Rim Conference on Multimedia, Xi'an, China, 15–16 กันยายน 2016; หน้า 252–261.
31. เจียง ส.; อาทิตย์, บี; วัง, ล.; ไป๋ ย.; ลี่, เค; Fu, Y. Skeleton Aware การรู้จำภาษามือหลายรูปแบบ ในการดำเนินการประชุม IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, Nashville, TN, USA, 19–25 มิถุนายน 2021; หน้า 3408–3418.
32. ซิดิก, เอเอไอ; ลุกมาน, เอช.; มาห์มูด เอส; Mohandes, M. KArSL: ฐานข้อมูลภาษามืออารบิก ACM ทรานส์ ทรัพยากรต่ำในเอเชีย หรั่ง. รายละเอียด กำลังดำเนินการในปี 2021, 20, 1–19 [ครอสรีฟ]
33. โคลเลอร์ โอ.; ฟอร์สเตอร์ เจ; Ney, H. การรู้จำภาษามืออย่างต่อเนื่อง: ไปสู่ระบบการรู้จำทางสถิติของคำศัพท์ขนาดใหญ่ที่จัดการผู้ลงนามหลายคน คอมพิวเตอร์ เยี่ยม ภาพเข้าใจ 2558, 141, 108–125. [ครอสรีฟ]
34. โคลเลอร์ โอ.; แคมกอซ นอร์ทแคโรไลนา ; Ney, H. การเรียนรู้ภายใต้การดูแลอย่างอ่อนด้วย CNN-LSTM-HMM แบบหลายสตรีมเพื่อค้นหาความเท่าเทียมตามลำดับในวิดีโอภาษามือ IEEE ทรานส์ รูปแบบก้น. เครื่องจักร อินเทล. 2563, 42, 2306–2320. [ครอสรีฟ] [PubMed]
35. แคมกอซ, นอร์ทแคโรไลนา; แฮดฟิฟิลด์ เอส; โคลเลอร์ โอ.; Bowden, R. SubUNets: รูปร่างมือแบบ end-to-end และการรู้จำภาษามือแบบต่อเนื่อง ในการดำเนินการประชุม IEEE International Conference on Computer Vision (ICCV) ประจำปี 2560 เมืองเวนิส อิตาลี 22-29 ตุลาคม 2560 หน้า 3075–3084
36. ต๋อง ซี; ภักดี, ซีซี; เขาเค; Tang, X. ความละเอียดของภาพสูงโดยใช้ Deep Convolutional Networks IEEE ทรานส์ รูปแบบก้น. เครื่องจักร อินเทล. 2557, 38, 295–307. [ครอสรีฟ] [PubMed]
37. เบรสเซม เคเค; อดัมส์ แอลซี; เออร์เซลเบน ซี; แฮมม์ บี; Niehues เอสเอ็ม; Vahldiek, JL การเปรียบเทียบสถาปัตยกรรมการเรียนรู้เชิงลึกที่แตกต่างกันสำหรับการจำแนกประเภทของภาพรังสีทรวงอก วิทย์ ตัวแทน 2020, 10, 13590 [CrossRef]
38. อาทิตย์ พ.; เสี่ยว บี; หลิว ด.; Wang, J. การเรียนรู้การเป็นตัวแทนความละเอียดสูงเชิงลึกสำหรับการประมาณท่าทางของมนุษย์ ในการดำเนินการประชุม IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 15–20 มิถุนายน 2019; หน้า 5686–5696.
39. โคลเลอร์ โอ.; ซาร์การาน เอส; Ney, H. Re-Sign: ปรับแนวการสร้างแบบจำลองลำดับจากต้นทางถึงปลายทางอีกครั้งด้วย CNN-HMMs ที่เกิดซ้ำลึก ใน Pro ceedings ของ 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Honululu, HI, USA, 21–26 กรกฎาคม 2017; หน้า 3416–3424.
40. โจว เอช; โจว ว.; Li, H. การถอดรหัสฉลากหลอกแบบไดนามิกสำหรับการจดจำภาษามืออย่างต่อเนื่อง ในรายงานการประชุม 2019 IEEE International Conference on Multimedia and Expo (ICME), เซี่ยงไฮ้, จีน, 18–21 กรกฎาคม 2019; หน้า 1282–1287
41. เสี่ยว Q.; ช้าง, เอ็กซ์; จาง เอ็กซ์; Liu, X. การรู้จำภาษามือตามวิดีโอโดยไม่มีการแบ่งส่วนชั่วคราว ในการดำเนินการประชุม AAAI ครั้งที่ 30 เรื่องปัญญาประดิษฐ์, นิวออร์ลีนส์, แอลเอ, สหรัฐอเมริกา, 2–7 กุมภาพันธ์ 2018; หน้า 2257–2264.
42. เกรฟส์, อ.; เฟอร์นันเดซ, เอส; โกเมซ, เอฟ; Schmidhuber, J. การจำแนกประเภทชั่วคราวของ Connectionist: การติดฉลากข้อมูลลำดับที่ไม่ได้แบ่งส่วนด้วยโครงข่ายประสาทเทียมที่เกิดซ้ำ ใน Proceedings of the ICML '06: Proceedings of the 23rd international conference on Machine learning, Pittsburgh, PA, USA, 25–29 มิถุนายน 2549; หน้า 369–376
43. เกรฟส์, อ.; Liwicki, ม.; เฟอร์นันเดซ, เอส; เบอร์โทลามี อาร์; Bunke, H.; Schmidhuber, J. ระบบ Connectionist ใหม่สำหรับการรู้จำลายมือที่ไม่มีข้อจำกัด IEEE ทรานส์ รูปแบบก้น. เครื่องจักร อินเทล. 2009, 31, 855–868 [ครอสรีฟ]
44. กั๋ว, ด.; โจว ว.; หลี่ เอช.; Wang, M. Hierarchical LSTM สำหรับการแปลภาษามือ ในการประชุม AAAI Conference on Artifificial Intelligence, New Orleans, LA, USA, 2–7 กุมภาพันธ์ 2018; หน้า 6845–6852.
45. ราห์มาน เอ็มเอ็ม; วาตาโนเบะ, วาย; Nakamura, K. โมเดลภาษา LSTM แบบสองทิศทางสำหรับการประเมินและซ่อมแซมโค้ด ความสมมาตร 2021, 13, 247 [CrossRef]
46.หู ว.; ไค, ม.; เฉิน เค; ดิง เอช; อาทิตย์, ล.; เหลียง เอส; โม, X.; Huo, Q. การฝึกอบรมการเลือกปฏิบัติตามลำดับสำหรับการรู้จำลายมือออฟไลน์โดย CTC ที่สอดแทรกและฟังก์ชันวัตถุประสงค์ MMI ที่ปราศจาก Lattice ในรายงานการประชุมระหว่างประเทศว่าด้วยการวิเคราะห์และการรับรู้เอกสาร, ICDAR, เกียวโต, ญี่ปุ่น, 9-15 พฤศจิกายน 2017; เล่ม 1, หน้า 61–66.
47. โยชิมูระ ท.; ฮายาชิ, ที; ทาเคดะ เค; Watanabe, S. การรู้จำเสียงอัตโนมัติแบบ end-to-end ที่รวมเข้ากับการตรวจจับกิจกรรมเสียงที่ใช้ CTC ในการดำเนินการของ ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing, บาร์เซโลนา, สเปน, 4–8 พฤษภาคม 2020; หน้า 6999–7003
48. กั๋ว, ด.; วัง ส.; เทียน Q.; Wang, M. Dense Temporal Convolution Network สำหรับการแปลภาษามือ ใน Proceedings of the Twenty-Eighth International Joint Conference on Artifificial Intelligence (IJCAI-19), มาเก๊า, จีน, 10–16 สิงหาคม 2017; หน้า 744–750
49. วัง ส.; Guo, D.; โจว ว.; Zha, Z.; Wang, M. Connectionist Temporal Fusion สำหรับการแปลภาษามือ ในรายงานการประชุม ACM International Conference on Multimedia ครั้งที่ 26, โซล, เกาหลี, 22–26 ตุลาคม 2018; หน้า 1483–1491
50. หยาง ซี; Shi, Z. SF-Net: เครือข่ายคุณสมบัติที่มีโครงสร้างเพื่อการจดจำภาษามืออย่างต่อเนื่อง arXiv 2019 arXiv:1908.01341
51. เฉิง กัวลาลัมเปอร์; หยาง ซี; เฉิน, Q.; Tai, Y. เครือข่าย Convolutional เต็มรูปแบบเพื่อการรู้จำภาษามืออย่างต่อเนื่อง ใน Proceedings of the European Conference on Computer Vision, Glasgow, UK, 23–28 สิงหาคม 2020; หน้า 697–714.
52. โคลเลอร์ โอ.; เนย์, เอช; Bowden, R. Deep Hand: วิธีฝึกฝน CNN บนภาพมือ 1 ล้านภาพ เมื่อข้อมูลของคุณต่อเนื่องและมีป้ายกำกับที่อ่อนแอ ในการประชุม 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, 27–30 มิถุนายน 2016; หน้า 3793–3802.
53. Slimane, FB Context Matters: การใส่ใจตนเองในการรู้จำภาษามือ arXiv 2021 arXiv:2101.04632
54. นิว, Z.; Mak, B. Stochastic Fine-grained Labeling of Multi-state Sign Glosses เพื่อการจดจำภาษามืออย่างต่อเนื่อง ใน Proceedings of the European Conference on Computer Vision, Glasgow, UK, 23–28 สิงหาคม 2020; หน้า 1–16
55. ชุย ร.; หลิว เอช; Zhang, C. กรอบประสาทเชิงลึกสำหรับการรู้จำภาษามืออย่างต่อเนื่องโดยการฝึกอบรมซ้ำ IEEE ทรานส์ มัลติ 2019, 21, 1880–1891 [ครอสรีฟ]
56. ปู, เจ; โจว ว.; หู, เอช.; Li, H. ส่งเสริมการรับรู้ภาษามืออย่างต่อเนื่องผ่านการเพิ่มรูปแบบข้าม ในการประชุม ACM International Conference on Multimedia ครั้งที่ 28, Seattle, WA, USA, 12–16 ตุลาคม 2020; หน้า 1497–1505






