การรู้จำภาษามืออย่างต่อเนื่องเชิงพื้นที่และชั่วคราวโดยใช้เครือข่ายคุณสมบัติหลากหลายที่เอาใจใส่(2)

Jun 01, 2023

3.5. การเรียนรู้ลำดับ

Sequence Learning หลังจากได้ผลลัพธ์จากตัวแยกคุณลักษณะเชิงพื้นที่และเชิงเวลาในรูปแบบของคุณลักษณะเงาแล้ว เราจำเป็นต้องจัดเรียงให้เป็นประโยคที่สมบูรณ์ ดังนั้นเราจึงจำเป็นต้องใช้การเรียนรู้ตามลำดับเพื่อให้แน่ใจว่ามีการจัดการความเงาเพื่อสร้างประโยคที่ดี วิธีการที่แพร่หลายที่สุดในการวิจัยปัจจุบันหมายถึง Bidirectional Long Short Term Memory (Bi-LSTM) และ Connectionist temporal allocation (CTC) [17,23] สำหรับปัญหาที่สามารถแก้ไขได้โดยใช้ CTC และงานล่าสุดหลายชิ้น [17,23] เสนอ CTC เป็นกระบวนการฝึกอบรมแบบ end-to-end สำหรับ CSLR

cistanche extract powder

ผงสกัด Cistanche

คลิกที่นี่เพื่อดูผลิตภัณฑ์ Cistanche

【สอบถามเพิ่มเติม】 อีเมล:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Long short-term memory (LSTM) [44] เป็นอีกรูปแบบหนึ่งของ recurrent neural network (RNN) และมีการใช้กันอย่างแพร่หลายในการสร้างแบบจำลองลำดับ LSTM สร้างแบบจำลองการพึ่งพาระยะยาวอย่างดีเยี่ยม มันสามารถประมวลผลลำดับทั้งหมดของอินพุตและใช้สถานะภายในเพื่อจำลองการเปลี่ยนสถานะ อย่างไรก็ตาม ข้อบกพร่องของ RNN ไปข้างหน้าเหล่านี้คือสถานะที่ซ่อนอยู่นั้นเรียนรู้จากทิศทางเดียวเท่านั้น RNN สร้างสถานะที่ซ่อนอยู่ตามที่อธิบายไว้ในสมการด้านล่างหลังจากได้รับลำดับคุณลักษณะเป็นอินพุต

ht=RNN(ht−1,ot),

โดยที่ ht แสดงถึงสถานะที่ซ่อนอยู่ โดยที่สถานะเริ่มต้น h0 คือเวกเตอร์ศูนย์ทั้งหมดคงที่ และ t คือขั้นตอนเวลา RNN ใช้เพื่อทำนายความเงาของเครื่องหมายตามการป้อนข้อมูลลำดับคุณลักษณะเชิงพื้นที่

นอกจากนี้ งาน SL ค่อนข้างซับซ้อน ดังนั้นจึงไม่เพียงต้องการคุณสมบัติที่ได้รับจากบริบททางเดียว แต่ยังต้องการความช่วยเหลือในการใช้ข้อมูลสองทางเพื่อเรียนรู้การเกิดขึ้นของคำที่อยู่ก่อนและหลังคำอื่นๆ ในประโยค ดังนั้นเราจึงใช้ Bi-LSTM [45] เพื่อเรียนรู้การพึ่งพาไดนามิกที่ซับซ้อนของลำดับภาพโดยการแปลงโดยใช้การแสดงเชิงพื้นที่และเชิงเวลาเป็นลำดับของคุณสมบัติเงา ตามคำอธิบายที่ระบุไว้ก่อนหน้านี้ วิธี Bi-LSTM สามารถทำงานสองทางด้วยวิธี LSTM ซึ่งหมายความว่าวิธี Bi-LSTM สามารถจำแนกข้อมูลตามลำดับได้ดีขึ้น การคำนวณ Bi-LSTM ที่ใช้สถานะซ่อนเร้นแบบสองทางสามารถมองได้ว่าเป็นการคำนวณซ้ำของ LSTM ที่ประมวลผลจากด้านหน้าไปด้านหลังและจากด้านหลังไปด้านหน้า หลังจากนั้น สถานะที่ซ่อนอยู่ของแต่ละขั้นตอนจะถูกส่งผ่านเลเยอร์ที่เชื่อมต่ออย่างสมบูรณ์และเลเยอร์ซอฟต์แม็กซ์ [17]

cistanche powder

ผงซิสแตนช์

ที่=W(ht บวก b)

yt,j=e at,j ∑ke at,j ,

โดยที่ b เป็นเวกเตอร์อคติและ y(t,j) แสดงถึงความน่าจะเป็นของป้ายกำกับ j ที่ขั้นตอนเวลา t ในงาน TSL ของเรา label j คือคำศัพท์ที่ได้จากประโยค ในทางปฏิบัติ Bi-LSTM ช่วยปรับปรุงจำนวนข้อมูลที่เครือข่ายสามารถเข้าถึงได้อย่างมีนัยสำคัญ ซึ่งจะปรับปรุงบริบทของข้อมูลที่มีอยู่ในอัลกอริทึม ข้อมูลประกอบด้วยความรู้ของคำที่มาหลังหรือก่อนเฟรมปัจจุบันในการป้อนลำดับคุณลักษณะของประโยค

Bi-LSTM ส่งสถานะที่ซ่อนอยู่เป็นเอาต์พุตไปยังเลเยอร์ CTC สำหรับแต่ละขั้นตอน เนื่องจากผลลัพธ์ของ Bi-LSTM นี้ไม่ได้สนใจการจัดเรียงเงา เราจึงใช้ CTC เพื่อจัดการการแมปลำดับวิดีโอ o={ot} T 0 t=1 เพื่อสร้างสัญญาณ ลำดับความเงา `={` i} IL =1 (L น้อยกว่าหรือเท่ากับ T) ด้วยการจัดที่ดีกว่า CTC ถูกใช้ในหลายสาขา รวมถึงการรู้จำลายมือ [46] การรู้จำเสียงพูด [47] และการรู้จำภาษามือ [17,23] ในโดเมนนี้ ใช้เป็นฟังก์ชันให้คะแนนโดยไม่ต้องจัดลำดับอินพุตและเอาต์พุต ใน CSLR CTC เรียกว่าโมดูลที่พัฒนาขึ้นสำหรับงานแบบครบวงจรที่เกี่ยวข้องกับการจัดประเภทของข้อมูลชั่วคราวโดยไม่มีการแบ่งส่วน ด้วยการเขียนโปรแกรมแบบไดนามิก CSLR สามารถแก้ปัญหาการจัดตำแหน่งโดยการสร้างป้ายกำกับว่าง (-) ซึ่งอนุญาตให้ระบบสร้างผลลัพธ์ที่ดีที่สุดสำหรับการแสดงข้อมูลที่ไม่มีป้ายกำกับ (เช่น ข้อมูล epenthesis และส่วนของข้อมูลที่ไม่ใช่รูปแบบลายเส้น) โดยเฉพาะอย่างยิ่ง CTC สร้างป้ายกำกับว่าง "-" เพื่อขยายคำศัพท์ V โดยที่ V=Vorigin ∪ {-} จุดประสงค์ของป้ายกำกับเปล่านี้คือเพื่อแสดงถึงการเปลี่ยนแปลงและเพื่อแจ้งให้ทราบถึงการมีอยู่ของเงาเปล่าที่ไม่ได้ให้ข้อมูลสำหรับกระบวนการเรียนรู้ เช่น π={πt} T 0 t{{20 }} โดยที่ πt ∈ V ส่งผลให้ CTC สามารถจัดการพารามิเตอร์เอาต์พุตจากตัวแยกคุณลักษณะเชิงพื้นที่และเชิงเวลา และ Bi-LSTM เป็นโมดูลการจัดตำแหน่งโดยการสรุปความน่าจะเป็นของเส้นทางที่เป็นไปได้ทั้งหมด เส้นทางการจัดตำแหน่งทั้งหมด π มีความน่าจะเป็นที่กำหนดลำดับอินพุตดังนี้ [17]:

Cistanche deserticola experiment

การทดลอง Cistanche Deserticola

p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, พาย

ในขั้นตอนถัดไป เรากำหนดการดำเนินการแมปแบบกลุ่มต่อหนึ่ง B ซึ่งจะลบช่องว่างและคำที่ซ้ำกันออกจากเส้นทางการจัดตำแหน่ง ตัวอย่างเช่น B (II-am- -a- -doctor)=I, am, a, doctor ด้วยเหตุนี้ เราสามารถคำนวณความน่าจะเป็นแบบมีเงื่อนไขของลำดับความเงาของเครื่องหมาย l เป็นผลรวมของความน่าจะเป็นของเส้นทางทั้งหมดที่สามารถจับคู่กับ l จาก B ด้วยวิธีที่อธิบายไว้ด้านล่าง [17]:

p(π|o) = ∑ π∈B−1 p(π|o)

โดยที่ B −1 (l)={π|B(π)=l} คือการดำเนินการผกผันของ B ในที่สุด การสูญเสีย CTC ของลำดับคุณลักษณะถูกกำหนดดังนี้ [17]:

Lctc=− ln p(` |o)

ความน่าจะเป็นแบบมีเงื่อนไข p(π|X) สามารถคำนวณได้ตามสมมติฐานความเป็นอิสระแบบมีเงื่อนไข

4. ผลการทดลองและการอภิปราย

cistanche—Improve memory2

Cistanche อาหารเสริมใกล้ฉัน-ปรับปรุงหน่วยความจำ

ในส่วนนี้ เราจะอธิบายรายละเอียดของการทดสอบของเราด้วยการกำหนดค่าที่เสนอตามที่อธิบายไว้ในส่วนก่อนหน้า

4.1. ชุดข้อมูล

ในส่วนนี้ เราจะอธิบายชุดข้อมูลที่เราใช้ในระหว่างการทดสอบนี้ เราใช้ชุดข้อมูลสองชุด ชุดแรกคือชุดข้อมูล CSL [8,40,41] และชุดที่สองคือชุดข้อมูล RWTH-PHOENIX [33,39] ชุดข้อมูลทั้งสองนี้เป็นชุดข้อมูลภาษามือแบบต่อเนื่อง ซึ่งใช้ในการแปลท่าทางบางชุดเป็นประโยคเต็ม

4.1.1. ชุดข้อมูล CSL

ชุดข้อมูล CSL ถูกใช้โดยงานหลายชิ้น [8,40,41] ชุดข้อมูลนี้มีทั้งหมด 100 ประโยคและ 178 คำ ซึ่งมักใช้ในการสื่อสารในชีวิตประจำวัน ชุดข้อมูลนี้มี 5 คำโดยเฉลี่ยต่อประโยค แต่ละประโยคดำเนินการโดยผู้ลงนาม 50 คน 5 ครั้ง ดังนั้น จำนวนวิดีโอทั้งหมดคือ 25 รายการ000 ทำให้เป็นหนึ่งในชุดข้อมูลที่ใหญ่ที่สุด ในการฝึกโมเดล CSL ของเรา เราแบ่งชุดข้อมูลออกเป็นข้อมูลสำหรับการฝึกกับวิดีโอ 20,{11}} รายการ และสำหรับการทดสอบกับวิดีโอ 5,000 รายการที่มีประโยคเดียวกันแต่มีผู้ลงนามต่างกัน

4.1.2. ชุดข้อมูล RWTH-PHOENIX

ชุดข้อมูล RWTH-PHOENIX [33,39] เป็นชุดข้อมูลภาษามือเยอรมัน ซึ่งเป็นชุดบันทึกการออกอากาศสภาพอากาศสาธารณะจากสถานีโทรทัศน์ในเยอรมนี วิดีโอนี้ได้รับการประมวลผลเพื่อให้มีขนาด 210 × 260 มีประโยคต่างๆ 6841 ประโยคที่ลงนามโดยผู้ลงนามที่แตกต่างกัน 9 คน ผู้ลงนามทุกคนสวมเสื้อผ้าสีเข้มบนพื้นสีอ่อน โดยรวมแล้วมีคำทั้งหมด 1232 คำที่มีเงาประมาณ 80,{11}} คำ ชุดข้อมูลนี้แบ่งตามรูปแบบที่กำหนดไว้ล่วงหน้า ประกอบด้วยตัวอย่างการฝึกอบรม 5672 ตัวอย่าง การตรวจสอบความถูกต้อง/ตัวอย่างการพัฒนา 540 ตัวอย่าง และตัวอย่างทดสอบ 629 ตัวอย่าง

4.2. การประมวลผลข้อมูลล่วงหน้า

สิ่งแรกที่เราต้องทำคือประมวลผลชุดข้อมูลล่วงหน้าเพื่อให้พอดีกับโมเดลที่เราเสนอ เราทำการปรับขนาดและครอบตัดตามที่แสดงในรูปที่ 3; ทางด้านซ้าย เราจะเห็นว่าข้อมูลต้นฉบับมีขนาดที่ความละเอียดระดับ Full HD หรือ 1920 × 1080 เราจำเป็นต้องครอบตัดและปรับขนาดเป็นความละเอียด 224 × 224 เนื่องจากโมดูลเชิงพื้นที่ของเราได้รับอินพุตที่มีขนาดเท่ากับอินพุต ResNet50 หลังจากนั้น เราป้อนข้อมูลลงในแบบจำลองเชิงพื้นที่ของเรา ซึ่งจะสร้างเทนเซอร์ขนาด 7 × 7 จากภาพเดียว

จากนั้นจึงใช้ภาพฟูลเฟรมที่ประมวลผลล่วงหน้าเพื่อสร้างฟีเจอร์จุดสำคัญ เราใช้โมเดล HRNet เพื่อทำนายจุดสำคัญ 133 จุดจากภาพ RGB เหล่านี้ อย่างไรก็ตาม เราใช้เพียง 27 จุดสำคัญของร่างกายส่วนบนในแบบจำลองที่เราเสนอ ขนาดอินพุตสำหรับคุณลักษณะจุดสำคัญคือ 27 × 3 เนื่องจากเรามีข้อมูลพิกัด 3-แกน (x, y และ z) ต่อจุด ขนาดอินพุตของโมเดลคือ N × 224 × 224 × 3 สำหรับฟีเจอร์ฟูลเฟรม และ N × 1 × 27 × 3 สำหรับอินพุตคีย์พอยต์ โดยที่ N คือจำนวนเฟรม เพื่อปรับปรุงรูปแบบต่างๆ ของชุดข้อมูล เราทำตามส่วนเสริมจาก [12] รวมถึงการครอบตัดแบบสุ่ม การพลิกแนวนอน และการปรับขนาดชั่วคราวแบบสุ่ม การครอบตัดแบบสุ่มยังใช้เป็นส่วนหนึ่งของขั้นตอนการประมวลผลล่วงหน้าเพื่อครอบตัดรูปภาพต้นฉบับ

cistanche—Improve memory7

Cistanche อาหารเสริมใกล้ฉัน-ปรับปรุงหน่วยความจำ

4.3. เมตริกการประเมินผล

ในการประเมินประสิทธิภาพการรู้จำของแบบจำลองที่เราเสนอ เราใช้เมตริกอัตราความผิดพลาดของคำ (WER) ซึ่งเป็นเมตริกที่ใช้กันทั่วไปใน CSLR เพื่อประเมินความแม่นยำในการรู้จำของประโยคที่คาดคะเน ดังแสดงโดยสมการด้านล่าง [17]:

WER=S บวก I บวก DT=S บวก I บวก DS บวก C บวก D

โดยที่ S คือจำนวนการแทนที่คำเดิม I คือจำนวนการแทรกที่ไม่ได้อยู่ในประโยคเดิม D คือจำนวนการลบที่ควรอยู่ในประโยคเดิม C คือจำนวนคำที่ถูกต้องที่ตรงกัน ของประโยคเดิม และ T คือจำนวนคำทั้งหมดในประโยคหรือที่หาได้จากการแทน ลบ และแก้ไขคำทั้งหมด สำหรับ CSL อักขระแต่ละตัวจะใช้แทนคำ

4.4. การทดลองเกี่ยวกับ Input Stream

การทดลองนี้มุ่งเน้นไปที่การเปรียบเทียบอินพุตแบบสตรีมเดียวและหลายสตรีมบนโมเดลของเราเป็นหลัก จุดมุ่งหมายคือการค้นหาการกำหนดค่าที่ดีที่สุดของสตรีมอินพุต เราใช้เฉพาะชุดข้อมูล RWTH-PHOENIX ในการทดสอบนี้ โมเดลของเราจะได้รับอินพุตแยกกันสองอินพุต ฟูลเฟรมและอินพุตคีย์พอยต์ อินพุตสตรีมเดียวใช้เฉพาะคุณสมบัติ RGB จากภาพฟูลเฟรม มีการทดลองอินพุตสตรีมเดียวสองครั้ง ฟีเจอร์แรกใช้เฉพาะฟีเจอร์ฟูลเฟรมจากภาพ RGB และฟีเจอร์ที่สองใช้ฟีเจอร์คีย์พอยต์จากการป้อนข้อมูลคีย์พอยต์ อินพุตแบบหลายสตรีมที่เราเสนอประกอบด้วยคุณสมบัติ RGB และคีย์พอยต์ ผลการเปรียบเทียบโดยใช้สตรีมเดียวและหลายสตรีมแสดงในตารางที่ 1 ที่นี่ เราจะเห็นว่าการใช้ฟีเจอร์หลายสตรีมทำให้เราได้ผลลัพธ์ที่ดีกว่าการใช้สตรีมเดียว สตรีมหลักได้มาจากฟีเจอร์ RGB ฟูลเฟรม และสตรีมเพิ่มเติมใช้ฟีเจอร์คีย์พอยต์ สตรีมจุดสำคัญเพิ่มเติมช่วยให้โมเดลเรียนรู้ได้ดีขึ้น โดยเฉพาะอย่างยิ่งในการจับรายละเอียดของรูปทรงมือ

ตารางที่ 1. การเปรียบเทียบประสิทธิภาพของ WER โดยใช้อินพุตสตรีมเดี่ยวและอินพุตหลายสตรีม

Table 1. WER Performance comparison using single stream and multi-stream input.


4.5. การทดลองเกี่ยวกับ Attention Module

จุดมุ่งหมายของการทดลองนี้คือการเลือกการกำหนดค่าที่ดีที่สุดของโมดูลความสนใจ ในการทดสอบนี้ เราใช้การกำหนดค่าของผลลัพธ์ที่ดีที่สุดจากผลการทดสอบก่อนหน้าและชุดข้อมูลเดียวกัน เราแสดงความสนใจเชิงพื้นที่เป็นแบบจำลองโดยมีชั้นความสนใจในตัวเองอยู่ที่ส่วนท้ายของโมดูลเชิงพื้นที่สำหรับแต่ละคุณลักษณะ ความสนใจทางโลกในช่วงแรกคือชั้นความสนใจตนเองหลังจากการรวมทางโลกครั้งแรก และความสนใจทางโลกช่วงปลายคือชั้นความสนใจตนเองหลังจากการรวมทางโลกครั้งที่สอง ที่นี่เราจะเปรียบเทียบการกำหนดค่าทั้งหมดข้างต้นและการรวมกันของความสนใจเชิงพื้นที่และทางโลก ผลลัพธ์แสดงในตารางที่ 2 ผลลัพธ์ของความสนใจเชิงพื้นที่นั้นแย่กว่าความสนใจชั่วคราว ระดับเชิงพื้นที่มีลำดับคุณลักษณะสำหรับแต่ละเฟรม ตามที่กล่าวไว้ใน [20] เลเยอร์การเอาใจใส่ตนเองนั้นง่ายต่อการเรียนรู้เส้นทางที่สั้นกว่าระหว่างการพึ่งพาที่ยาวนาน ดังนั้นความสนใจเชิงพื้นที่จึงล้มเหลวในการลด WER เนื่องจากลำดับที่ยาว ในทางกลับกัน เราสามารถได้รับผลลัพธ์ที่ดีขึ้นโดยใช้ความสนใจชั่วคราวโดยวางไว้หลังการรวมเพื่อให้ได้ลำดับความยาวที่สั้นลง ความสนใจล่าช้าที่มีความยาวลำดับสั้นที่สุดจะได้ผลลัพธ์ที่ดีที่สุด นอกจากนี้ การรวมกันของโมดูลความสนใจในเชิงพื้นที่และชั่วคราวนั้นแย่กว่าการใช้ความสนใจเพียงอย่างเดียว จากผลลัพธ์เหล่านี้ เราใช้การกำหนดค่าที่ดีที่สุดสำหรับการทดสอบเป็นต้นไป

ตารางที่ 2 การเปรียบเทียบประสิทธิภาพของ WER โดยใช้การกำหนดค่าความสนใจที่แตกต่างกัน

Table 2. WER Performance comparison using different attention configuration


4.6. การทดลอง Ablation บนเครือข่าย STAMF

นอกจากนี้ เราทำการทดสอบการระเหยโดยใช้ชุดข้อมูลเดียวกันและการกำหนดค่าที่ดีที่สุดของสตรีมอินพุตและโมดูลความสนใจ ตารางที่ 3 ในการทดลองโดยใช้ความสนใจชั่วขณะช่วงปลายโดยไม่มีการรวมเข้าด้วยกัน พิสูจน์ว่าความยาวของลำดับส่งผลต่อประสิทธิภาพความสนใจ การทดลองที่ใช้การรวมเลเยอร์ที่มีความยาวลำดับที่สั้นกว่าจะได้ผลลัพธ์ที่ดีกว่า นอกจากนี้เรายังทำการทดลองการระเหยเพื่อทราบประสิทธิภาพโดยใช้แบบจำลองต่างๆ สำหรับการเรียนรู้ตามลำดับ ผลลัพธ์ในตารางที่ 4 แสดงว่าการใช้ LSTM ซึ่งมีข้อมูลทางเดียวมีประสิทธิภาพต่ำกว่าการใช้ Bi-LSTM ซึ่งมีข้อมูลสองทาง

ตารางที่ 3. การเปรียบเทียบประสิทธิภาพของ WER โดยใช้การกำหนดค่าความสนใจชั่วคราวช่วงปลายที่แตกต่างกัน

Table 3. WER Performance comparison using different late temporal attention configurations.

ตารางที่ 4. การเปรียบเทียบประสิทธิภาพของ WER โดยใช้การกำหนดค่าการเรียนรู้ลำดับต่างๆ

Table 4. WER Performance comparison using different sequence learning confifiguration.


4.7. การทดลองบนเครือข่าย STAMF

ในส่วนนี้ เราจะอธิบายกระบวนการฝึกอบรมทั้งหมดสำหรับแบบจำลองที่เราเสนอที่เรียกว่า spatiotemporal attentive multi-feature (STAMF) ซึ่งจะครอบคลุมถึงวิธีที่เราใส่ข้อมูลอินพุตลงในโมดูลเชิงพื้นที่ โมดูลชั่วคราว และโมดูลการเรียนรู้ตามลำดับทีละขั้นตอน ในส่วนนี้ เราใช้อินพุตแบบหลายสตรีมและการกำหนดค่าความสนใจชั่วขณะ

4.7.1. รายละเอียดการดำเนินการ

เราดำเนินการฝึกอบรมและทดสอบแบบ end-to-end โดยใช้อินพุตเฟรมที่มีขนาด 224 × 224 สำหรับตัวเพิ่มประสิทธิภาพ เราใช้ตัวเพิ่มประสิทธิภาพ Adam โดยมี 10−4 เป็นอัตราการเรียนรู้ และหารด้วย 2 ที่ยุค 10 และ 15 สำหรับ CSL และ ยุค 30, 40 และ 60 สำหรับ RWTH PHOENIX เรากำหนดขนาดแบทช์เป็น 4 และดำเนินการ 80 epochs สำหรับ RWTH-PHOENIX และ 20 epochs สำหรับ CSL การฝึกอบรมและการทดสอบดำเนินการบน NVIDIA Tesla V100 และ 128G RAM

ในตอนแรก เราแยกคุณสมบัติจากสตรีม RGB โดยใช้ ResNet50 และใช้ HRNet เพื่อรับคีย์พอยต์ จากนั้นแยกคุณสมบัติคีย์พอยต์โดยใช้ ResNet50 โปรดทราบว่าเรากำลังจัดการกับข้อมูลต่อเนื่องหรือวิดีโอ ดังนั้นเราจึงจำเป็นต้องกำหนดค่าขนาดอินพุตของเราตามความยาวของวิดีโอ ด้วยเหตุผลทางเทคนิค ขนาดอินพุตสำหรับข้อมูลทั้งหมดจำเป็นต้องเหมือนกัน ดังนั้น เราต้องทราบวิดีโอที่ยาวที่สุดในชุดข้อมูลของเรา จากนั้นจึงเสริมความยาวเฟรมอินพุตของเราให้ตรงกับหมายเลขเฟรมที่ใหญ่ที่สุด

คุณสมบัติที่แยกออกมาตามลำดับเหล่านี้ถูกใช้โดยโมดูลชั่วคราว แต่ละสตรีมตามลำดับผ่านการรวมชั่วคราวแบบซ้อนกันสองครั้ง การรวมเวลาชั่วคราวแต่ละครั้งประกอบด้วย 1-เครือข่ายเชิงมิติและชั้นการรวมสูงสุด ซึ่งลดความยาวของลำดับลงครึ่งหนึ่ง จากนั้นเอาต์พุตของการรวมชั่วคราวจากสตรีมทั้งสองจะถูกเชื่อมต่อกับชั้นความสนใจและสำหรับการรวมชั่วคราวครั้งล่าสุด หลังจากชั้นความสนใจ จะถูกเชื่อมต่อที่ส่วนท้ายเป็นเอาต์พุตโมดูลชั่วคราว

เอาต์พุตชั่วคราวถูกประมวลผลโดยโมดูลการเรียนรู้ตามลำดับ กระบวนการนี้ใช้เลเยอร์ Bi-LSTM ที่เชื่อมต่อกับ CTC เพื่อจัดแนวขั้นสุดท้ายและเรียบเรียงความเงาเป็นประโยคสุดท้าย

4.7.2. ผลลัพธ์เชิงปริมาณ

ประโยคสุดท้ายถูกนำไปเปรียบเทียบกับความจริงพื้นฐานเพื่อคำนวณคะแนน WER เป็นผลเชิงปริมาณ สำหรับ CSL เราแบ่งชุดข้อมูลออกเป็น 80 เปอร์เซ็นต์สำหรับข้อมูลการฝึก และ 20 เปอร์เซ็นต์สำหรับข้อมูลการทดสอบ ดังที่แสดงในตารางที่ 5 โมเดลหลายคุณสมบัติ (STMF) ที่เราเสนอโดยใช้ฟูลเฟรมและฟีเจอร์คีย์พอยต์สามารถให้ผลลัพธ์ที่ดีกว่า และลด WER ลงเหลือ 0.8 เมื่อเทียบกับรุ่นที่ใช้ฟีเจอร์ฟูลเฟรมเท่านั้น [23] ผลลัพธ์ที่ดีที่สุดของเราได้รับจากโมเดลหลายคุณลักษณะที่เสนอโดยใช้กลไกการให้ความสนใจ (STAMF) ซึ่งได้ 0.7 สำหรับ WER เลเยอร์ความสนใจยังคงปรับปรุงผลลัพธ์เล็กน้อย แม้ว่าชุดข้อมูล CSL จะไม่มีเฟรมที่บกพร่อง นี่เป็นข้อพิสูจน์ว่าชั้นความสนใจมีผลกระทบต่อตัวแบบ ตัวแบบหลายคุณลักษณะที่นำเสนอนั้นเหนือกว่าวิธีการที่ทันสมัย ​​และชั้นความสนใจมีส่วนทำให้คะแนน WER ในชุดข้อมูล CSL ลดลง ประเด็นสำคัญเกี่ยวกับ CSL มีผลอย่างมากเนื่องจากสามารถให้ข้อมูลที่มีประสิทธิภาพเมื่อเทียบกับวิธีการแบบหลายคุณลักษณะอื่นๆ [17] ซึ่งใช้ท่าทางของมือ ใบหน้า และลำตัว

สำหรับชุดข้อมูล RWTH-PHOENIX เราใช้การกำหนดค่าเทียมเพื่อแยกข้อมูลการฝึกอบรมและการทดสอบ ชุดข้อมูลแบ่งออกเป็นวิดีโอตัวอย่าง 5672 รายการสำหรับการฝึกอบรม วิดีโอตัวอย่าง 540 รายการสำหรับการตรวจสอบตนเอง และวิดีโอตัวอย่าง 629 รายการสำหรับการทดสอบ ดังที่แสดงในตารางที่ 6 ผลลัพธ์ของแบบจำลองหลายคุณลักษณะ (STMF) ที่เราเสนอโดยใช้ฟูลเฟรมและคุณลักษณะจุดสำคัญมี WER 24 เปอร์เซ็นต์ และผลลัพธ์ที่ดีที่สุดของเราคือ 20.5 เปอร์เซ็นต์ ที่ได้มาจากแบบจำลองที่เสนอโดยใช้โมดูลความสนใจ (STAMF) ในผลการฝึก ผลการทดสอบดีที่สุดเป็นอันดับสองเมื่อเทียบกับ [17] เนื่องจากใช้คุณสมบัติเป็นอินพุตมากกว่า อย่างไรก็ตาม โมดูลความสนใจได้พิสูจน์แล้วว่ามีส่วนสำคัญในการลดคะแนน WER สำหรับชุดข้อมูล RWTHPHOENIX แตกต่างจากผลลัพธ์ของเราสำหรับชุดข้อมูล CSL แบบจำลองที่เรานำเสนอแบบหลายสตรีมไม่ได้ผลลัพธ์ที่เหมาะสมที่สุด เนื่องจากชุดข้อมูล RWTH-PHOENIX มีเฟรมที่บกพร่องจำนวนมาก มีส่วนที่พร่ามัวโดยเฉพาะบริเวณมือ เฟรมนี้ให้ข้อมูลคีย์พอยต์ที่ไม่สอดคล้องกันเนื่องจากตำแหน่งคีย์พอยต์ขาดหายไปหรือไม่ถูกต้อง และทำให้โมเดลมีความเหมาะสมน้อยลง ปัญหานี้จัดการได้โดยการเพิ่มชั้นความสนใจให้กับโมเดลหลายคุณลักษณะที่เราเสนอ ซึ่งช่วยในการเลือกข้อมูลที่ถูกต้องและผลลัพธ์ในการปรับปรุงที่สำคัญเมื่อเทียบกับโมเดลหลายคุณลักษณะที่เสนอโดยปราศจากความสนใจ

ตารางที่ 5. การเปรียบเทียบประสิทธิภาพของ WER ในชุดข้อมูล CSL

Table 5. WER Performance comparison on the CSL dataset.

ตารางที่ 6. การเปรียบเทียบประสิทธิภาพของ WER ในชุดข้อมูล RWTH-PHOENIX

Table 6. WER Performance comparison on the RWTH-PHOENIX dataset.


4.7.3. ผลลัพธ์เชิงคุณภาพ

เรายังทำการประเมินเชิงคุณภาพสำหรับโมเดลของเรา โดยใช้การแสดงภาพผลลัพธ์การจดจำ รูปที่ 8 แสดงรายละเอียดของการประเมินเชิงคุณภาพของเราโดยใช้ตัวอย่างประโยคสามตัวอย่าง ประโยคแรกประกอบด้วย 10 คำ และจำนวนเฟรมทั้งหมดคือ 220 ประโยคที่สองประกอบด้วย 12 คำ และจำนวนเฟรมทั้งหมดคือ 168 ประโยคที่สามประกอบด้วย 9 คำ และจำนวนเฟรมทั้งหมดคือ 135

ผลลัพธ์จากตัวอย่างแสดงให้เห็นว่าโมเดลคาดการณ์ความเงาบางอย่างไม่ถูกต้อง และเราระบุด้วยเครื่องหมายสีแดง อย่างไรก็ตาม ยังสามารถคาดเดาคำที่ถูกต้องส่วนใหญ่ได้ จำนวนข้อผิดพลาดมากที่สุดอยู่ในประโยคแรก ซึ่งมีหมายเลขเฟรมที่ยาวที่สุด ในประโยคนี้ จุดเริ่มต้นของประโยคมีข้อผิดพลาดมากกว่า เนื่องจากลักษณะท่าทางต่างๆ ของคำต้นต่างกันเพียงเล็กน้อย จึงยากที่จะแยกแยะขอบเขต อย่างไรก็ตาม แบบจำลองที่เสนอซึ่งมีคุณลักษณะหลากหลายและความสนใจ (STAMF) สามารถระบุคำได้มากขึ้น แต่มีการติดฉลากผิด ยิ่งไปกว่านั้น การกำหนดค่าแบบจำลองที่ให้ความสนใจจะทำให้ได้ผลการจดจำที่ดีกว่าสำหรับอีกสองตัวอย่าง เมื่อเทียบกับแบบจำลองที่เสนอโดยไม่ให้ความสนใจ

Figure 8.


รูปที่ 8 การประเมินเชิงคุณภาพของผลลัพธ์การรับรู้โดยใช้การกำหนดค่าที่แตกต่างกันของชุดข้อมูล RWTH-PHOENIX [33,39] เงาที่ทำนายผิดจะถูกทำเครื่องหมายด้วยสีแดง

5. สรุปผลการวิจัย

ในเอกสารนี้ เรานำเสนอคุณลักษณะเชิงพื้นที่เชิงพื้นที่หลายมิติ (STAMF) ที่แปลกใหม่สำหรับ CSLR ซึ่งมีจุดมุ่งหมายเพื่อเรียนรู้ความสัมพันธ์เชิงพื้นที่และเชิงเวลาและข้อมูลสำคัญจากลำดับของคุณลักษณะภาพและคุณลักษณะจุดสำคัญในแนวทางแบบ end-to-end ในเฟรมเวิร์กของเรา โมดูลเชิงพื้นที่ได้รับการพัฒนาด้วยคุณสมบัติฟูลเฟรมจากข้อมูล RGB และจุดสำคัญจากจุดสำคัญของตัวกล้อง รวมถึงเข็มเป็นคุณสมบัติหลายอย่าง ชุดค่าผสมเหล่านี้ใช้เป็นอินพุตคุณสมบัติหลายสตรีมให้ประสิทธิภาพที่เหนือกว่าเมื่อเทียบกับแนวทางล้ำสมัยที่ใช้เฉพาะฟูลเฟรมหรือเปรียบเทียบกับวิธีการรูปที่ 8 การประเมินเชิงคุณภาพของผลลัพธ์การรับรู้โดยใช้การกำหนดค่าที่แตกต่างกันของ RWTH - ชุดข้อมูล PHOENIX [33,39] เงาที่ทำนายผิดจะถูกทำเครื่องหมายด้วยสีแดง 5. บทสรุป ในเอกสารนี้ เรานำเสนอคุณลักษณะเชิงพื้นที่เชิงพื้นที่หลายมิติ (STAMF) ที่แปลกใหม่สำหรับ CSLR ซึ่งมีจุดมุ่งหมายเพื่อเรียนรู้ความสัมพันธ์เชิงพื้นที่และเชิงเวลาและข้อมูลสำคัญจากลำดับของคุณลักษณะด้านภาพและคุณลักษณะประเด็นสำคัญในตอนท้าย วิธีการสิ้นสุด ในเฟรมเวิร์กของเรา โมดูลเชิงพื้นที่ได้รับการพัฒนาด้วยคุณสมบัติฟูลเฟรมจากข้อมูล RGB และจุดสำคัญจากจุดสำคัญของตัวกล้อง รวมถึงเข็มเป็นคุณสมบัติหลายอย่าง ชุดค่าผสมเหล่านี้ใช้เป็นอินพุตคุณสมบัติหลายสตรีมให้ประสิทธิภาพที่เหนือกว่าเมื่อเทียบกับแนวทางล้ำสมัยที่ใช้เฉพาะฟูลเฟรม หรือเปรียบเทียบกับวิธีที่ใช้ชุดข้อมูลหลายคุณสมบัติอื่น โดยเฉพาะอย่างยิ่งสำหรับชุดข้อมูล CSL จากนั้น เราเสนอโมดูลชั่วคราวที่ประกอบด้วยการรวมข้อมูลชั่วคราวและความสนใจชั่วคราวเพื่อเก็บข้อมูลสำคัญในโดเมนชั่วคราว การเพิ่มความสนใจชั่วขณะทำให้ได้รับคุณสมบัติที่สำคัญจากลำดับที่มีข้อมูลที่ไม่ถูกต้อง และให้การปรับปรุงที่สำคัญเมื่อเทียบกับรูปแบบหลายคุณลักษณะที่เราเสนอ นอกจากนี้ยังช่วยให้ลำดับการเรียนรู้เรียนรู้ได้ดีขึ้นและเพิ่มประสิทธิภาพเช่นเดียวกับการทดลองชุดข้อมูล CSL การทดลองอย่างกว้างขวางในชุดข้อมูลที่ใช้กันทั่วไปแสดงให้เห็นถึงความเหนือกว่าของแบบจำลองที่เราเสนอเหนือแบบจำลองที่ทันสมัย ​​โดยคะแนน WER ลดลงมากกว่า 50 เปอร์เซ็นต์สำหรับชุดข้อมูล CSL และลดลง 5 เปอร์เซ็นต์สำหรับชุดข้อมูล RWTH-PHOENIX ในอนาคต เราวางแผนที่จะใช้เทคนิคการเรียนรู้แบบถ่ายโอนกับโมเดลปัจจุบันของเรา รวมถึงนำงานที่กำลังดำเนินอยู่ไปใช้ในอุตสาหกรรมจริง

อ้างอิง

1. ดริว พี; ไรบัค, ด.; Deselaers, T.; ซาฮีดี ม.; Ney, H. เทคนิคการรู้จำเสียงสำหรับระบบการรู้จำภาษามือ ในการดำเนินการของ INTERSPEECH 2007, การประชุมประจำปีครั้งที่ 8 ของ International Speech Communication Association, Antwerp, Belgium, 27–31 สิงหาคม 2007; หน้า 2513–2516.

2. องอาจ วท.; Ranganath, S. การวิเคราะห์ภาษามืออัตโนมัติ: การสำรวจและอนาคตนอกเหนือจากความหมายคำศัพท์ IEEE ทรานส์ รูปแบบก้น. เครื่องจักร อินเทล. 2548, 27, 873–891. [ครอสรีฟ] [PubMed]

3. โวเกลอร์ ซี; Metaxas, D. กรอบการทำงานสำหรับการจดจำลักษณะต่างๆ พร้อมกันของภาษามืออเมริกัน คอมพิวเตอร์ เยี่ยม ภาพเข้าใจ 2544, 81, 358–384. [ครอสรีฟ]

4. โบว์เดน อาร์; วินด์ริดจ์, D.; คาดีร์, ท.; ซิสเซอร์แมน, อ.; Brady, M. A Linguistic Feature Vector for The Visual Interpretation of Sign Language. ในการประชุม European Conference on Computer Vision (ECCV), ปราก, สาธารณรัฐเช็ก, 11–14 พฤษภาคม 2547; หน้า 390–401

5. กาสุกูรธี น.; โรคาด, บี; บิดานี เอส; Dennisan, DA American Sign Language Alphabet Recognition using Deep Learning. arXiv 2019 arXiv:1905.05487

6. โคลเลอร์ โอ.; ซาร์การาน เอส; เนย์, เอช; Bowden, R. Deep Sign: การเปิดใช้งานการรู้จำภาษามืออย่างต่อเนื่องทางสถิติที่มีประสิทธิภาพผ่าน Hybrid CNN-HMM ภายใน เจ.คอมพิวเตอร์. เยี่ยม 2018, 126, 1311–1325. [ครอสรีฟ]

7. ปู เจ; โจว ว.; Li, H. Dilated Convolutional Network พร้อมการเพิ่มประสิทธิภาพแบบวนซ้ำเพื่อการจดจำภาษามืออย่างต่อเนื่อง ในการดำเนินการประชุมร่วมระหว่างประเทศครั้งที่ 27 เรื่องปัญญาประดิษฐ์, สตอกโฮล์ม, สวีเดน, 13–19 กรกฎาคม 2018; หน้า 885–891

8. ปู เจ; โจว ว.; Li, H. Iterative Alignment Network เพื่อการจดจำภาษามืออย่างต่อเนื่อง ในการดำเนินการประชุม IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 15–20 มิถุนายน 2019; หน้า 4160–4169.

9. Kumar, N. การติดตามการเคลื่อนไหวตามใบหน้าและมือของมนุษย์เพื่อการรู้จำภาษามือ ในการดำเนินการของ 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, India, 26–28 ตุลาคม 2017; หน้า 211–216.

10. บูยาน เอ็มเค; โกอาห์, ด.; Bora, PK กรอบการทำงานสำหรับการรู้จำท่าทางมือด้วยแอปพลิเคชันสำหรับภาษามือ ในรายงานการประชุมประจำปีของอินเดียประจำปี 2549, INDICON, นิวเดลี, อินเดีย, 15–17 กันยายน 2549; หน้า 1–6

11. ดาส เอสพี; ตะลักดาร์, AK; Sarma, KK การรู้จำภาษามือโดยใช้การแสดงออกทางสีหน้า ใน Proceedings of the Procedia Computer Science, Kerala, India, 10–13 สิงหาคม 2015; หน้า 210–216.

12. ราสท์กู อาร์.; เคียนี่, เค; เอสคาเลรา เอส; Saborou, M. การผลิตภาษามือ: บทวิจารณ์. ในการประชุมเชิงปฏิบัติการ 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), Nashville, TN, USA, 19–25 มิถุนายน 2021; หน้า 3446–3456.

13. ดง เอส; วังพี; Abbas, K. การสำรวจการเรียนรู้เชิงลึกและการประยุกต์ใช้ คอมพิวเตอร์ วิทย์ รายได้ 2021, 40, 100379 [CrossRef]

14. อทิตสฺส, ว.; นีเดิล ซี; สคลารอฟฟ์ เอส.; แนช, เจ; สเตฟาน, อ.; หยวน Q.; Thangali, A. ชุดข้อมูลวิดีโอคำศัพท์ภาษามืออเมริกัน ในการประชุมเชิงปฏิบัติการ 2008 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, CVPR Workshops, Anchorage, Alaska, 23–28 มิถุนายน 2551; หน้า 1–8

15. บังเกรอธ เจ; สไตน์ ด.; ดริว พี; เนย์, เอช; มอร์ริสซีย์ เอส; ทาง ก.; Zijl, LV คลังข้อมูลภาษามือของ ATIS ในการประชุมนานาชาติครั้งที่ 6 เกี่ยวกับแหล่งข้อมูลและการประเมินภาษา, LREC 2008, Marrakech, Morocco, 28–30 พฤษภาคม 2008; หน้า 2943–2946.

16. ปาปาสตราติส, I.; Chatzikonstantinou, C.; คอนสแตนตินิดิส, ด.; ดิมิโทรปูลอส เค; Daras, P. เทคโนโลยีปัญญาประดิษฐ์สำหรับภาษามือ เซ็นเซอร์ 2021, 21, 5843 [CrossRef] [PubMed]

17. โจว เอช; โจว ว.; โจว วาย; Li, H. เครือข่ายหลายคิวเชิงพื้นที่-ชั่วขณะเพื่อการจดจำภาษามืออย่างต่อเนื่อง ในการดำเนินการของ AAAI 2020—การประชุม AAAI ครั้งที่ 34 เรื่องปัญญาประดิษฐ์ นิวยอร์ก นิวยอร์ก สหรัฐอเมริกา 7–12 กุมภาพันธ์ 2020; หน้า 13009–13016.

18. Gündüz, C.; Polat, H. การรู้จำภาษามือของตุรกีขึ้นอยู่กับการรวมข้อมูลหลายกระแส เตอร์กิช เจ อิเลคเตอร์ อังกฤษ คอมพิวเตอร์ วิทย์ 2021, 29, 1171–1186 [ครอสรีฟ]

19. โบฮาเซก ม.; Hruz, M. Sign Pose-based Transformer สำหรับการรู้จำภาษามือระดับคำ ในรายงานการประชุม 2022 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops, WACVW, Waikoloa, HI, USA, 4–8 มกราคม 2022; หน้า 182–191.

20. Vaswani, A. ความสนใจคือสิ่งที่คุณต้องการ ใน Proceedings of the Conference on Neural Information Processing Systems, Long Beach, CA, USA, 4–9 ธันวาคม 2017; หน้า 1–11

21. โจว ม.; อึ้ง, ม.; ไค, ซี; Cheung, KC Self-attention Based Fully-Inception Networks เพื่อการรู้จำภาษามืออย่างต่อเนื่อง ด้านหน้า. อาร์ทิฟ อินเทล. แอป 2563, 325, 2832–2839.

22. แคมกอซ, นอร์ทแคโรไลนา; โคลเลอร์ โอ.; แฮดฟิฟิลด์ เอส; Bowden, R. Sign Language Transformers: การรับรู้และการแปลภาษามือแบบ end-to-end ในการประชุม IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA, 14–19 มิถุนายน 2020; หน้า 10020–10030.

23. มิน, ย.; เฮา, อ.; ชัย, เอ็กซ์; Chen, X. ข้อจำกัดในการจัดแนวภาพสำหรับการรู้จำภาษามืออย่างต่อเนื่อง ในการดำเนินการประชุม IEEE International Conference on Computer Vision (ICCV), มอนทรีออล, บริติชโคลัมเบีย, แคนาดา, 10–17 ตุลาคม 2021; หน้า 11542–11551.

24. กัว, ด.; โจว ว.; วัง ม.; Li, H. การรู้จำภาษามือขึ้นอยู่กับ HMM ที่ปรับเปลี่ยนได้พร้อมการเพิ่มข้อมูล ในการดำเนินการประชุม IEEE International Conference on Image Processing (ICIP), Phoenix, AZ, USA, 25–28 กันยายน 2016; หน้า 2876–2880.

25. หวาง เจ; โจว ว.; หลี่ เอช.; Li, W. การรู้จำภาษามือโดยใช้เครือข่ายประสาทเทียม 3 มิติ ในการดำเนินการประชุม IEEE International Conference on Multimedia and Expo (ICME), ตูริน, อิตาลี, 29 มิถุนายน–3 กรกฎาคม 2558; หน้า 1–6

26. กั่ว ด.; โจว ว.; หลี่ เอช.; Wang, M. ฟิวชั่นออนไลน์ช่วงต้นและปลายโดยใช้ HMM ที่ปรับเปลี่ยนได้สำหรับการจดจำภาษามือ ACM ทรานส์ มัลติ คอมพิวเตอร์ ชุมชน แอป 2017, 14, 1–18. [ครอสรีฟ]

27. อัลฮัมมาดี ม.; มูฮัมหมัด, G.; สมาชิก S. Hand Gesture Recognition สำหรับภาษามือโดยใช้ 3DCNN การเข้าถึง IEEE 2020, 8, 79491–79509 [ครอสรีฟ]

28. เรซา, เอช.; Joze, V. MS-ASL: ชุดข้อมูลขนาดใหญ่และเกณฑ์มาตรฐานสำหรับการทำความเข้าใจภาษามืออเมริกัน arXiv 2019, arXiv:1812.01053.

29. ลี่, ด.; โอปาโซ ซีอาร์ ; หยู เอ็กซ์; Li, H. การรู้จำภาษามือเชิงลึกระดับคำจากวิดีโอ: การเปรียบเทียบชุดข้อมูลขนาดใหญ่และวิธีการใหม่ ในรายงานการประชุม 2020 IEEE Winter Conference on Applications of Computer Vision, WACV, Snowmass Village, CO, USA, 1-5 มีนาคม 2020; หน้า 1448–1458

30. ปู เจ; โจว ว.; Li, H. การรู้จำภาษามือพร้อมคุณสมบัติหลายรูปแบบ ใน Proceedings of the Pacific Rim Conference on Multimedia, Xi'an, China, 15–16 กันยายน 2016; หน้า 252–261.

31. เจียง ส.; อาทิตย์, บี; วัง, ล.; ไป๋ ย.; ลี่, เค; Fu, Y. Skeleton Aware การรู้จำภาษามือหลายรูปแบบ ในการดำเนินการประชุม IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, Nashville, TN, USA, 19–25 มิถุนายน 2021; หน้า 3408–3418.

32. ซิดิก, เอเอไอ; ลุกมาน, เอช.; มาห์มูด เอส; Mohandes, M. KArSL: ฐานข้อมูลภาษามืออารบิก ACM ทรานส์ ทรัพยากรต่ำในเอเชีย หรั่ง. รายละเอียด กำลังดำเนินการในปี 2021, 20, 1–19 [ครอสรีฟ]

33. โคลเลอร์ โอ.; ฟอร์สเตอร์ เจ; Ney, H. การรู้จำภาษามืออย่างต่อเนื่อง: ไปสู่ระบบการรู้จำทางสถิติของคำศัพท์ขนาดใหญ่ที่จัดการผู้ลงนามหลายคน คอมพิวเตอร์ เยี่ยม ภาพเข้าใจ 2558, 141, 108–125. [ครอสรีฟ]

34. โคลเลอร์ โอ.; แคมกอซ นอร์ทแคโรไลนา ; Ney, H. การเรียนรู้ภายใต้การดูแลอย่างอ่อนด้วย CNN-LSTM-HMM แบบหลายสตรีมเพื่อค้นหาความเท่าเทียมตามลำดับในวิดีโอภาษามือ IEEE ทรานส์ รูปแบบก้น. เครื่องจักร อินเทล. 2563, 42, 2306–2320. [ครอสรีฟ] [PubMed]

35. แคมกอซ, นอร์ทแคโรไลนา; แฮดฟิฟิลด์ เอส; โคลเลอร์ โอ.; Bowden, R. SubUNets: รูปร่างมือแบบ end-to-end และการรู้จำภาษามือแบบต่อเนื่อง ในการดำเนินการประชุม IEEE International Conference on Computer Vision (ICCV) ประจำปี 2560 เมืองเวนิส อิตาลี 22-29 ตุลาคม 2560 หน้า 3075–3084

36. ต๋อง ซี; ภักดี, ซีซี; เขาเค; Tang, X. ความละเอียดของภาพสูงโดยใช้ Deep Convolutional Networks IEEE ทรานส์ รูปแบบก้น. เครื่องจักร อินเทล. 2557, 38, 295–307. [ครอสรีฟ] [PubMed]

37. เบรสเซม เคเค; อดัมส์ แอลซี; เออร์เซลเบน ซี; แฮมม์ บี; Niehues เอสเอ็ม; Vahldiek, JL การเปรียบเทียบสถาปัตยกรรมการเรียนรู้เชิงลึกที่แตกต่างกันสำหรับการจำแนกประเภทของภาพรังสีทรวงอก วิทย์ ตัวแทน 2020, 10, 13590 [CrossRef]

38. อาทิตย์ พ.; เสี่ยว บี; หลิว ด.; Wang, J. การเรียนรู้การเป็นตัวแทนความละเอียดสูงเชิงลึกสำหรับการประมาณท่าทางของมนุษย์ ในการดำเนินการประชุม IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 15–20 มิถุนายน 2019; หน้า 5686–5696.

39. โคลเลอร์ โอ.; ซาร์การาน เอส; Ney, H. Re-Sign: ปรับแนวการสร้างแบบจำลองลำดับจากต้นทางถึงปลายทางอีกครั้งด้วย CNN-HMMs ที่เกิดซ้ำลึก ใน Pro ceedings ของ 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Honululu, HI, USA, 21–26 กรกฎาคม 2017; หน้า 3416–3424.

40. โจว เอช; โจว ว.; Li, H. การถอดรหัสฉลากหลอกแบบไดนามิกสำหรับการจดจำภาษามืออย่างต่อเนื่อง ในรายงานการประชุม 2019 IEEE International Conference on Multimedia and Expo (ICME), เซี่ยงไฮ้, จีน, 18–21 กรกฎาคม 2019; หน้า 1282–1287

41. เสี่ยว Q.; ช้าง, เอ็กซ์; จาง เอ็กซ์; Liu, X. การรู้จำภาษามือตามวิดีโอโดยไม่มีการแบ่งส่วนชั่วคราว ในการดำเนินการประชุม AAAI ครั้งที่ 30 เรื่องปัญญาประดิษฐ์, นิวออร์ลีนส์, แอลเอ, สหรัฐอเมริกา, 2–7 กุมภาพันธ์ 2018; หน้า 2257–2264.

42. เกรฟส์, อ.; เฟอร์นันเดซ, เอส; โกเมซ, เอฟ; Schmidhuber, J. การจำแนกประเภทชั่วคราวของ Connectionist: การติดฉลากข้อมูลลำดับที่ไม่ได้แบ่งส่วนด้วยโครงข่ายประสาทเทียมที่เกิดซ้ำ ใน Proceedings of the ICML '06: Proceedings of the 23rd international conference on Machine learning, Pittsburgh, PA, USA, 25–29 มิถุนายน 2549; หน้า 369–376

43. เกรฟส์, อ.; Liwicki, ม.; เฟอร์นันเดซ, เอส; เบอร์โทลามี อาร์; Bunke, H.; Schmidhuber, J. ระบบ Connectionist ใหม่สำหรับการรู้จำลายมือที่ไม่มีข้อจำกัด IEEE ทรานส์ รูปแบบก้น. เครื่องจักร อินเทล. 2009, 31, 855–868 [ครอสรีฟ]

44. กั๋ว, ด.; โจว ว.; หลี่ เอช.; Wang, M. Hierarchical LSTM สำหรับการแปลภาษามือ ในการประชุม AAAI Conference on Artifificial Intelligence, New Orleans, LA, USA, 2–7 กุมภาพันธ์ 2018; หน้า 6845–6852.

45. ราห์มาน เอ็มเอ็ม; วาตาโนเบะ, วาย; Nakamura, K. โมเดลภาษา LSTM แบบสองทิศทางสำหรับการประเมินและซ่อมแซมโค้ด ความสมมาตร 2021, 13, 247 [CrossRef]

46.หู ว.; ไค, ม.; เฉิน เค; ดิง เอช; อาทิตย์, ล.; เหลียง เอส; โม, X.; Huo, Q. การฝึกอบรมการเลือกปฏิบัติตามลำดับสำหรับการรู้จำลายมือออฟไลน์โดย CTC ที่สอดแทรกและฟังก์ชันวัตถุประสงค์ MMI ที่ปราศจาก Lattice ในรายงานการประชุมระหว่างประเทศว่าด้วยการวิเคราะห์และการรับรู้เอกสาร, ICDAR, เกียวโต, ญี่ปุ่น, 9-15 พฤศจิกายน 2017; เล่ม 1, หน้า 61–66.

47. โยชิมูระ ท.; ฮายาชิ, ที; ทาเคดะ เค; Watanabe, S. การรู้จำเสียงอัตโนมัติแบบ end-to-end ที่รวมเข้ากับการตรวจจับกิจกรรมเสียงที่ใช้ CTC ในการดำเนินการของ ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing, บาร์เซโลนา, สเปน, 4–8 พฤษภาคม 2020; หน้า 6999–7003

48. กั๋ว, ด.; วัง ส.; เทียน Q.; Wang, M. Dense Temporal Convolution Network สำหรับการแปลภาษามือ ใน Proceedings of the Twenty-Eighth International Joint Conference on Artifificial Intelligence (IJCAI-19), มาเก๊า, จีน, 10–16 สิงหาคม 2017; หน้า 744–750

49. วัง ส.; Guo, D.; โจว ว.; Zha, Z.; Wang, M. Connectionist Temporal Fusion สำหรับการแปลภาษามือ ในรายงานการประชุม ACM International Conference on Multimedia ครั้งที่ 26, โซล, เกาหลี, 22–26 ตุลาคม 2018; หน้า 1483–1491

50. หยาง ซี; Shi, Z. SF-Net: เครือข่ายคุณสมบัติที่มีโครงสร้างเพื่อการจดจำภาษามืออย่างต่อเนื่อง arXiv 2019 arXiv:1908.01341

51. เฉิง กัวลาลัมเปอร์; หยาง ซี; เฉิน, Q.; Tai, Y. เครือข่าย Convolutional เต็มรูปแบบเพื่อการรู้จำภาษามืออย่างต่อเนื่อง ใน Proceedings of the European Conference on Computer Vision, Glasgow, UK, 23–28 สิงหาคม 2020; หน้า 697–714.

52. โคลเลอร์ โอ.; เนย์, เอช; Bowden, R. Deep Hand: วิธีฝึกฝน CNN บนภาพมือ 1 ล้านภาพ เมื่อข้อมูลของคุณต่อเนื่องและมีป้ายกำกับที่อ่อนแอ ในการประชุม 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, 27–30 มิถุนายน 2016; หน้า 3793–3802.

53. Slimane, FB Context Matters: การใส่ใจตนเองในการรู้จำภาษามือ arXiv 2021 arXiv:2101.04632

54. นิว, Z.; Mak, B. Stochastic Fine-grained Labeling of Multi-state Sign Glosses เพื่อการจดจำภาษามืออย่างต่อเนื่อง ใน Proceedings of the European Conference on Computer Vision, Glasgow, UK, 23–28 สิงหาคม 2020; หน้า 1–16

55. ชุย ร.; หลิว เอช; Zhang, C. กรอบประสาทเชิงลึกสำหรับการรู้จำภาษามืออย่างต่อเนื่องโดยการฝึกอบรมซ้ำ IEEE ทรานส์ มัลติ 2019, 21, 1880–1891 [ครอสรีฟ]

56. ปู, เจ; โจว ว.; หู, เอช.; Li, H. ส่งเสริมการรับรู้ภาษามืออย่างต่อเนื่องผ่านการเพิ่มรูปแบบข้าม ในการประชุม ACM International Conference on Multimedia ครั้งที่ 28, Seattle, WA, USA, 12–16 ตุลาคม 2020; หน้า 1497–1505

คุณอาจชอบ