ปรับปรุงการแยกพารามิเตอร์คุณสมบัติจากสัญญาณเสียงโดยใช้อัลกอริทึมการเรียนรู้ของเครื่อง (2)
May 30, 2023
3.7. กระบวนการรวบรวมและการสร้างชุดข้อมูลได้ดำเนินการดังนี้ ในการศึกษานี้ ใช้ชุดข้อมูลที่มีเสียง 120 ชั่วโมงสำหรับการฝึกอบรมแบบจำลอง ชุดข้อมูลประกอบด้วยการบันทึกเสียงคำพูดซึ่งประกอบด้วยประโยคที่มีความยาวสูงสุด 15 คำ โดยมีความยาวรวมประมาณ 120 ชั่วโมง

โสมทะเลทราย
นอกจากนี้ ชุดข้อมูลยังมีข้อความต่างๆ จำนวนมากเพื่อใช้ในการพัฒนาโมเดลภาษา รวบรวมคำพูดมากกว่า 90,650 คำ 415,780 คำ และคำเฉพาะ 65,810 คำที่รวมอยู่ในคลังข้อความ ทำให้มีข้อมูลคำพูดที่ถอดความได้ประมาณ 120 ชั่วโมง เราแบ่งชุดข้อมูลออกเป็นชุดการฝึก การตรวจสอบ และการทดสอบ สถิติชุดข้อมูล
มีรายงานไว้ในตารางที่ 3
ตารางที่ 3. ข้อมูลจำเพาะของชุดข้อมูล

เราแบ่งชุดข้อมูลออกเป็นสามโฟลเดอร์ที่สอดคล้องกับชุดการฝึกอบรม การตรวจสอบ และการทดสอบ แต่ละโฟลเดอร์มีการบันทึกเสียงและการถอดเสียง ชื่อไฟล์เสียงและการถอดความที่สอดคล้องกันจะเหมือนกัน ยกเว้นว่าการบันทึกเสียงจะถูกจัดเก็บเป็นไฟล์ WAV ในขณะที่การถอดเสียงจะจัดเก็บเป็นไฟล์ TXT โดยใช้การเข้ารหัส UTF-8 การถอดความทั้งหมดแสดงโดยใช้ตัวอักษรละตินซึ่งประกอบด้วยตัวอักษร 29 ตัวและสัญลักษณ์อะพอสทรอฟี เพื่อป้องกันการโอเวอร์ฟิต เราใช้เทคนิคการเพิ่มข้อมูลตามการรบกวนความเร็วและการปรับปรุงสเปกตรัม

ซิสแทนช์ เดสทิโคลา
4. วิธีการที่เสนอ
งานที่สำคัญสำหรับโปรแกรมเมอร์ในการพัฒนาระบบการรู้จำเสียงคือการสร้างวิธีการที่เหมาะสมที่สุดสำหรับการแสดงออกของสัญญาณเสียงพูดแบบพาราเมตริก [45] วิธีนี้ทำให้สามารถแยกเสียงและคำพูดได้อย่างยอดเยี่ยม ในขณะเดียวกันก็มั่นใจได้ว่าผู้พูดจะไม่ไวต่อรูปแบบการออกเสียงและการเปลี่ยนแปลงของสภาพแวดล้อมทางเสียง ข้อผิดพลาดส่วนใหญ่ในการรู้จำคำศัพท์เกิดจากการเปลี่ยนแปลงของระดับเสียงของสัญญาณเนื่องจากการเปลี่ยนไมโครโฟนหรือความแตกต่างของระดับเสียงของการออกเสียง [46] สาเหตุทั่วไปอีกประการของข้อผิดพลาดคือการผิดรูปแบบไม่เชิงเส้นแบบสุ่มของรูปร่างสเปกตรัม ซึ่งมักปรากฏอยู่ในสัญญาณเสียงพูดของผู้พูด [47,48] ดังนั้น หนึ่งในงานที่สำคัญที่สุดในการสร้างระบบการรู้จำเสียงที่มีประสิทธิภาพคือการเลือกตัวแทนที่เพียงพอสำหรับเนื้อหาของสัญญาณที่วิเคราะห์ รวมทั้งไม่ไวต่อเสียงของผู้พูดและสภาพแวดล้อมทางเสียงต่างๆ

Cistanche เสริมใกล้ฉัน-ปรับปรุงหน่วยความจำ
ระบบที่ใช้สำหรับการแยกพารามิเตอร์คุณลักษณะโดยทั่วไปมีข้อกำหนดต่อไปนี้ เนื้อหาข้อมูล ซึ่งก็คือชุดของพารามิเตอร์คุณลักษณะ จะต้องทำให้มั่นใจถึงการระบุองค์ประกอบของคำพูดที่สามารถจดจำได้อย่างน่าเชื่อถือ นอกจากนี้ ความดัง ซึ่งก็คือการบีบอัดสูงสุดของสัญญาณเสียง และความสัมพันธ์ที่ไม่ใช่ทางสถิติของพารามิเตอร์จะต้องลดลงให้เหลือน้อยที่สุด ต้องบรรลุความเป็นอิสระจากผู้พูดนั่นคือการลบข้อมูลสูงสุดที่เกี่ยวข้องกับลักษณะของผู้พูดออกจากเวกเตอร์ของอักขระ สุดท้าย ความเป็นเนื้อเดียวกัน ซึ่งหมายถึงพารามิเตอร์ที่มีความแปรปรวนเฉลี่ยเท่ากันและความสามารถในการใช้เมตริกอย่างง่ายเพื่อกำหนดความสัมพันธ์ระหว่างชุดอักขระ ต้องระบุ [49] อย่างไรก็ตาม ไม่สามารถปฏิบัติตามข้อกำหนดทั้งหมดพร้อมกันได้เสมอไป เนื่องจากข้อกำหนดดังกล่าวขัดแย้งกัน คำอธิบายพารามิเตอร์ขององค์ประกอบคำพูดควรมีรายละเอียดเพียงพอที่จะแยกความแตกต่างได้อย่างน่าเชื่อถือและควรพูดน้อยที่สุดเท่าที่จะเป็นไปได้

ซุปสมุนไพรซุปเปอร์แมน
ในทางปฏิบัติ สัญญาณเสียงพูดที่ได้รับจากไมโครโฟนจะถูกแปลงเป็นดิจิทัลที่อัตราการสุ่มตัวอย่าง 8 ถึง 22 kHz ค่าตัวเลขอนุกรมแบ่งออกเป็นส่วนย่อยของคำพูด (เฟรม) ด้วยระยะเวลา 10 ถึง 30 มิลลิวินาที ซึ่งสอดคล้องกับส่วนคำพูดกึ่งนิ่ง เวกเตอร์ของคุณลักษณะต่างๆ จะถูกคำนวณจากแต่ละเฟรม ซึ่งต่อมาจะใช้ในระดับอะคูสติกของการรู้จำเสียง ในปัจจุบัน มีวิธีการที่หลากหลายสำหรับการแสดงสัญญาณแบบพาราเมตริกโดยอิงจากการวิเคราะห์ความสัมพันธ์อัตโนมัติ การกรองเชิงเส้นของฮาร์ดแวร์ การวิเคราะห์สเปกตรัม และ LPC วิธีการทั่วไปสำหรับการกำหนดพารามิเตอร์ของเสียงพูดคือการวิเคราะห์สเปกตรัมของชิ้นส่วนสัญญาณและการคำนวณค่าสัมประสิทธิ์เซพสตรัล
MFCCs ถูกนำมาใช้เป็นคุณลักษณะข้อมูลสำหรับสัญญาณเสียงพูด [41] คุณลักษณะเหล่านี้ใช้อย่างกว้างขวางในการรู้จำเสียงและอิงตามแนวคิดหลักสองประการ: มาตราส่วนเซพสตรัลและเมล ข้อได้เปรียบหลักของอัลกอริทึมคือความคุ้นเคยในระดับสูงและความง่ายในการพูด คุณสมบัติ MFCC จะแยกออกจากสัญญาณเสียงพูดที่บันทึกไว้ อัลกอริทึม MFCC ใช้ผลลัพธ์ของโฟโนแกรมและอัลกอริธึมการสลับสเปกตรัม อัลกอริทึมแบบคลาสสิกที่ใช้ในการคำนวณ MFCC แสดงไว้ในรูปที่ 5

รูปที่ 5 รูปแบบคลาสสิกสำหรับการคำนวณ MFCC
การศึกษานี้นำเสนอวิธีการที่รวดเร็วในการแยกพารามิเตอร์ของฟังก์ชันออกจากสัญญาณเสียงพูด อัลกอริทึมที่เสนอสำหรับการคำนวณอย่างรวดเร็วของ MFCC แสดงไว้ในรูปที่ 6

รูปที่ 6 กรอบที่เสนอสำหรับการคำนวณ MFCC
เราพิจารณาลำดับการดำเนินการของอัลกอริทึมที่เสนอสำหรับการแยกพารามิเตอร์ฟังก์ชันอย่างรวดเร็วจากสัญญาณเสียงพูด
4.1. แบ่งเป็นเฟรม
หลังจากการกรองเบื้องต้น สัญญาณเสียงพูดจะถูกแบ่งออกเป็นเฟรม 16 มิลลิวินาที ทุกเฟรม (ยกเว้นเฟรมแรก) จะมี 10 มิลลิวินาทีสุดท้ายของเฟรมก่อนหน้า กระบวนการนี้ดำเนินต่อไปจนกว่าจะสิ้นสุดสัญญาณ ในการศึกษานี้ เนื่องจากอัตราการสุ่มตัวอย่างสัญญาณเสียงพูดคือ 16 kHz ความยาวเฟรมคือ N=256 และความยาวออฟเซ็ตคือ M=160 ความเหลื่อมกันคือ 62.5 เปอร์เซ็นต์ของความยาวเฟรม โดยทั่วไปแนะนำให้ครอบคลุม 50 เปอร์เซ็นต์ถึง 75 เปอร์เซ็นต์ของความยาวเฟรม
4.2. Hanning Window และค่าที่ลดลง
ใช้หน้าต่าง Hanning ขนาด 1D หน้าต่าง Hanning เรียกอีกอย่างว่าหน้าต่างโคไซน์ที่ยกขึ้น หน้าต่าง Hanning เปรียบได้กับผลรวมของสเปกตรัมความถี่ของหน้าต่างเวลาสี่เหลี่ยมสามช่อง มันสามารถใช้กลีบข้างเพื่อหักล้างกัน ขจัดสัญญาณรบกวนความถี่สูงและการรั่วไหลของพลังงาน Hanning windows เป็นฟังก์ชั่นหน้าต่างที่มีประโยชน์มาก

Cistanche เสริมใกล้ฉัน-ปรับปรุงหน่วยความจำ
คลิกที่นี่เพื่อดูผลิตภัณฑ์ Cistanche พัฒนาความจำและป้องกันโรคอัลไซเมอร์
【สอบถามเพิ่มเติม】 อีเมล:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
กล่องน้ำหนักถูกใช้เพื่อลดความผิดเพี้ยนและทำให้เฟรมแต่ละเฟรมเรียบขึ้น สัญญาณลอยตัวที่ตรวจสอบในการศึกษานี้ประกอบด้วยโทนเสียงที่หนาแน่น ขนาดของโทนเสียงเรียบถูกกำหนดโดยขนาดของโทนบริสุทธิ์ที่ความถี่ f ซึ่งถูกกรองผ่านหน้าต่าง Hanning
สิ่งสำคัญของหน้าต่างนี้คือการกำหนดเส้นขอบของเฟรมให้เป็นศูนย์ ในกรณีนี้ พลังงานช่วงสั้นๆ สามารถคำนวณได้ขณะผ่านหน้าต่าง และสามารถถ่ายโอนจากลำดับที่ใช้ในการคำนวณพลังงานแอมพลิจูดต่ำสุดได้ จุดมุ่งหมายคือการลบสัญญาณพลังงานต่ำออกจากสัญญาณโดยการคำนวณพลังงานสัญญาณในขณะที่ปรับสัญญาณให้เรียบจากหน้าต่างนี้ กระบวนการนี้ต้องการสมการพลังงานสัญญาณต่อไปนี้:

โดยที่ En คือพลังงานของส่วนสัญญาณอินพุต และ xi คือค่าสัญญาณ
นอกเหนือจากการประมวลผลหน้าต่างโดยใช้ (11) สัญญาณจะถูกประมวลผลในขั้นตอนถัดไป ซึ่งลดจำนวนค่าที่เข้าสู่โปรเซสเซอร์ลงอย่างมาก รูปที่ 7 แสดงขั้นตอนวิธีการประมวลผลแบบขนาน
ขนาดหน้าต่างแสดงจำนวนตัวอย่างและระยะเวลา เป็นตัวแปรหลักของการวิเคราะห์ ขนาดหน้าต่างขึ้นอยู่กับความถี่พื้นฐาน ความเข้ม และการเปลี่ยนแปลงของสัญญาณ

รูปที่ 7. อัลกอริทึม Hanning window สำหรับการถอดชิ้นส่วนที่เงียบ 4.3. Short-Time Fourier Transform (STFT) Switches มีความเข้าใจโดยสัญชาตญาณของความหมายของความสูงที่สูงหรือต่ำ STFT เป็นการแปลงฟูเรียร์ที่เกี่ยวข้องซึ่งใช้เพื่อกำหนดความถี่ไซน์และเนื้อหาเฟสของส่วนท้องถิ่นของสัญญาณเมื่อมีการเปลี่ยนแปลงเมื่อเวลาผ่านไป ในทางปฏิบัติ การคำนวณ STFT เกี่ยวข้องกับการแบ่งสัญญาณเวลาที่ยาวกว่าออกเป็นส่วนสั้นๆ ที่มีความยาวเท่ากัน โดยการคำนวณการแปลงฟูริเยร์แยกกันในแต่ละส่วนที่สั้นกว่า ซึ่งเผยให้เห็นสเปกตรัมฟูเรียร์ของแต่ละส่วนที่สั้นกว่า สัญญาณแบบไม่ต่อเนื่องของเวลาคือ ใช้ในทางปฏิบัติ การแปลงความถี่เวลาที่สอดคล้องกันคือการแปลงฟูเรียร์แบบไม่ต่อเนื่อง ซึ่งอธิบายความยาวของสัญญาณ Xn ในฐานะตัวแทนของโดเมนความถี่ค่าเชิงซ้อนของค่าสัมประสิทธิ์ N STFT ซึ่งอธิบายถึงวิวัฒนาการของส่วนประกอบความถี่เมื่อเวลาผ่านไป เป็นหนึ่งในเครื่องมือที่ใช้กันอย่างแพร่หลายสำหรับการวิเคราะห์และประมวลผลคำพูด [50] เช่นเดียวกับสเปกตรัม ข้อดีอย่างหนึ่งของ STFT คือพารามิเตอร์มีการตีความทางกายภาพและใช้งานง่าย โดยทั่วไปแล้ว STFT จะแสดงภาพโดยใช้ log spectra 20log10 (X(h, k)) จากนั้นสามารถดูสเปกตรัมบันทึก 2 มิติดังกล่าวได้โดยใช้แผนที่ความร้อนที่เรียกว่าสเปกตรัม ในขั้นตอนที่สามของอัลกอริทึม ขั้นตอนการสลับสเปกตรัมของ STFT จะถูกนำไปใช้กับเฟรมที่ส่งผ่านหน้าต่างน้ำหนัก ได้รับ STFT ของสัญญาณโดยการเปิดหน้าต่างและกำหนด DFT ของแต่ละหน้าต่าง โดยเฉพาะอย่างยิ่ง การแปลงสำหรับหน้าต่าง Xn และ Wn ของสัญญาณอินพุตถูกกำหนดดังนี้:

โดยที่ดัชนี k สอดคล้องกับค่าความถี่ และ wn คือฟังก์ชันหน้าต่าง ซึ่งโดยทั่วไปคือหน้าต่าง Hanning หรือหน้าต่าง Gaussian ที่มีศูนย์กลางอยู่ที่ศูนย์
4.4. เมลทรานส์ฟอร์ม
ในขั้นที่สี่ สัญญาณที่ถ่ายโอนไปยังย่านความถี่จะถูกแบ่งออกเป็นช่วงโดยใช้ตัวกรองรูปสามเหลี่ยม ขอบเขตตัวกรองคำนวณโดยใช้ความถี่ชอล์ค การเปลี่ยนไปใช้ฟิลด์ความถี่ชอล์คขึ้นอยู่กับสมการต่อไปนี้:

โดยที่ f คือช่วงความถี่
สวิตช์ย้อนกลับถูกกำหนดดังนี้:

พิจารณา NN เป็นจำนวนของตัวกรอง (โดยทั่วไปจะใช้ตัวกรอง 26 ตัว) และจำนวนโฟลว์ ซึ่งสูงเท่ากับช่วงความถี่ที่ศึกษา ช่วงนี้จะถูกถ่ายโอนไปยังมาตราส่วน Mel และแบ่งออกเป็น NN ที่กระจายอย่างสม่ำเสมอ ขอบเขตที่เหมาะสมของความถี่เชิงเส้นถูกกำหนดภายในฟิลด์ ในขณะที่ค่าสัมประสิทธิ์การถ่วงน้ำหนักที่ได้รับจากการกรองจะแสดงโดย H ต่อจากนั้น ตัวกรองจะถูกนำไปใช้กับโมดูลัสกำลังสองของค่าสัมประสิทธิ์ที่ได้จากการแปลงฟูริเยร์ ค่าที่ได้รับเป็นลอการิทึมเนื่องจากนิพจน์ต่อไปนี้:

อัลกอริธึมการแยกย่อยค่าเอกพจน์ถูกนำมาใช้ในขั้นตอนสุดท้ายของการคำนวณ MFCC
5. ผลการทดลอง
เราได้ดำเนินการและทดสอบวิธีการที่เสนอใน Visual Studio 2019 C plus plus บนพีซีที่มี CPU 4.90 GHz, RAM 32 GB และ GPU Nvidia GeForce 2080Ti สองตัว ดังแสดงในตารางที่ 4 ระบบได้รับการทดสอบในสภาพแวดล้อมของอุปกรณ์ต่างๆ เพื่อ ประเมินประสิทธิภาพของวิธีการแยกคุณลักษณะสัญญาณ ในการทดลอง ระหว่างการทำงานของอัลกอริทึม (รูปที่ 8) เมื่อลำดับพื้นผิวของสัญญาณเป็น n=15 จำนวนของค่าจะลดลง 40–50 เปอร์เซ็นต์ และเวลาในการประมวลผลเพิ่มขึ้น 1 2-พับ ดังนั้น อัลกอริทึมนี้จึงแสดงประสิทธิภาพที่สูงขึ้นอย่างมาก ยิ่งไปกว่านั้น อัลกอริทึมนี้ยังช่วยให้สามารถแยกและกำจัดพื้นที่เงียบได้ในขณะที่ผ่านหน้าต่าง Hanning
มีหลายวิธีที่เป็นไปได้เพื่อหลีกเลี่ยงการสิ้นเปลืองแบนด์วิธหน่วยความจำ เรานำเสนอโซลูชันใหม่ที่เพิ่มประสิทธิภาพการประมวลผลโดยจับคู่ขนาดของเฟรมสัญญาณกับขนาดบล็อกของหน่วยความจำแคช การเพิ่มประสิทธิภาพประเภทนี้สามารถส่งผลกระทบอย่างมากต่อประสิทธิภาพการประมวลผลแบบขนานโดยรวม อย่างไรก็ตาม สามารถใช้ในการประมวลผลสัญญาณดิจิทัลโดยแบ่งสัญญาณออกเป็นเฟรมผ่านการใช้งานบนโปรเซสเซอร์แบบมัลติคอร์ อย่างไรก็ตาม ในทางปฏิบัติ การเลือกมักจะดำเนินการในขนาดเล็ก ซึ่งสอดคล้องกับความกว้างของบัสข้อมูลที่เชื่อมต่อหน่วยความจำแคชกับหน่วยความจำหลักและขนาดของบล็อก วิธีการของเราใช้หน่วยความจำเหล่านี้ให้เกิดประโยชน์สูงสุดในการคำนวณแบบขนาน การจัดระเบียบของหน่วยความจำแคชมีบทบาทสำคัญในอัลกอริธึมการประมวลผลแบบขนานเมื่อแบ่งข้อมูลออกเป็นสตรีม โดยเฉพาะอย่างยิ่ง การมีอยู่ของเอฟเฟกต์ vector-matrix ในการประมวลผลสัญญาณดิจิทัลและขนาดของสตรีมควรปรับตามขนาดของบล็อกแคช สามารถทำได้โดยใช้วิธีการที่เสนอดังแสดงในรูปที่ 9
ตารางที่ 4. ข้อมูลจำเพาะโดยละเอียดของการตั้งค่าการทดลอง


รูปที่ 8 (a) สัญญาณขาเข้าเริ่มต้นและ (b) ลักษณะของสัญญาณหลังจากใช้อัลกอริทึมที่เสนอ

รูปที่ 9 โครงสร้างการคำนวณแบบขนานโดยใช้โปรเซสเซอร์ RK3288
ในส่วนนี้ เราจะหารือเกี่ยวกับการวิเคราะห์เชิงปริมาณเพื่อเปรียบเทียบประสิทธิภาพของระบบต่างๆ เราเปรียบเทียบวิธีการของเรากับการรู้จำเสียงและจังหวะที่เป็นที่รู้จักโดยใช้วิธีการเรียนรู้เชิงลึก เมตริกการประเมินผลมีความจำเป็นสำหรับการคำนวณกลยุทธ์ต่างๆ สำหรับการรู้จำเสียงและประเมินประสิทธิภาพของแนวทางต่างๆ แม้ว่าเราจะใช้ผลการศึกษาอื่นๆ เพื่อเปรียบเทียบ แต่เราก็ไม่แน่ใจว่าจะเป็นจริงหรือไม่ เนื่องจากซอร์สโค้ดและชุดข้อมูลของวิธีการเหล่านี้ไม่เปิดเผยต่อสาธารณะเพื่อตรวจสอบประสิทธิภาพที่แท้จริง รูปที่ 10 แสดงผลของการเคลื่อนย้ายส่วนที่เงียบอีกครั้งระหว่างการผ่านของชิ้นส่วนสัญญาณเสียงพูดผ่านหน้าต่าง Han ning ตามอัลกอริทึมอย่างรวดเร็วที่เสนอ ผลลัพธ์ความเร็วที่ได้จากการวิเคราะห์แสดงในตารางที่ 5

รูปที่ 10 ค่า k ของอัลกอริทึม KNN (พร้อมการเลือกคุณสมบัติ)
ตารางที่ 5 ผลการทดลองของวิธีที่เสนอ

มีการกำหนดช่วงเพื่อหาระดับของย่านที่ให้ค่าความแม่นยำดีที่สุดในอัลกอริทึม KNN ช่วงที่ระบุครอบคลุม 1–25 ในรูปที่ 10 กราฟของอัลกอริทึม KNN พร้อมการเลือกคุณลักษณะถูกนำไปใช้ เมื่อตรวจสอบกราฟ เมื่อค่าย่านความถี่เป็น 1 ในตอนเริ่มต้น ความแม่นยำในการฝึกจะสูงกว่าความแม่นยำในการทดสอบมาก ในอัลกอริทึม KNN ที่สร้างขึ้นโดยใช้คุณสมบัติที่เลือกโดยความสัมพันธ์ ความแม่นยำของแบบจำลองถูกกำหนดให้เป็น 99.15 เปอร์เซ็นต์ในชุดข้อมูลการฝึกอบรมและ 97.35 เปอร์เซ็นต์ในชุดข้อมูลทดสอบ
โดยทั่วไป อัตราข้อผิดพลาดของคำ (WER) หรืออัตราข้อผิดพลาดของอักขระใช้เพื่อประเมินความถูกต้องของการแยกคุณลักษณะจากสัญญาณเสียงพูด เหล่านี้เป็นเมทริกซ์วัตถุประสงค์ที่เป็นประโยชน์สำหรับการเปรียบเทียบอย่างยุติธรรมของเทคนิคการจดจำ ในการศึกษาก่อนหน้านี้ [51–56] เราคำนวณเมตริกต่างๆ เช่น F-measure (FM) ความแม่นยำ และการเรียกคืน FM คือค่าเฉลี่ยถ่วงน้ำหนักที่สร้างสมดุลการวัดระหว่างความแม่นยำและอัตราการเรียกคืน ความแม่นยำคืออัตราส่วนของจำนวนการสังเกตเชิงบวกที่คาดการณ์ไว้อย่างถูกต้องต่อจำนวนการสังเกตเชิงบวกที่คาดการณ์ไว้ทั้งหมด การเรียกคืนคืออัตราส่วนของจำนวนการสังเกตเชิงบวกที่คาดการณ์ไว้อย่างถูกต้องต่อจำนวนการสังเกตทั้งหมดในชั้นเรียนจริงตามที่ระบุไว้ใน (9) สามารถใช้สมการต่อไปนี้เพื่อคำนวณความแม่นยำเฉลี่ยและอัตราการเรียกคืนของวิธีการแยกคุณลักษณะ:

โดยที่ TP หมายถึงจำนวนของผลบวกจริง FP หมายถึงจำนวนของผลบวกปลอม และ FN หมายถึงจำนวนของผลลบลวง
FM คำนวณโดยใช้ (10) พิจารณาทั้งความแม่นยำและการเรียกคืน

ค่าเฉลี่ย FM การเรียกคืน และความแม่นยำของวิธีที่เสนอคือ 98.4 เปอร์เซ็นต์ การตรวจจับที่ผิดพลาดเกิดขึ้นใน 1.6 เปอร์เซ็นต์ของกรณีเนื่องจากสัญญาณรบกวนที่ไม่ต้องการที่ไมโครโฟน ช่วงของความแม่นยำของแบบจำลองอยู่ระหว่าง 0 ถึง 1 และคะแนนการประมาณเมตริกถึงค่าที่ดีที่สุดที่ 1 การประเมินวิธีการของเราและวิธีการแยกคุณลักษณะเสียงพูดอื่นๆ ที่เผยแพร่เมื่อเร็วๆ นี้แสดงในตารางที่ 6 หมายเลขเดียวกัน ของคุณสมบัติถูกนำมาใช้เพื่อการเปรียบเทียบอย่างยุติธรรม ตัวอย่างคำพูดทั้งหมด 325 ตัวอย่างจากแต่ละกลุ่มได้รับการวิเคราะห์จากอาสาสมัครที่มีภูมิหลังคล้ายคลึงกัน นอกจากนี้ ยังมีการตรวจสอบผลกระทบของความยาวเฟรมที่แตกต่างกันตามจำนวนของช่องกรองใน MFCC และความยาวเฟรมที่แตกต่างกันตามลำดับของ LPC เพื่อความแม่นยำที่ดีขึ้น
ตารางที่ 6 ผลลัพธ์ความแม่นยำเชิงปริมาณของการสกัดคุณลักษณะเสียงพูด

ดังที่ได้กล่าวไว้ก่อนหน้านี้ WER เป็นการวัดประสิทธิภาพการรู้จำเสียงที่ใช้บ่อยที่สุด คำนวณโดยการเปรียบเทียบการถอดความอ้างอิงกับผลลัพธ์ของตัวรู้จำเสียง จากการเปรียบเทียบนี้ เป็นไปได้ที่จะคำนวณจำนวนข้อผิดพลาด ซึ่งโดยทั่วไปจะอยู่ในสามประเภท: (1) การแทรกเมื่อไม่มีคำอยู่ในการอ้างอิงในผลลัพธ์ของการรู้จำเสียงอัตโนมัติ (ASR) (2) การลบเมื่อพลาดคำในเอาต์พุต ASR และ (3) การแทนที่เมื่อคำหนึ่งสับสนกับคำอื่น สามารถคำนวณ WER ได้ดังนี้

โดยที่ S คือจำนวนการแทนที่คำที่จำไม่ถูกต้อง D คือจำนวนการลบ I คือจำนวนการแทรก และ N คือจำนวนคำในการถอดความอ้างอิง ประเด็นหลักในการคำนวณคะแนนนี้คือการจัดตำแหน่งระหว่างลำดับสองคำ สิ่งนี้สามารถกำหนดได้ผ่านการเขียนโปรแกรมแบบไดนามิกโดยใช้ระยะทาง Levenshtein [67]
จากตารางที่ 6 เราทำการวิเคราะห์ทางสถิติเพื่อระบุความแม่นยำโดยเฉลี่ยของวิธีการเปรียบเทียบโดยใช้เมตริกการประเมิน WER ดังที่แสดงไว้ในรูปที่ 11 ตัวแยกคุณสมบัติที่ได้รับการปรับปรุงให้ความแม่นยำประมาณ 98.4 เปอร์เซ็นต์ ในขณะที่วิธีอื่นๆ ให้ความแม่นยำระหว่าง 78 เปอร์เซ็นต์ และ 96 เปอร์เซ็นต์ . เราใช้ผลลัพธ์ที่ให้ไว้ในเอกสารที่เกี่ยวข้องเพื่อเปรียบเทียบ อย่างไรก็ตาม ความถูกต้องของค่าเหล่านี้ไม่สามารถตรวจสอบได้ง่ายๆ เนื่องจากซอร์สโค้ดและชุดข้อมูลของเมธอดเหล่านี้ไม่เปิดเผยต่อสาธารณะเพื่อยืนยันประสิทธิภาพที่แท้จริง อย่างไรก็ตาม ในกรณีของฉากมาตรฐาน วิธีการที่เสนอได้รับการสาธิตการทดลองเพื่อให้ความแม่นยำในการแยกเสียงพูดที่ยอดเยี่ยมโดยลดเวลาในการคำนวณ แม้ว่าข้อมูลเสียงพูดจะมีเสียงรบกวนหรือคุณภาพต่ำก็ตาม

รูปที่ 11 ผลลัพธ์เชิงปริมาณของวิธีการแยกคุณลักษณะสัญญาณเสียงพูดโดยใช้กราฟแนวตั้ง
ยิ่งไปกว่านั้น เราประเมินผลลัพธ์ที่เป็นเท็จของวิธีที่เลือก ดังสังเกตได้จากรูปที่ 12 แนวทางที่เสนอมีข้อผิดพลาดน้อยที่สุด นอกจากนี้ วิธีการคำนวณแบบขนานที่มีประสิทธิภาพสูงยังลดข้อผิดพลาดในการเลือกคุณลักษณะสัญญาณเสียงและการแยกสัญญาณลงอย่างมาก การทำงานหนักเกินไปเป็นหนึ่งในประเด็นหลักในระหว่างการฝึกอบรม และโมเดลแมชชีนเลิร์นนิงเกือบทั้งหมดประสบปัญหาดังกล่าว เราพยายามลดความเสี่ยงจากการจัดสรรเกินกำลังโดยใช้เทคนิคการเลือกคุณลักษณะที่มีจุดประสงค์เพื่อจัดอันดับความสำคัญของคุณลักษณะที่มีอยู่ในชุดข้อมูลแทน และละทิ้งคุณลักษณะที่สำคัญน้อยกว่า (ไม่มีการสร้างคุณลักษณะใหม่)

รูปที่ 12 ผลลัพธ์ที่มองเห็นได้ของการทดลองการแยกคุณลักษณะสัญญาณเสียงพูดเท็จ
ตารางที่ 7 แสดงผลประสิทธิภาพของวิธีการที่ใช้ในสภาพแวดล้อมการรู้จำเสียงตามคุณสมบัติต่างๆ แนวทางที่เรานำเสนอไม่ได้รับผลกระทบจากเสียงรบกวนรอบข้างที่ไม่ต้องการและไม่จำเป็น และไม่ได้รับผลกระทบจากเสียงของมนุษย์คุณภาพต่ำ เช่น เสียงแหบ เสียงที่เกิดจากอาการเจ็บคอ หรือแม้แต่เสียงจากมนุษย์ที่สูญเสียเสียงทั้งหมด วิธีการของเรามีจุดมุ่งหมายเพื่อเอาชนะปัญหาของอุปกรณ์บันทึกเสียงที่ไม่เพียงพอ เสียงพื้นหลัง สำเนียงและภาษาถิ่นที่ยาก และระดับเสียงต่างๆ ในเสียง ในสภาพแวดล้อมปกติ ผลลัพธ์ที่ดีที่สุดสำหรับการตรวจจับและแยกคุณสมบัติเสียงพูดที่แม่นยำนั้นได้รับมาโดยใช้วิธีการที่นำเสนอพร้อมเวลาดำเนินการที่ลดลง
ตารางที่ 7. การทบทวนประสิทธิภาพการตรวจหาและสกัดคุณลักษณะเสียงพูดโดยใช้คุณลักษณะต่างๆ

ผลลัพธ์ของวิธีการรู้จำเสียงถูกจัดประเภทว่าทรงพลัง ปกติ หรืออ่อนแอสำหรับเจ็ดประเภท เกณฑ์ที่มีประสิทธิภาพแสดงให้เห็นว่าอัลกอริทึมสามารถเอาชนะความท้าทายทุกประเภทได้ ในทางตรงกันข้าม เกณฑ์ปกติระบุว่าอัลกอริทึมอาจล้มเหลวในบางกรณีเนื่องจากไม่ได้กำหนดขอบเขตของคำไว้ล่วงหน้า ประการสุดท้าย เกณฑ์ที่อ่อนแอแสดงว่าอัลกอริทึมไม่น่าเชื่อถือภายใต้เสียงพื้นหลังหรือการสั่นสะเทือน
6. ข้อจำกัด
เป็นการยากที่จะสรุปได้ว่าวิธีการที่นำเสนอในปัจจุบันไม่ได้แสดงถึงการมาถึงในระยะสั้น วิธีการที่เรานำเสนออาจส่งผลให้เกิดข้อผิดพลาดเนื่องจากสภาพแวดล้อมที่มีเสียงรบกวนต่างๆ เพื่อแก้ปัญหานี้ เรามีเป้าหมายที่จะลดจำนวนคุณลักษณะในชุดข้อมูลโดยการสร้างคุณลักษณะใหม่จากคุณลักษณะที่มีอยู่ [69] เนื่องจากการโอเวอร์ฟิตติ้งเป็นหนึ่งในประเด็นหลักสำหรับการฝึกโมเดลต่างๆ ในระหว่างการแข่งขัน การเพิ่มคุณค่าให้กับข้อมูลการฝึกโดยการเพิ่มตัวอย่างข้อมูลจากทรัพยากรต่างๆ อาจเป็นวิธีแก้ปัญหาที่เป็นไปได้สำหรับการปรับปรุงผลลัพธ์ โดยไม่คำนึงถึงปัญหาข้างต้น ผลการทดลองพบว่าวิธีการของเรามีประสิทธิภาพมากและมีประสิทธิภาพสำหรับงานแยกเสียงพูด โดยมีความแม่นยำเฉลี่ย 98.4 เปอร์เซ็นต์ และ FM 99.5 เปอร์เซ็นต์
7. ข้อสรุป
มีการเสนอวิธีการคำนวณแบบขนานที่มีประสิทธิภาพสูงแบบใหม่โดยใช้วิธีการเรียนรู้ของเครื่องสำหรับระบบการรู้จำเสียง ปัญหาการเร่งความเร็วในเครื่องที่มีทรัพยากรการประมวลผลจำกัดสามารถแก้ไขได้โดยใช้ระบบกระจาย ความเร็วในการคำนวณในระบบจดจำสัญญาณสามารถเพิ่มขึ้นได้ และประสิทธิภาพของแพลตฟอร์มมัลติคอร์สามารถปรับปรุงได้โดยการสร้างและใช้อัลโกริทึ่มที่มีประสิทธิภาพและรวดเร็ว ผลลัพธ์แสดงให้เห็นว่าโมเดลที่เสนอช่วยลดเวลาการประมวลผลและปรับปรุงความแม่นยำในการแยกคุณลักษณะได้ถึง 98.4 เปอร์เซ็นต์โดยใช้ MFCC อย่างมีประสิทธิภาพ มีการสังเกตพบว่าคุณสมบัติที่มีค่าความสัมพันธ์ต่ำซึ่งแยกโดยการเลือกคุณสมบัตินั้นมีผลในความสำเร็จของโมเดลเช่นกัน การวิเคราะห์ทางสถิติดำเนินการกับข้อมูลที่ประมวลผลล่วงหน้า และข้อมูลที่มีความหมายถูกสร้างขึ้นจากข้อมูลโดยใช้อัลกอริทึมการเรียนรู้ของเครื่องเพื่อนบ้านที่ใกล้ที่สุด (KNN)
การศึกษาในอนาคตจะมุ่งเน้นไปที่การปรับปรุงความแม่นยำของวิธีการของเราโดยใช้วิธีการเรียนรู้เชิงลึกและเพิ่มประสิทธิภาพหน่วยความจำแคชของโปรเซสเซอร์แบบมัลติคอร์เพื่อตรวจจับและแยกสัญญาณเสียงพูดโดยไม่สูญเสียคุณภาพที่มีนัยสำคัญ นอกจากนี้ เราวางแผนที่จะสร้างแบบจำลองการวิเคราะห์สเปกตรัมตามการประมวลผลแบบคู่ขนานพร้อมประสิทธิภาพการวิเคราะห์ที่แข็งแกร่ง ซึ่งจะช่วยให้สามารถสร้างอุปกรณ์ฝังตัวที่มีทรัพยากรการคำนวณต่ำโดยใช้ชุดข้อมูลคำพูดของ Taris [70] ใน 3D CNN และ 3D U-Net Environment [71– 75]
อ้างอิง
1. เหมิง, วายเจ; หลิว ดับบลิวเจ ; จาง RZ; Du, HS Speech Feature Parameter Extraction and Recognition Based on Interpolation. แอป เมค แม่ 2014, 602–605, 2118–2123. [CrossRef] 2. มูซาเยฟ ม.; Rakhimov, M. การฝึกอบรมแบบเร่งรัดสำหรับเครือข่ายประสาทเทียม ในรายงานการประชุมนานาชาติด้านวิทยาการสารสนเทศและเทคโนโลยีการสื่อสาร (ICISCT) ประจำปี 2563 ทาชเคนต์ อุซเบกิสถาน 4-6 พฤศจิกายน 2563 หน้า 1–5 [CrossRef] 3. เย, เอฟ.; Yang, J. โมเดล Deep Neural Network สำหรับการระบุผู้พูด แอป วิทย์ 2021, 11, 3603. [CrossRef] 4. มูซาเยฟ, ม.; Rakhimov, M. วิธีการแมปบล็อกของหน่วยความจำหลักกับแคชในการประมวลผลแบบขนานของสัญญาณเสียงพูด ในรายงานการประชุมนานาชาติด้านวิทยาการสารสนเทศและเทคโนโลยีการสื่อสาร (ICISCT) ประจำปี 2562 การาจี ปากีสถาน 9-10 มีนาคม 2562 หน้า 1–4 [CrossRef] 5. เจียง เอ็น; Liu, T. อัลกอริทึมการแบ่งส่วนเสียงพูดและการจัดกลุ่มที่ดีขึ้นตาม SOM และ k-mean คณิตศาสตร์. ปัญหา อังกฤษ 2020, 2020, 3608286. [CrossRef] 6. หู, ว.; หยาง ซี; เฉิน ซี; อาทิตย์, บี; Xie, Q. วิธีการแบ่งส่วนการสั่นสะเทือนสำหรับระบบมัลติแอคชั่นของป้อมปืนควบคุมเชิงตัวเลข กระบวนการวิดีโอภาพสัญญาณ 2021, 16, 489–496. [ครอสรีฟ]
7. โปเปสคู, ทีดี; Aiordachioaie, D. การตรวจจับข้อผิดพลาดของตลับลูกปืนเม็ดกลมโดยใช้การแบ่งส่วนที่เหมาะสมที่สุดของสัญญาณการสั่น เมค ระบบ กระบวนการสัญญาณ 2019, 116, 370–391. [CrossRef] 8. ชิฮับ, MSH; อาทิตยา, ส.; เซตู, JH; Imtiaz-Ud-Din, KM ; Efat, MIA เทคนิคการแยกคุณสมบัติ GRU-CNN แบบผสมผสานสำหรับการระบุผู้พูด ในรายงานการประชุม 2020 23rd International Conference on Computer and Information Technology (ICCIT), ธากา, บังกลาเทศ, 19–21 ธันวาคม 2020; หน้า 1–6 [CrossRef] 9. คอร์มาซ, โอ.; Atasoy, A. การรับรู้อารมณ์จากสัญญาณเสียงโดยใช้ค่าสัมประสิทธิ์เซปสตรัลความถี่เมล ในรายงานการประชุมนานาชาติด้านวิศวกรรมไฟฟ้าและอิเล็กทรอนิกส์ครั้งที่ 9 (ELECO), เบอร์ซา, ตุรกี, 26–28 พฤศจิกายน 2558; หน้า 1254–1257 10. ไอวาซ ยู; Gürüler, H.; ข่าน ฉ.; อาเหม็ด เอ็น.; วังโบ, ที.; Abdusalomov, A. การรู้จำลำโพงอัตโนมัติโดยใช้ค่าสัมประสิทธิ์เซปสตรัลความถี่เมลผ่านการเรียนรู้ของเครื่อง CMC-คอมพิวเตอร์. แม่ ต่อ. 2022, 71, 5511–5521. 11. อัล-กอเดรี, ม.; ลาแฮมเมอร์ อี.; Rad, A. ระบบการระบุผู้พูดสองระดับผ่านการผสมผสานของตัวแยกประเภทที่แตกต่างกันและความร่วมมือด้านคุณสมบัติเสริม เซ็นเซอร์ 2021, 21, 5097. [CrossRef] 12. Batur Dinler, Ö.; Aydin, N. พารามิเตอร์คุณสมบัติที่เหมาะสมที่สุดที่ตั้งค่าตามเครือข่ายประสาทที่เกิดซ้ำของหน่วย Gated สำหรับการตรวจจับส่วนคำพูด แอป วิทย์ 2020, 10, 1273. [CrossRef] 13. Kim, H.; Shin, JW Dual-Mic Speech Enhancement บนพื้นฐานของ TF-GSC พร้อมการป้องกันการรั่วไหลและการกู้คืนสัญญาณ แอป วิทย์ 2021, 11, 2816 [CrossRef] 14. Lee, S.-J.; ควอน, H.-Y. กลยุทธ์การประมวลผลล่วงหน้าสำหรับการขจัดเสียงพูดตามการตรวจจับส่วนเสียงพูด แอป วิทย์ 2020, 10, 7385 [CrossRef] 15. Rusnac, A.-L.; Grigore, O. CNN Architectures and Feature Extraction Methods for EEG Imaginary Speech Recognition. เซ็นเซอร์ 2022, 22, 4679. [CrossRef] [PubMed] 16. Wafa, R.; ข่าน, MQ; มาลิก, เอฟ; อับดุลซาโลมอฟ AB; โช, ยี่; Odarchenko, R. ผลกระทบของวิธีการแบบ Agile ต่อความสำเร็จของโครงการ โดยมีบทบาทที่พอเหมาะพอควรกับงานของบุคคลในอุตสาหกรรมไอทีของปากีสถาน แอป วิทย์ 2022, 12, 10698. [CrossRef] 17. Aggarwal, A.; ศรีวัสสวา, อ.; Agarwal, อ.; ชาฮาล, น.; ซิงห์, ด.; อัลนัวอิม, เอเอ ; อัลฮัดลัค, อ.; ลี เอช.-เอ็น. การสกัดคุณสมบัติแบบสองทางสำหรับการรู้จำอารมณ์คำพูดโดยใช้การเรียนรู้เชิงลึก เซ็นเซอร์ 2022, 22, 2378. [CrossRef] [PubMed] 18. Marini, M.; วาเนลโล, น.; Fanucci, L. การเพิ่มประสิทธิภาพพารามิเตอร์การสกัดคุณลักษณะที่ขึ้นกับลำโพงเพื่อปรับปรุงประสิทธิภาพการรู้จำเสียงอัตโนมัติสำหรับผู้ที่เป็นโรค Dysarthria เซ็นเซอร์ 2021, 21, 6460. [CrossRef] 19. Tiwari, S.; เชน, อ.; ชาร์มา, อลาสก้า; Almustafa, KM Phonocardiogram Signal Based Multi-Class ระบบสนับสนุนการตัดสินใจวินิจฉัยโรคหัวใจ การเข้าถึง IEEE 2021, 9, 110710–110722 [CrossRef] 20. โมทาจ ส.; ชมิทท์, V.; Möller, S. แบบจำลองที่ใช้การสกัดคุณลักษณะสำหรับการระบุคำพูดแสดงความเกลียดชัง arXiv 2022, arXiv: 2201.04227. 21. กุลโดชเบย์ อ.; อับดุลซาโลมอฟ, อ.; มูคิดดินอฟ ม.; Baratov, N.; มัคมูดอฟ เอฟ; Cho, YI การปรับปรุงสำหรับวิธีการจำแนกอัตโนมัติสำหรับภาพอัลตราซาวนด์ที่ใช้ใน CNN ภายใน J. Wavelets ข้อมูลหลายความละเอียด กระบวนการ. 2022, 20, 2150054. 22. พัสริชา, ว.; Aggarwal, RK ลูกผสมของ Deep CNN และ LSTM แบบสองทิศทางสำหรับการรู้จำเสียงอัตโนมัติ เจ อินเทล ระบบ 2020, 29, 1261–1274. [CrossRef] 23. มูคามาดิเยฟ อ.; คูจายารอฟ, I.; Djuraev, O.; Cho, J. วิธีการรู้จำเสียงอัตโนมัติตามแนวทางการเรียนรู้เชิงลึกสำหรับภาษาอุซเบก เซ็นเซอร์ 2022, 22, 3683. [CrossRef] [PubMed] 24. Li, F.; หลิว ม.; Zhao, Y.; ก้อง, ล.; ดง, ล.; หลิว เอ็กซ์; Hui, M. คุณลักษณะการสกัดและการจำแนกประเภทของเสียงหัวใจโดยใช้โครงข่ายประสาทเทียม 1 มิติ EURASIP J. Adv. กระบวนการสัญญาณ 2019, 2019, 59. [CrossRef] 25. ช้าง, L.-C.; ฮุง เจ.-ดับบลิว. การศึกษาเบื้องต้นของการสกัดคุณลักษณะเสียงพูดที่มีประสิทธิภาพโดยอิงจากการเพิ่มความเป็นไปได้ของสถานะสูงสุดในโมเดลอะคูสติกลึก แอป ระบบ นวัตกรรม 2022, 5, 71. [CrossRef] 26. รามิเรซ, เจ; กอร์ริซ, JM; Segura การตรวจจับกิจกรรมด้วยเสียงของ JC พื้นฐานและความทนทานของระบบการรู้จำเสียง ในการรู้จำเสียงและความเข้าใจที่แข็งแกร่ง Grimm, M. , Kroschel, K., Eds.; I-TECH Education and Publishing: ลอนดอน สหราชอาณาจักร 2550; หน้า 1–22 27. โอ้ S. DNN การสกัดคุณลักษณะเสียงพูดที่มีประสิทธิภาพและวิธีการกำจัดสัญญาณรบกวนโดยใช้ตัวกรอง LMS การคาดการณ์เฉลี่ยที่ได้รับการปรับปรุงสำหรับการรู้จำเสียง เจ คอนเวิร์ส รายละเอียด เทคโนโลยี 2021, 11, 1–6. [CrossRef] 28. อับบาสเชียน, บียู; เซียร์รา-โซซา, D.; Elmaghraby, A. เทคนิคการเรียนรู้เชิงลึกสำหรับการรู้จำอารมณ์คำพูด จากฐานข้อมูลไปจนถึงแบบจำลอง เซ็นเซอร์ 2021, 21, 1249. [CrossRef] 29. Rakhimov, M.; Mamadjanov, D.; Mukhiddinov, A. วิธีการคู่ขนานที่มีประสิทธิภาพสูงในการประมวลผลภาพในคอมพิวเตอร์แบบกระจาย ในรายงานการประชุม IEEE 14th International Conference on Application of Information and Communication Technologies (AICT) ประจำปี 2020, อุซเบกิสถาน, ทาชเคนต์, 7-9 ตุลาคม 2020; หน้า 1–5 [ครอสรีฟ] 30. อับดุลซาโลมอฟ เอ; มูคิดดินอฟ ม.; Djuraev, O.; คำดามอฟ, U.; Whangbo, TK การสกัดวัตถุเด่นโดยอัตโนมัติตามเกณฑ์ที่ปรับเปลี่ยนได้ในท้องถิ่นเพื่อสร้างกราฟิกที่สัมผัสได้ แอป วิทย์ 2020, 10, 3350 [CrossRef] 31. Abdusalomov, A.; Whangbo, TK การปรับปรุงวิธีการจดจำพื้นหน้าโดยใช้เทคนิคการลบเงาสำหรับสภาพแวดล้อมภายในอาคาร ภายใน J. Wavelets ข้อมูลหลายความละเอียด กระบวนการ. 2017, 15, 1750039 [CrossRef] 32. Abdusalomov, A.; Whangbo, TK การตรวจจับและกำจัดเงาของวัตถุที่เคลื่อนไหวโดยใช้รูปทรงเรขาคณิตและข้อมูลสีสำหรับสตรีมวิดีโอในอาคาร แอป วิทย์ 2019, 9, 5165. [CrossRef] 33. Mery, D. Computer Vision for X-ray Testing; Springer International Publishing: จาม สวิตเซอร์แลนด์ 2558; หน้า 271, ISBN 978-3319207469 34. Mark, S. ภาพคำพูดปรับขอบเขตการรับรู้เสียงพูดใหม่ เรียน การรับรู้ โรคจิต 2016, 78, 1496–1511. [CrossRef] 35. มัดกัล, อี.; มุคันธาราช, ส.; โมดัก, MU; Rao การรู้จำเสียงแบบเรียลไทม์ตามเทมเพลต YS โดยใช้ตัวกรองดิจิทัลบน DSP-TMS320F28335 ในรายงานการประชุมนานาชาติครั้งที่สี่ปี 2018 ว่าด้วยการควบคุมการสื่อสารด้วยคอมพิวเตอร์และระบบอัตโนมัติ (ICCUBEA), ปูเน่, อินเดีย, 16-18 สิงหาคม 2018; หน้า 1–6 [ครอสรีฟ]






