การรู้จำเสียงสระจากการตรวจคลื่นสมองด้วยไฟฟ้าของหนูโดยใช้โครงข่ายประสาทเทียมหน่วยความจำระยะสั้นแบบยาว ตอนที่ 3
Dec 28, 2023
ตัวแยกประเภทการเรียนรู้ของเครื่อง
ประสิทธิภาพของ BiLSTM ถูกเปรียบเทียบกับตัวแยกประเภทแมชชีนเลิร์นนิงทั่วไป: SVM พร้อมเคอร์เนลเชิงเส้น (SVM{0}}lin), SVM พร้อมเคอร์เนลฟังก์ชันพื้นฐานรัศมี (SVM_rbf), Randomforests (RF), NB และ เคเอ็นเอ็น.
Random Forest เป็นอัลกอริธึมการเรียนรู้ของเครื่องที่ใช้กันอย่างแพร่หลายในสาขาการวิเคราะห์ข้อมูลและการทำนายต่างๆ เมื่อเปรียบเทียบกับอัลกอริธึมแมชชีนเลิร์นนิงอื่นๆ แล้ว อัลกอริธึมนี้มีความทนทานและแม่นยำดีกว่า ขณะเดียวกันก็ลดการโอเวอร์ฟิตได้อย่างมีประสิทธิภาพ ในช่วงไม่กี่ปีที่ผ่านมา ขอบเขตการใช้งานของป่าสุ่มได้ขยายออกไป และยังสามารถใช้ในการทำนายความสามารถด้านความจำของมนุษย์ได้อีกด้วย
ในสาขาจิตวิทยาความรู้ความเข้าใจ ความจำเป็นทิศทางการวิจัยที่สำคัญมาก นักวิทยาศาสตร์กำลังมองหาวิธีที่ง่ายและมีประสิทธิภาพในการประเมินระดับความจำของมนุษย์ ในช่วงไม่กี่ปีที่ผ่านมา การเกิดขึ้นของป่าสุ่มได้นำแนวคิดและวิธีการใหม่ๆ มาสู่สาขานี้
Random Forest สามารถฝึกโมเดลให้ทำนายตัวแปร ซึ่งสามารถเป็นอะไรก็ได้ที่คุณต้องการทำนาย รวมถึงความสามารถด้านความจำ นักวิทยาศาสตร์สามารถป้อนปัจจัยที่เกี่ยวข้องลงในแบบจำลองฟอเรสต์แบบสุ่มเพื่อทำนายว่าบุคคลจะให้คะแนนในการทดสอบความจำได้ดีเพียงใด ปัจจัยเหล่านี้อาจเป็นปัจจัยต่างๆ เช่น อายุ ระดับการศึกษา เพศ น้ำหนัก ฯลฯ หรือตัวบ่งชี้ทางชีวภาพ เช่น โครงสร้างสมอง จากการวิจัยพบว่าปัจจัยเหล่านี้มีความสัมพันธ์บางอย่างกับความสามารถในการจดจำของมนุษย์
ด้วยการรวบรวมและวิเคราะห์ข้อมูลการทดสอบจำนวนมากจากอาสาสมัคร นักวิทยาศาสตร์สามารถสร้างแบบจำลองที่ทำนายความสามารถด้านความจำในแบบจำลองฟอเรสต์แบบสุ่มได้ การคาดการณ์ผลลัพธ์สามารถให้ข้อมูลอันมีค่าเกี่ยวกับประสิทธิภาพในอนาคตของอาสาสมัครในการทดสอบหน่วยความจำบางอย่าง
โดยสรุป อัลกอริธึมสุ่มฟอเรสต์ทำให้นักวิทยาศาสตร์มีวิธีใหม่ในการประเมินระดับความจำของมนุษย์ ในอนาคต การประยุกต์ใช้อาจมีบทบาทสำคัญในจิตวิทยาการรู้คิด ประสาทวิทยาศาสตร์ และสาขาอื่นๆ เรามีเหตุผลที่เชื่อได้ว่าการผสมผสานระหว่างป่าสุ่มและเทคนิคอื่นๆ สามารถให้มุมมองที่กว้างขึ้นและความเข้าใจที่ลึกซึ้งยิ่งขึ้นเกี่ยวกับการวิจัยการทำงานของสมองของมนุษย์ จะเห็นได้ว่าเราต้องปรับปรุงความจำ และ Cistanche Deserticola สามารถปรับปรุงความจำได้อย่างมาก เนื่องจาก Cistanche Deserticola ยังสามารถควบคุมความสมดุลของสารสื่อประสาท เช่น การเพิ่มระดับของอะเซทิลโคลีนและปัจจัยการเจริญเติบโต สารเหล่านี้มีความสำคัญมากต่อความจำและการเรียนรู้ นอกจากนี้ เนื้อสัตว์ยังช่วยเพิ่มการไหลเวียนของเลือดและส่งเสริมการส่งออกซิเจน ซึ่งช่วยให้สมองได้รับสารอาหารและพลังงานที่เพียงพอ ซึ่งจะช่วยปรับปรุงความมีชีวิตชีวาและความอดทนของสมอง

คลิกรู้วิธีปรับปรุงการทำงานของสมอง
SVM [74] มีจุดมุ่งหมายเพื่อกำหนดไฮเปอร์เพลนที่แยกออกจากกันอย่างเหมาะสมที่สุด โดยการเพิ่มระยะขอบให้สูงสุด ซึ่งเป็นระยะห่างระหว่างเวกเตอร์รองรับ ด้วยการใช้เคล็ดลับเคอร์เนล SVM จึงสามารถแมปพื้นที่คุณลักษณะจากขนาดต่ำไปสูงได้ ดังนั้นจึงสามารถจำแนกประเภทเชิงเส้นและการจำแนกแบบไม่เชิงเส้นได้อย่างมีประสิทธิภาพ
RF [75] ดำเนินการโดยการสร้างแผนผังการตัดสินใจหลายแผนผังในระหว่างขั้นตอนการฝึกอบรม และสร้างคลาสสุดท้ายที่รวมผลลัพธ์ของแผนผังการตัดสินใจแต่ละแผนผัง NB [76, 77] เป็นตัวแยกประเภทความน่าจะเป็นตามทฤษฎีบทของเบย์และความน่าจะเป็นแบบมีเงื่อนไข ซึ่งมักจะถือว่าคุณลักษณะทั้งหมดเป็นอิสระจากกัน
KNN [78] เป็นวิธีการแบบไม่มีพารามิเตอร์ที่จัดประเภทอินพุตตามคลาสส่วนใหญ่ของเพื่อนบ้านที่ใกล้ที่สุดในพื้นที่คุณลักษณะ โดยปกติแล้ว ค่า k จะถูกเลือกเป็นเลขคี่เพื่อหลีกเลี่ยงคลาสที่ผูกกัน
เพื่อฝึกอบรมและประเมินโมเดลแมชชีนเลิร์นนิงข้างต้น มีการใช้ 10-CV เดียวกันกับใน BiLSTM โมเดลการเรียนรู้ของเครื่องทั้งหมดถูกนำมาใช้โดยใช้ไลบรารี Scikit-Learn [73] ใน Python
การวิเคราะห์ทางสถิติ
การวิเคราะห์ทางสถิติทั้งหมดดำเนินการโดยใช้ซอฟต์แวร์ SPSS (SPSS เวอร์ชัน 20.0, SPSS Inc.,Armonk, NY, USA) และซอฟต์แวร์ MATLAB เวอร์ชัน 2017b (Mathworks, Inc., MA, USA)
ข้อมูลถูกวิเคราะห์ด้วยสถิติพาราเมตริก เนื่องจากข้อมูลทั้งหมดในการศึกษาแสดงการแจกแจงแบบปกติในการทดสอบชาปิโร–วิลค์ (p > 0.05) การวิเคราะห์ความแปรปรวนถูกนำมาใช้ในการวิเคราะห์นัยสำคัญทางสถิติของ TFR ตามสิ่งเร้าของสระที่แตกต่างกัน
นอกจากนี้ ยังได้ดำเนินการวัดความแปรปรวนซ้ำหลายครั้งเพื่อเปรียบเทียบประสิทธิภาพของตัวแยกประเภทแต่ละตัว ต่อจากนั้น การเปรียบเทียบแบบคู่โดยใช้การทดสอบทีแบบคู่ได้ดำเนินการระหว่างเครือข่าย BiLSTM และตัวแยกประเภทแมชชีนเลิร์นนิงแบบคลาสสิกอื่นๆ และดำเนินการแก้ไข Bonferroni เพื่อปรับอัตราเงินเฟ้อของอัตราความผิดพลาดประเภท I
นัยสำคัญทางสถิติของค่า p ถูกตั้งค่าไว้ที่ 0.01 เมื่อเปรียบเทียบ TFR ของการตอบสนอง EEG ในขณะที่ระดับนัยสำคัญของค่า thep ถูกตั้งค่าไว้ที่ 0.05 เมื่อเปรียบเทียบประสิทธิภาพระหว่างเครือข่าย BiLSTM และตัวแยกประเภทแมชชีนเลิร์นนิงอื่นๆ
ผลลัพธ์
การได้ยินทำให้เกิดศักยภาพในการตอบสนองต่อเสียงสระ
หนู Sprague-Dawley ทั้งหมด 19 ตัวได้รับการผ่าตัดปลูกฝังอิเล็กโทรดแก้ปวด และหนูทุกตัวรอดชีวิตจากขั้นตอนการผ่าตัด เป็นผลให้การตอบสนอง EEG ต่อเสียงสระภาษาอังกฤษห้าเสียงถูกบันทึกจากหนูที่ได้รับยาสลบไอโซฟลูเรน 19 ตัว ในการดึงรูปคลื่น AEP เฉลี่ย การตอบสนองของระบบประสาททั้งหมดจะถูกเฉลี่ยเหนืออาสาสมัครสำหรับการกระตุ้นแต่ละครั้ง รูปที่ 4 แสดงรูปคลื่น AEP โดยเฉลี่ยสำหรับเสียงสระแต่ละเสียงจาก AAF แบบทวิภาคี
ตามที่คาดไว้ เสียงสระแต่ละหมวดหมู่ทำให้เกิดกิจกรรมของระบบประสาทที่แตกต่างกันใน AAF ทวิภาคี โดยมีแอมพลิจูดและเวลาแฝงสูงสุดที่แตกต่างกัน แอมพลิจูดสูงสุดของ AEP ซึ่งถูกกำหนดให้เป็นแรงดันไฟฟ้าสูงสุดที่บันทึกไว้หลังสิ่งเร้าของสระ มีค่าน้อยที่สุดสำหรับ /i/ (61.74 ㎶ ใน AAF ด้านซ้าย และ 61.27 ㎶ ใน AAF ด้านขวา) ในขณะที่ AEP ในการตอบสนองต่อ /a/ แสดงแอมพลิจูดของพีคที่ใหญ่ที่สุด (92.12 ㎶ ใน AAF ด้านซ้าย และ 90.18 ㎶ ใน AAF ด้านขวา)
เวลาแฝงสูงสุด ซึ่งกำหนดเป็นระยะเวลาตั้งแต่เริ่มกระตุ้นจนถึงแอมพลิจูดสูงสุดคือประมาณ {{0}}.39 วินาทีถึง 0.5 วินาที ซึ่งสั้นที่สุดในหน่วย /i/(0 39 วินาทีใน AAF ซ้ายและขวา) และยาวที่สุดในเสียง /o/ (0.51 วินาทีใน AAF ซ้ายและขวา) ดังแสดงในรูปที่ 4 รูปคลื่น AEP ที่คล้ายกันถูกสังเกตจาก AAF ซ้ายและขวา

การวิเคราะห์ความถี่เวลาของสัญญาณ EEG
การวิเคราะห์ความถี่เวลาเป็นวิธีที่มีประสิทธิภาพในการวิเคราะห์สัญญาณ EEG ที่ไม่นิ่งบนระนาบความถี่เอไทม์ และใช้เพื่อให้ข้อมูลเชิงคุณภาพสำหรับการจำแนกประเภท EEG [79, 80] ดังนั้น TFR ของ EEG เฉลี่ยแกรนด์จึงถูกคำนวณสำหรับแต่ละเสียงเพื่อระบุการเปลี่ยนแปลงที่เกี่ยวข้องกับการจดจำสระในขนาดและระยะของการสั่นของ EEG ที่ความถี่เฉพาะ (รูปที่ 5A)
จากการวิเคราะห์ TFR พบว่าการกระตุ้นพลังงานสูงรอบๆ แถบเดลต้า (1–4 Hz), ทีตา (4–8 Hz) และอัลฟา (8–12 Hz) ที่ 0.3–{{8} }.6 วินาทีนับจากเริ่มมีอาการ โดยไม่คำนึงถึงการกระตุ้นเสียงพูด

นอกจากนี้ ได้ทำการทดสอบ ANOVA ด้วยการแก้ไข Bonferroni เพื่อวิเคราะห์ส่วนประกอบ TFR ที่มีนัยสำคัญทางสถิติตามการกระตุ้นสระแต่ละครั้ง
ต่อมา กำลังของพื้นที่ที่มีนัยสำคัญทางสถิติ (p < {{0}}.01) ถูกแสดงด้วยค่า F (รูปที่ 5B) ในการวิเคราะห์ คลื่นความถี่ EEG ส่วนใหญ่ในช่วง 0.2–0.8 วินาที มีความแตกต่างอย่างมีนัยสำคัญตามสิ่งเร้าของสระ
นอกจากนี้ ส่วนหนึ่งของ TFR จาก {{0}}.8–1 วินาทีก็แตกต่างกันทางสถิติสำหรับการกระตุ้นแต่ละครั้งด้วย เมื่อพิจารณารูปคลื่นของ AEP และผลลัพธ์ของการทดสอบ ANOVA สรุปได้ว่า AEP จาก 0.2–0.8 วินาทีหลังการกระตุ้นสระเป็นการตอบสนองของระบบประสาทที่ให้ข้อมูลมากที่สุดและเกี่ยวข้องกับการจดจำเสียงสระ
การฝึกอบรมโมเดลและการประเมินผลเครือข่าย BiLSTM
จากผลลัพธ์ของรูปที่ 5B ข้อมูล EEG ที่ถูกกรองแบนด์พาสระหว่าง 1–60 Hz พร้อมหน้าต่างเวลา 0.2–0.8 วินาทีถูกเลือก จากนั้นใช้คะแนน z ของข้อมูล EEG ที่เลือกเป็นอินพุตไปยังเครือข่าย BiLSTM
ข้อมูล EEG ทั้งหมดถูกแบ่งออกเป็น 10 เท่าในแต่ละหัวข้อเพื่อประเมินเครือข่าย BiLSTM ดังนั้น จึงได้รับประสิทธิภาพการทดสอบต่อการพับโดยใช้แบบจำลองที่ได้รับการฝึกพร้อมกับพับที่เหลือใน 10-แผน CV
ประสิทธิภาพของเครือข่ายได้รับการประเมินโดยใช้หน่วยเมตริกความแม่นยำ คะแนน f{{0}} และสถิติคัปปาของโคเฮน κ (รูปที่ 6 และตารางที่ 1) ความแม่นยำในการเลือกปฏิบัติ EEG ห้าคลาสโดยเฉลี่ยของเครือข่าย BiLSTM คือ 75.18 ± 7.06% และคะแนน f1- คือ 0.74 ± 0.08 . κของโคเฮนคือ 0.68 ± 0.09 ซึ่งถูกตีความว่าเป็นข้อตกลงระดับปานกลาง [81]
เพื่อวิเคราะห์ประสิทธิภาพของเครือข่าย BiLSTM โดยละเอียดยิ่งขึ้น จึงได้วางแผนเมทริกซ์ความสับสนในรูปที่ 7 สิ่งนี้บ่งชี้ว่าข้อผิดพลาดจำนวนมากเกิดจากการจำแนกประเภทการตอบสนอง EEG ไม่ถูกต้องเป็น /u/ เป็น /a/ และ /e/ เป็น /o/ อย่างไรก็ตาม เครือข่าย BiLSTM ได้จัดประเภทการตอบสนอง EEG ส่วนใหญ่ด้วยความแม่นยำมากกว่า 50% ซึ่งเป็นความแม่นยำสูงในการจัดประเภท EEG ห้าคลาส

การเปรียบเทียบเครือข่าย BiLSTM กับวิธีการเรียนรู้ของเครื่องอื่นๆ
เพื่อตรวจสอบประสิทธิภาพของเครือข่าย BiLSTM ในการจัดประเภท EEG สำหรับการรู้จำเสียงสระ ผลลัพธ์จะถูกนำไปเปรียบเทียบกับวิธีการเรียนรู้ของเครื่องแบบทั่วไปอื่นๆ รูปที่ 6 และตารางที่ 1 แสดงประสิทธิภาพของตัวแยกประเภทการเรียนรู้ของเครื่อง
RF แสดงให้เห็นถึงความแม่นยำในการจำแนกประเภทสูงสุดในบรรดาอัลกอริทึมการเรียนรู้ของเครื่องแบบทั่วไป (ความแม่นยำ: 63.21 ± 7.41%, คะแนน f1-: 0.62 ± 0.09 และของ Cohen : 0.52 ± 0.1) ในการวิเคราะห์ทางสถิติ ประสิทธิภาพการจำแนกประเภทของ RF ไม่ได้สูงกว่าของ SVM_lin และ SVM_rbf อย่างมีนัยสำคัญ ในขณะที่แสดงประสิทธิภาพที่สูงกว่าเมื่อเปรียบเทียบกับของ NB และ KNN
อย่างไรก็ตาม เมื่อเปรียบเทียบประสิทธิภาพของอัลกอริธึมการเรียนรู้ของเครื่องแบบเดิมๆ รวมถึง RF กับ BiLSTM ก็เห็นได้ชัดว่าเครือข่าย BiLSTM นั้นเหนือกว่าตัวชี้วัดทั้งหมดที่ใช้ในการศึกษา (p < 0.01)
ในเมทริกซ์ความสับสน อัลกอริธึมแมชชีนเลิร์นนิงแบบทั่วไปไม่สามารถแยกแยะการตอบสนอง EEG บางอย่างได้ดี โดยเฉพาะอย่างยิ่งอัลกอริธึมการเรียนรู้ของเครื่องแบบเดิมทั้งหมดมีความยากในการแยกแยะเสียง /u/ พบว่าอัลกอริธึมมีแนวโน้มที่จะจัดประเภทเสียง /u/ เป็น /a/ ไม่ถูกต้องโดยเฉลี่ย 30% ของเวลา (25.96% ใน NB ถึง 36.97% ใน KNN) ส่งผลให้ประสิทธิภาพการจำแนกโดยรวมลดลง (รูปที่ 7) .

การอภิปราย
ในการศึกษานี้ การตอบสนอง EEG ของหนูแก้ปวดต่อเสียงสระห้าประเภท (/a/, /e/, /i/, /o/, และ/u/) ถูกเลือกปฏิบัติโดยใช้เครือข่าย BiLSTM การจำแนกประเภท EEGsignals ห้าระดับดำเนินการบนพื้นฐานการทดลองเดี่ยว ซึ่งเป็นที่ทราบกันว่ามีความท้าทาย เพื่อเพิ่มประสิทธิภาพการเรียนรู้ให้สูงสุด การศึกษานี้พยายามระบุองค์ประกอบ EEG เฉพาะที่อาจเกี่ยวข้องกับการจดจำเสียงคำพูดในสมองหนู และใช้ส่วนประกอบ EEG เหล่านี้เป็นคุณสมบัติอินพุต เป็นผลให้มีประสิทธิภาพค่อนข้างสูงในการจำแนก AEP ออกเป็นเสียงสระที่แตกต่างกันห้าเสียงโดยใช้ BiLSTM การเปรียบเทียบประสิทธิภาพการจำแนกประเภทของเครือข่าย BiLSTM กับอัลกอริธึมการเรียนรู้ของเครื่องอื่นๆ แสดงให้เห็นว่าเครือข่าย BiLSTM มีประสิทธิภาพเหนือกว่าตัวแยกประเภทแบบคลาสสิกอื่นๆ ผลลัพธ์เหล่านี้บ่งชี้ว่าเครือข่าย BiLSTM ที่ได้รับการฝึกด้วยส่วนประกอบ EEG ที่เกี่ยวข้องกับการรู้จำเสียงสามารถจัดประเภท AEP ให้กับเสียงสระแต่ละหมวดหมู่ได้อย่างน่าเชื่อถือด้วยความแม่นยำสูง ตามความรู้ของเรา เครือข่าย LSTM ไม่ได้ถูกนำไปใช้กับการจำแนกประเภทของการตอบสนอง EEG ต่อสิ่งเร้าทางการได้ยิน และนี่คือการศึกษาครั้งแรกที่ใช้อัลกอริธึมการเรียนรู้เชิงลึกเพื่อวิเคราะห์สัญญาณ EEG จาก AAF ของหนู

ปัจจุบัน มีงานวิจัยเพียงไม่กี่ชิ้นเท่านั้นที่ใช้สถาปัตยกรรม LSTM เพื่อให้ได้ผลลัพธ์ที่ล้ำสมัยในการจำแนกประเภทตาม EEG สถาปัตยกรรม LSTM เหมาะสำหรับการจำแนกประเภทตาม EEG เนื่องจากโครงสร้างคล้ายลูกโซ่สามารถจับลำดับเวลาของข้อมูล EEG ได้ [82] ในการเริ่มต้น การวิจัยมุ่งเน้นไปที่การปรับปรุงผลการจำแนกประเภทผ่านสถาปัตยกรรม LST ต่างๆ อย่างไรก็ตาม คุณลักษณะอินพุตยังคงถูกดึงออกมาด้วยตนเอง เช่นเดียวกับในวิธีการเรียนรู้ด้วยเครื่องจักรแบบเดิมๆ [83, 84]
ซิอูริส และคณะ ประเมินประสิทธิภาพขององค์ประกอบเครือข่าย LSTM ที่หลากหลายเพื่อค้นหาสถาปัตยกรรม LSTM ที่มีประสิทธิภาพสูงสุดในการตรวจหาอาการชักจากโรคลมชัก ดังนั้นจึงได้รับผลลัพธ์ที่เกือบจะสมบูรณ์แบบในการทำนายอาการชัก (ความไว 100% และความจำเพาะ 99.86%) [83] เนื่องจาก LSTM เป็นโครงสร้างที่มีประสิทธิภาพสำหรับการประมวลผลข้อมูลตามลำดับ การศึกษาบางชิ้นจึงใช้ข้อมูล EEG แบบดิบเป็นคุณลักษณะอินพุตที่มีการประมวลผลล่วงหน้าน้อยที่สุด เนื่องจากเครือข่าย LSTM เรียนรู้คุณสมบัติโดยตรงจากข้อมูล EEG แบบดิบ ประสิทธิภาพในการศึกษาการจดจำอารมณ์จึงดีขึ้นอย่างน้อย 12% [85] และผลลัพธ์ของการศึกษาการจำแนกประเภทภาพยนต์ก็ดีขึ้นเช่นกัน [86] เมื่อเปรียบเทียบกับการศึกษาแบบดั้งเดิมอื่นๆ โดดเด่นด้วยเทคนิคการสกัด
นอกจากนี้ สถาปัตยกรรม BiLSTM ยังถูกใช้สำหรับการจำแนกประเภทตาม EEG เนื่องจากสามารถเข้าถึงข้อมูลจากทั้งสถานะในอดีตและอนาคต ดังนั้น การตรวจจับสภาวะต่างๆ ของสมองที่สะท้อนในข้อมูล EEG เช่น การชัก การนอนหลับ เป็นต้น [63–67] โดยทั่วไปแล้ว เครือข่าย BiLSTM มีประสิทธิภาพเหนือกว่าเครือข่าย LSTM ที่รวบรวมข้อมูลในอดีตจากลำดับในทิศทางไปข้างหน้าเท่านั้น ด้วยเหตุนี้ ประสิทธิภาพสูงจึงได้รับการรายงานในการจำแนกประเภทตาม EEG ล่าสุดโดยใช้เครือข่าย BiLSTM ชาร์มา และคณะ ได้รับความแม่นยำในการจำแนกประเภท 82.01% สำหรับอารมณ์สี่ประเภทตามอัลกอริทึม BiLSTM และสถิติที่มีลำดับสูงกว่า [87] นอกจากนี้ เครือข่าย BiLSTM ยังประสบความสำเร็จในการจำแนกประเภทโรคลมบ้าหมูและระยะการนอนหลับ [88, 89]
เช่นเดียวกับการศึกษาก่อนหน้านี้ การศึกษานี้บรรลุผลลัพธ์ที่ค่อนข้างดีโดยใช้เครือข่าย BiLSTM อัลกอริธึมที่นำเสนอประสบความสำเร็จในการแยกแยะการตอบสนองของ EEG ต่อเสียงสระ 5 ตัวที่มีค่าความแม่นยำสูง คะแนน f{{0}} และ κ ของ Cohen ที่ 75.18%, 74.43% และ 0.68 ตามลำดับ ค่าของ κ ของโคเฮนสำหรับการจำแนกประเภทห้าคลาสนั้นสูงกว่าที่เห็นในการศึกษาปัจจุบันส่วนใหญ่ [90] ดังที่แสดงในรูปที่ 6 วิธี BiLSTM สร้างค่าสูงสุดสำหรับหน่วยวัดทั้งหมด เมื่อเทียบกับวิธีการเรียนรู้ของเครื่องอื่นๆ นอกจากนี้ เพื่อกำหนดความแตกต่างทางสถิติในประสิทธิภาพการจำแนกประเภท ผลลัพธ์ ANOVA ที่วัดซ้ำได้รับการวิเคราะห์ระหว่าง BiLSTM และวิธีการเรียนรู้ของเครื่องแบบคลาสสิกอื่นๆ โดยใช้ค่าธีมทั้งหมด จากการวิเคราะห์ทางสถิติ พบว่าประสิทธิภาพการจำแนกประเภทของเครือข่าย BiLSTM สูงกว่าวิธีการเรียนรู้ด้วยเครื่องจักรแบบดั้งเดิมอื่นๆ อย่างมีนัยสำคัญ (p < 0.01) ผลลัพธ์นี้ยังสอดคล้องกับเมทริกซ์ความสับสนอีกด้วย ดังแสดงในรูปที่ 7 เครือข่าย BiLSTM ทำนายฉลากที่แท้จริงของเสียงสระทั้งห้าเสียงได้ดี ในขณะที่วิธีการเรียนรู้ด้วยเครื่องแบบคลาสสิกไม่ได้ทำนาย
การทำนายที่ได้รับจากลักษณนามแมชชีนเลิร์นนิงแบบเดิมๆ นั้นแย่เป็นพิเศษในการจำแนกเสียง /u/ เสียง /u/sound ถูกตีความหมายผิดเป็น /a/ เป็นหลัก แม้แต่ RF ซึ่งแสดงให้เห็นประสิทธิภาพที่ดีที่สุดในบรรดาตัวแยกประเภทแมชชีนเลิร์นนิงทั้งห้าแบบทั่วไป ก็มีอัตราการจำแนกประเภทเสียง/u/ ที่ 34.48% โดยมีอัตราการจำแนกประเภทที่ผิดของเสียง /u/ เป็นเสียง /a/ ที่ 33.89% ดังที่เห็นได้ในรูปที่ 4 เสียง /a/ และ /u/ มีความหน่วงสูงสุดใกล้เคียงกัน ซึ่งเป็นหนึ่งในคุณลักษณะหลักของรูปคลื่น AEP (ค่าแฝงสูงสุดของเสียง /a/: 0.448, สูงสุด เวลาแฝงของเสียง /u/: 0.444) เมื่อดำเนินการจำแนกตามสัญญาณ EEG ทดลองเดี่ยวที่ประมวลผลล่วงหน้าขั้นต่ำ ดูเหมือนว่าความคล้ายคลึงดังกล่าวไม่สามารถแยกแยะได้ด้วยอัลกอริทึมการเรียนรู้ของเครื่องแบบทั่วไป ในขณะที่เครือข่าย BiLSTM สามารถแยกแยะพวกมันได้
เนื่องจากเครือข่าย BiLSTM สามารถเข้าถึงบริบทในอดีตและอนาคตทั้งหมดได้พร้อมๆ กัน คุณจึงสามารถเรียนรู้ข้อมูลที่หลากหลายผ่านเครือข่ายนี้ได้ นอกจากนี้ แม้ว่าคุณสมบัติที่สะท้อนถึงคุณลักษณะของการตอบสนอง EEG ต่อเสียงสระแต่ละเสียงจะถูกดึงโดยตรงจากทิศทางไปข้างหน้าและข้างหลังของเลเยอร์ LSTM แต่ประสิทธิภาพการจำแนกประเภทก็ได้รับการปรับปรุงให้ดีขึ้น ในการศึกษานี้ เราสามารถได้รับผลลัพธ์การจำแนกประเภทที่ดีโดยใช้สถาปัตยกรรม BiLSTM แบบง่ายๆ โดยไม่ต้องมีกระบวนการแยกคุณสมบัติที่ประดิษฐ์ขึ้นด้วยมือเพิ่มเติม
การจำแนกประเภทการตอบสนองของ ERP ต่อสิ่งเร้าการพูดในการทดลองครั้งเดียวนั้นเป็นเรื่องที่ท้าทายมาก เนื่องจากลักษณะของ SNR ของ EEG ที่ต่ำ แม้ว่าข้อดีหลักประการหนึ่งของวิธีการเรียนรู้เชิงลึกคือความสามารถในการเรียนรู้คุณลักษณะระดับสูงโดยไม่ต้องแยกคุณลักษณะแบบฮาร์ดคอร์ แต่เราพยายามเลือกสัญญาณ EEG ที่เกี่ยวข้องมากที่สุดที่เกี่ยวข้องกับการรู้จำเสียงเพื่อให้ได้ประสิทธิภาพที่ดีขึ้น ในการศึกษานี้ รูปคลื่น AEP ที่แตกต่างกันซึ่งสอดคล้องกับการกระตุ้นเสียงพูดแต่ละครั้งถูกสังเกตด้วยการเปิดใช้งานพลังงานสูงของย่านความถี่ต่ำ รวมถึงย่านเดลต้า ทีต้า และอัลฟา ในการวิเคราะห์ TFR การสั่นของระบบประสาทในแถบอัลฟาได้รับการยอมรับอย่างกว้างขวางว่ามีบทบาทสำคัญในการประมวลผลการได้ยิน Mazaheri และคณะ รายงานว่าการลดทอนของกิจกรรมอัลฟ่ามีความสัมพันธ์อย่างใกล้ชิดกับการเลือกปฏิบัติของเป้าหมายการได้ยิน [91]
Starus และคณะ พิสูจน์ว่าการแกว่งของอัลฟ่าในเยื่อหุ้มสมองเป็นกลไกสำคัญในการยับยั้งการประมวลผลเสียงแบบเลือกสรร เพื่อปรับปรุงความสนใจแบบเลือกฟังไปยังสัญญาณเป้าหมาย [92] ก่อนหน้านี้ เรายังพบว่าพลังอัลฟ่าถูกกระตุ้นอย่างมากในพื้นที่ขมับทวิภาคีหลังจากสิ่งเร้าทางเสียงที่เฉพาะเจาะจงซึ่งมีความแตกต่างทางสถิติในแง่ของประเภทของเสียง [48] นอกจากนี้ เป็นที่ทราบกันว่าแถบเดลต้าและทีต้ามีความเกี่ยวข้องกับการกำหนดการแบ่งส่วนและอิทธิพลการรับรู้ของข้อมูลอะคูสติก [93]
แม้ว่าการศึกษานี้จะขึ้นอยู่กับข้อมูลการทดลองในสัตว์ แต่องค์ประกอบที่เกี่ยวข้องกับคำพูดที่คล้ายกันเมื่อเทียบกับการศึกษาก่อนหน้านี้ในอาสาสมัครถูกพบในการวิเคราะห์ TFR ยิ่งไปกว่านั้น ในการวิเคราะห์ทางสถิติ พบว่าแถบ EEG ทั้งหมดมีนัยสำคัญภายใน 1 ปกป้องสิ่งเร้าและเป็นตัวแทนของส่วนประกอบ EEG ที่เกี่ยวข้องกับการรับรู้เสียง ผลลัพธ์เหล่านี้ค่อนข้างแตกต่างจากการศึกษาก่อนหน้านี้ โดยเสนอว่าเฉพาะแถบ EEG ที่เฉพาะเจาะจง เช่น แถบอัลฟ่า เท่านั้นที่เกี่ยวข้องกับการรับรู้เสียง คาดว่าการเปลี่ยนแปลงเล็กๆ น้อยๆ ของกิจกรรมย่านความถี่ EEG ทั้งหมดจะถูกบันทึกผ่านการบันทึก EEG นอกกะโหลกศีรษะ เนื่องจากให้ SNR ที่สูงกว่าโดยการลดการนำระดับเสียงและกำจัดสิ่งแปลกปลอมที่มีอยู่ในการบันทึก EEG นอกกะโหลกศีรษะ
ในการศึกษานี้ ส่วนประกอบ EEG ที่เกี่ยวข้องกับการรู้จำเสียงพูดในหนูได้รับการพิจารณา และส่วนประกอบ AEP ได้รับการจำแนกโดยใช้เครือข่าย BiLSTM ได้สำเร็จ อย่างไรก็ตาม การศึกษาครั้งนี้มีข้อจำกัดบางประการ ประการแรก จำนวนวิชาที่รวมมีน้อยเกินไป โดยเฉพาะสำหรับการเรียนรู้เชิงลึก นอกจากนี้ การศึกษานี้ไม่ได้ประเมินประสิทธิภาพของตัวแยกประเภทแต่ละตัวด้วยการตรวจสอบภายนอก แต่ใช้ 10-CV เพื่อเอาชนะขนาดตัวอย่างที่จำกัดแทน นอกจากนี้ เราไม่สามารถตัดความเป็นไปได้ที่ระบบการได้ยินของหนูจะตอบสนองต่อเสียงอย่างต่อเนื่อง เนื่องจากในการศึกษานี้ใช้เพียงเสียงสระแต่ละตัวเท่านั้น นอกจากนี้ การตอบสนองของ EEG ที่ได้รับยังได้รับผลกระทบจากผลของยาชาอีกด้วย แม้ว่าจะใช้ยาชาในปริมาณที่น้อยที่สุด แต่ความถี่ที่ช้าลงด้วยการเพิ่มพลังเดลต้าเป็นเรื่องปกติ การค้นพบการเปลี่ยนแปลงของ EEG หลังจากการสูดดมไอโซฟลูเรน [94] ดังนั้นส่วนประกอบ EEG การจดจำเสียงสระที่แนะนำในการศึกษานี้อาจแตกต่างจากสัญญาณ EEG ที่ได้มาจากหนูที่ตื่นตัว อย่างไรก็ตาม เราเชื่อว่าคุณภาพของสัญญาณ EEG นั้นดีเพียงพอเนื่องจากมีการบันทึก EEG ผ่านการฝังอิเล็กโทรดแก้ปวด และไม่มีการปนเปื้อนจากสิ่งประดิษฐ์จากการเคลื่อนไหว
ข้อสรุป
โดยสรุป การศึกษานี้ได้ดึงส่วนประกอบของระบบประสาทที่มีความหมายซึ่งเกี่ยวข้องกับการรับรู้คำพูดตามหมวดหมู่ นอกจากนี้ ตามลักษณะของเครือข่าย LSTM ได้รับการพิสูจน์แล้วว่าเครือข่าย BiLSTM เหมาะสำหรับการจำแนกประเภทการตอบสนอง EEG ด้วย AEP ที่ประมวลผลล่วงหน้าน้อยที่สุด เนื่องจากการศึกษานี้เป็นการวิจัยบุกเบิกด้วยข้อมูลจากสัตว์ จึงไม่สามารถถ่ายโอนโดยตรงไปยังการใช้งานจริงอื่นๆ เช่น อินเทอร์เฟซคอมพิวเตอร์สมอง หรือเครื่องมือสื่อสารทางเลือกสำหรับมนุษย์

ดังนั้น การศึกษาในอนาคตกับข้อมูล EEG ของมนุษย์จึงจำเป็นต้องมีการตรวจสอบประสิทธิภาพของเครือข่าย BiLSTM ในการจำแนกประเภทการรู้จำคำพูดตาม EEG การได้ยิน นอกจากนี้ ยังต้องมีการประเมินอีกครั้งเพื่อการปรับพารามิเตอร์และการดึงคุณลักษณะที่เหมาะสมที่สุด คาดว่าการศึกษาครั้งนี้จะเป็นแนวทางใหม่ในการวิเคราะห์สัญญาณ EEG ตลอดจนข้อมูลอันมีค่าเกี่ยวกับกลไกการรับรู้และการจดจำคำพูดในสมอง

อ้างอิง
1. Wernicke C. อาการที่ซับซ้อนของความพิการทางสมอง ใน: Cohen RS, Wartofsky MW, บรรณาธิการ การดำเนินการของ Boston Colloquium สำหรับปรัชญาวิทยาศาสตร์ 1966/1968 ดอร์เดรชท์: สปริงเกอร์ เนเธอร์แลนด์;1969 หน้า 34–97.
2. Shi Z, Yan S, Ding Y, Zhou C, Qian S, Wang Z และคณะ สนามการได้ยินด้านหน้าจำเป็นสำหรับการจัดหมวดหมู่เสียงในการปรับสภาพความกลัวของหนูตัวเต็มวัย ประสาทด้านหน้า 2019; 13:1374.
3. ลิเบอร์แมน AM, แฮร์ริส KS, ฮอฟฟ์แมน HS, กริฟฟิธ BC การเลือกปฏิบัติของเสียงพูดภายในและข้ามขอบเขตฟอนิม เจเอ็กซ์พี ไซโคล. 2500; 54: 358–368.
4. Johnson K. สัทศาสตร์และเสียง ชิเชสเตอร์: ไวลีย์-แบล็คเวลล์; 2555.
5. Green PA, Brandley NC, Nowicki S. การรับรู้เชิงหมวดหมู่ในการสื่อสารและการตัดสินใจของสัตว์ พฤติกรรม Ecol 2020; 31: 859–867.
6. เครก เอ, เฮ วาย, คอนเตรราส-วิดัล เจแอล. การเรียนรู้เชิงลึกสำหรับงานจำแนกประเภทคลื่นไฟฟ้าสมอง (EEG): บทวิจารณ์ เจ ประสาท อังกฤษ 2019; 16:28.
7. Na¨a¨ta¨nen R, Paavilainen P, Rinne T, Alho K. การปฏิเสธที่ไม่ตรงกัน (MMN) ในการวิจัยพื้นฐานของการประมวลผลการได้ยินส่วนกลาง: การทบทวน สรีรวิทยาคลินิก. เอลส์เวียร์; 2550. หน้า 2544–2590.
8. การ์ริโด้ มิชิแกน, คิลเนอร์ เจเอ็ม, สเตฟาน เคอี, ฟริสตัน เคเจ การปฏิเสธที่ไม่ตรงกัน: การทบทวนกลไกเบื้องหลัง สรีรวิทยาคลินิก. เอลส์เวียร์; 2009. หน้า 453–463
For more information:1950477648nn@gmail.com






