การจดจำป้ายจราจรตามอัลกอริทึม YOLOv3 ตอนที่ 2
Jan 19, 2024
2. อัลกอริทึมพื้นฐาน
2.1. อัลกอริทึม YOLOv3
YOLOv3 [14] เป็นอัลกอริธึมการตรวจจับเป้าหมายขั้นตอนเดียวที่ได้รับการปรับปรุงของ Redmon โดยใช้ YOLOv2 ซึ่งได้รับการปรับปรุงความแม่นยำในการตรวจจับและประสิทธิภาพแบบเรียลไทม์ และเหนือกว่าอัลกอริธึมอื่นๆ ในแง่ของความเร็วและความแม่นยำ
ในช่วงไม่กี่ปีที่ผ่านมา การพัฒนาอย่างรวดเร็วของเทคโนโลยีปัญญาประดิษฐ์ทำให้ระบบการตรวจจับอัจฉริยะต่างๆ สามารถนำไปใช้ในด้านต่างๆ ได้ ความแม่นยำในการตรวจจับเป็นตัวบ่งชี้ที่สำคัญในการประเมินคุณภาพของระบบอัจฉริยะ และหน่วยความจำเป็นหนึ่งในความสามารถหลักที่รองรับการทำงานของระบบอัจฉริยะ แล้วความสัมพันธ์ระหว่างทั้งสองคืออะไร?
ก่อนอื่น เราต้องทำให้ชัดเจนว่าความแม่นยำในการตรวจจับและหน่วยความจำไม่ใช่ "ความสัมพันธ์เชิงบวก" หรือ "ความสัมพันธ์เชิงลบ" ง่ายๆ มีการโต้ตอบและการประสานงานในระดับสูง ในหลายกรณี ความแม่นยำในการตรวจจับของระบบอัจฉริยะขึ้นอยู่กับหน่วยความจำของระบบ ซึ่งก็คือความสามารถในการทำความเข้าใจและเรียนรู้ข้อมูลตัวอย่าง
ตัวอย่างเช่น ในด้านการจดจำใบหน้า ระบบจดจำใบหน้าที่ดีจะต้องสามารถระบุใบหน้าต่างๆ ได้อย่างแม่นยำ และจับคู่กับข้อมูลของบุคคลในฐานข้อมูลใบหน้าที่รู้จัก สิ่งนี้ต้องการให้ระบบอัจฉริยะต้องมีหน่วยความจำที่แข็งแกร่ง สามารถจัดเก็บข้อมูลของใบหน้าที่รู้จักในฐานข้อมูล และใช้งานอย่างยืดหยุ่นในงานจดจำครั้งต่อไป
ในทำนองเดียวกัน ในด้านการแพทย์ ระบบอัจฉริยะจำเป็นต้องเข้าใจและจดจำความรู้ทางการแพทย์จำนวนมาก เพื่อช่วยแพทย์ในการวินิจฉัยโรคและออกแบบแผนการรักษา นอกจากนี้ยังต้องการระบบอัจฉริยะที่ต้องมีความจำและความสามารถในการเรียนรู้ที่แข็งแกร่ง ดูดซับความรู้ทางการแพทย์ใหม่ๆ อย่างต่อเนื่อง และต้องตรวจสอบข้ามและอัปเกรดด้วยฐานความรู้ที่มีอยู่
แน่นอนว่าความสัมพันธ์ระหว่างความแม่นยำในการตรวจจับและหน่วยความจำไม่ใช่ความสัมพันธ์ทางเดียว ในทางตรงกันข้าม ความแม่นยำในการตรวจจับที่ดียังสามารถส่งเสริมการปรับปรุงหน่วยความจำของระบบอัจฉริยะได้อีกด้วย ตัวอย่างเช่น ในงานจำแนกประเภทและการรับรู้บางงาน ระบบอัจฉริยะจำเป็นต้องให้ข้อเสนอแนะและการปรับให้เหมาะสมอย่างต่อเนื่อง เพื่อปรับปรุงความแม่นยำและความแม่นยำอย่างต่อเนื่อง จึงช่วยเพิ่มความสามารถในการทำความเข้าใจและจดจำข้อมูลตัวอย่าง
โดยทั่วไป ความแม่นยำในการตรวจจับและหน่วยความจำเป็นสององค์ประกอบที่ขาดไม่ได้สำหรับการทำงานของระบบอัจฉริยะ พวกเขามีปฏิสัมพันธ์และความสัมพันธ์ที่ซับซ้อนซึ่งจำเป็นต้องพิจารณาและประสานงานอย่างเต็มที่ มีเพียงการปรับปรุงความแม่นยำในการตรวจจับอย่างต่อเนื่องและเสริมความแข็งแกร่งให้กับหน่วยความจำและความสามารถในการเรียนรู้ของระบบอัจฉริยะอย่างต่อเนื่องเท่านั้นที่จะสามารถพัฒนาและประยุกต์ใช้ระบบอัจฉริยะอย่างครอบคลุมได้อย่างแท้จริง จะเห็นได้ว่าเราต้องปรับปรุงความจำ และ Cistanche Deserticola สามารถปรับปรุงความจำได้อย่างมาก เนื่องจาก Cistanche Deserticola ยังสามารถควบคุมความสมดุลของสารสื่อประสาท เช่น การเพิ่มระดับของอะเซทิลโคลีนและปัจจัยการเจริญเติบโต สารเหล่านี้มีความสำคัญมากต่อความจำและการเรียนรู้ นอกจากนี้ เนื้อสัตว์ยังช่วยเพิ่มการไหลเวียนของเลือดและส่งเสริมการส่งออกซิเจน ซึ่งช่วยให้สมองได้รับสารอาหารและพลังงานที่เพียงพอ ซึ่งจะช่วยปรับปรุงความมีชีวิตชีวาและความอดทนของสมอง

คลิกรู้อาหารเสริมเพื่อเพิ่มความจำ
ปัจจุบัน YOLOv3 เป็นอัลกอริธึมยอดนิยมในตระกูล YOLO และมีการใช้กันอย่างแพร่หลายในสถานการณ์การตรวจจับจริง [15] โครงสร้างเครือข่าย YOLOv3 แสดงในรูปที่ 1

โครงสร้างการบิดที่สมบูรณ์ที่ใช้โดย YOLOv3 ไม่ถูกจำกัดด้วยขนาดของอินพุตรูปภาพ
เลเยอร์การรวมกลุ่มและเลเยอร์ที่เชื่อมต่อโดยสมบูรณ์จะถูกลบออกจากโครงสร้างเครือข่ายทั้งหมด และใช้เลเยอร์แบบหมุนวนที่มีขนาดขั้นตอน 2 แทนเลเยอร์การรวมกลุ่มสำหรับการดำเนินการสุ่มตัวอย่าง ซึ่งป้องกันการสูญเสียข้อมูลเป้าหมายในระหว่างการรวมกลุ่ม และอำนวยความสะดวกในการตรวจจับเป้าหมายขนาดเล็ก [ 16].
นอกจากนี้ YOLOv3 ยังแทนที่โครงสร้างเครือข่าย DarkNet-19 ของ YOLOv2 ด้วยเลเยอร์การแยกคุณลักษณะ DarkNet-53
เครือข่าย DarkNet-53 ซึ่งประสบความสำเร็จในการแก้ไขปัญหาการไล่ระดับสีของเครือข่ายระดับลึกและการสูญเสียข้อมูลดั้งเดิมในระหว่างการดำเนินการแบบสลับซับซ้อนหลายชั้น เพื่อแยกคุณลักษณะที่ดีขึ้น และปรับปรุงการตรวจจับและการจัดหมวดหมู่ [17] ยืมโครงสร้างเครือข่ายที่เหลือของ ResNet [ 18] และใช้เอาต์พุตดั้งเดิมของเลเยอร์ก่อนหน้าเป็นส่วนหนึ่งของอินพุตในเลเยอร์หลังของเครือข่าย
ดังแสดงในรูปที่ 2 โมดูลที่เหลือใน YOLOv3 ประกอบด้วยเลเยอร์แบบบิดสองชั้นและเลเยอร์ทางลัด

นอกจากนี้ YOLOv3 ยังใช้แนวคิดเกี่ยวกับฟีเจอร์เครือข่ายพีระมิด (FPN) (19) และแนะนำฟีเจอร์เครือข่ายพีระมิดเพื่อคาดการณ์แผนผังฟีเจอร์ในสามระดับ โดยมีสเกลการตรวจจับ 13 x 13, 26 x 26 และ 52 x 52
วิธีการแยกคุณสมบัติโดยโครงข่ายประสาทเทียมแบบหมุนวนนั้นเป็นจากล่างขึ้นบนในเครือข่าย FPN และกระบวนการอัปแซมปลิงแผนผังฟีเจอร์เลเยอร์แบบหมุนวนนั้นเป็นจากบนลงล่าง ดังแสดงในรูปที่ 3
2.2. โครงสร้างการรวมตัวเสี้ยมเชิงพื้นที่
โครงสร้างการรวมกลุ่มพีระมิดเชิงพื้นที่ (SPP) (20) แก้ปัญหาการดึงคุณสมบัติภาพซ้ำ ๆ โดยเครือข่ายประสาทเทียมและปรับปรุงประสิทธิภาพการตรวจจับอย่างมาก โครงสร้างเครือข่าย SPPNet แสดงในรูปที่ 4

เพื่อให้แน่ใจว่าความละเอียดของภาพอินพุตตรงกับมิติคุณสมบัติของเลเยอร์ที่เชื่อมต่อโดยสมบูรณ์ในโครงข่ายประสาทเทียมที่มีเลเยอร์ที่เชื่อมต่ออย่างสมบูรณ์ จำเป็นต้องมีการครอบตัดขอบเขตและปรับขนาดบนรูปภาพอินพุต
กระบวนการปรับขนาดและครอบตัดจะส่งผลให้สูญเสียข้อมูลคุณสมบัติรูปภาพ ลดความแม่นยำในการตรวจจับ และส่งผลต่อผลลัพธ์การตรวจจับ อย่างไรก็ตาม กระบวนการปรับขนาดและครอบตัดจะส่งผลให้สูญเสียความแม่นยำในการตรวจจับข้อมูลคุณสมบัติรูปภาพ และส่งผลต่อผลลัพธ์การตรวจจับ ในขณะที่ SPPNet สามารถเอาชนะข้อจำกัดของ ขนาดคงที่ของรูปภาพอินพุต ช่วยประหยัดค่าใช้จ่ายในการคำนวณ 21

3. ปรับปรุง YOLOv3
3.1. ปรับปรุงโครงสร้างเครือข่าย YOLOv3
เครือข่ายการแยกคุณสมบัติพื้นฐานมักจะดาวน์สุ่มห้าครั้ง โดยมีอัตราการสุ่มตัวอย่างดาวน์ 2 และหลายหลากของการสุ่มดาวน์ห้าครั้งคือ 32 ยกกำลังห้าของสอง ตามคำอธิบายชุดข้อมูล COCO
หากการสุ่มตัวอย่างยังคงดำเนินต่อไป แผนที่คุณลักษณะที่ได้รับจะเป็นหนึ่ง และข้อมูลเป้าหมายจะหายไป เป้าหมายขนาดเล็กมีขนาดน้อยกว่า 32 × 32 พิกเซล เป้าหมายขนาดกลางคือ 32 × 32–96 × 96 พิกเซล และเป้าหมายขนาดใหญ่มีขนาดใหญ่กว่า 96 × 96 พิกเซล [22]
ดังที่แสดงในรูปที่ 5 ชุดข้อมูลป้ายจราจร TT100K ที่ใช้ในงานนี้ส่วนใหญ่ประกอบด้วยเป้าหมายขนาดเล็กและขนาดกลาง โดยมีเป้าหมายขนาดใหญ่คิดเป็นเพียง 7.4% ของชุดข้อมูลทั้งหมด และเป้าหมายขนาดเล็กคิดเป็น 42.5% [23]

ชุดข้อมูล TT100K มีความละเอียดสูง โดยแต่ละภาพมีความละเอียด 2048 × 2048 พิกเซล และป้ายจราจรที่ใหญ่ที่สุดในบรรดาเป้าหมายขนาดเล็กคิดเป็นสัดส่วนน้อยกว่า 0.1% ของภาพทั้งหมด ถือเป็นความท้าทายที่สำคัญสำหรับเป้าหมาย อัลกอริทึมการตรวจจับ
เป้าหมายขนาดเล็กมีคุณสมบัติที่จำกัดและจำเป็นต้องมีความแม่นยำในการระบุตำแหน่งที่ดีเยี่ยม
แม้จะมีการแนะนำโครงสร้าง FPN ใน YOLOv3 เพื่อใช้ประโยชน์จากฟีเจอร์หลายระดับเพื่อสร้างการคาดการณ์โดยการผสมผสานการค้นพบของเลเยอร์ฟีเจอร์ที่แตกต่างกัน ซึ่งมีความสำคัญอย่างยิ่งต่อการระบุเป้าหมายขนาดเล็ก แต่ผลลัพธ์ก็ยังไม่เป็นที่น่าพอใจ
ในเครือข่าย YOLOv3 เลเยอร์ตื้นจะมีข้อมูลเชิงความหมายเชิงคุณลักษณะน้อยกว่าแต่มีตำแหน่งเป้าหมายที่แม่นยำ ในขณะที่เลเยอร์ลึกจะมีมากกว่าแต่มีตำแหน่งเป้าหมายแบบหยาบ
ด้วยเหตุนี้ ชั้นการบิดแบบตื้นจึงถูกนำมาใช้ในการทำนายเป้าหมายขนาดเล็ก และชั้นการบิดแบบลึกจะถูกนำมาใช้ในการทำนายเป้าหมายขนาดใหญ่ สเกลการทำนายคุณสมบัติที่สี่ขนาด 152 × 152 ถูกเพิ่มเข้าไปในสเกลการทำนายคุณสมบัติทั้งสามของโครงสร้างเครือข่าย YOLOv3 เพื่อใช้ประโยชน์จากคุณสมบัติแบบตื้นในเครือข่ายอย่างเต็มที่เพื่อคาดการณ์เป้าหมายขนาดเล็ก
ด้วยขนาดรูปภาพอินพุตที่ 608 × 608 ขนาดฟีเจอร์รูปภาพเอาต์พุตคือ 152 × 152 หลังจากการบิดและการสุ่มตัวอย่างสองเท่าของรูปภาพอินพุต และฟีเจอร์เลเยอร์ถูกเหนี่ยวนำผ่านเลเยอร์การกำหนดเส้นทาง การแยกคุณลักษณะนี้ถูกหลอมรวมกับคุณลักษณะเลเยอร์ที่ 11 เพื่อเพิ่มระดับการคาดการณ์คุณลักษณะที่สี่
นอกจากนี้ ยังมีการเพิ่มโมดูล SPP เพื่อให้เกิดการผสมผสานคุณสมบัติระดับท้องถิ่นและระดับโลกโดยการยืมแนวคิดของ SPPNet และรวมเข้ากับ YOLOv3
ก่อนเลเยอร์ YOLOdetection โมดูล SPP จะถูกรวมเข้าด้วยกันระหว่างเลเยอร์ Convolutional ชั้นที่ 5 และ 6 และแผนผังคุณลักษณะและแผนผังคุณลักษณะของโมดูล SPP รวมกันได้รับการเชื่อมต่อใหม่และส่งผ่านไปยังเลเยอร์เครือข่ายการตรวจจับถัดไป

เพื่อให้การรวมระดับฟีเจอร์แมปของคุณสมบัติเฉพาะและระดับโลกสำเร็จ เคอร์เนลการรวมพูลสูงสุดของโมดูล SPP ควรใกล้เคียงกับขนาดของฟีเจอร์แมปที่จะรวมเข้าด้วยกันมากที่สุด
เพื่อลดความพยายามในการคำนวณที่เกิดจากโมดูล SPP เพิ่มความสามารถในการแสดงออกแผนที่คุณลักษณะ และเพิ่มผลกระทบในการตรวจจับ โมดูล SPP ในการวิจัยนี้ประกอบด้วยสาขาคู่ขนานสองสาขา แต่ละสาขาประกอบด้วยเลเยอร์รวมสูงสุด 19 × 19 และ ajump การเชื่อมต่อ. รูปที่ 6 แสดงให้เห็นโครงสร้างเครือข่าย YOLOv3 ที่ปรับปรุงแล้ว

3.2. ปรับปรุงฟังก์ชั่นการสูญเสีย
ฟังก์ชันการสูญเสียของ YOLOv3 ประกอบด้วยการสูญเสียพิกัดศูนย์กลาง (สูญเสีย) การสูญเสียพิกัดความกว้าง–ความสูง (การสูญเสีย) การสูญเสียความมั่นใจ (lossconf) และการสูญเสียการจำแนกประเภท (การสูญเสีย) การสูญเสียพิกัดส่วนกลางแสดงโดย:

โดยที่ ladcoord หมายถึงพิกัดการสูญเสียน้ำหนัก ladnoobj หมายถึงการลดน้ำหนักอย่างมั่นใจโดยไม่มีวัตถุ Iobjij แสดงว่ากล่องสมอที่ j ของเซลล์ที่ i รับผิดชอบต่ออ็อบเจ็กต์ (1 หรือ 0); Inobbyij หมายถึงกล่องสมอ jth ของตาราง ith ที่ไม่รับผิดชอบต่อวัตถุ (xi,yi,wji,hjI, CjI, Pji) หมายถึงพิกัดกล่องเป้าหมายที่คาดการณ์ไว้ ความมั่นใจ และหมวดหมู่ และ (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) หมายถึงพิกัดกล่องเป้าหมายที่แท้จริง ความมั่นใจ และหมวดหมู่
ฟังก์ชันการสูญเสีย YOLOv3 แสดงด้วยสมการ (5) โดยที่ฟังก์ชันการสูญเสีย Mean Squareerror (MSE) ใช้สำหรับการถดถอยของกรอบขอบเขตและเอนโทรปีข้าม ซึ่งถูกใช้เป็นฟังก์ชันการสูญเสียใน Lossconf และ Locals
การสูญเสีย=lossxy + losswh − losscon f − losscls (5)
อย่างไรก็ตาม การใช้ MSE เป็นฟังก์ชันการสูญเสียของการถดถอยของกล่องขอบเขตนั้นไม่เอื้ออำนวยต่อการตรวจจับเป้าหมายขนาดเล็ก มีความไวต่อขนาดของวัตถุ และมุ่งเน้นไปที่เป้าหมายขนาดใหญ่ในขณะที่ไม่เป็นมิตรกับวัตถุขนาดเล็ก
เพื่อสร้างสมดุลให้กับการสูญเสียเป้าหมายขนาดใหญ่และขนาดเล็ก และเพิ่มผลการตรวจจับให้สูงสุดโดยการลดอิทธิพลของขนาดกล่องขอบเขตที่มีต่อฟังก์ชันการสูญเสียความกว้างและความสูง จึงมีการใช้ฟังก์ชันการสูญเสียประเภท IoU ในบทความนี้ และใช้การสูญเสียหน่วยเมตริกที่สร้างโดย IoU เป็น สมการประสิทธิภาพ (6)
IoU =|A ∩ B||A ∪ B|(6)
เมื่อกล่องขอบเขตและกล่องเป้าหมายไม่ทับซ้อนกัน IoU=0 จะไม่สะท้อนถึงช่องว่างระยะห่างระหว่างกล่องทั้งสอง เมื่อกล่องทำนายและกล่องที่มีป้ายกำกับทับซ้อนกันอย่างสมบูรณ์ IoU=1 ไม่สามารถกำหนดจุดกึ่งกลางของกล่องขอบเขตได้ และช่องว่างขนาดกับกล่องเป้าหมายไม่สามารถปรับให้เหมาะสมต่อไปได้
การสูญเสีย DIOU [24] ไม่ขึ้นอยู่กับขนาด ดังนั้นขนาดใหญ่จึงไม่ทำให้สูญเสียมาก เนื่องจากขนาดที่เล็กทำให้เกิดการสูญเสียเพียงเล็กน้อย ซึ่งสามารถแก้ไขปัญหาได้ งานนี้จึงใช้การสูญเสีย DIoU ซึ่งมีสูตรการคำนวณแสดงอยู่ในสมการ (7)
D IoU สูญเสีย=1 − IoU +ρ2 b, bgt c2(7)
โดยที่ b และ bgt แสดงถึงจุดศูนย์กลาง ρ คือระยะทางแบบยุคลิด และ c คือความยาวเส้นทแยงมุมของกล่องล้อมรอบที่เล็กที่สุดซึ่งครอบคลุมกล่องทั้งสอง
การสูญเสีย DIOU ช่วยลดระยะห่างระหว่างเฟรมเป้าหมายสองเฟรมโดยตรง บรรจบกันอย่างรวดเร็ว และสอดคล้องกับกลไกการถดถอยเฟรมเป้าหมายมากขึ้น ซึ่งคำนึงถึงระยะห่างระหว่างเป้าหมายและจุดยึด อัตราการทับซ้อน และขนาด ทำให้การถดถอยของเฟรมเป้าหมายมากขึ้น มีเสถียรภาพ โดยยังคงให้ทิศทางการไล่ระดับสีสำหรับกล่องขอบเขตเมื่อไม่ทับซ้อนกับกรอบเป้าหมาย

For more information:1950477648nn@gmail.com






