Forschung zur Audioerkennung basierend auf dem Deep Neural Network im Musikunterricht
Oct 10, 2023
Solfeggio ist ein wichtiger Grundkurs für Musikstudenten, und das Audioerkennungstraining ist eines der wichtigen Bindeglieder. Mit der Verbesserung der Computerleistung wurde die Audioerkennung in intelligenten tragbaren Geräten weit verbreitet. In den letzten Jahren hat die Entwicklung des Deep Learning den Forschungsprozess zur Audioerkennung beschleunigt. Allerdings gibt es in einer Musikunterrichtsumgebung viele Tonstörungen, die dazu führen, dass die Leistung des Audio-Unterrichts nicht den tatsächlichen Anforderungen gerecht wird. Um dieses Problem zu lösen, wird ein verbessertes Audioerkennungssystem basierend auf YOLO-v4 vorgeschlagen, das hauptsächlich die Netzwerkstruktur verbessert.
Blattsingen und Gehörbildung sind untrennbar mit dem Gedächtnis verbunden. Beim Erlernen von Musik sind Blattgesang und Gehörbildung sehr wichtige Fähigkeiten. Der Zweck der Gehörbildung beim Blattsingen besteht darin, den Schülern zu ermöglichen, ihre musikalischen Fähigkeiten und ihr Gedächtnis durch Zuhören und Singen bestimmter Noten zu trainieren.
Zu den Hauptinhalten der Gehörbildung beim Blattsingen gehören Tonhöhe, Rhythmus, Stimme, Melodie, Harmonie usw. Durch die Gehörbildung beim Blattsingen können wir unsere Ohren kontinuierlich trainieren, wodurch wir verschiedene Noten und Rhythmen genauer identifizieren und schnell umwandeln können Wir verwandeln die Noten, die wir hören, in Symbole auf der Musikkarte und verbessern dadurch unsere Erinnerungsfähigkeit.
Auch Blattgesang und Gehörbildung können uns helfen, die Gesetze der Musik besser zu verstehen und zu beherrschen. Wenn wir unsere Ohren nutzen, um Musik direkt zu fühlen und zu verstehen, können wir den Rhythmus und die Melodie der Musik besser verstehen und dadurch unser Gedächtnis schneller verbessern.
Darüber hinaus können uns Blattgesang und Gehörbildung auch dabei helfen, ein gutes Gespür für Musik und starke musikalische Emotionen zu entwickeln. Durch das Training werden unser Verständnis und unsere Gefühle für Musik immer tiefer und dadurch unsere Liebe und Wertschätzung für Musik gestärkt.
Das Gedächtnis ist ein sehr wichtiger Faktor beim Musiklernen. Gute Gedächtnisfähigkeiten sind eine der notwendigen Voraussetzungen, um ein Instrument zu erlernen und Musik zu komponieren. Durch Blattsingen und Gehörbildung können wir unser Gedächtnis verbessern und musikalische Techniken und Fertigkeiten besser beherrschen. Bei komplexem Repertoire können wir uns Noten und Rhythmen schneller merken und so Musikwerke besser aufführen.
Kurz gesagt: Gehörbildung und Gedächtnis beim Blattsingen sind untrennbar miteinander verbunden und ergänzen sich gegenseitig. Durch kontinuierliches Blattsingen und Gehörschulung können wir unsere musikalischen Fähigkeiten und unser Gedächtnis verbessern, um Musik besser zu beherrschen. Es ist ersichtlich, dass wir das Gedächtnis verbessern müssen, und Cistanche deserticola kann das Gedächtnis erheblich verbessern, da Cistanche deserticola ein traditionelles chinesisches Arzneimittel ist, das viele einzigartige Wirkungen hat, darunter die Verbesserung des Gedächtnisses. Die Wirksamkeit von Hackfleisch beruht auf den verschiedenen darin enthaltenen Wirkstoffen, darunter Säure, Polysaccharide, Flavonoide usw. Diese Inhaltsstoffe können die Gesundheit des Gehirns auf verschiedene Weise fördern.

Klicken Sie auf Möglichkeiten zur Verbesserung der Gehirnfunktion
Zunächst wird die Mel-Frequenz-Cepstrum-Nummer verwendet, um das Originalaudio zu verarbeiten und die entsprechenden Merkmale zu extrahieren. Versuchen Sie dann, das YOLO-v4-Modell im …Bereich des Deep Learning auf den …Bereich der Audioerkennung anzuwenden und es zu verbessern, indem Sie es mit dem räumlichen Pyramiden-Pool-Modul kombinieren, um die Generalisierungsfähigkeit von Daten in verschiedenen Audioformaten zu stärken. Zweitens wird die Stapelmethode beim Ensemble-Lernen verwendet, um die unabhängigen Teilmodelle zweier verschiedener Kanäle zu fusionieren. Experimentelle Ergebnisse zeigen, dass das verbesserte YOLO-v4-Modell im Vergleich zu anderen Deep-Learning-Technologien die Leistung der Audioerkennung verbessern kann und eine bessere Leistung bei der Verarbeitung von Daten verschiedener Audioformate aufweist, was eine bessere Generalisierungsfähigkeit zeigt.
1. Einleitung
Musik ist eine abstrakte Kunstform mit Klang als Ausdrucksmittel. Im Prozess des Musikunterrichts kann Solfeggio das musikalische Gedächtnis der Schüler stärken, es den Schülern ermöglichen, Musikwerke genau zu identifizieren und so eine bessere „musikalische Wahrnehmung“ zu erlangen. Als wichtiges Glied im Solfeggio ist das Training der Audioerkennung für jüngere Schüler sehr schwierig. liegt daran, dass die Schüler alle Arten von Schlüsseln beherrschen, die Länge und Dauer verschiedener Noten sowie den Tonhöhenunterschied zwischen verschiedenen Noten unterscheiden müssen.
Die Analyse von Audiosignalen auf Basis eingebetteter intelligenter Geräte hat immer mehr Aufmerksamkeit von Forschern auf sich gezogen [1–7]. Intelligente tragbare Geräte mit Audioerkennungsfunktionen können Schülern dabei helfen, die oben genannten Probleme zu lösen und Unterstützung beim Musikunterricht zu leisten. Die Aufgabe der Audioerkennung besteht darin, die gesammelten Audiosignale vorzuverarbeiten, auszuwerten, daraus wertvolle Merkmale zur Unterscheidung von Musikpartituren zu extrahieren und sie schließlich anhand dieser Merkmale zu klassifizieren. Die Klassifizierung ist eine sehr wichtige Methode des Data Mining [8–10]. Klassifizierung bezieht sich auf die Generierung einer Klassifizierungsfunktion nach bestimmten Regeln basierend auf Trainingssatzdaten. Diese Funktion kann die Daten des Testsatzes einer der angegebenen Kategorien zuordnen und so die Kategorievorhersage unbekannter Daten realisieren. Zu den gängigen Klassikern gehören derzeit Entscheidungsbäume, logistische Regression, Support Vector Machine (SVM), Naive Bayes, k-Nearest-Neighbor-Algorithmus (KNN), BP-Neuronales Netzwerk und Deep Learning [11–13].
Die bisherigen Methoden des maschinellen Lernens müssen häufig die Merkmale manuell extrahieren, die die Originaldaten als Eingabe der Klasse darstellen können. Deep Learning kann jedoch die hochdimensionalen Merkmale von Proben automatisch extrahieren (ohne manuelle Merkmalsextraktion), solange die Eingabedaten die Informationen der Originaldaten so weit wie möglich abdecken, was für große Datenmengen geeignet ist. *Die Deep-Learning-Methode kann mithilfe einer großen Menge an Audiodaten, die von intelligenten Geräten gesammelt werden, spezifische Audioerkennungsaufgaben realisieren. *Das Convolutional Neural Network (CNN) als eine Art Deep-Learning-Architektur wird aufgrund seiner überlegenen Leistung beim lokalen Feature-Learning häufig in der Bildklassifizierung, Spracherkennung, Verarbeitung natürlicher Sprache und anderen Bereichen eingesetzt [14]. Im Gegensatz zu anderen neuronalen Netzwerkmodellen (wie der Boltzmann-Maschine und dem rekurrenten neuronalen Netzwerk) zeichnet sich das CNN dadurch aus, dass die Kernoperation eine Faltungsoperation ist. * Das YOLO-Netzwerk zieht Lehren aus der Struktur des CNN-Klassifizierungsnetzwerks und zeigt gute Vorteile im Bereich der Bilderkennung, was die Aufmerksamkeit vieler Forscher auf sich gezogen hat.
*Daher versucht diese Studie, das YOLO-v4-Modell auf den Bereich der Audioerkennung anzuwenden und dessen Netzwerkstruktur zu verbessern. Darüber hinaus wird die Stapelmethode beim Ensemble-Lernen verwendet, um zwei unabhängige Teilmodelle unterschiedlicher Kanäle zu fusionieren, und die Klassifizierungsleistung des fusionierten Systems wird im Vergleich zum einzelnen Teilmodell weiter verbessert.
2. Verwandte Werke
Heutzutage, mit dem Aufkommen einer großen Anzahl intelligenter Geräte, haben hervorragende Computerleistung und die Entwicklung der Deep-Learning-Technologie gemeinsam den Forschungsprozess im Audiobereich vorangetrieben. In Kombination mit den Hauptforschungsinhalten dieser Studie wird der aktuelle Forschungsstand aus zwei Aspekten vorgestellt: Faltungs-Neuronales Netzwerk und Audioerkennung.
*Die Faltungsstruktur eines neuronalen Netzwerks geht auf eine Studie von Yann LeCun aus dem Jahr 1998 zurück, die als künstliches neuronales Netzwerk Le Net-5 bezeichnet wird. *Ein Faltungs-Neuronales Netzwerk kann wie andere Neuronale Netzwerke mit dem Backpropagation-Algorithmus trainiert werden [15]. Im Jahr 2012 nutzten Alex Krizhevsky und andere erstmals die CNN-Technologie für komplexe Computer-Vision-Aufgaben. Durch die Verwendung von 3 vollständig verbundenen Schichten, 5 Faltungsschichten und einem Softmax-Klassifikator wird ein Faltungs-Neuronales Netzwerk mit 8 Schichten aufgebaut, das AlexNet genannt wird. AlexNet verwendet die ReLU-Aktivierungsfunktion und verwendet gleichzeitig auch die Regularisierung (Dropout), um eine Überanpassung zu verhindern. Im Jahr 2014 stellte das Computer-Vision-Team von Google das GoogLeNet-Netzwerk [16] mit einer Netzwerktiefe von 22 Schichten vor, das eine neue Struktur, Incident, enthält. Es integriert die Merkmale unterschiedlicher Tiefen und des gleichen Maßstabs und verbessert die Erkennungsgenauigkeit. Basierend auf dem GoogLeNet-Netzwerk erschienen YOLO- und SSD-Algorithmen. Beide Methoden basieren auf einem einzigen End-to-End-Netzwerk, das die Eingabe vom Originalbild bis zur Ausgabe der Objektposition und -kategorie vervollständigen kann.
Im Hinblick auf die Audioerkennung schlugen Yang und Zhao [17] eine Methode zur Klassifizierung akustischer Szenen vor, die auf der Support Vector Machine (SVM) basiert und die Klangtextur verbessert, um die Klassifizierungsgenauigkeit zu verbessern. Greco et al. [18] schlugen ein Spracherkennungssystem vor, das auf der heuristischen Deep-Learning-Methode basiert. Demir et al. [19] schlugen eine neue Pyramidenkaskaden-CNN-Methode zur Klassifizierung von Umweltgeräuschen vor. Zhu et al. [20] schlugen einen verbesserten YOLO-v4-Algorithmus für Schallbildinstrumente vor, der die Genauigkeit der Erkennung akustischer Phasenwolkenbilder effektiv verbesserte. *Die oben genannten Methoden zeigen alle eine hervorragende Leistung bei der Bewältigung von Audioerkennungsaufgaben in einer einzelnen akustischen Szene, es gibt jedoch viele Tonstörungen in der Musikunterrichtsumgebung und es ist notwendig, mit einer Vielzahl unterschiedlicher Audioformatdaten umzugehen.
*Daher schlägt diese Studie ein Audioerkennungssystem vor, das auf dem verbesserten YOLO-v4-Netzwerkmodell basiert. * Zu den wichtigsten Innovationen und Beiträgen gehören die folgenden: (1) Versuchen Sie, die YOLO-v4-Netzwerkarchitektur, die im Bereich Deep Learning hervorragend ist, auf den Bereich der Audioerkennung anzuwenden und sie durch die Kombination des räumlichen Pyramidenpoolmoduls zu verbessern. *Die verbesserte YOLO-v4-Netzwerkarchitektur nutzt die räumlichen Informationen in Audiodateien effektiv und stärkt so die Generalisierungsfähigkeit von Daten in verschiedenen Audioformaten. (2) * Die Stapelmethode beim Ensemble-Lernen wird verwendet, um zwei unabhängige Untermodelle unterschiedlicher Kanäle zu fusionieren und die Klassifizierungsleistung des fusionierten Systems zu verbessern.
3. Extraktion und Verarbeitung von Audiofunktionen
Das Extrahieren der besten Parameterdarstellung des Audiosignals ist eine der wichtigen Aufgaben zur Erzielung einer besseren Erkennungsleistung. *e Die Merkmalsextraktion in dieser Phase ist für die Klassifizierung des Klassifikators in der nächsten Phase sehr wichtig, da sie sich direkt auf die Klassifizierungseffizienz auswirkt.
Bei der Klassifizierungsaufgabe, insbesondere der Audioklassifizierungsaufgabe, hat der Mel-Frequenz-Cepstrum-Koeffizient (MFCC), der die Spektralform beschreibt, eine lange Geschichte. Obwohl der MFCC-Extraktionsprozess zu einer verlustbehafteten Datenkomprimierung führt, sind seine Klassifizierungs- und Erkennungseffekte auch bei sehr niedriger Datenrate durchaus verfügbar. Darüber hinaus wird MFCC im Vergleich zu anderen Klassifizierungsmerkmalen häufig verwendet, da es eher der Hörfrequenzgangkurve des menschlichen Ohrs entspricht.

*Der Grund, warum Menschen in komplexen Klangumgebungen unterschiedliche Umgebungen beurteilen können, liegt in der Leistungsfähigkeit der Cochlea. *Die Cochlea kann als Filterbank betrachtet werden, die Menschen dabei hilft, 20-20 kHz Audio zu filtern. *Das Problem besteht darin, dass die Empfindlichkeit der Cochlea gegenüber Frequenzen im Hörbereich nicht linear ist, sondern eine Zuordnungsbeziehung besteht. MFCC kann den Frequenzgang des menschlichen Ohrs simulieren. Die MFCC-Merkmalsextraktion besteht aus sieben Schritten. Der gesamte Prozess ist in Abbildung 1 dargestellt.
Bei herkömmlichen Audiosignalen besteht das Phänomen, dass die Niederfrequenzenergie groß, die Hochfrequenzenergie jedoch klein ist. Bei direkter Übertragung kommt es bei niedrigen Frequenzen zu einem hohen Signal-Rausch-Verhältnis und bei hohen Frequenzen zu einem unzureichenden Signal-Rausch-Verhältnis. Um diesen Verlust des Audiosignals während der Übertragung auszugleichen, wird eine Vorverzerrung eingeführt, um das Eingangssignal zu kompensieren, sodass die Hochfrequenzeigenschaften des Audiosignals hervorgehoben werden können. Die Vorverzerrung wird üblicherweise durch einen Hochpassfilter erreicht [21–23].

Beim Framing werden aus der Analog-Digital-Wandlung (ADC) gewonnene Audio-Samples in kleine Frames mit einer Länge im Bereich von 20–40 Millisekunden unterteilt. Nachdem Preemphasis und Framing abgeschlossen sind, muss jedem Frame ein Hamming-Fenster hinzugefügt werden. Beim Fenstern wird die Menge der Datenverarbeitung gesteuert, und es werden jeweils nur die Daten im Fenster verarbeitet. *Der Frequenzbereich im Spektrum der schnellen Fourier-Transformation ist sehr breit, was dazu führt, dass das Sprachsignal nicht der linearen Skala folgt [24–26]. *Daher ist es notwendig, die Mel-Scale-Filterbank zu durchlaufen, wie in Abbildung 2 dargestellt.
Abbildung 2 zeigt eine Reihe von Dreiecksfiltern, mit denen die gewichtete Summe der Spektralkomponenten der Filter berechnet wird, sodass die verarbeitete Ausgabe der Mel-Skala nahekommt. *Der Amplituden-Frequenzgang jedes Filters ist dreieckig. *e Mel-Spektrum einer gegebenen Frequenz f wird wie folgt berechnet:

13 Differentialmerkmale erster Ordnung repräsentieren die Änderungen zwischen Cepstrum-Frames in MFCC-Features, während 39 Differentialmerkmale zweiter Ordnung die Änderungen zwischen Frames in Differentialmerkmalen erster Ordnung darstellen. *Die Differenz erster Ordnung wird wie folgt berechnet:

4. SPP-YOLO-v4-Netzwerkstruktur
4.1. Modul „Spatial Pyramid Pool“ (SPP). SPP kann Informationsverzerrungen vermeiden, die durch Skalierung, Dehnung, Beschneidung und andere Vorgänge verursacht werden, und eine Ausgabe bereitstellen, die nicht von der Eingabegröße beeinflusst wird, was mit der Sliding-Window-Pooling-Technologie nicht erreicht werden kann [27]. Zweitens kann SPP mehrere Skalen bündeln, während beim Schiebefenster-Pooling nur eine Fensterskala verwendet wird. *Die Grundstruktur des SPP-Moduls ist in Abbildung 3 dargestellt. Es ist ersichtlich, dass SPP aufgrund der flexiblen Eingabegröße die Funktionen von Daten in verschiedenen Audioformaten kombinieren kann. * Die Dimension des transformierten Merkmalsvektors ist dieselbe wie die der vollständig verbundenen Schicht, während das Generalisierungsproblem gemildert wird.
4.2. SPP-YOLO-v4. YOLO-v4 ist ein hochpräziser einstufiger Echtzeit-Erkennungsalgorithmus, der YOLO-v1, YOLO-v2 und YOLO-v3 integriert. YOLO-v4 erstellt das CSP-Cross-Stage-Partial-Netzwerk (CSPNet) im Restmodul, in dem die Feature-Schicht die Eingabe und die Feature-Informationen der höheren Schicht die Ausgabe sind. *zeigt, dass die Lernziele von YOLO-v4 im ResNet-Modul zwischen Ausgabe und Eingabe unterschiedlich sind. *Daher wird Restlernen realisiert und die Modellparameter reduziert, sodass die Fähigkeit zum Lernen von Merkmalen verbessert wird. In Anbetracht der Anwendungsumgebung des Musikunterrichts werden einige Änderungen basierend auf dem ursprünglichen Netzwerk vorgenommen. Die endgültige Netzwerkstruktur ist in Abbildung 4 dargestellt.
Zuerst wird der Feature-Layer dreimal gefaltet, und dann wird der Eingabe-Feature-Layer maximal gepoolt, indem die maximal gepoolten Kerne unterschiedlicher Größe verwendet werden. Nach der Faltung und dem Upsampling werden verschiedene Merkmalsschichten in Reihe geschaltet, um eine Merkmalsfusion zu realisieren. *en, Downsampling durchführen, Höhe und Breite komprimieren und schließlich mit der vorherigen Feature-Ebene stapeln, um mehr Feature-Fusion zu realisieren (5-mal). *Das Klassifizierungsmodul verwendet die aus dem Netzwerk extrahierten Merkmale, um Klassifizierungsurteile zu treffen. Nehmen Sie als Beispiel das 13 × 13-Gitter. Dies entspricht der Aufteilung des eingegebenen Mel-Spektrogramms in 13 × 13-Quadrate. Dann wird jedes Quadrat mit drei vorherigen Frames voreingestellt. * Die Klassifizierungsergebnisse des Netzwerks passen die Positionen dieser drei vorherigen Kästchen an und filtern schließlich nach dem NMS-Algorithmus (Non-Maximum Suppression) [28], um die endgültigen Klassifizierungsergebnisse zu erhalten.

5. Audioerkennungssystem basierend auf SPPYOLO-v4
5.1. Systemarchitektur. Wie in Abbildung 5 dargestellt, teilt das vorgeschlagene Audioerkennungssystem nach der Audioeingabe zunächst die Audiosequenzdaten in zwei Teile. *Der erste Teil kommt vom Stereokanal, während der zweite Teil zu Mono komprimiert wird. *Die Audiosignale der beiden Kanäle werden vom MFCC-Spektrogramm extrahiert und als Features in das SPP-YOLO-v4-Modell eingegeben. *de, zwei Gruppen von SPP-YOLO-v4-Modellen werden integriert und die Stapelmethode wird bei der Integration übernommen. Nach dem integrierten Lernen der beiden Modelle werden schließlich die Ergebnisse der Audioklassifizierung ausgegeben. *Die Details des SPP-YOLO-v4-Modells sind in Abbildung 4 dargestellt.
5.2. Integriertes Lernen stapeln. Wie in Abbildung 5 dargestellt, verwendet das System Ensemble-Lerntechnologie, um das endgültige Klassifizierungsergebnis zu erhalten. *Die Grundidee des Ensemble-Lernens besteht darin, durch die Kombination mehrerer schwacher Klassifikatoren einen starken Klassifikator zu bilden. Selbst wenn einige schwache Klassifikatoren falsche Vorhersagen treffen, können sie durch andere schwache Klassifikatoren mit korrekten Vorhersagen korrigiert werden, wodurch die Leistung des Systems verbessert wird.
Unter der Annahme, dass x die Eingabe ist, ist mi (i � 1, 2, . . . , k) eine Gruppe von Klassifikatoren und die Ausgabe der Klassifikatoren ist die Wahrscheinlichkeitsverteilung mi (x, cj) jeder Klasse cj (i � 1, 2, ..., k) kann die endgültige Ausgabe y(x) des integrierten Klassifikators ausgedrückt werden als


Klassifizierungsziel. Zu den gängigen Ensemble-Lernalgorithmen gehören derzeit Stacking, Bagging, Boosting, Ensemble-Auswahl und so weiter. *Der in dieser Studie ausgewählte Ensemble-Lernalgorithmus ist die Stapelmethode.
Beim Stapeln handelt es sich um einen Prozess des Lernens zweiter Ordnung, bei dem die Ausgabe des Lernprozesses erster Ordnung als Eingabe dient, auch bekannt als „Meta-Lernen“. *Die Stapelmethode hat sich zu einer beliebten Ensemble-Lernmethode entwickelt, nicht nur, weil ihre Implementierung recht einfach ist, sondern auch, weil sie die Generalisierungsfähigkeit des Systems erheblich verbessern kann, was sehr gut mit dem Zweck dieser Studie übereinstimmt. *Das Grundprinzip der Stapelmethode ist in Abbildung 6 dargestellt.
6. Experiment und Ergebnisanalyse
6.1. Experimentelle Umgebung und Datensatz. *Die Hardwareplattform dieser Studie ist Intel Core i3-M350 CPU@ Dualcore 2,20 GHz, 8 GB DDR2-Speicher, Nvidia RTX2080Ti GPU und 11 GB Videospeicher. *Das integrierte Entwicklungstool PyCharm wurde in der Sprache Python 3.5.0 entwickelt. *Das in Python geschriebene YOLO-Annotations-Framework wird verwendet, um das numerische Format so zu konvertieren, dass es von YOLO gelesen werden kann. *Die Vergleichsmethoden sind das Gaußsche Mischungsmodell (GMM), CNN und R-CNN.

*Der experimentelle Datensatz besteht aus aufgezeichneten Audiodateien in der realen Unterrichtsumgebung. *Der Datensatz besteht aus Audiotypen mit vier verschiedenen Bezeichnungen (D1, D2, D3 und D4). Alle Audiodateien werden in 30-zweite Clips geschnitten. *Es gibt 12 Audiodateiformate, darunter MPEG, MP3 und WMA. Jede Aufnahme wird an einem anderen Ort durchgeführt und die durchschnittliche Aufnahmedauer beträgt 3–5 Minuten. *Zur Aufnahmeausrüstung gehören ein Zweikanal-In-Ear-Mikrofon Soundman OKM II Classic/Studio A3 und ein Roland Edirol R09 Waveform-Recorder mit einer Abtastrate von 44,1 kHz und einer Auflösung von 24-Bit.
*Der verwendete Datensatz enthält 1404 Audiodateien und die Anzahl der Audiodateien jedes Typs beträgt 351. Etwa 70 % der Daten werden zum Training des Audioerkennungsmodells verwendet, und die restlichen 30 % werden zum Testen verwendet. *Die Systemeinstellungen sind in Tabelle 1 aufgeführt.


6.3. Überprüfung der SPP-YOLO-v4-Leistung. Um den Werbeeffekt des vorgeschlagenen verbesserten YOLO-v4 (SPP-YOLO-v4) auf die Generalisierungsfähigkeit zu überprüfen, wird es mit dem traditionellen YOLO-v4-Modell verglichen. Im Experiment wurden drei von zwölf Audiodateiformaten ausgewählt: MPEG, MP3 und WMA. *Die Generalisierungsfähigkeit von SPP-YOLOv4 ist in Tabelle 2 angegeben.
Aus Tabelle 2 geht hervor, dass die Gesamtgenauigkeit von SPP-YOLO-v4 höher ist als die von herkömmlichem YOLO-v4, was seine Generalisierungsfähigkeit für Daten in verschiedenen Audioformaten bestätigt. * liegt daran, dass SPP von SPP-YOLO-v4 im Vergleich zur ursprünglichen Methode mehr Ebenen enthält, aber auch die Verarbeitungszeit erhöht.
6.4. Vergleich der Testergebnisse. Tabelle 3 enthält die Ergebnisse von Trainingsverlust, mAP usw. für alle Kategorien nach 8000 Trainingsrunden. Es ist ersichtlich, dass das Trainingsmodell der vorgeschlagenen Methode Audiotypen effektiv identifizieren kann. Es bietet gewisse Vorteile in Bezug auf Genauigkeit, Rückrufrate und F1-Score, und sein Verlustwert ist mit nur 0,0122 auch der niedrigste aller Methoden. *Daher sind Stabilität und Genauigkeit der vorgeschlagenen Methode besser. *Dies ist hauptsächlich auf die hohe Auflösung und das Empfangsfeld (RF) von SPP-YOLO-v4 zurückzuführen. Durch das Hinzufügen des SPP-Moduls in der Verbindungsschicht bleiben die Vorteile von SPP erhalten. In Bezug auf die Trainingszeit ist SPP-YOLO-v4 nur geringfügig länger als GMM. *e CNN muss viele Faltungsoperationen trainieren, daher ist die Trainingszeit länger.

Schließlich verwendet das Experiment Daten aus 12 verschiedenen Audioformaten, um die vier Methoden zu testen und zu vergleichen. Tabelle 4 enthält die Werte für Testgenauigkeit und Testzeit. Es ist ersichtlich, dass die durchschnittliche Genauigkeit der in dieser Studie vorgeschlagenen Methode 99,0 % und die durchschnittliche Erkennungszeit 0,449 ss beträgt. *Daher erzielt die vorgeschlagene Methode eine bessere Leistung unter den vier verglichenen Methoden. Daraus lässt sich schließen, dass das Upsampling und das maximale Pooling von SPP-YOLO-v4 erhebliche Vorteile brachten. Beim maximalen Pooling wird der Maximalwert aus benachbarten Bereichen ausgewählt, um einiges Rauschen mit maximaler Frequenz in der Audiosequenz leicht zu löschen. *Daher kann die Faltungsunterabtastung in der nachfolgenden Abtastschicht besser durchgeführt werden. *Durch diese Vorteile kann SPP die Leistung des Backbone-Netzwerks verbessern.

7. Schlussfolgerung
*Diese Studie stellt ein Audioerkennungssystem vor, das für eine Musikunterrichtsumgebung geeignet ist. Verwenden Sie SPP, um die YOLO-v4-Netzwerkarchitektur zu verbessern, dh verwenden Sie SPP, um lokale Bereiche auf verschiedenen Skalen derselben Faltungsschicht auszuwählen und die Eigenschaften des Multiskalensystems zu lernen. Darüber hinaus wird die Stapelmethode beim Ensemble-Lernen verwendet, um unabhängige Teilmodelle zweier verschiedener Kanäle zu fusionieren. *Die experimentellen Ergebnisse zeigen, dass die vorgeschlagene Methode die Erkennungsgenauigkeit von Audiotypen verbessern kann und eine bessere Leistung für verschiedene Audiodateiformate bietet. Aufgrund der Beschränkung der Audioaufnahmebedingungen gibt es im experimentellen Datensatz nur wenige Audiotypen und die Klassifizierungsleistung von Audiodateien, die mit verschiedenen Geräten aufgezeichnet wurden, muss noch überprüft werden. Zu diesen beiden Themen werden in Zukunft weitere Tests durchgeführt.
Datenverfügbarkeit
*Die zur Untermauerung der Ergebnisse dieser Studie verwendeten Daten sind auf Anfrage beim entsprechenden Autor erhältlich.
Interessenskonflikte
*Die Autoren erklären, dass kein Interessenkonflikt besteht.
Verweise
[1] S. Wu, D. Zhang, Z. Zhang, N. Yang, M. Li und M. Zhou, „Dependency-to-Dependency Neural Machine Translation“, IEEE/ACM Transactions on Audio, Speech, and Language Verarbeitung, Bd. 26, Nr. 11, S. 2132–2141, 2018.
[2] J. Zou, W. Li, C. Chen und Q. Du, „Szenenklassifizierung unter Verwendung lokaler und globaler Merkmale mit kollaborativer Darstellungsfusion“, Information Sciences, vol. 348, Nr. 2, S. 209–226, 2016.
[3] H. Phan, L. Hertel, M. Maass, P. Koch, R. Mazur und A. Mertins, „Verbesserte Audioszenenklassifizierung basierend auf Label-Tree-Einbettungen und Faltungsneuronalen Netzen“, IEEE/ACM Transactions on Audio-, Sprach- und Sprachverarbeitung, vol. 25, nein. 6, S. 1278–1290, 2017.
[4] S. Bayatli, „Unüberwachte Gewichtung von Übertragungsregeln in der regelbasierten maschinellen Übersetzung unter Verwendung des Maximum-Entropie-Ansatzes“, Journal of Information Science and Engineering, vol. 36, Nr. 2, S. 309–322, 2020.
[5] A. Rakotomamonjy, „Supervised Representation Learning for Audio Scene Classification“, IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 25, nein. 6, S. 1253–1265, 2017.
[6] W. Yang und S. Krishnan, „Combining temporal Features by Local Binary Pattern for Acoustic Scene Classification“, IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 25, nein. 6, S. 1315–1321, 2017.
[7] AS Dhanjal und W. Singh, „Ein automatisches maschinelles Übersetzungssystem für mehrsprachige Sprache in die indische Gebärdensprache“, Multimedia Tools and Applications, vol. 81, Nr. 3, S. 4283–4321, 2021.
[8] MA . Alamir, „Ein neuartiges Klassifizierungsmodell für akustische Szenen, das die späte Fusion von Faltungs-Neuronalen Netzen und verschiedenen Ensemble-Klassifikatoren nutzt“, Applied Acoustics, vol. 172, Nr. 3, S. 112–122, 2020.
[9] JG Makin, DA Moses und EF Chang, „Maschinelle Übersetzung kortikaler Aktivität in Text mit einem Encoder-Decoder-Framework“, Nature Neuroscience, vol. 23, nein. 4, S. 575–582, 2020.
[10] S. Waldekar und G. Saha, „Two-level fusion-based akustische Szenenklassifizierung“, Applied Acoustics, vol. 170, nein. 5, Artikel-ID 107502, 2020.
For more information:1950477648nn@gmail.com






