Neuartige räumlich-zeitliche kontinuierliche Gebärdenspracherkennung mithilfe eines aufmerksamen Multi-Feature-Netzwerks(2)
Jun 01, 2023
3.5. Sequenzlernen
Sequenzlernen Nachdem wir die Ergebnisse des räumlichen und zeitlichen Merkmalsextraktors in Form eines Glanzmerkmals erhalten haben, müssen wir sie zu einem vollständigen Satz anordnen. Daher müssen wir Sequenzlernen verwenden, um sicherzustellen, dass die Glosse einen guten Satz bildet. Die in der aktuellen Forschung am weitesten verbreitete Methode bezieht sich auf das bidirektionale Langzeit-Kurzzeitgedächtnis (Bi-LSTM) und die konnektionistische zeitliche Klassifizierung (CTC) [17,23] für Probleme, die mithilfe von CTC gelöst werden können, und mehrere neuere Arbeiten [17,23] schlagen vor CTC als End-to-End-Trainingsprozess für CSLR.

Cistanche-Extrakt-Pulver
Klicken Sie hier, um Cistanche-Produkte anzuzeigen
【Fragen Sie nach mehr】 E-Mail:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Das lange Kurzzeitgedächtnis (LSTM) [44] ist eine Variante des rekurrenten neuronalen Netzwerks (RNN) und wird häufig in der Sequenzmodellierung verwendet. LSTM modelliert hervorragend langfristige Abhängigkeiten; Es kann ganze Eingabesequenzen verarbeiten und deren internen Zustand zur Modellierung der Zustandsübergänge verwenden. Der Nachteil dieser Vorwärts-RNNs besteht jedoch darin, dass die verborgenen Zustände nur aus einer Einwegrichtung gelernt werden. Das RNN erzeugt einen verborgenen Zustand, wie durch die folgende Gleichung beschrieben, nachdem es die Merkmalssequenz als Eingabe empfangen hat.
ht=RNN(ht−1,ot),
Dabei stellt ht den verborgenen Zustand dar, wobei der Anfangszustand h0 ein fester All-Null-Vektor ist und t der Zeitschritt ist. RNN wird verwendet, um die Zeichenglossen gemäß der Eingabe der räumlichen Merkmalssequenz vorherzusagen.
Darüber hinaus sind SL-Aufgaben recht komplex. Daher sind nicht nur Merkmale erforderlich, die aus einem einseitigen Kontext stammen, sondern auch Unterstützung bei der Verwendung von zweiseitigen Informationen, um das Vorkommen von Wörtern zu lernen, die vor und nach den anderen Wörtern im Satz stehen. Daher verwenden wir Bi-LSTM [45], um die komplexen dynamischen Abhängigkeiten von Bildsequenzen zu lernen, indem wir sie mithilfe räumlicher und zeitlicher Darstellungen in Sequenzen von Glanzmerkmalen umwandeln. Gemäß der zuvor gegebenen Erklärung kann die Bi-LSTM-Methode mit der LSTM-Methode bidirektional arbeiten. Dies bedeutet, dass die Bi-LSTM-Methode sequentielle Daten besser klassifizieren kann. Die Berechnung von Bi-LSTM, die bidirektionale versteckte Zustände verwendet, kann auch als wiederholte Berechnungen des LSTM angesehen werden, das von vorne nach hinten und dann von hinten nach vorne verarbeitet wird. Anschließend wird der verborgene Zustand jedes Zeitschritts durch eine vollständig verbundene Schicht und eine Softmax-Schicht geleitet [17].

Cistanche-Pulver
bei=W(ht plus b),
yt,j=e at,j ∑ke at,j ,
Dabei ist b ein Bias-Vektor und y(t,j) die Wahrscheinlichkeit der Markierung j zum Zeitpunkt t. In unserer TSL-Aufgabe ist Label j das Vokabular, das aus dem Satz gewonnen wird. In der Praxis verbessert Bi-LSTM die Informationsmenge, auf die ein Netzwerk zugreifen kann, erheblich, was wiederum den Kontext der im Algorithmus verfügbaren Informationen verbessert. Die Informationen enthalten die Kenntnis darüber, welches Wort nach oder vor dem aktuellen Frame in der Eingabe der Satzmerkmalssequenz steht.
Bi-LSTM sendet für jeden Zeitschritt verborgene Zustände als Ausgabe an die CTC-Schicht. Da die Ergebnisse dieses Bi-LSTM die Glanzanordnung nicht berücksichtigen, verwenden wir CTC zur Verarbeitung der Videosequenzzuordnung o={ot} T 0 t=1, um ein Zeichen zu erzeugen Glanzfolge `={` i} IL =1 (L kleiner oder gleich T) mit einer besseren Anordnung. CTC wird in vielen Bereichen eingesetzt, einschließlich der Handschrifterkennung [46], der Spracherkennung [47] und der Gebärdenspracherkennung [17,23]. In diesem Bereich wird es als Bewertungsfunktion verwendet, ohne die Eingabe- und Ausgabesequenzen auszurichten. In CSLR ist CTC als Modul bekannt, das für End-to-End-Aufgaben entwickelt wurde, bei denen es um die Klassifizierung zeitlicher Daten ohne Segmentierung geht. Durch dynamische Programmierung kann CSLR das Ausrichtungsproblem lösen, indem es eine leere Beschriftung (-) erstellt, die es dem System ermöglicht, optimale Ergebnisse für die Darstellung von Daten zu erzielen, die keine Beschriftungen haben (z. B. Epenthesedaten und Segmente von Nicht-Gestendaten). Insbesondere generiert CTC ein leeres Label „-“, um das Vokabular V zu erweitern, wobei V=Vorigin ∪ {-}. Der Zweck dieser leeren Beschriftung besteht darin, den Übergang darzustellen und auf die Existenz einer leeren Glosse hinzuweisen, die keine Informationen für den Lernprozess bereitstellt, wie z. B. π={πt} T 0 t{{20 }}, wobei πt ∈ V. Dadurch kann CTC die Ausgabeparameter des räumlichen und zeitlichen Merkmalsextraktors und auch des Bi-LSTM als Ausrichtungsmodul verwalten, indem es die Wahrscheinlichkeiten aller möglichen Pfade zusammenfasst. Alle Ausrichtungspfade π haben eine Wahrscheinlichkeit, die der Eingabesequenz wie folgt gegeben wird [17]:

Cistanche deserticola-Experiment
p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt
Im nächsten Schritt definieren wir eine Viele-zu-Eins-Zuordnungsoperation B, die alle Leerzeichen entfernt und Wörter aus dem Ausrichtungspfad dupliziert. Zum Beispiel: B (II-am- -ein- -Arzt)=I, am, a, doctor. Als Ergebnis können wir die bedingte Wahrscheinlichkeit der Zeichenglanzsequenz l als Summe der Wahrscheinlichkeiten aller Routen berechnen, die von B auf l abgebildet werden können, und zwar auf die unten beschriebene Weise [17]:
p(π|o) = ∑ π∈B−1 p(π|o)
wobei B −1 (l)={π|B(π)=l} die Umkehroperation von B ist. Schließlich sind die CTC-Verluste der Merkmalssequenz wie folgt definiert [17]:
Lctc=− ln p(` |o)
Die bedingte Wahrscheinlichkeit p(π|X) kann gemäß der Annahme der bedingten Unabhängigkeit berechnet werden.
4. Experimentelle Ergebnisse und Diskussion

Cistanche-Ergänzung in meiner Nähe – Gedächtnis verbessern
In diesem Abschnitt erläutern wir die Details unseres Experiments mit der vorgeschlagenen Konfiguration, wie im vorherigen Abschnitt erläutert.
4.1. Datensätze
In diesem Abschnitt erklären wir die Datensätze, die wir während dieses Experiments verwendet haben. Wir haben zwei Datensätze verwendet, der erste ist der CSL-Datensatz [8,40,41] und der zweite ist der RWTH-PHOENIX-Datensatz [33,39]. Bei beiden Datensätzen handelt es sich um kontinuierliche Gebärdensprachdatensätze, die dazu verwendet werden, eine Reihe von Gesten in einen vollständigen Satz zu übersetzen.
4.1.1. CSL-Datensatz
Der CSL-Datensatz wurde von mehreren Arbeiten verwendet [8,40,41]. Insgesamt sind in diesem Datensatz 100 Sätze und 178 Wörter enthalten, die häufig in der täglichen Kommunikation verwendet werden. Dieser Datensatz enthält durchschnittlich 5 Wörter pro Satz. Jeder Satz wurde von 50 Unterzeichnern fünfmal vorgetragen. Somit beträgt die Gesamtzahl der Videos 25,000, was diesen Datensatz zu einem der größten Datensätze macht. Um unser CSL-Modell zu trainieren, haben wir den Datensatz in Daten zum Training mit 20000 Videos und zum Testen mit 5.000 Videos desselben Satzes, aber mit unterschiedlichen Unterzeichnern unterteilt.
4.1.2. RWTH-PHOENIX-Datensatz
Der RWTH-PHOENIX-Datensatz [33,39] ist ein Datensatz in deutscher Gebärdensprache, bei dem es sich um eine Aufzeichnung öffentlicher Wetterübertragungen von Fernsehsendern in Deutschland handelt. Dieses Video wird so verarbeitet, dass es eine Größe von 210 × 260 hat. Es gibt 6841 verschiedene Sätze, unterzeichnet von 9 verschiedenen Unterzeichnern. Alle Unterzeichner trugen dunkle Kleidung auf hellem Hintergrund. Insgesamt gibt es 1232 Wörter mit etwa 80000 Glossen. Dieser Datensatz ist nach einem vorgegebenen Format unterteilt und besteht aus 5672 Trainingsbeispielen, 540 Validierungs-/Entwicklungsbeispielen und 629 Testbeispielen.
4.2. Datenvorverarbeitung
Als Erstes mussten wir unseren Datensatz vorverarbeiten, damit er zu unserem vorgeschlagenen Modell passte. Wir haben die Größe geändert und zugeschnitten, wie in Abbildung 3 dargestellt. Auf der linken Seite können wir sehen, dass die Originaldaten eine Full-HD- oder 1920 × 1080-Auflösung hatten. Wir mussten es zuschneiden und die Größe auf eine Auflösung von 224 × 224 ändern, da unser räumliches Modul Eingaben empfängt, die dieselbe Größe wie die ResNet50-Eingabe haben. Danach haben wir die Daten in unser räumliches Modell eingespeist, das aus einem einzigen Bild den 7 × 7-Tensor erzeugen würde.
Das vorverarbeitete Vollbild wurde dann zur Generierung der Schlüsselpunktmerkmale verwendet. Wir haben das HRNet-Modell verwendet, um die 133 Schlüsselpunkte aus diesen RGB-Bildern vorherzusagen. Allerdings nutzen wir in unserem vorgeschlagenen Modell nur 27 Schlüsselpunkte des Oberkörpers. Die Eingabegröße für die Schlüsselpunktmerkmale beträgt 27 × 3, da wir pro Punkt über 3-Achsen-Koordinatendaten (x, y und z) verfügen. Die Eingabedimension des Modells beträgt N × 224 × 224 × 3 für die Vollbildfunktion und N × 1 × 27 × 3 für die Schlüsselpunkteingabe, wobei N die Anzahl der Bilder ist. Um die Variation des Datensatzes zu verbessern, folgen wir der Erweiterung aus [12], einschließlich zufälligem Zuschneiden, horizontalem Spiegeln und zufälliger zeitlicher Skalierung. Zufälliges Zuschneiden wird auch als Teil eines Vorverarbeitungsschritts zum Zuschneiden des Originalbilds verwendet.

Cistanche-Ergänzung in meiner Nähe – Gedächtnis verbessern
4.3. Bewertungsmetrik
Um die Erkennungsleistung unseres vorgeschlagenen Modells zu bewerten, verwenden wir eine Wortfehlerratenmetrik (WER), eine Metrik, die häufig in CSLR verwendet wird, um die Erkennungsgenauigkeit eines vorhergesagten Satzes abzuschätzen, wie durch die folgende Gleichung dargestellt [17]:
WER=S plus I plus DT=S plus I plus DS plus C plus D
Dabei ist S die Anzahl der Ersetzungen des ursprünglichen Worts, I die Anzahl der Einfügungen, die nicht im ursprünglichen Satz enthalten sind, D die Anzahl der Löschungen, die im ursprünglichen Satz hätten sein sollen, und C die Anzahl der richtigen Wörter, die übereinstimmen der ursprüngliche Satz, und T ist die Gesamtzahl der Wörter im Satz oder die aus der Gesamtzahl der Ersetzungen, Löschungen und korrekten Wörter ermittelt werden kann. Bei CSL wird jedes Zeichen zur Darstellung eines Wortes verwendet.
4.4. Experimentieren Sie mit Eingabeströmen
Dieses Experiment konzentriert sich hauptsächlich auf den Vergleich von Single-Stream- und Multi-Stream-Eingaben in unserem Modell. Ziel ist es, die beste Konfiguration des Eingabestreams zu finden. Wir verwenden in diesem Experiment ausschließlich den RWTH-PHOENIX-Datensatz. Unser Modell würde zwei separate Eingaben erhalten, Vollbild- und Schlüsselpunkteingabe. Die Single-Stream-Eingabe verwendet nur die RGB-Funktion des Vollbildbilds. Es gibt zwei Single-Stream-Eingabeexperimente. Der erste verwendet nur die Vollbildfunktion aus dem RGB-Bild und der zweite verwendet Schlüsselpunktfunktionen aus der Schlüsselpunkteingabe. Die von uns vorgeschlagene Multi-Stream-Eingabe besteht aus RGB- und Schlüsselpunktfunktionen. Das Vergleichsergebnis mit einem einzelnen Stream und einem Multi-Stream ist in Tabelle 1 dargestellt. Hier können wir sehen, dass wir durch die Verwendung der Multi-Stream-Funktion ein besseres Ergebnis erzielen können als durch die Verwendung eines einzelnen Streams. Der Hauptstream wird aus einem Vollbild-RGB-Feature gewonnen und der zusätzliche Stream nutzt die Keypoint-Features. Der zusätzliche Keypoint-Stream hilft dem Modell, besser zu lernen, insbesondere die Details der Handform zu erfassen.
Tabelle 1. WER-Leistungsvergleich mit Einzel-Stream- und Multi-Stream-Eingabe.

4.5. Experimentieren Sie mit dem Aufmerksamkeitsmodul
Ziel dieses Experiments war es, die beste Konfiguration des Aufmerksamkeitsmoduls auszuwählen. In diesem Experiment verwenden wir die Konfiguration des besten Ergebnisses aus dem vorherigen Experiment und demselben Datensatz. Wir bezeichnen räumliche Aufmerksamkeit als Modell mit einer Selbstaufmerksamkeitsschicht am Ende des räumlichen Moduls für jedes Merkmal. Die frühe zeitliche Aufmerksamkeit ist die Selbstaufmerksamkeitsschicht nach der ersten zeitlichen Bündelung, und die späte zeitliche Aufmerksamkeit ist die Selbstaufmerksamkeitsschicht nach der zweiten zeitlichen Bündelung. Hier vergleichen wir alle oben genannten Konfigurationen und die Kombination von räumlicher und zeitlicher Aufmerksamkeit. Das Ergebnis ist in Tabelle 2 dargestellt. Das Ergebnis der räumlichen Aufmerksamkeit ist schlechter als das der zeitlichen Aufmerksamkeit. Die räumliche Ebene enthält eine Folge von Merkmalen für jeden Frame. Wie in [20] erwähnt, ist es für die Selbstaufmerksamkeitsschicht einfacher, den kürzeren Weg zwischen langen Abhängigkeiten zu erlernen. Daher kann die räumliche Aufmerksamkeit aufgrund der langen Sequenz die WER nicht verringern. Andererseits konnten wir mithilfe der zeitlichen Aufmerksamkeit ein besseres Ergebnis erzielen, indem wir sie nach dem Pooling platzierten, sodass die Sequenzlänge kürzer wurde. Die späte Aufmerksamkeit mit der kürzesten Sequenzlänge erzielt das beste Ergebnis. Darüber hinaus ist die Kombination des Aufmerksamkeitsmoduls in räumlicher und zeitlicher Hinsicht schlechter als die Verwendung nur einer einzigen Aufmerksamkeit. Basierend auf diesen Ergebnissen wenden wir die beste Konfiguration für die weiteren Experimente an.
Tabelle 2. WER-Leistungsvergleich mit unterschiedlichen Aufmerksamkeitskonfigurationen

4.6. Ablationsexperiment im STAMF-Netzwerk
Darüber hinaus führen wir ein Ablationsexperiment mit demselben Datensatz und der besten Konfiguration des Eingabestroms und des Aufmerksamkeitsmoduls durch. Tabelle 3 zu einem Experiment mit später zeitlicher Aufmerksamkeit ohne Pooling beweist, dass die Sequenzlänge die Aufmerksamkeitsleistung beeinflusst. Die Experimente, die Pooling-Schichten mit kürzeren Sequenzlängen verwenden, erzielen bessere Ergebnisse. Wir führen auch ein Ablationsexperiment durch, um die Leistung mithilfe verschiedener Modelle für das Sequenzlernen zu ermitteln. Das Ergebnis in Tabelle 4 zeigt, dass die Verwendung von LSTM, das nur über unidirektionale Informationen verfügt, eine geringere Leistung aufweist als die Verwendung von Bi-LSTM, das über bidirektionale Informationen verfügt.
Tabelle 3. WER-Leistungsvergleich unter Verwendung verschiedener Konfigurationen der späten zeitlichen Aufmerksamkeit.

Tabelle 4. WER-Leistungsvergleich mit unterschiedlichen Sequenzlernkonfigurationen.

4.7. Experimentieren Sie im STAMF-Netzwerk
In diesem Abschnitt erläutern wir den gesamten Trainingsprozess für unser vorgeschlagenes Modell namens „Spatiotemporal Attention Multi-Feature“ (STAMF). Hier erfahren Sie Schritt für Schritt, wie wir unsere Eingabedaten in das räumliche Modul, das zeitliche Modul und das Sequenzlernmodul einpassen. In diesem Abschnitt verwenden wir die Multi-Stream-Eingabe und die Konfiguration der späten zeitlichen Aufmerksamkeit.
4.7.1. Implementierungsdetails
Wir führen End-to-End-Training und -Tests mit Eingaberahmen der Größe 224 × 224 durch. Für den Optimierer verwenden wir einen Adam-Optimierer mit 10−4 als Lernrate und dividieren ihn in den Epochen 10 und 15 für die CSL und durch 2 Epochen 30, 40 und 60 für die RWTH PHOENIX. Wir setzen die Batch-Größe auf 4 und führen 80 Epochen für den RWTH-PHOENIX und 20 Epochen für CSL durch. Das Training und die Tests wurden auf NVIDIA Tesla V100 und 128 GB RAM durchgeführt.
Zuerst haben wir das Feature mit ResNet50 aus RGB-Streams extrahiert und HRNet verwendet, um den Schlüsselpunkt zu erhalten und dann die Schlüsselpunkt-Features mit ResNet50 zu extrahieren. Beachten Sie, dass es sich um sequentielle Daten oder ein Video handelte. Daher mussten wir unsere Eingabegröße abhängig von der Länge des Videos konfigurieren. Aus technischen Gründen musste die Eingabegröße für alle Daten identisch sein. Daher müssen wir das längste Video in unserem Datensatz kennen und dann die Länge unseres Eingabebilds auffüllen, um es an die größte Bildnummer anzupassen
Diese sequentiell extrahierten Merkmale wurden vom Zeitmodul verwendet. Jeder sequentielle Stream durchlief zwei gestapelte zeitliche Pools. Jedes zeitliche Pooling bestand aus einem 1-dimensionalen Faltungsnetzwerk und einer maximalen Pooling-Schicht, wodurch die Länge der Sequenz um die Hälfte verringert wurde. Die Ausgabe des zeitlichen Poolings aus beiden Streams wurde dann mit der Aufmerksamkeitsschicht verbunden und für das letzte zeitliche Pooling nach der Aufmerksamkeitsschicht am Ende als zeitliche Modulausgabe verkettet.
Die zeitliche Ausgabe wurde vom Sequenzlernmodul verarbeitet. Der Prozess nutzte die mit dem CTC verbundene Bi-LSTM-Schicht, um die endgültige Ausrichtung zu erhalten und den Gloss zu einem endgültigen Satz zusammenzusetzen.
4.7.2. Quantitatives Ergebnis
Die endgültigen Sätze wurden mit der Grundwahrheit verglichen, um den WER-Score als quantitatives Ergebnis zu berechnen. Für die CSL teilen wir den Datensatz in 80 Prozent für die Trainingsdaten und 20 Prozent für die Testdaten auf. Wie in Tabelle 5 gezeigt, kann unser vorgeschlagenes Multi-Feature-Modell (STMF), das die Vollbild- und Schlüsselpunktfunktionen verwendet, im Vergleich zu dem Modell, das nur die Vollbild-Funktion verwendet, ein besseres Ergebnis erzielen und die WER auf 0,8 senken [23]. Unser bestes Ergebnis wurde mit dem vorgeschlagenen Multi-Feature-Modell unter Verwendung des Aufmerksamkeitsmechanismus (STAMF) erzielt, das 0,7 für den WER erreichte. Die Aufmerksamkeitsschicht verbesserte das Ergebnis immer noch leicht, obwohl der CSL-Datensatz keine fehlerhaften Frames aufwies. Dies beweist, dass die Aufmerksamkeitsschicht einen Einfluss auf das Modell hat. Das vorgeschlagene Multi-Feature-Modell selbst ist den modernsten Methoden überlegen und die Aufmerksamkeitsschicht trägt dazu bei, den WER-Score im CSL-Datensatz zu senken. Der entscheidende Punkt bei CSL hat erhebliche Auswirkungen, da er im Vergleich zu der anderen Methode mit mehreren Funktionen [17], die Hände, Gesicht und Körperhaltung verwendet, effektive Informationen liefern kann.
Für den RWTH-PHOENIX-Datensatz haben wir die künstliche Konfiguration verwendet, um die Trainings- und Testdaten aufzuteilen. Der Datensatz wurde in 5672 Beispielvideos für Schulungen, 540 Beispielvideos zur Selbstvalidierung und 629 Beispielvideos zum Testen unterteilt. Wie in Tabelle 6 gezeigt, betrug das Ergebnis unseres vorgeschlagenen Multi-Feature-Modells (STMF) unter Verwendung des Vollbilds und der Schlüsselpunktmerkmale 24 Prozent WER, und unser bestes Ergebnis lag bei 20,5 Prozent, das mit dem vorgeschlagenen Modell unter Verwendung des Aufmerksamkeitsmoduls (STAMF) erzielt wurde. im Trainingsergebnis. Die Testergebnisse sind im Vergleich zu [17] die zweitbesten, da mehr Funktionen als Eingabe verwendet werden. Es hat sich jedoch gezeigt, dass das Aufmerksamkeitsmodul einen wesentlichen Beitrag zur Senkung des WER-Scores für den RWTHPHOENIX-Datensatz leistet. Anders als unser Ergebnis für den CSL-Datensatz erzielte unser vorgeschlagenes Modell mit Multi-Stream kein optimales Ergebnis. Dies liegt daran, dass der RWTH-PHOENIX-Datensatz viele fehlerhafte Frames aufweist; Sie haben einen verschwommenen Teil, insbesondere im Handbereich. Dieser Rahmen liefert aufgrund der fehlenden oder falschen Schlüsselpunktposition inkonsistente Schlüsselpunktinformationen und macht das Modell weniger optimal. Dieses Problem wird gelöst, indem die Aufmerksamkeitsschicht zu unserem vorgeschlagenen Multi-Feature-Modell hinzugefügt wird. Dies hilft bei der Auswahl der richtigen Informationen und führt zu einer deutlichen Verbesserung im Vergleich zum vorgeschlagenen Multi-Feature-Modell ohne Aufmerksamkeit.
Tabelle 5. WER-Leistungsvergleich im CSL-Datensatz.

Tabelle 6. WER-Leistungsvergleich im RWTH-PHOENIX-Datensatz.

4.7.3. Qualitatives Ergebnis
Wir haben auch eine qualitative Bewertung unseres Modells durchgeführt, indem wir das Erkennungsergebnis visualisiert haben. Abbildung 8 zeigt die Details unserer qualitativen Auswertung anhand von drei Satzbeispielen. Der erste Satz besteht aus 10 Wörtern und die Gesamtzahl der Frames beträgt 220. Der zweite Satz besteht aus 12 Wörtern und die Gesamtzahl der Frames beträgt 168. Der dritte Satz besteht aus 9 Wörtern und die Gesamtzahl der Frames beträgt 135.
Das Beispielergebnis zeigt, dass einige Glossen von den Modellen nicht korrekt vorhergesagt werden, und wir kennzeichnen dies mit der roten Markierung. Es kann jedoch immer noch die meisten richtigen Wörter vorhersagen. Die meisten Fehler finden sich im ersten Satz, der die längste Frame-Nummer hat. In diesem Satz weist der Satzanfang mehr Fehler auf, da einige Gesten für die frühen Wörter nur geringfügig unterschiedlich sind und es daher schwierig ist, die Grenzen zu unterscheiden. Das vorgeschlagene Modell mit Multi-Feature und Aufmerksamkeit (STAMF) konnte jedoch mehr Wörter identifizieren, diese waren jedoch falsch beschriftet. Darüber hinaus erzielt die Modellkonfiguration mit Aufmerksamkeit ein besseres Erkennungsergebnis für zwei weitere Stichproben im Vergleich zum vorgeschlagenen Modell ohne Aufmerksamkeit.

Abbildung 8. Qualitative Auswertung des Erkennungsergebnisses anhand einer anderen Konfiguration des RWTH-PHOENIX-Datensatzes [33,39]. Die falsch vorhergesagten Glossen werden rot markiert.
5. Schlussfolgerungen
In diesem Artikel stellen wir ein neuartiges Spatiotemporal Attention Multi-Feature (STAMF) für CSLR vor, das darauf abzielt, räumlich-zeitliche Korrelationen und die wichtigen Informationen aus der Abfolge von visuellen Merkmalen und Schlüsselpunktmerkmalen im End-to-End-Ansatz zu lernen. In unserem Framework wurde ein räumliches Modul mit einem Vollbild-Feature aus RGB-Daten und Schlüsselpunkten aus den Körper-Schlüsselpunkten, einschließlich der Hände als Multi-Features, entwickelt. Diese Kombinationen, die als Multi-Stream-Feature-Eingabe verwendet wurden, ergaben eine überlegene Leistung im Vergleich zum State-of-the-Art-Ansatz, der nur Vollbild verwendet, oder im Vergleich zur Methode Abbildung 8. Qualitative Bewertung des Erkennungsergebnisses unter Verwendung einer anderen Konfiguration der RWTH -PHOENIX-Datensatz [33,39]. Die falsch vorhergesagten Glossen werden rot markiert. 5. Schlussfolgerungen In diesem Artikel stellen wir ein neuartiges räumlich-zeitliches aufmerksames Multi-Feature (STAMF) für CSLR vor, das darauf abzielt, räumlich-zeitliche Korrelationen und die wichtigen Informationen aus der Abfolge visueller Merkmale und Schlüsselpunktmerkmale im End-to-End-Bereich zu lernen. Endansatz. In unserem Framework wurde ein räumliches Modul mit einem Vollbild-Feature aus RGB-Daten und Schlüsselpunkten aus den Körper-Schlüsselpunkten, einschließlich der Hände als Multi-Features, entwickelt. Diese als Multi-Stream-Feature-Eingabe verwendeten Kombinationen lieferten eine überlegene Leistung im Vergleich zum modernen Ansatz, der nur Vollbilder verwendet, oder im Vergleich zu der Methode, die eine andere Multi-Feature-Kombination verwendet, insbesondere für den CSL-Datensatz. Anschließend schlagen wir ein zeitliches Modul vor, das aus zeitlichem Pooling und zeitlicher Aufmerksamkeit besteht, um die wichtigen Informationen im zeitlichen Bereich zu erfassen. Das Hinzufügen der späten zeitlichen Aufmerksamkeit ist in der Lage, das wichtige Merkmal aus der Sequenz zu erhalten, die falsche Informationen enthält, und führt zu einer erheblichen Verbesserung im Vergleich zu unserem vorgeschlagenen Modell mit mehreren Merkmalen. Es hilft auch dem Sequenzlernen, besser zu lernen und verbessert die Leistung wie im Experiment des CSL-Datensatzes. Umfangreiche Experimente mit häufig verwendeten Datensätzen belegen die Überlegenheit unseres vorgeschlagenen Modells gegenüber dem hochmodernen Modell, wobei die WER-Scores beim CSL-Datensatz um mehr als 50 Prozent und beim RWTH-PHOENIX-Datensatz um 5 Prozent abnahmen. In Zukunft planen wir, die Transfer-Learning-Technik mit unserem aktuellen Modell zu implementieren und unsere laufende Arbeit in einer realen Branche anzuwenden.
Verweise
1. Dreuw, P.; Rybach, D.; Deselaers, T.; Zahedi, M.; Ney, H. Spracherkennungstechniken für ein Gebärdenspracherkennungssystem. In Proceedings of the INTERSPEECH 2007, 8. Jahreskonferenz der International Speech Communication Association, Antwerpen, Belgien, 27.–31. August 2007; S. 2513–2516.
2. Ong, SCW; Ranganath, S. Automatische Gebärdensprachanalyse: Eine Umfrage und die Zukunft jenseits der lexikalischen Bedeutung. IEEE Trans. Muster Anal. Mach. Intel. 2005, 27, 873–891. [CrossRef] [PubMed]
3. Vogler, C.; Metaxas, D. Ein Rahmen zur Erkennung der gleichzeitigen Aspekte der amerikanischen Gebärdensprache. Berechnen. Vis. Bildverstand. 2001, 81, 358–384. [CrossRef]
4. Bowden, R.; Windridge, D.; Kadir, T.; Zisserman, A.; Brady, M. Ein linguistischer Merkmalsvektor für die visuelle Interpretation der Gebärdensprache. In Proceedings of the European Conference on Computer Vision (ECCV), Prag, Tschechische Republik, 11.–14. Mai 2004; S. 390–401.
5. Kasukurthi, N.; Rokad, B.; Bidani, S.; Dennisan, DA Alphabeterkennung der amerikanischen Gebärdensprache mithilfe von Deep Learning. arXiv 2019, arXiv:1905.05487.
6. Koller, O.; Zargaran, S.; Ney, H.; Bowden, R. Deep Sign: Ermöglichung einer robusten statistischen kontinuierlichen Gebärdenspracherkennung über hybride CNN-HMMs. Int. J. Comput. Vis. 2018, 126, 1311–1325. [CrossRef]
7. Pu, J.; Zhou, W.; Li, H. Erweitertes Faltungsnetzwerk mit iterativer Optimierung für kontinuierliche Gebärdenspracherkennung. In Proceedings of the Twenty-Seventh International Joint Conference on Artificial Intelligence, Stockholm, Schweden, 13.–19. Juli 2018; S. 885–891.
8. Pu, J.; Zhou, W.; Li, H. Iteratives Ausrichtungsnetzwerk für kontinuierliche Gebärdenspracherkennung. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 15.–20. Juni 2019; S. 4160–4169.
9. Kumar, N. Bewegungsbahnbasierte Verfolgung menschlicher Gesichter und Hände zur Erkennung von Gebärdensprache. In Proceedings of the 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, Indien, 26.–28. Oktober 2017; S. 211–216.
10. Bhuyan, MK; Ghoah, D.; Bora, PK Ein Framework für die Handgestenerkennung mit Anwendungen in der Gebärdensprache. In Proceedings of the 2006 Annual India Conference, INDICON, Neu-Delhi, Indien, 15.–17. September 2006; S. 1–6.
11. Das, SP; Talukdar, AK; Sarma, KK Gebärdenspracherkennung mithilfe des Gesichtsausdrucks. In Proceedings of the Procedia Computer Science, Kerala, Indien, 10.–13. August 2015; S. 210–216.
12. Rastgoo, R.; Kiani, K.; Escalera, S.; Sabokrou, M. Gebärdensprachproduktion: Ein Rückblick. In Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), Nashville, TN, USA, 19.–25. Juni 2021; S. 3446–3456.
13. Dong, S.; Wang, P.; Abbas, K. Eine Umfrage zu Deep Learning und seinen Anwendungen. Berechnen. Wissenschaft. Rev. 2021, 40, 100379. [CrossRef]
14. Athitsos, V.; Neidle, C.; Sclaroff, S.; Nash, J.; Stefan, A.; Yuan, Q.; Thangali, A. Der Videodatensatz des American Sign Language Lexicon. In Proceedings of the 2008 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, CVPR Workshops, Anchorage, Alaska, 23.–28. Juni 2008; S. 1–8.
15. Bungeroth, J.; Stein, D.; Dreuw, P.; Ney, H.; Morrissey, S.; Weg, A.; Zijl, LV Der ATIS Sign Language Corpus. In Proceedings of the 6th International Conference on Language Resources and Evaluation, LREC 2008, Marrakesch, Marokko, 28.–30. Mai 2008; S. 2943–2946.
16. Papastratis, I.; Chatzikonstantinou, C.; Konstantinidis, D.; Dimitropoulos, K.; Daras, P. Künstliche Intelligenztechnologien für Gebärdensprache. Sensoren 2021, 21, 5843. [CrossRef] [PubMed]
17. Zhou, H.; Zhou, W.; Zhou, Y.; Li, H. Räumlich-zeitliches Multi-Cue-Netzwerk zur kontinuierlichen Gebärdenspracherkennung. In Proceedings of the AAAI 2020 – The Thirty-Fourth AAAI Conference on Artificial Intelligence, New York, NY, USA, 7.–12. Februar 2020; S. 13009–13016.
18. Gündüz, C.; Polat, H. Türkische Gebärdenspracherkennung basierend auf Multistream-Datenfusion. Türkischer J. Elektr. Ing. Berechnen. Wissenschaft. 2021, 29, 1171–1186. [CrossRef]
19. Bohacek, M.; Hruz, M. Gebärdenhaltungsbasierter Transformator zur Erkennung von Gebärdensprache auf Wortebene. In Proceedings of the 2022 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops, WACVW, Waikoloa, HI, USA, 4.–8. Januar 2022; S. 182–191.
20. Vaswani, A. Aufmerksamkeit ist alles, was Sie brauchen. In Proceedings of the Conference on Neural Information Processing Systems, Long Beach, CA, USA, 4.–9. Dezember 2017; S. 1–11.
21. Zhou, M.; Ng, M.; Cai, Z.; Cheung, KC Selbstaufmerksamkeitsbasierte Fully-Inception-Netzwerke für kontinuierliche Gebärdenspracherkennung. Vorderseite. Artif. Intel. Appl. 2020, 325, 2832–2839.
22. Camgöz, NC; Koller, O.; Hadfifield, S.; Bowden, R. Sign Language Transformers: Gemeinsame End-to-End-Gebärdenspracherkennung und -übersetzung. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA, 14.–19. Juni 2020; S. 10020–10030.
23. Minute, Y.; Hao, A.; Chai, X.; Chen, X. Visuelle Ausrichtungsbeschränkung für die kontinuierliche Gebärdenspracherkennung. In Proceedings of the IEEE International Conference on Computer Vision (ICCV), Montreal, BC, Kanada, 10.–17. Oktober 2021; S. 11542–11551.
24. Guo, D.; Zhou, W.; Wang, M.; Li, H. Gebärdenspracherkennung basierend auf adaptiven HMMs mit Datenerweiterung. In Proceedings of the IEEE International Conference on Image Processing (ICIP), Phoenix, AZ, USA, 25.–28. September 2016; S. 2876–2880.
25. Huang, J.; Zhou, W.; Li, H.; Li, W. Gebärdenspracherkennung mithilfe 3D-Faltungs-Neuronaler Netze. In Proceedings of the IEEE International Conference on Multimedia and Expo (ICME), Turin, Italien, 29. Juni–3. Juli 2015; S. 1–6.
26. Guo, D.; Zhou, W.; Li, H.; Wang, M. Online-Früh-Spät-Fusion basierend auf adaptivem HMM zur Gebärdenspracherkennung. ACM Trans. Multimed. Berechnen. Komm. Appl. 2017, 14, 1–18. [CrossRef]
27. Al-hammadi, M.; Muhammad, G.; Mitglied, S. Handgestenerkennung für Gebärdensprache mit 3DCNN. IEEE Access 2020, 8, 79491–79509. [CrossRef]
28. Reza, H.; Joze, V. MS-ASL: Ein umfangreicher Datensatz und Benchmark zum Verständnis der amerikanischen Gebärdensprache. arXiv 2019, arXiv:1812.01053.
29. Li, D.; Opazo, CR; Yu, X.; Li, H. Tiefe Gebärdenspracherkennung auf Wortebene aus Video: Ein neuer umfangreicher Datensatz und Methodenvergleich. In Proceedings of the 2020 IEEE Winter Conference on Applications of Computer Vision, WACV, Snowmass Village, CO, USA, 1.–5. März 2020; S. 1448–1458.
30. Pu, J.; Zhou, W.; Li, H. Gebärdenspracherkennung mit multimodalen Funktionen. In Proceedings of the Pacific Rim Conference on Multimedia, Xi'an, China, 15.–16. September 2016; S. 252–261.
31. Jiang, S.; Sun, B.; Wang, L.; Bai, Y.; Li, K.; Fu, Y. Skelettbewusste multimodale Gebärdenspracherkennung. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, Nashville, TN, USA, 19.–25. Juni 2021; S. 3408–3418.
32. Sidig, AAI; Luqman, H.; Mahmoud, S.; Mohandes, M. KArSL: Datenbank für arabische Gebärdensprache. ACM Trans. Asiatische Low-Ressource. Lang. Inf. Bearbeitung 2021, 20, 1–19. [CrossRef]
33. Koller, O.; Forster, J.; Ney, H. Kontinuierliche Gebärdenspracherkennung: Auf dem Weg zu statistischen Erkennungssystemen mit großem Vokabular, die mehrere Gebärden verarbeiten. Berechnen. Vis. Bildverstand. 2015, 141, 108–125. [CrossRef]
34. Koller, O.; Camgoz, NC; Ney, H. Schwach überwachtes Lernen mit Multi-Stream-CNN-LSTM-HMMs zur Entdeckung sequentieller Parallelität in Gebärdensprachvideos. IEEE Trans. Muster Anal. Mach. Intel. 2020, 42, 2306–2320. [CrossRef] [PubMed]
35. Camgoz, NC; Hadfifield, S.; Koller, O.; Bowden, R. SubUNets: End-to-End-Handform und kontinuierliche Gebärdenspracherkennung. In Proceedings of the 2017 IEEE International Conference on Computer Vision (ICCV), Venedig, Italien, 22.–29. Oktober 2017; S. 3075–3084.
36. Dong, C.; Loy, CC; Er, K.; Tang, X. Bild-Superauflösung mit Deep Convolutional Networks. IEEE Trans. Muster Anal. Mach. Intel. 2014, 38, 295–307. [CrossRef] [PubMed]
37. Bressem, KK; Adams, LC; Erxleben, C.; Hamm, B.; Niehues, SM; Vahldiek, JL Vergleich verschiedener Deep-Learning-Architekturen zur Klassifizierung von Thorax-Röntgenaufnahmen. Wissenschaft. Rep. 2020, 10, 13590. [CrossRef]
38. Sun, K.; Xiao, B.; Liu, D.; Wang, J. Deep High-Resolution Representation Learning zur menschlichen Posenschätzung. In Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 15.–20. Juni 2019; S. 5686–5696.
39. Koller, O.; Zargaran, S.; Ney, H. Re-Sign: Neu ausgerichtete End-to-End-Sequenzmodellierung mit Deep Recurrent CNN-HMMs. In Pro ceedings der 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Honululu, HI, USA, 21.–26. Juli 2017; S. 3416–3424.
40. Zhou, H.; Zhou, W.; Li, H. Dynamische Pseudo-Label-Dekodierung für die kontinuierliche Gebärdenspracherkennung. In Proceedings of the 2019 IEEE International Conference on Multimedia and Expo (ICME), Shanghai, China, 18.–21. Juli 2019; S. 1282–1287.
41. Xiao, Q.; Chang, X.; Zhang, X.; Liu, X. Videobasierte Gebärdenspracherkennung ohne zeitliche Segmentierung. In Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence, New Orleans, LA, USA, 2.–7. Februar 2018; S. 2257–2264.
42. Graves, A.; Fernández, S.; Gomez, F.; Schmidhuber, J. Konnektionistische zeitliche Klassifikation: Kennzeichnung unsegmentierter Sequenzdaten mit wiederkehrenden neuronalen Netzen. In Proceedings of the ICML '06: Proceedings of the 23rd international Conference on Machine Learning, Pittsburgh, PA, USA, 25.–29. Juni 2006; S. 369–376.
43. Graves, A.; Liwicki, M.; Fernández, S.; Bertolami, R.; Bunke, H.; Schmidhuber, J. Ein neuartiges verbindungsorientiertes System zur uneingeschränkten Handschrifterkennung. IEEE Trans. Muster Anal. Mach. Intel. 2009, 31, 855–868. [CrossRef]
44. Guo, D.; Zhou, W.; Li, H.; Wang, M. Hierarchisches LSTM für die Gebärdensprachübersetzung. In Proceedings of the AAAI Conference on Artificial Intelligence, New Orleans, LA, USA, 2.–7. Februar 2018; S. 6845–6852.
45. Rahman, MM; Watanobe, Y.; Nakamura, K. Ein bidirektionales LSTM-Sprachmodell für die Codebewertung und -reparatur. Symmetrie 2021, 13, 247. [CrossRef]
46. Hu, W.; Cai, M.; Chen, K.; Ding, H.; Sonne, L.; Liang, S.; Mo, X.; Huo, Q. Sequenzdiskriminatives Training für die Offline-Handschrifterkennung durch eine interpolierte CTC- und gitterfreie MMI-Zielfunktion. In Proceedings of the International Conference on Document Analysis and Recognition, ICDAR, Kyoto, Japan, 9.–15. November 2017; Band 1, S. 61–66.
47. Yoshimura, T.; Hayashi, T.; Takeda, K.; Watanabe, S. End-to-End-automatische Spracherkennung integriert mit CTC-basierter Sprachaktivitätserkennung. In Proceedings of the ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing, Barcelona, Spanien, 4.–8. Mai 2020; S. 6999–7003.
48. Guo, D.; Wang, S.; Tian, Q.; Wang, M. Dichtes zeitliches Faltungsnetzwerk für die Übersetzung von Gebärdensprache. In Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence (IJCAI-19), Macau, China, 10.–16. August 2017; S. 744–750.
49. Wang, S.; Guo, D.; Zhou, W.; Zha, Z.; Wang, M. Konnektionistische Zeitfusion für die Gebärdensprachübersetzung. In Proceedings of the 26th ACM International Conference on Multimedia, Seoul, Korea, 22.–26. Oktober 2018; S. 1483–1491.
50. Yang, Z.; Shi, Z. SF-Net: Strukturiertes Feature-Netzwerk für kontinuierliche Gebärdenspracherkennung. arXiv 2019, arXiv:1908.01341.
51. Cheng, KL; Yang, Z.; Chen, Q.; Tai, Y. Vollständig gefaltete Netzwerke für die kontinuierliche Erkennung von Gebärdensprache. In Proceedings of the European Conference on Computer Vision, Glasgow, Großbritannien, 23.–28. August 2020; S. 697–714.
52. Koller, O.; Ney, H.; Bowden, R. Deep Hand: So trainieren Sie ein CNN anhand von 1 Million Handbildern, wenn Ihre Daten kontinuierlich und schwach gekennzeichnet sind. In Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, 27.–30. Juni 2016; S. 3793–3802.
53. Slimane, FB Context Matters: Selbstaufmerksamkeit für die Erkennung von Gebärdensprache. arXiv 2021, arXiv:2101.04632.
54. Niu, Z.; Mak, B. Stochastische feinkörnige Beschriftung von Multi-State-Zeichenglossen für die kontinuierliche Gebärdenspracherkennung. In Proceedings of the European Conference on Computer Vision, Glasgow, Großbritannien, 23.–28. August 2020; S. 1–16.
55. Cui, R.; Liu, H.; Zhang, C. Ein tiefes neuronales Framework für die kontinuierliche Erkennung von Gebärdensprache durch iteratives Training. IEEE Trans. Multimed. 2019, 21, 1880–1891. [CrossRef]
56. Pu, J.; Zhou, W.; Hu, H.; Li, H. Verbesserung der kontinuierlichen Erkennung von Gebärdensprache durch Cross-Modality-Augmentation. In Proceedings of the 28th ACM International Conference on Multimedia, Seattle, WA, USA, 12.–16. Oktober 2020; S. 1497–1505.






