Vokal-Spracherkennung aus der Ratten-Elektroenzephalographie unter Verwendung eines neuronalen Netzwerks mit Langzeit-Kurzzeitgedächtnis, Teil 3
Dec 28, 2023
Klassifikatoren für maschinelles Lernen
Die Leistung von BiLSTM wurde mit herkömmlichen Klassifikatoren für maschinelles Lernen verglichen: SVM mit linearem Kernel (SVM_lin), SVM mit radialem Basisfunktionskernel (SVM_rbf), Randomforests (RF), NB und KNN.
Random Forest ist ein Algorithmus für maschinelles Lernen, der derzeit in verschiedenen Bereichen der Datenanalyse und -vorhersage weit verbreitet ist. Im Vergleich zu anderen Algorithmen für maschinelles Lernen weist es eine bessere Robustheit und Genauigkeit auf und reduziert gleichzeitig wirksam die Überanpassung. In den letzten Jahren hat sich der Anwendungsbereich von Random Forests erweitert und kann sogar zur Vorhersage bestimmter menschlicher Gedächtnisfähigkeiten verwendet werden.
Auf dem Gebiet der kognitiven Psychologie ist das Gedächtnis eine sehr wichtige Forschungsrichtung. Wissenschaftler haben nach einer einfachen und effektiven Möglichkeit gesucht, das menschliche Gedächtnis zu beurteilen. In den letzten Jahren hat die Entstehung zufälliger Wälder neue Ideen und Methoden auf diesem Gebiet hervorgebracht.
Random Forest kann ein Modell trainieren, um eine Variable vorherzusagen, bei der es sich um alles handeln kann, was Sie vorhersagen möchten, einschließlich der Gedächtnisleistung. Wissenschaftler können relevante Faktoren in ein Random-Forest-Modell einspeisen, um vorherzusagen, wie gut eine Person bei einem Gedächtnistest abschneiden wird. Diese Faktoren können Faktoren wie Alter, Bildungsniveau, Geschlecht, Gewicht usw. oder biologische Indikatoren wie die Gehirnstruktur sein. Untersuchungen zufolge besteht ein gewisser Zusammenhang zwischen diesen Faktoren und der menschlichen Gedächtnisfähigkeit.
Durch das Sammeln und Analysieren großer Mengen an Testdaten von Probanden können Wissenschaftler ein Modell erstellen, das die Gedächtnisleistung in einem Zufallswaldmodell vorhersagt. Die Vorhersage von Ergebnissen kann wertvolle Informationen über die zukünftige Leistung eines Probanden bei einem bestimmten Gedächtnistest liefern.
Zusammenfassend lässt sich sagen, dass der Random-Forest-Algorithmus Wissenschaftlern eine neue Möglichkeit bietet, das menschliche Gedächtnis zu bewerten. In Zukunft könnte seine Anwendung eine wichtige Rolle in der kognitiven Psychologie, den Neurowissenschaften und anderen Bereichen spielen. Wir haben Grund zu der Annahme, dass die Kombination von Random Forests und anderen Techniken eine breitere Perspektive und ein tieferes Verständnis der menschlichen Gehirnfunktionsforschung ermöglichen kann. Es ist ersichtlich, dass wir das Gedächtnis verbessern müssen, und Cistanche deserticola kann das Gedächtnis erheblich verbessern, da Cistanche deserticola auch das Gleichgewicht von Neurotransmittern regulieren kann, beispielsweise durch die Erhöhung des Acetylcholin- und Wachstumsfaktorspiegels. Diese Stoffe sind sehr wichtig für das Gedächtnis und das Lernen. Darüber hinaus kann Fleisch auch die Durchblutung verbessern und die Sauerstoffversorgung fördern, wodurch sichergestellt werden kann, dass das Gehirn ausreichend Nährstoffe und Energie erhält, wodurch die Vitalität und Ausdauer des Gehirns verbessert werden.

Klicken Sie auf Möglichkeiten zur Verbesserung der Gehirnfunktion
SVM [74] zielt darauf ab, die optimal getrennte Hyperebene durch Maximierung des Spielraums, also des Abstands zwischen den Stützvektoren, zu bestimmen. Mithilfe des Kernel-Tricks ist SVM in der Lage, den Funktionsraum von niedrigen auf hohe Dimensionen abzubilden; Daher kann eine lineare und nichtlineare Klassifizierung effizient durchgeführt werden.
RF [75] funktioniert, indem es während der Trainingsphase mehrere Entscheidungsbäume erstellt und die endgültige Klasse generiert, die die Ergebnisse jedes Entscheidungsbaums kombiniert. NB [76, 77] ist ein probabilistischer Klassifikator, der auf dem Satz von Bayes und der bedingten Wahrscheinlichkeit basiert und normalerweise davon ausgeht, dass alle Merkmale unabhängig voneinander sind.
KNN [78] ist ein nichtparametrischer Ansatz, der die Eingabe basierend auf der Mehrheitsklasse ihrer k-nächsten Nachbarn im Merkmalsraum klassifiziert. Normalerweise wird der k-Wert als ungerade Zahl gewählt, um gebundene Klassen zu vermeiden.
Zum Trainieren und Bewerten der oben genannten Modelle für maschinelles Lernen wurde derselbe 10-CV wie in BiLSTM verwendet. Alle Modelle für maschinelles Lernen wurden mithilfe der Scikit-Learn-Bibliothek [73] in Python implementiert.
Statistische Analysen
Alle statistischen Analysen wurden mit SPSS-Software (SPSS Version 20.0, SPSS Inc., Armonk, NY, USA) und MATLAB-Software Version 2017b (Mathworks, Inc., MA, USA) durchgeführt.
Die Daten wurden mit parametrischer Statistik analysiert, da alle Daten in der Studie eine Normalverteilung im Shapiro-Wilk-Test zeigten (p > 0.05). ANOVA wurde verwendet, um die statistische Signifikanz der TFRs entsprechend den verschiedenen Vokalstimuli zu analysieren.
Darüber hinaus wurde eine ANOVA mit wiederholten Messungen durchgeführt, um die Leistung jedes Klassifikators zu vergleichen. Anschließend wurden paarweise Vergleiche unter Verwendung gepaarter t-Tests zwischen dem BiLSTM-Netzwerk und anderen klassischen Klassifikatoren für maschinelles Lernen durchgeführt und eine Bonferroni-Korrektur durchgeführt, um die Inflation der Fehlerrate vom Typ I auszugleichen.
Die statistische Signifikanz des p-Werts wurde beim Vergleich der TFR der EEG-Antworten auf 0.01 festgelegt, während das Signifikanzniveau des p-Werts beim Vergleich der Leistung zwischen den BiLSTM-Netzwerken auf 0,05 festgelegt wurde und andere Klassifikatoren für maschinelles Lernen.
Ergebnisse
Akustisch evozierte Potenziale als Reaktion auf Vokale
Insgesamt 19 Sprague-Dawley-Ratten wurden einer epiduralen Elektrodenimplantation unterzogen, und alle Ratten überlebten den chirurgischen Eingriff. Als Ergebnis wurden EEG-Reaktionen auf fünf englische Vokale von 19 mit Isofluran betäubten Ratten aufgezeichnet. Um die mittleren AEP-Wellenformen zu extrahieren, wurden alle neuronalen Reaktionen für jeden Reiz über die Probanden gemittelt. Abb. 4 zeigt die gemittelten AEP-Wellenformen für jeden Vokalton aus bilateraler AAF.
Wie erwartet rief jeder kategoriale Vokallaut unterschiedliche neuronale Aktivitäten im bilateralen AAF mit unterschiedlichen Spitzenamplituden und Latenzen hervor. Die Spitzenamplitude der AEPs, definiert als die höchste aufgezeichnete Spannung nach den Vokalreizen, war für /i/ am kleinsten (61,74 ㎶ im linken AAF und 61,27 ㎶ im rechten AAF), während AEPs als Reaktion auf /a/ die größten Spitzenamplituden zeigten (92,12 ㎶ im linken AAF und 90,18 ㎶ im rechten AAF).
Die Spitzenlatenz, definiert als die Dauer vom Einsetzen des Reizes bis zur Spitzenamplitude, betrug ungefähr {{0}},39 s bis 0,5 s, am kürzesten in /i/(0. 39 s in linken und rechten AAFs) und am längsten im /o/-Sound (0,51 s in linken und rechten AAFs). Wie in Abb. 4 dargestellt, wurden ähnliche AEP-Wellenformen vom linken und rechten AAF beobachtet.

Zeit-Frequenz-Analyse der EEG-Signale
Die Zeit-Frequenz-Analyse ist eine leistungsstarke Methode zur Analyse instationärer EEG-Signale über eine Zeit-Frequenz-Ebene und wird verwendet, um qualitative Informationen für die Klassifizierung von EEG bereitzustellen [79, 80]. Daher wurde die TFR des groß gemittelten EEG für jeden Ton berechnet, um vokalerkennungsbedingte Änderungen in der Größe und Phase der EEG-Oszillationen bei bestimmten Frequenzen zu identifizieren (Abb. 5A).
Aus der TFR-Analyse wurde eine Aktivierung hoher Leistung um das Delta- (1–4 Hz), Theta- (4–8 Hz) und Alpha-Band (8–12 Hz) bei 0,3–{{8} beobachtet. },6 s ab Beginn des Reizes, unabhängig von der Sprachlautstimulation.

Darüber hinaus wurde ein ANOVA-Test mit einer Bonferroni-Korrektur durchgeführt, um die statistisch signifikanten TFR-Komponenten für jeden Vokalreiz zu analysieren.
Anschließend wurde die Potenz statistisch signifikanter Bereiche (p < {{0}}.01) durch den F-Wert dargestellt (Abb. 5B). In der Analyse unterschieden sich die meisten EEG-Frequenzbänder von 0,2–0,8 s je nach Vokalreiz deutlich.
Darüber hinaus war ein Teil der TFR von {{0}},8–1 s auch statistisch für jeden Reiz unterschiedlich. Unter Berücksichtigung der AEP-Wellenformen und der Ergebnisse der ANOVA-Tests wurde gefolgert, dass die AEPs von 0,2–0,8 s nach dem Vokalreiz die informativsten neuronalen Reaktionen waren und mit der Vokallauterkennung zusammenhängen.
Modelltraining und Evaluierung der BiLSTM-Netzwerke
Basierend auf den Ergebnissen von Abb. 5B wurden EEG-Daten ausgewählt, die zwischen 1–6 0 Hz mit einem Zeitfenster von 0,2–0,8 s bandpassgefiltert wurden. Anschließend wurden die Z-Scores der ausgewählten EEG-Daten als Eingabe für das BiLSTM-Netzwerk verwendet.
Alle EEG-Daten wurden innerhalb jedes Probanden in 10 Falten unterteilt, um die BiLSTM-Netzwerke zu bewerten. Daher wurde die Testleistung pro Falte unter Verwendung des trainierten Modells mit den verbleibenden Faltungen in einem 10-CV-Schema ermittelt.
Die Leistung des Netzwerks wurde anhand von Genauigkeitsmetriken, dem f{{0}}-Score und der Cohen-Kappa-Statistik κ bewertet (Abb. 6 und Tabelle 1). Die durchschnittliche Fünf-Klassen-EEG-Unterscheidungsgenauigkeit des BiLSTM-Netzwerks betrug 75,18 ± 7,06 % und der f1--Score betrug 0,74 ± 0,08 . Cohens κ betrug 0,68 ± 0,09, was als moderate Übereinstimmung interpretiert wurde [81].
Um die Leistung des BiLSTM-Netzwerks detaillierter zu analysieren, wurde die Verwirrungsmatrix in Abb. 7 dargestellt. Dies deutete darauf hin, dass viele der Fehler auf die Fehlklassifizierung der EEG-Antworten auf /u/ als /a/ und /e/ als /o/ zurückzuführen waren. Allerdings klassifizierte das BiLSTM-Netzwerk die meisten EEG-Antworten mit einer Genauigkeit von mehr als 50 %, was einer hohen Genauigkeit bei der Fünf-Klassen-EEG-Klassifizierung entspricht.

Vergleich des BiLSTM-Netzwerks mit anderen Methoden des maschinellen Lernens
Um die Wirksamkeit der BiLSTM-Netzwerke bei der Klassifizierung des EEG zur Vokallauterkennung zu validieren, wurden die Ergebnisse mit denen anderer herkömmlicher Methoden des maschinellen Lernens verglichen. Abb. 6 und Tabelle 1 zeigen die Leistung der Klassifikatoren für maschinelles Lernen.
Der RF zeigte die höchste Klassifizierungsgenauigkeit unter den herkömmlichen Algorithmen für maschinelles Lernen (Genauigkeit: 63,21 ± 7,41 %, f1--Score: 0,62 ± 0,09 und Cohens : 0.52 ± 0.1). In der statistischen Analyse war die Klassifizierungsleistung von RF nicht signifikant höher als die von SVM_lin und SVM_rbf, während sie im Vergleich zu denen von NB und KNN eine höhere Leistung zeigte.
Als jedoch die Leistung herkömmlicher Algorithmen für maschinelles Lernen, einschließlich RF, mit BiLSTM verglichen wurde, wurde deutlich, dass das BiLSTM-Netzwerk bei allen in der Studie verwendeten Metriken überlegen war (p < 0,01).
In der Verwirrungsmatrix können herkömmliche Algorithmen für maschinelles Lernen bestimmte EEG-Antworten nicht gut unterscheiden. Insbesondere hatten alle herkömmlichen Algorithmen für maschinelles Lernen Schwierigkeiten, den Laut /u/ zu unterscheiden. Es wurde festgestellt, dass die Algorithmen in durchschnittlich 30 % der Fälle (25,96 % in NB bis 36,97 % in KNN) dazu neigten, Geräusche /u/ als /a/ falsch zu klassifizieren, was zu einer Verschlechterung der Gesamtklassifizierungsleistung führte (Abb. 7). .

Diskussion
In dieser Studie wurden epidurale EEG-Reaktionen von Ratten auf fünf kategoriale Vokale (/a/, /e/, /i/, /o/ und/u/) mithilfe des BiLSTM-Netzwerks unterschieden. Die Fünf-Klassen-Klassifizierung epiduraler EEG-Signale wurde in Einzelversuchen durchgeführt, was bekanntermaßen eine Herausforderung darstellt. Um die Lernleistung zu maximieren, wurde in dieser Studie versucht, spezifische EEG-Komponenten zu bestimmen, die mit der Erkennung von Sprachlauten im Gehirn von Ratten zusammenhängen könnten, und diese EEG-Komponenten als Eingabemerkmale verwendet. Infolgedessen wurde mit BiLSTM eine relativ hohe Leistung bei der Klassifizierung von AEPs in fünf verschiedene Vokale erzielt. Ein Vergleich der Klassifizierungsleistung des BiLSTM-Netzwerks mit anderen Algorithmen für maschinelles Lernen zeigte, dass das BiLSTM-Netzwerk andere klassische Klassifikatoren übertrifft. Diese Ergebnisse deuten darauf hin, dass das mit spracherkennungsbezogenen EEG-Komponenten trainierte BiLSTM-Netzwerk AEPs zuverlässig und mit einem hohen Maß an Genauigkeit jedem kategorialen Vokallaut zuordnet. Unseres Wissens wurden LSTM-Netzwerke nicht auf die Klassifizierung von EEG-Reaktionen auf Hörreize angewendet, und dies ist die erste Studie, die einen Deep-Learning-Algorithmus zur Analyse von EEG-Signalen von Ratten-AAF verwendet.

Derzeit haben nur wenige Studien die LSTM-Architektur verwendet, um hochmoderne Ergebnisse bei der EEG-basierten Klassifizierung zu erzielen. Die LSTM-Architektur eignet sich für die EEG-basierte Klassifizierung, da ihre kettenartige Struktur die zeitliche Abfolge von EEG-Daten erfassen kann [82]. Zu Beginn konzentrierte sich die Forschung auf die Verbesserung der Klassifizierungsergebnisse durch verschiedene LST-Architekturen; Die Eingabemerkmale wurden jedoch immer noch manuell extrahiert, wie bei herkömmlichen Methoden des maschinellen Lernens [83, 84].
Tsiouris et al. bewertete die Leistung verschiedener Kombinationen von LSTM-Netzwerkelementen, um die effizientesten LSTM-Architekturen zur Erkennung epileptischer Anfälle zu finden und so nahezu perfekte Ergebnisse bei der Anfallsvorhersage zu erzielen (100 % Sensitivität und 99,86 % Spezifität) [83]. Da LSTM eine leistungsstarke Struktur zur Verarbeitung sequenzieller Daten ist, verwenden einige Studien EEG-Rohdaten als Eingabemerkmale mit minimaler Vorverarbeitung. Da das LSTM-Netzwerk Merkmale direkt aus EEG-Rohdaten lernt, verbesserte sich die Leistung in Emotionserkennungsstudien um mindestens 12 % [85], und auch die Ergebnisse von Motorimage-Klassifizierungsstudien verbesserten sich im Vergleich zu anderen herkömmlichen Studien [86]. Techniken zur Merkmalsextraktion.
Darüber hinaus wurde die BiLSTM-Architektur für die EEG-basierte Klassifizierung verwendet, da sie auf Informationen sowohl aus vergangenen als auch aus zukünftigen Zuständen zugreifen kann. Daher übertraf das BiLSTM-Netzwerk im Allgemeinen das LSTM-Netzwerk, das nur vergangene Informationen aus der Sequenz in Vorwärtsrichtung erfasst, indem es verschiedene Gehirnzustände, die sich in EEG-Daten widerspiegeln, wie Krampfanfälle, Schlaf usw. [63–67], nicht erkannte. Aus diesem Grund wurde in der jüngsten EEG-basierten Klassifizierung unter Verwendung von BiLSTM-Netzwerken über eine hohe Leistung berichtet. Sharma et al. erreichte eine Klassifizierungsgenauigkeit von 82,01 % für vier Arten von Emotionen basierend auf dem BiLSTM-Algorithmus und Statistiken höherer Ordnung [87]. Darüber hinaus klassifizierten die BiLSTM-Netzwerke erfolgreich Epilepsietypen und Schlafstadien [88, 89].
Ähnlich wie frühere Studien erzielte diese Studie mit BiLSTMnetworks vergleichsweise gute Ergebnisse. Der vorgeschlagene Algorithmus unterschied erfolgreich die EEG-Antworten auf fünf Vokale mit hohen Genauigkeitswerten, dem f{{0}}-Score und Cohens κ von 75,18 %, 74,43 % bzw. 0,68. Der Wert von Cohens κ für die Fünf-Klassen-Klassifizierung ist höher als in den meisten aktuellen Studien [90]. Wie in Abbildung 6 dargestellt, lieferte die BiLSTM-Methode im Vergleich zu den anderen Methoden des maschinellen Lernens den höchsten Wert für alle Metriken. Um den statistischen Unterschied in der Klassifizierungsleistung zu bestimmen, wurden außerdem wiederholt gemessene ANOVA-Ergebnisse zwischen BiLSTM und anderen klassischen Methoden des maschinellen Lernens unter Verwendung aller metrischen Werte analysiert. Durch statistische Analysen wurde festgestellt, dass die Klassifizierungsleistung des BiLSTM-Netzwerks deutlich höher war als die anderer klassischer Methoden des maschinellen Lernens (p < 0,01). Dieses Ergebnis stimmte auch mit der Verwirrungsmatrix überein. Wie in Abbildung 7 dargestellt, hat das BiLSTM-Netzwerk die wahren Bezeichnungen der fünf Vokale gut vorhergesagt, während dies bei klassischen Methoden des maschinellen Lernens nicht der Fall war.
Die durch den herkömmlichen Klassifikator für maschinelles Lernen gewonnene Vorhersage war besonders schlecht bei der Klassifizierung des /u/-Lauts; Der Laut /u/ wurde hauptsächlich als /a/ fehlinterpretiert. Sogar RF, das die beste Leistung unter den fünf herkömmlichen Klassifikatoren für maschinelles Lernen zeigte, hatte eine Klassifizierungsrate von 34,48 % für den /u/-Laut, mit einer Fehlklassifizierungsrate des /u/-Lauts als /a/-Laut von 33,89 %. Wie in Abb. 4 zu sehen ist, hatten die Töne /a/ und /u/ eine ähnliche Spitzenlatenz, was eines der Hauptmerkmale von AEP-Wellenformen ist (Spitzenlatenz des Tons /a/: 0.448, Spitze Latenz des Tons /u/: 0.444). Wenn die Klassifizierung auf der Grundlage minimal vorverarbeiteter Einzelversuch-EEG-Signale durchgeführt wurde, scheint es, dass solche Ähnlichkeiten von herkömmlichen maschinellen Lernalgorithmen nicht unterschieden werden konnten, wohingegen das BiLSTM-Netzwerk konnte sie unterscheiden.
Da das BiLSTM-Netzwerk gleichzeitig auf alle vergangenen und zukünftigen Kontexte zugreifen kann, können über dieses Netzwerk umfangreiche Informationen erlernt werden. Darüber hinaus wurde die Klassifizierungsleistung verbessert, obwohl die Merkmale, die die Eigenschaften der EEG-Reaktionen auf jeden Vokalton widerspiegeln, direkt aus den Vorwärts- und Rückwärtsrichtungen der LSTM-Schicht extrahiert wurden. In dieser Studie können wir mithilfe einer einfachen BiLSTM-Architektur gute Klassifizierungsergebnisse ohne einen zusätzlichen manuellen Merkmalsextraktionsprozess ableiten.
Die Klassifizierung der ERP-Reaktionen auf Sprachreize in einem einzigen Versuch ist aufgrund der Merkmale des niedrigen SNR des EEG sehr schwierig. Obwohl einer der Hauptvorteile der Deep-Learning-Methode darin besteht, dass sie Funktionen auf hoher Ebene ohne Extraktion von Kernmerkmalen erlernen kann, haben wir versucht, die relevantesten EEG-Signale im Zusammenhang mit der Spracherkennung auszuwählen, um eine bessere Leistung zu erzielen. In dieser Studie wurden bei der Hochleistungsaktivierung des Niederfrequenzbands, einschließlich der Delta-, Theta- und Alpha-Bänder, in den TFR-Analysen unterschiedliche AEP-Wellenformen beobachtet, die jedem Sprachklangreiz entsprechen. Es ist allgemein bekannt, dass neuronale Schwingungen im Alphaband eine wichtige Rolle bei der Hörverarbeitung spielen. Mazaheri et al. berichteten, dass die Abschwächung der Alpha-Aktivität eng mit der Unterscheidung von Hörzielen zusammenhängt [91].
Staruß et al. bewiesen, dass kortikale Alpha-Oszillationen ein zentraler Mechanismus zur selektiven Hemmung der Geräuschverarbeitung sind, um die auditive selektive Aufmerksamkeit gegenüber Zielsignalen zu verbessern [92]. Zuvor haben wir auch festgestellt, dass die Alphakraft in bilateralen Schläfenbereichen nach bestimmten Schallreizen, die sich hinsichtlich der Art des Klangs statistisch unterschieden, stark aktiviert war [48]. Darüber hinaus ist bekannt, dass die Delta- und Theta-Bänder mit der Gestaltung der Segmentierung und des wahrnehmungsbezogenen Einflusses akustischer Informationen verbunden sind [93].
Obwohl diese Studie auf tierexperimentellen Daten basiert, wurden in den TFR-Analysen ähnliche sprachbezogene Komponenten im Vergleich zu den vorherigen Studien an Menschen beobachtet. Darüber hinaus wurde in der statistischen Analyse festgestellt, dass alle EEG-Bänder innerhalb von 20 Jahren signifikant waren 1 folgte den Reizen und stellte die EEG-Komponenten im Zusammenhang mit der Geräuschwahrnehmung dar. Diese Ergebnisse unterschieden sich etwas von denen früherer Studien, was darauf hindeutet, dass nur bestimmte EEG-Bänder, wie etwa das Alpha-Band, mit der Geräuschwahrnehmung in Zusammenhang standen. Es wird erwartet, dass selbst subtile Änderungen aller EEG-Bandaktivitäten durch die epidurale EEG-Aufzeichnung aufgezeichnet werden, da sie durch die Reduzierung der Volumenleitung und die Eliminierung der Artefakte, die bei extrakraniellen EEG-Aufzeichnungen inhärent sind, ein höheres SNR bietet.
In dieser Studie wurden die EEG-Komponenten im Zusammenhang mit der Sprachlauterkennung bei Ratten bestimmt und die AEP-Komponenten mithilfe des BiLSTM-Netzwerks erfolgreich klassifiziert. Diese Studie wies jedoch einige Einschränkungen auf. Erstens war die Anzahl der enthaltenen Fächer zu gering, insbesondere für Deep Learning. Darüber hinaus wurde in dieser Studie die Leistung jedes Klassifikators nicht mit externer Validierung bewertet, sondern stattdessen 10-CV verwendet, um die begrenzten Stichprobengrößen zu überwinden. Außerdem können wir die Möglichkeit nicht ausschließen, dass das Hörsystem der Ratte kontinuierlich auf Geräusche reagiert, da in dieser Studie nur eine einzige Äußerung jedes Vokals verwendet wurde. Darüber hinaus wurden die erfassten EEG-Reaktionen durch die anästhetischen Wirkungen beeinflusst. Obwohl nur eine minimale Anästhesiedosis verwendet wurde, ist eine Frequenzverlangsamung mit einem Anstieg der Delta-Leistung ein typischer Befund von EEG-Veränderungen nach Isofluran-Inhalation [94]. Daher können sich die in dieser Studie vorgeschlagenen Vokalerkennungs-EEG-Komponenten von den EEG-Signalen unterscheiden, die von Ratten im Wachzustand erfasst wurden. Wir glauben jedoch, dass die Qualität des EEG-Signals gut genug ist, da das EEG durch epidurale Elektrodenimplantation aufgezeichnet wurde und es nicht durch Bewegungsartefakte verunreinigt wurde.
Schlussfolgerungen
Zusammenfassend konnte diese Studie bedeutungsvolle neuronale Komponenten im Zusammenhang mit der kategorialen Sprachwahrnehmung extrahieren. Basierend auf den Eigenschaften der LSTM-Netzwerke wurde außerdem nachgewiesen, dass das BiLSTM-Netzwerk zur Klassifizierung von EEG-Antworten mit minimal vorverarbeiteten AEPs geeignet ist. Da es sich bei dieser Studie um Pionierforschung mit Tierdaten handelt, ist sie möglicherweise nicht direkt auf andere praktische Anwendungen wie Gehirn-Computer-Schnittstellen oder alternative Kommunikationshilfen für Menschen übertragbar.

Daher sind zukünftige Studien mit menschlichen EEG-Daten erforderlich, um die Wirksamkeit des BiLSTM-Netzwerks bei der Klassifizierung der auditiven EEG-basierten Spracherkennung zu überprüfen. Darüber hinaus muss es für eine optimale Parameterabstimmung und Merkmalsextraktion neu bewertet werden. Es wird erwartet, dass diese Studie einen neuartigen Ansatz zur Analyse von EEG-Signalen sowie wertvolle Informationen über die Mechanismen der Sprachwahrnehmung und -erkennung im Gehirn liefern wird.

Verweise
1. Wernicke C. Der Symptomkomplex der Aphasie. In: Cohen RS, Wartofsky MW, Herausgeber. Tagungsband des Boston Colloquium for the Philosophy of Science 1966/1968. Dordrecht: Springer Niederlande;1969. S. 34–97.
2. Shi Z, Yan S, Ding Y, Zhou C, Qian S, Wang Z, et al. Das vordere Hörfeld wird für die Geräuschkategorisierung bei der Angstkonditionierungsaufgabe erwachsener Ratten benötigt. Vordere Neurosci. 2019; 13: 1374.
3. Liberman AM, Harris KS, Hoffman HS, Griffith BC. Die Unterscheidung von Sprachlauten innerhalb und über Phonemgrenzen hinweg. J Exp Psychol. 1957; 54: 358–368.
4. Johnson K. Akustische und auditive Phonetik. Chichester: Wiley-Blackwell; 2012.
5. Green PA, Brandley NC, Nowicki S. Kategorische Wahrnehmung in der Tierkommunikation und Entscheidungsfindung. Verhalten Ecol. 2020; 31: 859–867.
6. Craik A, He Y, Contreras-Vidal JL. Deep Learning für Elektroenzephalogramm (EEG)-Klassifizierungsaufgaben: Ein Rückblick. J Neural Eng. 2019; 16:28.
7. Na¨a¨ta¨nen R, Paavilainen P, Rinne T, Alho K. Die Mismatch-Negativität (MMN) in der Grundlagenforschung der zentralen Hörverarbeitung: Eine Übersicht. Klinische Neurophysiologie. Sonst; 2007. S. 2544–2590.
8. Garrido MI, Kilner JM, Stephan KE, Friston KJ. Die Mismatch-Negativität: Eine Überprüfung der zugrunde liegenden Mechanismen. Klinische Neurophysiologie. Sonst; 2009. S. 453–463
For more information:1950477648nn@gmail.com






