HIV-1/HBV-Koinfektion Präzise Multitarget-Vorhersage unter Verwendung eines auf einem graphischen neuronalen Netzwerk basierenden Ensemble-Vorhersagemodell Ⅲ

Aug 02, 2023

3. Diskussion

Weltweit sind etwa 2 Milliarden Menschen mit dem Hepatitis-B-Virus (HBV) infiziert, von denen mehr als 350 Millionen daran leidenChronische Infektion,und zwischen 500,000und jedes Jahr sterben 700000 Menschen an einer HBV-Infektion. Darüber hinaus lebten im Jahr 2019 weltweit schätzungsweise 38 Millionen Menschen mit HIV, darunter 1,8 Millionen Kinder unter 15 Jahren. Im Jahr 2019 starben weltweit fast 690000 Menschen an AIDS-bedingten Krankheiten. Aufgrund der ähnlichen Übertragungswege von HIV und HBV, den beiden durch Blut übertragenen Viren, führt die hohe Häufigkeit von Koinfektionen zu großen globalen Gesundheitsproblemen. Im Gegensatz zu Einzelinfektionen dieser Viren können Koinfektionen zu einer Vielzahl von leberbedingten Erkrankungen, Funktionsstörungen nichtlebiger Organe und zum Tod führen. Die Behandlung koinfizierter Patienten ist aufgrund der Nebenwirkungen antiviraler Medikamente kompliziert, was zu Arzneimittelresistenzen, Lebertoxizität und dem Fehlen einer wirksamen Reaktion führt. Darüber hinaus müssen koinfizierte Personen gleichzeitig mit mehreren Medikamenten behandelt werden, was zur Folge hatkomplexe Diagnose, Behandlung, UndKontrolle von HIV und HBVKoinfektionen. Daher ist die Forschung und Entwicklung vonneuartige MedikamentemitMehrere Ziele sind ein dringendes Problem. 

Echinacoside in cistanche (8)

KLICKEN SIE HIER, UM CISTANCHE ZUR VORBEUGUNG VON INFEKTIONEN KENNENZULERNEN

Allerdings ist die herkömmliche Methodik zur Arzneimittelentdeckung, bei der Experimente zum Screening von Arzneimittelkandidaten zum Einsatz kommen, teuer und zeitaufwändig. Mit der Entwicklung von Algorithmen für maschinelles Lernen und Deep Learning wurden schnelle Innovationen im virtuellen Screening realisiert. Eines der wichtigsten Verfahren für die Anwendung von Modellen des maschinellen Lernens für das Screening groß angelegter Verbindungen ist die Extraktion molekularer Merkmale. Graphische neuronale Netze (GNNs) ermöglichten Durchbrüche beim Erlernen interatomarer Verbindungen, da sie die räumlichen Graphenstrukturen von Molekülen darstellen können.


In dieser Studie verglichen wir drei Arten von graphischen neuronalen Netzen auf ihre Fähigkeit, molekulare Merkmale zu extrahieren, indem wir die Ausgabeschichten dieser neuronalen Netze durch einen optimalen überwachten Lernalgorithmus, GBDT, ersetzten. Das Ensemblemodell DMPNN plus GBDT wurde für die HIV-1/HBV-Mehrzielfischerei basierend auf der Kombination von 12 binären Klassifikatoren ausgewählt. Die Proof-of-Principle-Studie zeigte, dass die Integration von DMPNN und GBDT die Vorhersageleistung in Bezug auf HIV-1- und HBV-Ziele im Vergleich zu einzelnen Algorithmen für maschinelles Lernen oder einzelne neuronale Netzwerke effizient verbessern kann. Darüber hinaus wurde vorhergesagt, dass 22 zugelassene HIV-1-Medikamente und 8 zugelassene HBV-Medikamente potenzielle Multitargets haben, wobei 8 von ihnen durch Referenzen validiert wurden. Um unsere Zielvorhersagen für die zehn neuen Verbindungen zu verifizieren, wurden außerdem molekulare Docking-Simulationen durchgeführt, um eine detaillierte Untersuchung des Bindungsmodus für jede Verbindung zu ermöglichen, wobei sechs Verbindungen vorausgesagt wurden, dass sie Zwillingsbeziehungen mit HIV- und HBV-Zielen haben, was verifiziert wurde durch den molekularen Docking-Algorithmus. Somit zeigten die Ergebnisse, dass es möglich ist, spezifische Inhibitoren zu entwickeln, die gleichzeitig gegen HIV-1 und HBV wirken. Darüber hinaus bietet unser Ensemble-Modell die Möglichkeit, Multitarget-Co-Inhibitoren der HIV/HBV-Koinfektion effektiv zu erkennen, und bietet potenzielle Anwendungen für das virtuelle Screening von Multitarget-Medikamenten zur Behandlung anderer komplexer Krankheiten.

Flavonoid (8)

4. Materialien und Methoden

4.1. Vorbereitung des Datensatzes

Die ChEMBL-Datenbank [35] (Version 32) und die Therapeutic Target Database (TTD) wurden verwendet, um die klinischen Ziele im Zusammenhang mit HIV-1 und HBV auszuwählen. Als Abrufbedingungen wurden die Schlüsselwörter „HIV-1“, „Human Immunodeficiency Virus type-1“, „HBV“ und „Hepatitis B Virus“ verwendet. Anschließend wurden die Suchergebnisse weiter gefiltert, wenn die Anzahl der mit dem Ziel verbundenen Verbindungen weniger als 30 betrug. In der Zwischenzeit wurden Verbindungen mit einem quantitativen Maß für die biologische Aktivität (IC50, EC50, Ki oder Kd) kleiner oder gleich 10 µM gefunden als „aktiv“ gekennzeichnet; Im Gegensatz dazu wurden diejenigen mit einem quantitativen Maß an biologischer Aktivität von mehr als 10 µM als „inaktiv“ gekennzeichnet.


4.2. Extraktion molekularer Merkmale durch ein graphisches neuronales Netzwerk

Das Simplified Molecular Input Line Entry System56 (SMILES) [55] von Verbindungen wurde aus der ChEMBL-Datenbank heruntergeladen und das Tool RDKit [56] wurde verwendet, um diese SMILES-kodierenden Verbindungen zu verarbeiten, um molekulare Diagramme und Morgan-Fingerabdrücke zu erhalten [34]. Anschließend wurden drei graphische neuronale Netzwerkmodelle (GCN, GGNN, DMPNN) übernommen, um die Darstellung der molekularen Strukturen zu erlernen, wobei jeder Graph aus Knoten und Kanten besteht. Knoten werden durch die Art des Atoms, die Atomelemente, die Anzahl zusätzlicher Atome, die Anzahl der Valenzelektronen, aromatische Eigenschaften und andere Eigenschaften beschrieben. Die Adjazenzmatrix stellt die Konnektivität zwischen Atompaaren dar, unabhängig von Einfach- oder Doppelbindungen. Im Graph Convolutional Neural Network (GCN) werden die Zustände der Graphknoten mithilfe der Einbettungsmethode aktualisiert: hi t=U(hi t−1 , mi t ), wobei der i-te Knoten vom vorherigen aktualisiert wurde Knotenstatus hi t−1 mit dem Nachrichtenstatus mi t . Das Gated Graph Neural Network (GGNN) nutzt die Gate Recurrent Units (GRUs) [57] im Ausbreitungsschritt. Darüber hinaus enthält die gerichtete MPNN drei Hauptoperationen: Nachrichtenübermittlung, Knotenaktualisierung und Auslesen:

image

Dabei ist Mt die Nachrichtenfunktion, Ut die Knotenaktualisierungsfunktion und N(i) die Menge der Nachbarn des Knotens i im Diagramm G. Die Auslesephase verwendet eine Auslesefunktion R, um den Merkmalsvektor des gesamten Diagramms zu berechnen:

image

Die Nachrichtenfunktion, die Aktualisierungsfunktion und die Auslesefunktion sind alle differenzierbar. R arbeitet mit der Menge der Knotenzustände und ist unempfindlich gegenüber der Anordnung der Knoten, was dazu führt, dass MPNN gegenüber dem Graphisomorphismus invariant ist. Anstatt im generischen MPNN Nachrichten zu verwenden, die Scheitelpunkten (Atomen) zugeordnet sind, verwendet Directed MPNN (DMPNN) Nachrichten, die gerichteten Kanten (Bindungen) in den Molekülen zugeordnet sind Flugbahn der Nachrichtenübermittlung [58]. In unserer Studie zeigte DMPNN eine überlegene Leistung bei der Extraktion molekularer Eigenschaften.

Cistanche tubulosa-Anti Fatigue

4.3. Multitarget-Vorhersagemodell

In dieser Studie wurden zur Generierung eines Multitarget-Klassifikators drei auf graphischen neuronalen Netzwerken basierende Ensemblemodelle, die die Graphdarstellung und die Morgan-Darstellung molekularer Strukturen integrieren, in 12 binären Klassifikatordatensätzen ausgewertet. Die ursprüngliche Ausgabeschicht jedes GNN wurde durch den Gradient Boosting Decision Tree (GBDT) ersetzt, der unter allen anderen überwachten Lernenden die beste Vorhersageleistung erzielte: SVM, RF und XGBoost. Anschließend wurde durch die Kombination dieser 12 binären Klassifikatoren der Multitarget-Prädiktor zur Identifizierung von HIV-1/HBV-Ziel-Verbindungs-Assoziationen generiert, der den Namen DMPNN plus GBDT trägt.


4.4. Methoden des maschinellen Lernens

Um die Zusammenarbeit des graphischen neuronalen Netzwerks in den zusammenarbeitenden Duetten auszuwählen, wurden sechs Arten von Algorithmen für maschinelles Lernen hinsichtlich der Leistung der binären Zielklassifizierungsaufgabe bewertet: Random Forest (RF), Support Vector Machines (SVM), Naive Bayes (NB). , Gradient Boosting Decision Tree (GBDT) und Extreme Gradient Boosting Algorithmus (XGBoost). Die Hyperparameter-Abstimmung aller Methoden des maschinellen Lernens wurde mithilfe einer {{0}}fachen Kreuzvalidierung in einer umfassenden Suche über einen begrenzten Hyperparameterraum optimiert. Bei der RF-Klassifizierung sagt jeder Entscheidungsbaum für eine bestimmte Stichprobe eine Bezeichnung voraus, und die endgültige Vorhersage der Stichprobe ist die Bezeichnung der meisten Baumvorhersagen, bei denen die Anzahl der Entscheidungsbäume auf 10{{18 festgelegt wurde }}0. Die SVM-Klassifizierung konstruierte die beste Trennung zweier Klassen, indem sie den Abstand (binär) zwischen Instanzen maximierte, die zu verschiedenen Klassen gehören. Für diesen Algorithmus wurde ein „Kosten“-Hyperparameter zur Fehlerkontrolle durch die Kandidatenwerte 0.{{30}}1, 0.1, 1, 10, optimiert. und 100. GBDT ist ein Mitglied der Ensemble-Learning-Boosting-Familie, die mithilfe eines Vorwärtsverteilungsalgorithmus iteriert. Angenommen, der starke Lerner aus der vorherigen Iteration ist ft−1(x), die Verlustfunktion ist L(y, ft−1(x)) und das Ziel dieser Iteration besteht darin, einen Entscheidungsbaum-Lerner ht(x) zu finden. Minimierung der Verlustfunktion L(y, ft(x))=L(y, ft−1(x) plus ht(x)). Für diesen Algorithmus wurde die Anzahl der Entscheidungsbäume auf 1000 festgelegt; die maximale Tiefe des Entscheidungsbaums wurde aus 3, 5,10 ausgewählt; Die Lernrate wurde von (0, 1) abgetastet. und die Mindestanzahl von Stichproben zum Teilen eines internen Knotens war ein Kandidat aus 2, 3, 4 und 5. Schließlich wurden 3 XGBoost-Parameter optimiert, d. h. die Lernrate, die maximale Tiefe und das minimale untergeordnete Gewicht von 5 Kandidatenwerten von 0,01 , 0,05, 0,1, 0,15 und 0,2.

Anti fatigue Cistanche extract

4.5. Leistungskennzahlen

In dieser Studie wurde die Vorhersageleistung des vorgeschlagenen Frameworks DMPNN plus GBDT mit den anderen beiden grafischen neuronalen Netzen bei der Validierung der Einzelzielvorhersage bewertet. Zur Beurteilung der Leistung jedes Modells wurden der F1-Score und die AUC herangezogen. Der F1-Score ist das harmonische Mittel aus Präzision (PPV) und Recall (TPR), der AUC-Score ist definiert als die Fläche unter der Receiver Operating Characteristics (ROC)-Kurve für die Klassifizierungsleistungsmetrik. Die ROC-Kurve ist definiert als die verbundene Kurve der Punkte True-Positive-Rate (TPR) und False-Positive-Rate (FPR).

image

Dabei bedeutet TP echte Positive, TN bedeutet echte Negative, FP bedeutet falsch positive Ergebnisse und FN bedeutet falsch negative Ergebnisse, wobei sich „positiv“ und „negativ“ auf aktive bzw. inaktive Verbindungsmarkierungen beziehen.

Um die globale Leistung unseres Multitarget-Klassifikators in Kombination mit 12 Einzelziel-Binärklassifikatoren in der HIV-1/HBV-Zielvorhersageaufgabe zu bewerten, wurde die Fähigkeit zur Identifizierung der bekannten Wirkstoffe unter den bekannten Zielassoziationen NPV, TPR und ermittelt Als Metrik wurde die Fähigkeit verwendet, keine bekannten Interaktionen (FNR) zu verpassen.


image

4.6. Datenungleichgewicht

Wie in Abbildung 2 dargestellt, sind die in dieser Studie verwendeten Datensätze unausgewogen. Wir haben die kostensensitive Lernmethode übernommen, um die Bedeutung bestimmter Kategorien in den Klassifizierungstrainingsaufgaben zu erhöhen, indem wir insbesondere Klassifizierungsfehler in diesen Kategorien bestrafen, indem wir die Parameter in maschinellen Lernmethoden anpassen. Für XGBoost wurde der Parameter „scale_pos_weight“ auf das Verhältnis der Anzahl negativer und positiver Fälle gesetzt. Für SVM und RF wurde der Parameter „class_weight“ auf „balanced“ gesetzt. Im NB-Algorithmus gibt es keinen technischen Parameter für den Datenausgleich. Allerdings können Entscheidungsbaummodelle, die Partitionsregeln basierend auf Klassenvariablen verwenden, um Klassifizierungsbäume zu erstellen, eine gute Leistung erzielen, indem sie Stichproben aus verschiedenen Kategorien zwangsweise trennen. Daher legen wir in GDBT den Parameter „sample_weight“ entsprechend dem Anteil negativer und positiver Proben in verschiedenen Datensätzen fest, was zu einer künstlichen Reduzierung der Auswirkungen großer Stichprobensätze führt.


5. Schlussfolgerungen

In diesem Artikel haben wir ein auf einem graphischen neuronalen Netzwerk basierendes Vorhersagemodell vorgeschlagen, indem wir einen effizienten überwachten Lernalgorithmus integriert haben, der eine hervorragende Implementierung der Gradient-Boosting-Strategie GBDT darstellt. Durch die Kombination von 12 Datensätzen zur binären optimalen Klassifizierung wurde 1 Modell zur Vorhersage mehrerer Ziele erstellt. Um die Leistung unseres Multitarget-Vorhersage-Ensemble-Modells zu bewerten, wurden fünf externe Datensätze für die Vorhersageauswertungen erstellt, die alle den erfüllten PPV und TPR erreichten, was eine relativ hochgenaue Vorhersage potenzieller Ziele für HIV bedeutet.-1 und HBV. Darüber hinaus gab unsere Forschung einen Rückblick auf bekannte HIV- und HBV-Medikamente zur Erkennung potenziell möglicher Angriffspunkte und untersuchte auch neue Verbindungen für ihre beiden Angriffspunkte HIV und HBV, was zu sechs neuen potenziellen Behandlungsverbindungen führte Koinfektion von HIV-1 und HBV. Zusammenfassend lässt sich sagen, dass das in dieser Studie verwendete neuronale Netzwerkmodell Co-Inhibitoren für HIV-1 und HBV effektiv identifizieren könnte und möglicherweise für das virtuelle Screening von Multitarget-Medikamenten zur Behandlung von HIV/HBV-Koinfektionen eingesetzt werden könnte.


Autorenbeiträge: LZ und YW konzipierten und gestalteten das Graphennetzwerkmodell und implementierten die simulierte Studie und die Analyse realer Datensätze; YL hat die Codes für Experimente geschrieben; LZ, YW und XC haben das gesamte Manuskript geschrieben. Alle Autoren haben sich ausreichend an der Arbeit beteiligt, um die Verantwortung dafür zu übernehmen. Alle Autoren haben die veröffentlichte Version des Manuskripts gelesen und ihr zugestimmt.

Finanzierung: Diese Forschung wurde von der National Natural Science Foundation of China finanziert (Nr. 3161194 und Nr. 72271028).

Erklärung des Institutional Review Board: Nicht zutreffend.

Einverständniserklärung: Nicht anwendbar.


Verweise

1. UNAIDS. AIDSinfo 2020. Online verfügbar:https://aidsinfo.unaids.org/(abgerufen am 12. Januar 2022).

2. Bendavid, E.; Jung, SD; Katzenstein, DA; Bayoumi, AM; Sanders, GD; Owens, DK Kosteneffizienz der HIV-ÜberwachungStrategien in ressourcenbeschränkten Umgebungen: Eine Analyse des südlichen Afrikas.Bogen. Praktikant. Med.2008, 168, 1910–1918. [CrossRef] [PubMed] 

3. Charles, M.; Boyle, BA Exzess und Zugang: Die anhaltende Kontroverse um HIV und Gesundheitsversorgung in Afrika.AIDS lesen.2002, 12, 288–292. 4. Xia, H.; Wang, Y.; Sun, HL; Gao, LY; Cao, Y.; Zaongo, SD; Zeng, RN; Wu, H.; Zhang, MJ; Ma, P. Sicherheit und Wirksamkeit vonAllogene natürliche Killerzell-Immuntherapie bei immunologischen Non-Respondern des humanen Immundefizienzvirus Typ 1: AKurzer Bericht.Kinn. Med. J.2020, 133, 2803–2807. [CrossRef] [PubMed] 5. Zaongo, SD; Xia, H.; Ma, P. Strategien und Sicherheit der HIV-Gentherapie: Was wissen wir aus den jüngsten Veröffentlichungen?AIDSRev.2020, 23, 195–202. [CrossRef] [PubMed] 6. Falkenhagen, A.; Joshi, S. Genetische Strategien zur HIV-Behandlung und -Prävention.Mol. Dort. Nukleinsäuren2018, 13, 514–533. [CrossRef] 7. Janeway, CA, Jr.; Travers, P.; Walport, M.; Shlomchik, MJImmunbiologie: Das Immunsystem in Gesundheit und Krankheit, 5. Aufl.;Garland Science: New York, NY, USA, 2001.8. Hoffmann, CJ; Thio, CL Klinische Implikationen der HIV- und Hepatitis-B-Koinfektion in Asien und Afrika.Lanzetteninfektion. Dis.2007, 7, 402–409. [CrossRef] 9. Singh, KP; Crane, M.; Audsley, J.; Avihingsanon, A.; Sasadeusz, J.; Lewin, SR HIV-Hepatitis-B-Virus-Koinfektion: Epidemiologie,Pathogenese und Behandlung.AIDS2017, 31, 2035–2052. [CrossRef] 10. Cheng, Z.; Lin, P.; Cheng, N. HBV/HIV-Koinfektion: Auswirkungen auf die Entwicklung und klinische Behandlung von Lebererkrankungen.Vorderseite.Med.2021, 8, 713981. [CrossRef] 


Unterstützender Service:

E-Mail:wallence.suen@wecistanche.com

WhatsApp/Tel: plus 86 15292862950

Geschäft:

https://www.xjcistanche.com/cistanche-shop


Das könnte dir auch gefallen