- AutorIn
- MSc John Eric Anders
- Titel
- Annotation of Small Proteins
- Untertitel
- An Investigation of an Overlooked Protein Class
- Zitierfähige Url:
- https://nbn-resolving.org/urn:nbn:de:bsz:15-qucosa2-947264
- Datum der Einreichung
- 06.04.2023
- Datum der Verteidigung
- 30.04.2024
- Abstract (DE)
- Kleine Proteine (sProteine, Proteine mit einer Aminosäurenkettenlänge kürzer als 100) sind eine Gruppe von Proteinen, die von klassischen Annotationsverfahren oft nicht erkannt werden, obwohl ihre wichtige Funktion in vielen grundlegenden zellulären Prozessen seit langem bekannt ist. Die Verbesserung der Annotationsverfahren für sProteine ist daher von großer Bedeutung, um ein vollständiges Bild des funktionellen Potentials eines Organismus zu erhalten. In dieser Arbeit stelle ich ein neues Annotationsverfahren mit Fokus auf sProteine vor, das für die Analyse von Proteom- und Transkriptomdaten entwickelt wurde. Das Verfahren zeigt, wie zuverlässig unbekannte sProteine mit hoher Konfidenz identifiziert werden können und legt den Schwerpunkt auf die Auswertung von PSMs (Peptide to Spectrum Maps). Dabei kann gezeigt werden, dass der Erhalt der genomischen Position wichtig für die Bewertung ist. Die genomische Position ist ein gutes Bindeglied für die Integration verschiedener Quellen von Kodierungspotential. Darüber hinaus erlaubt sie die Nutzung des genomischen Kontextes (Überlappung mit anderen annotierten Genen etc.) zur automatischen Bewertung der Proteinvorhersage. Mit dieser Methode konnte ich sechs unbekannte sProteine mit hoher Sicherheit identifizieren. Um weitere Beweise für die vorhergesagten Proteingene zu erbringen, habe ich einen vergleichenden Sequenzanalyse auf der Grundlage von Whole Genes Alignments (WGA) angepasst. Diese genomweite Vorhersagemethode lieferte keine signifikanten Ergebnisse für die neuen sProteine. Als schnellere Alternative habe ich eine zielspezifische Methode entwickelt, mit der begrenzte Regionen analysiert werden können. Die Methode wurde der Öffentlichkeit als Webdienst zur Verfügung gestellt. Mit Hilfe des Webdienstes kann für alle sechs sProteine ein eindeutiges konserviertes Kodierungspotenzial nachgewiesen werden. Darüber hinaus ist der Webservice in der Lage, kodierende Gene über mehrere Phyla hinweg zuverlässig vorherzusagen und funktioniert auch bei großen gespleißten Genen zuverlässig. Aufgrund der Unzulänglichkeiten der ursprünglichen WGA-Analyse wurde untersucht, wie durch die Vorverarbeitung eines WGA die Senistivität von vergleichenden Sequenzanalysen erhöht werden kann. Diese Methode führte zwar zu einer Erhöhung der Erkennungsrate von Genen, aber auch zu vielen falsch positiven Vorhersagen. Die Vorverarbeitung konnte sowohl zeigen, dass eine bestehende WGA optimiert werden kann, als auch, dass die Methode in gut definierten Abschnitten funktioniert. Die neu eingeführten Fehler bedeuten jedoch, dass die Methode für eine genomweite Analyse nicht geeignet ist. Dennoch geben diese Ergebnisse ein klareres Bild davon, was vergleichende Sequenzanalysen benötigen, um bessere Vorhersagen mit einem WGA als Input zu machen.
- Freie Schlagwörter (DE)
- annotation, protein, sprotein, mass spectromety
- Klassifikation (DDC)
- 500
- Den akademischen Grad verleihende / prüfende Institution
- Universität Leipzig, Leipzig
- Version / Begutachtungsstatus
- publizierte Version / Verlagsversion
- URN Qucosa
- urn:nbn:de:bsz:15-qucosa2-947264
- Veröffentlichungsdatum Qucosa
- 06.12.2024
- Dokumenttyp
- Dissertation
- Sprache des Dokumentes
- Deutsch
- Lizenz / Rechtehinweis
CC BY-SA 4.0- Inhaltsverzeichnis
1 Introduction 1.1 Small Proteins, an Unexplored World 2 Background 2.1 Homology Relations 2.2 Synteny 2.3 Sequence Alignments 2.4 Homology Search and the Blast Algorithm 2.5 Whole Genome Alignment 2.6 RNAcode and Conserved Coding Sequences 2.7 Transcriptomics and Read Mapping 2.8 Tandem Mass Spectrometry and Peptide to Spectrum Mapping 3 Mass Spectrometry to Identify Small Proteins 3.1 Standard Workflow 3.2 Adapted Workflow 4 RNAcode Web 4.1 Introduction 4.2 Materials and Methods 4.3 Results 4.4 Discussion 5 Preprocessing WGA for RNAcode 5.1 Introduction 5.2 Methods 5.3 Results 5.4 Discussion 6 Outlook and Conclusion 6.1 Conclusion 6.2 Outlook Appendices A Appendix List of Abbreviations