Wikipedia · einfach zusammengefasst · Stand
Bioinformatik
Die Bioinformatik ist eine interdisziplinäre Wissenschaft, die Probleme aus den Lebenswissenschaften mit theoretischen computergestützten Methoden löst.
Inhalt4 Abschnitte
Bedeutung und Aufgaben der Bioinformatik
Bioinformatik ist eine interdisziplinäre Wissenschaft. Sie löst Probleme aus den Lebenswissenschaften mit theoretischen computergestützten Methoden. Sie hat grundlegende Erkenntnisse in moderner Biologie und Medizin ermöglicht und wurde besonders 2001 bekannt, als sie wesentlich zur Sequenzierung des menschlichen Genoms beitrug.
Das Gebiet umfasst vor allem die Verwaltung und Integration biologischer Daten, die Analyse von Sequenzen, die Strukturbioinformatik und die Auswertung von Daten aus Hochdurchsatzmethoden, auch ~omics genannt. Hochdurchsatzmethoden erzeugen große Datenmengen, etwa durch Microarrays. Weil solche Daten nur mit computergestützten Verfahren in großem Maßstab ausgewertet werden können, ist die Bioinformatik ein wesentlicher Pfeiler der Systembiologie.
Im englischen Sprachraum wird Bioinformatik häufig der computational biology gegenübergestellt. Computational biology kann einen weiteren Bereich als die klassische Bioinformatik bezeichnen; meist werden beide Begriffe jedoch synonym verwendet.
Biologische Datenbanken und ihre Verknüpfung
Biologische Daten wachsen schnell an. Dazu gehören insbesondere DNA- und Proteinsequenzen, ihre Annotationen, also ergänzende Beschreibungen und Zuordnungen, dreidimensionale Proteinstrukturen, Wechselwirkungen biologischer Moleküle sowie Hochdurchsatzdaten. Diese Informationen müssen aufbereitet, gespeichert und in geeignet indizierten und verknüpften Datenbanken abgelegt werden. Indizes erleichtern das schnelle Auffinden von Daten. Einheitliche Datenstrukturen, bessere Durchsuchbarkeit und die Automatisierung von Analysen durch Software sind wichtige Vorteile solcher Datenbanken.
Eine frühe Datenbank ist die Protein Data Bank (PDB). Sie enthält Daten zu 3D-Strukturen biologischer Makromoleküle, meist Proteinen. In den 80er Jahren entstanden Datenbanken für Nukleotidsequenzen, darunter EMBL Data Library und GenBank, sowie für Aminosäuresequenzen, darunter Protein Information Resource (PIR) und Swiss-Prot.
Die Nukleotidsequenz-Datenbanken der Internationalen Nukleotidsequenz-Datenbank-Zusammenarbeit sind Primärdatenbanken. Das bedeutet, dass sie Originaldaten archivieren, welche Forschende selbst einreichen. UniProt ist ein Zusammenschluss aus PIR und Swiss-Prot. Es stellt von Experten gepflegte und annotierte Proteinsequenzeinträge mit umfangreichen Informationen zu einzelnen Proteinen bereit. Ergänzt werden diese durch automatisch aus der EMBL-Bank translatierte Proteinsequenzen ohne weitere Annotation.
Weitere Datenbanken speichern zum Beispiel wiederkehrende Proteinsequenzmotive wie Pfam, Informationen über Enzyme und biochemische Komponenten wie GeneCards, BRENDA, KEGG LIGAND und ENZYME, Angaben zu Protein-Protein- oder Protein-DNA-Wechselwirkungen wie TRANSFAC, Stoffwechsel- und regulatorische Netzwerke wie KEGG und REACTOME sowie Daten zur Genexpression wie Bgee.
Die Datenbanken wachsen teilweise exponentiell; Ende 2024 gab es über 2.200 einschlägige Datenbanken. Für die Recherche werden daher Meta-Suchmaschinen wie Bioinformatik-Harvester, Entrez und EBI SRS verwendet. Die große Zahl an Datenbanken kann aber zu redundanter und fehleranfälliger Datenhaltung führen. DNA-Sequenzen können außerdem entweder als Fragmente, sogenannte raw reads, oder als vollständig assemblierte Konsensus-Sequenzen vorliegen. Für die Integration sind kontrollierte Vokabulare und Ontologien wichtig. Sie erlauben, Funktionsbezeichnungen über verschiedene biologische Ebenen hinweg einheitlich zuzuordnen.
Analyse von DNA- und Proteinsequenzen
Zu den ersten Bioinformatikanwendungen gehörten DNA-Sequenzanalyse und Sequenzalignment. Bei der Sequenzanalyse werden Muster in Protein- oder DNA-Sequenzen schnell gesucht. Ein Sequenzalignment richtet zwei Sequenzen so gegeneinander aus, dass ihre Übereinstimmung möglichst groß ist. Damit wird untersucht, ob Gene oder Proteine homolog, also miteinander verwandt, sind.
Ist die Übereinstimmung deutlich besser als eine zufällig erwartbare Ähnlichkeit, kann auf Verwandtschaft geschlossen werden. Bei Genen und Proteinen bedeutet Verwandtschaft stets ähnliche Struktur und meist ähnliche Funktion. Deshalb ist der Sequenzvergleich zentral für die Vorhersage unbekannter oder vermuteter Gene sowie ihrer Struktur.
Dynamische Programmierung liefert beim Sequenzvergleich optimale Lösungen. Wegen des hohen Bedarfs an Computerressourcen ist sie bei sehr langen Sequenzen oder sehr großen Datenbanken jedoch kaum praktisch einsetzbar. Heuristische Algorithmen durchsuchen große Datenbanken mit bekannten Sequenzen schneller. Sie garantieren keine optimalen Ergebnisse, sind aber sehr nützlich. Der BLAST-Algorithmus ist für die tägliche Arbeit von Bioinformatikern und Molekularbiologen besonders wichtig. Weitere häufig genutzte Algorithmen sind FASTA, Needleman-Wunsch und Smith-Waterman.
Manchmal werden exakte Übereinstimmungen kurzer Sequenzabschnitte gesucht, etwa Schnittstellen von Restriktionsenzymen in DNA-Sequenzen. Auch Proteinmuster aus der PROSITE-Datenbank können auf diese Weise untersucht werden.
Bei der Genomanalyse werden viele kleine sequenzierte DNA-Bruchstücke mit bioinformatischen Methoden zu einer Gesamtsequenz zusammengesetzt. Für unbekannte DNA-Sequenzen gibt es außerdem Verfahren zur Genvorhersage, auch gene finding oder gene prediction. Dabei kommen statistische Sequenzanalyse, Markow-Ketten und künstliche neuronale Netze zur Mustererkennung zum Einsatz. Aus DNA- und Aminosäuresequenzen lassen sich zudem phylogenetische Bäume erstellen. Sie stellen die evolutionäre Entwicklung heutiger Lebewesen aus meist unbekannten und deshalb hypothetischen Vorfahren dar.
Proteinstrukturen und molekulare Wechselwirkungen
Nachdem vollständige Genome aufgeklärt und umfangreich funktionell analysiert wurden, verlagerte sich ein Schwerpunkt der Bioinformatik auf die Proteomik. Dazu zählen Fragen der Proteinfaltung und Strukturvorhersage. Untersucht wird, welche Sekundär- oder Tertiärstruktur ein Protein bei gegebener Aminosäuresequenz besitzt. Die Sekundärstruktur beschreibt lokale Strukturelemente eines Proteins, die Tertiärstruktur seine räumliche Gesamtform.
Die Strukturbioinformatik untersucht auch Wechselwirkungen von Proteinen mit Liganden. Liganden können Nukleinsäuren, andere Proteine oder kleinere Moleküle sein. Solche Untersuchungen liefern Erkenntnisse für die Grundlagenforschung sowie für Medizin und Pharmazie. Sie können etwa zeigen, wie ein durch Mutation verändertes Protein Körperfunktionen beeinflusst oder wie Medikamente an verschiedenen Proteinen wirken.