Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Bioinformatik

Die Bioinformatik ist eine interdisziplinäre Wissenschaft, die Probleme aus den Lebenswissenschaften mit theoretischen computergestützten Methoden löst.

Inhalt4 Abschnitte
  1. 1. Bedeutung und Aufgaben der Bioinformatik
  2. 2. Biologische Datenbanken und ihre Verknüpfung
  3. 3. Analyse von DNA- und Proteinsequenzen
  4. 4. Proteinstrukturen und molekulare Wechselwirkungen

Bedeutung und Aufgaben der Bioinformatik

Bioinformatik ist eine interdisziplinäre Wissenschaft. Sie löst Probleme aus den Lebenswissenschaften mit theoretischen computergestützten Methoden. Sie hat grundlegende Erkenntnisse in moderner Biologie und Medizin ermöglicht und wurde besonders 2001 bekannt, als sie wesentlich zur Sequenzierung des menschlichen Genoms beitrug.

Das Gebiet umfasst vor allem die Verwaltung und Integration biologischer Daten, die Analyse von Sequenzen, die Strukturbioinformatik und die Auswertung von Daten aus Hochdurchsatzmethoden, auch ~omics genannt. Hochdurchsatzmethoden erzeugen große Datenmengen, etwa durch Microarrays. Weil solche Daten nur mit computergestützten Verfahren in großem Maßstab ausgewertet werden können, ist die Bioinformatik ein wesentlicher Pfeiler der Systembiologie.

Im englischen Sprachraum wird Bioinformatik häufig der computational biology gegenübergestellt. Computational biology kann einen weiteren Bereich als die klassische Bioinformatik bezeichnen; meist werden beide Begriffe jedoch synonym verwendet.

Biologische Datenbanken und ihre Verknüpfung

Biologische Daten wachsen schnell an. Dazu gehören insbesondere DNA- und Proteinsequenzen, ihre Annotationen, also ergänzende Beschreibungen und Zuordnungen, dreidimensionale Proteinstrukturen, Wechselwirkungen biologischer Moleküle sowie Hochdurchsatzdaten. Diese Informationen müssen aufbereitet, gespeichert und in geeignet indizierten und verknüpften Datenbanken abgelegt werden. Indizes erleichtern das schnelle Auffinden von Daten. Einheitliche Datenstrukturen, bessere Durchsuchbarkeit und die Automatisierung von Analysen durch Software sind wichtige Vorteile solcher Datenbanken.

Eine frühe Datenbank ist die Protein Data Bank (PDB). Sie enthält Daten zu 3D-Strukturen biologischer Makromoleküle, meist Proteinen. In den 80er Jahren entstanden Datenbanken für Nukleotidsequenzen, darunter EMBL Data Library und GenBank, sowie für Aminosäuresequenzen, darunter Protein Information Resource (PIR) und Swiss-Prot.

Die Nukleotidsequenz-Datenbanken der Internationalen Nukleotidsequenz-Datenbank-Zusammenarbeit sind Primärdatenbanken. Das bedeutet, dass sie Originaldaten archivieren, welche Forschende selbst einreichen. UniProt ist ein Zusammenschluss aus PIR und Swiss-Prot. Es stellt von Experten gepflegte und annotierte Proteinsequenzeinträge mit umfangreichen Informationen zu einzelnen Proteinen bereit. Ergänzt werden diese durch automatisch aus der EMBL-Bank translatierte Proteinsequenzen ohne weitere Annotation.

Weitere Datenbanken speichern zum Beispiel wiederkehrende Proteinsequenzmotive wie Pfam, Informationen über Enzyme und biochemische Komponenten wie GeneCards, BRENDA, KEGG LIGAND und ENZYME, Angaben zu Protein-Protein- oder Protein-DNA-Wechselwirkungen wie TRANSFAC, Stoffwechsel- und regulatorische Netzwerke wie KEGG und REACTOME sowie Daten zur Genexpression wie Bgee.

Die Datenbanken wachsen teilweise exponentiell; Ende 2024 gab es über 2.200 einschlägige Datenbanken. Für die Recherche werden daher Meta-Suchmaschinen wie Bioinformatik-Harvester, Entrez und EBI SRS verwendet. Die große Zahl an Datenbanken kann aber zu redundanter und fehleranfälliger Datenhaltung führen. DNA-Sequenzen können außerdem entweder als Fragmente, sogenannte raw reads, oder als vollständig assemblierte Konsensus-Sequenzen vorliegen. Für die Integration sind kontrollierte Vokabulare und Ontologien wichtig. Sie erlauben, Funktionsbezeichnungen über verschiedene biologische Ebenen hinweg einheitlich zuzuordnen.

Analyse von DNA- und Proteinsequenzen

Zu den ersten Bioinformatikanwendungen gehörten DNA-Sequenzanalyse und Sequenzalignment. Bei der Sequenzanalyse werden Muster in Protein- oder DNA-Sequenzen schnell gesucht. Ein Sequenzalignment richtet zwei Sequenzen so gegeneinander aus, dass ihre Übereinstimmung möglichst groß ist. Damit wird untersucht, ob Gene oder Proteine homolog, also miteinander verwandt, sind.

Ist die Übereinstimmung deutlich besser als eine zufällig erwartbare Ähnlichkeit, kann auf Verwandtschaft geschlossen werden. Bei Genen und Proteinen bedeutet Verwandtschaft stets ähnliche Struktur und meist ähnliche Funktion. Deshalb ist der Sequenzvergleich zentral für die Vorhersage unbekannter oder vermuteter Gene sowie ihrer Struktur.

Dynamische Programmierung liefert beim Sequenzvergleich optimale Lösungen. Wegen des hohen Bedarfs an Computerressourcen ist sie bei sehr langen Sequenzen oder sehr großen Datenbanken jedoch kaum praktisch einsetzbar. Heuristische Algorithmen durchsuchen große Datenbanken mit bekannten Sequenzen schneller. Sie garantieren keine optimalen Ergebnisse, sind aber sehr nützlich. Der BLAST-Algorithmus ist für die tägliche Arbeit von Bioinformatikern und Molekularbiologen besonders wichtig. Weitere häufig genutzte Algorithmen sind FASTA, Needleman-Wunsch und Smith-Waterman.

Manchmal werden exakte Übereinstimmungen kurzer Sequenzabschnitte gesucht, etwa Schnittstellen von Restriktionsenzymen in DNA-Sequenzen. Auch Proteinmuster aus der PROSITE-Datenbank können auf diese Weise untersucht werden.

Bei der Genomanalyse werden viele kleine sequenzierte DNA-Bruchstücke mit bioinformatischen Methoden zu einer Gesamtsequenz zusammengesetzt. Für unbekannte DNA-Sequenzen gibt es außerdem Verfahren zur Genvorhersage, auch gene finding oder gene prediction. Dabei kommen statistische Sequenzanalyse, Markow-Ketten und künstliche neuronale Netze zur Mustererkennung zum Einsatz. Aus DNA- und Aminosäuresequenzen lassen sich zudem phylogenetische Bäume erstellen. Sie stellen die evolutionäre Entwicklung heutiger Lebewesen aus meist unbekannten und deshalb hypothetischen Vorfahren dar.

Proteinstrukturen und molekulare Wechselwirkungen

Nachdem vollständige Genome aufgeklärt und umfangreich funktionell analysiert wurden, verlagerte sich ein Schwerpunkt der Bioinformatik auf die Proteomik. Dazu zählen Fragen der Proteinfaltung und Strukturvorhersage. Untersucht wird, welche Sekundär- oder Tertiärstruktur ein Protein bei gegebener Aminosäuresequenz besitzt. Die Sekundärstruktur beschreibt lokale Strukturelemente eines Proteins, die Tertiärstruktur seine räumliche Gesamtform.

Die Strukturbioinformatik untersucht auch Wechselwirkungen von Proteinen mit Liganden. Liganden können Nukleinsäuren, andere Proteine oder kleinere Moleküle sein. Solche Untersuchungen liefern Erkenntnisse für die Grundlagenforschung sowie für Medizin und Pharmazie. Sie können etwa zeigen, wie ein durch Mutation verändertes Protein Körperfunktionen beeinflusst oder wie Medikamente an verschiedenen Proteinen wirken.

Weiterlesen

Wissenschaft Wissenschaft ist die Methodik des überprüfbaren Erkenntnisgewinns. Sie nutzt dazu die Arbeitsmittel Beobachtung, Experiment, Analyse, Theorie, Veröffentlichung, … Systembiologie Das Ziel ist, ein integriertes Bild aller regulatorischen Prozesse über alle Ebenen vom Genom über das Proteom zu den Organellen bis hin zum Verhalten und zur … Proteinstruktur Die Proteinstruktur ist in der Biochemie in verschiedene Strukturebenen gegliedert. Die Einteilung zu einer Hierarchie in Primärstruktur (Aminosäuresequenz) … Genexpression Durch Genexpression wird der Genotyp eines Organismus oder einer Zelle als Phänotyp ausgeprägt. Im engeren Sinn ist Genexpression die Biosynthese von Proteinen … Ontologie (Informatik) Ontologien im Datenmanagement sind meist sprachlich gefasste und formal geordnete Darstellungen einer Menge von Begriffen und der zwischen ihnen bestehenden … Algorithmus Algorithmen bestehen aus endlich vielen, wohldefinierten Einzelschritten. ... Damit können sie zur Ausführung in ein Computerprogramm implementiert, aber auch in … Dynamische Programmierung Dynamische Programmierung ist eine Methode zum algorithmischen Lösen eines Optimierungsproblems durch Aufteilung in Teilprobleme und systematische … String-Matching-Algorithmus In der Informatik sind String-Matching-Algorithmen eine Gruppe von Algorithmen, die das Finden von Textsegmenten in einer Zeichenkette (englisch string) … Künstliches neuronales Netz Ein künstliches neuronales Netz besteht aus mehreren künstlichen Neuronen, die miteinander verbunden sind und in der Regel in Schichten organisiert werden. Im … Phylogenetischer Baum In einem phylogenetischen Baum repräsentiert jeder Knoten mit Nachfahren den „nächsten gemeinsamen Verwandten“ dieser Nachfahren. Die Kantenlänge entspricht …