Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Biostatistik

Zu ihren Aufgaben zählen unter anderem die Planung und Durchführung von Studien sowie die Analyse gewonnener Daten, das heißt die Auswertung zahlenmäßiger …

Inhalt4 Abschnitte
  1. 1. Gegenstand und Aufgaben der Biostatistik
  2. 2. Datenanalyse in den Lebenswissenschaften
  3. 3. Hochdimensionale Daten und wichtige Methoden
  4. 4. Klinische Studien, Ernährung und Prävention

Gegenstand und Aufgaben der Biostatistik

Biostatistik, auch Medizinische Statistik oder häufig Biometrie genannt, ist ein Bereich der Statistik. Sie befasst sich mit Fragen aus der biologischen und medizinischen Forschung sowie aus weiteren Forschungsfeldern zu Lebewesen, etwa dem landwirtschaftlichen Versuchswesen und der statistischen Genetik.

Ihre Aufgaben reichen von der Planung und Durchführung von Studien bis zur Analyse der dabei gewonnenen Daten. Dabei werden zahlenmäßige Beobachtungen mit statistischen Methoden ausgewertet. Biostatistik ist wichtig, weil sie Forschungsergebnisse überprüfbar macht und helfen kann, Entscheidungen in Medizin und Biologie auf Daten zu stützen.

Datenanalyse in den Lebenswissenschaften

Die Bedeutung der Statistik in den Lebenswissenschaften nimmt zu, weil Hochdurchsatzmethoden sehr große Rohdatenmengen erzeugen. Dazu gehören Next Generation Sequencing, Microarrays auf DNA- und RNA-Ebene sowie Massenspektrometrie auf Proteinebene. Solche Daten können nur mit biostatistischen Methoden analysiert werden. Dieser Ansatz wird auch Systembiologie genannt.

Für die Auswertung werden komplexe Verfahren eingesetzt, darunter statistisches maschinelles Lernen mit Künstlichen neuronalen Netzen, Support Vector Machines und Hauptkomponentenanalyse. Klassische statistische Konzepte wie Regression und Korrelation bleiben dabei wichtige Grundlagen.

Eine zentrale Anforderung ist robuste Statistik. Damit sind Methoden gemeint, die gegenüber Ausreißern nicht anfällig sind. Ausreißer sind Messwerte, die durch zufällige Erscheinungen viel zu hoch oder zu niedrig ausfallen. In Genexpressionsdaten treten viele Ausreißer auf; schon ein Staubpartikel auf einem Microarray kann Messungen stark beeinflussen.

Hochdimensionale Daten und wichtige Methoden

Biologische Datensätze sind oft hochdimensional und redundant. Hochdimensional bedeutet hier, dass die Zahl der Beobachtungen n kleiner ist als die Zahl der Prädiktoren k: n<k. Prädiktoren sind Merkmale, die zur Vorhersage oder Einordnung verwendet werden, beispielsweise zur Klassifikation von kranken und nichtkranken Individuen. Redundant bedeutet, dass viele gesammelte Informationen für diese Klassifikation nicht relevant sind.

Bei Multikollinearität ist die Information eines Prädiktors bereits in einem anderen enthalten; beide können stark korreliert sein. Um Datensätze zu verkleinern, ohne wesentliche Informationen zu verlieren, werden Dimensionsreduktionstechniken eingesetzt. Ein Beispiel ist die Hauptkomponentenanalyse.

Klassische Methoden wie lineare und logistische Regression sowie lineare Diskriminanzanalyse sind häufig für niedrigdimensionale Daten entwickelt worden, bei denen n>k gilt. Bei hochdimensionalen Daten können sie ungeeignet sein. So kann eine lineare Regression mit allen Prädiktoren ein hohes Bestimmtheitsmaß R^{2} liefern, obwohl das Modell keine große Vorhersagekraft besitzt. Daher ist bei der Interpretation Vorsicht nötig.

Die Random-Forest-Methode („Zufallswald-Methode“) von Leo Breiman wird zunehmend wichtig. Sie erzeugt zufällige Entscheidungsbäume, die klar interpretierbar sind. Im Unterschied etwa zu Support Vector Machines kann sie klinische Entscheidungen statistisch absichern und unterstützen; außerdem kann die Korrektheit klinischer Entscheidungen mathematisch streng bewiesen werden. Random Forests werden auch in klinischen Entscheidungsunterstützungssystemen verwendet. Ihre Trainingszeit steigt linear mit der Anzahl der Bäume. Da ein Testbeispiel auf jedem Baum einzeln ausgewertet wird, ist diese Auswertung parallelisierbar.

Bei der Gene Set Enrichment Analyse werden Kenntnisse über genregulatorische Netzwerke und biochemische Signalkaskaden in die Analyse einbezogen. Statt einzelne Gene getrennt zu betrachten, kann es sinnvoller sein, die Veränderung ganzer Genmengen zu untersuchen, etwa einer Signalkaskade wie dem Jak-Stat-Signalweg. Dies macht die Analyse robuster: Ein einzelnes falsch positives Gen ist wahrscheinlicher als eine ganze falsch positive Signalkaskade. Für diese Analyse gibt es bioinformatische Tools, darunter GSEA – Gene Set Enrichment Analysis vom Broad Institute. Die Mendelsche Randomisierung ist ein nicht-experimenteller Ansatz, der DNA-Sequenzen nutzt, um kausale Zusammenhänge zu bestimmen.

Klinische Studien, Ernährung und Prävention

In klinischen Studien untersucht die evidenzbasierte Medizin die Wirksamkeit von Medikamenten, Medizinprodukten oder Behandlungsverfahren. Biostatistik ist schon bei der Studienplanung wichtig, beispielsweise bei der Berechnung der Versuchszahl. Idealerweise ist eine Studie doppelblind: Weder Experimentator noch Patient wissen, ob Placebo oder Medikament enthalten sind. Moderne statistische Verfahren können außerdem ermitteln, welcher Patient besonders von welcher Therapie profitieren könnte oder ob eine Therapie überhaupt sinnvoll ist. Durch statistisches Matching lässt sich aus nicht-randomisierten Observationsdaten eine quasi-randomisierte Studie entwickeln.

In der Ernährungsforschung helfen biostatistische Methoden bei Fragen nach der gesundheitlichen Wirkung von Nahrungsmitteln. Untersucht wird zum Beispiel, ob ein bestimmtes Nahrungsmittel mit der Entstehung einer Krankheit verbunden ist oder ob sein Konsum sich positiv auf eine bestimmte Krankheit auswirkt. In Deutschland forscht unter anderem das Deutsche Institut für Ernährungsforschung auf diesem Gebiet.

Auch die Präventivmedizin nutzt Biostatistik. Präventivmedizin ist ein Teilgebiet der Medizin, das Krankheiten verhindern soll, bevor sie entstehen. Biostatistik kann dabei helfen herauszufinden, wie Krankheiten verhindert werden können.

Weiterlesen

Biologie Auf dem Gebiet der Pharmazie werden Medikamente, wie beispielsweise Insulin oder zahlreiche Antibiotika, aus genetisch veränderten Mikroorganismen statt aus … Genetik Der heute weitaus bedeutendste Teilbereich der Genetik ist die Molekulargenetik, die sich mit den molekularen Grundlagen der Vererbung befasst. Aus ihr ging die … Desoxyribonukleinsäure Die Grundbausteine von DNA-Strängen sind vier verschiedene Nukleotide, die jeweils aus einem Phosphatrest, dem Zucker Desoxyribose sowie einer von vier … Protein Proteinquellen · Eier · Fisch · Fleisch · Hülsenfrüchte (Soja, Lupinen ca. 40 %: Bohnen, Linsen, Erbsen, Kichererbsen ca. 20 % bis 25 %) · Milchprodukte (Käse und … Systembiologie Das Ziel ist, ein integriertes Bild aller regulatorischen Prozesse über alle Ebenen vom Genom über das Proteom zu den Organellen bis hin zum Verhalten und zur … Maschinelles Lernen Maschinelles Lernen (ML) entwickelt, untersucht und verwendet statistische Algorithmen, auch Lernalgorithmen genannt. Solche Algorithmen können lernen, … Künstliches neuronales Netz Ein künstliches neuronales Netz besteht aus mehreren künstlichen Neuronen, die miteinander verbunden sind und in der Regel in Schichten organisiert werden. Im … Support Vector Machine Es handelt sich um ein rein mathematisches Verfahren der Mustererkennung, das in Computerprogrammen umgesetzt wird. Der Namensteil machine weist dementsprechend … Hauptkomponentenanalyse Die Hauptkomponentenanalyse (kurz: HKA, englisch Principal Component Analysis, kurz: PCA) – das mathematische Verfahren ist auch als … Regressionsanalyse Die Regressionsanalyse ist ein Instrumentarium statistischer Analyseverfahren, die zum Ziel haben, Beziehungen zwischen einer abhängigen (auch erklärte … Korrelation Die Maßzahlen der Korrelation liegen betragsmäßig meist in einem Bereich von Null (kein Zusammenhang) bis Eins (starker Zusammenhang). · Ein Beispiel für eine … Random Forest Random Forest (deutsch Zufallswald) oder Random Decision Forest ist ein Verfahren, das beim maschinellen Lernen eingesetzt wird. Es handelt sich um eine …