Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Optische Notenerkennung

Das Ziel ist es, aus einem vorliegenden Notentext die Noten in einer maschinenverständlichen Form zu extrahieren, so dass sie in verschiedene Formate exportiert …

Inhalt5 Abschnitte
  1. 1. Begriff und Bedeutung
  2. 2. OMR und OCR: ein grundlegender Unterschied
  3. 3. Verfahren und Entwicklung der Modelle
  4. 4. Ausgaben, Datensätze und Forschungsprojekte
  5. 5. Geschichte und verfügbare Software

Begriff und Bedeutung

Optische Notenerkennung (englisch Optical Music Recognition, OMR) ist ein Forschungsfeld, das das computergestützte Lesen musikalischer Notenschrift in Dokumenten untersucht. Ziel ist, aus einem vorhandenen Notentext die Noten in maschinenverständlicher Form zu extrahieren. Die Ergebnisse können anschließend beispielsweise als MIDI-Datei wiedergegeben oder mit MusicXML erneut gesetzt werden.

OMR steht in Verbindung mit maschinellem Sehen, Dokumentenanalyse und Music Information Retrieval. In der musikalischen Praxis dient es als Eingabemethode für Noten in den Computer und erleichtert das Bearbeiten, Transkribieren und Komponieren. Bibliotheken können Notenarchive durchsuchbar machen; außerdem ermöglicht OMR musikwissenschaftliche Studien im großen Rahmen zu geringeren Kosten.

OMR wurde früher teilweise als optische Zeichenerkennung (Optical Character Recognition, OCR) und als „Music OCR“ bezeichnet. Wegen der grundlegenden Unterschiede zwischen Text- und Musiknotation sollte man diese Begriffe jedoch nicht vermischen und die Bezeichnung „Music OCR“ vermeiden.

OMR und OCR: ein grundlegender Unterschied

Musiknotation ist ein konfiguratives Schreibsystem. Die Bedeutung hängt nicht nur von den einzelnen Symbolen ab, etwa Notenköpfen, Notenhälsen oder Fähnchen, sondern vor allem davon, wie diese Symbole auf den Notenzeilen platziert sind. Zweidimensionale Beziehungen und der Kontext sind daher entscheidend. Text kann dagegen üblicherweise als eindimensionaler Informationsfluss entlang einer Textlinie verstanden werden; geringfügige Abweichungen von dieser Linie verändern seine Bedeutung meist nicht.

Auch die erwartete Ausgabe unterscheidet sich. Ein OCR-System endet normalerweise bei der Erkennung von Buchstaben und Wörtern. Ein OMR-System muss zusätzlich die musikalische Semantik rekonstruieren. Aus einem gefüllten Notenkopf und einem angehängten Notenhals muss es beispielsweise ableiten, dass eine Note mit einer bestimmten Dauer gemeint ist. Grafische Eigenschaften wie Position und Symbolart müssen in musikalische Konzepte wie Tonhöhe und Notendauer übersetzt werden. Ein vergleichbarer Schritt fehlt bei der Texterkennung; die Anforderung wäre ungefähr so, als sollte OCR aus dem Screenshot einer Webseite den HTML-Quellcode rekonstruieren.

Ein weiterer Unterschied ist der Zeichensatz. Musiknotation umfasst Symbole mit sehr unterschiedlichen Größen, von kleinen Punkten bis zu Klammern, die eine ganze Seite überspannen können. Binde- und Phrasierungsbögen besitzen außerdem eine nahezu unbeschränkte Darstellungsart: Sie können als mehr oder weniger glatte Kurven auftreten und beliebig unterbrochen sein.

Verfahren und Entwicklung der Modelle

Die Erkennung erfolgt gewöhnlich in mehreren Teilschritten mit Algorithmen aus der Mustererkennung. Viele Ansätze verwenden eine Pipeline, in der jeder Schritt eine bestimmte Aufgabe übernimmt, etwa das Erkennen und Entfernen der Notenlinien vor den folgenden Verarbeitungsschritten. Ein Nachteil ist die Fehlerfortpflanzung: Werden Notenzeilen am Anfang übersehen, können spätere Schritte diesen Bildbereich ebenfalls ignorieren und eine unvollständige Ausgabe erzeugen.

Bei einem perfekten Scan gedruckter Noten können relativ einfache Verfahren wie Projektionen oder Pattern Matching (Mustervergleich) die visuelle Erkennung unterstützen. Niedrige Scanqualität macht die Aufgabe deutlich schwieriger. Die Erkennung handschriftlicher Noten stellt eine besondere Herausforderung dar, an der fast alle Systeme scheitern. Selbst bei perfekter visueller Erkennung bleibt die Rekonstruktion der musikalischen Bedeutung schwierig, weil Notation mehrdeutig sein kann und musikalische Werke die Regeln der Notenschrift häufig verletzen.

David Bainbridge und Tim Bell veröffentlichten 2001 einen Überblick über die damalige Forschung und leiteten daraus ein generelles Modell mit vier Schritten ab. Dieses Modell wurde zur Vorlage für zahlreiche Systeme. Die vier Schritte befassten sich hauptsächlich mit der visuellen Erkennung; die Erkennung der musikalischen Semantik wurde in wissenschaftlichen Arbeiten häufig nicht beschrieben, weil sie vom jeweiligen Ausgabeformat abhängt.

Ana Rebelo et al. schlugen 2012 nach einer weiteren Untersuchung ein verfeinertes Modell mit vier Hauptbestandteilen vor: Vorverarbeitung, Musiksymbolerkennung, Rekonstruktion der Musiknotation und Konstruktion der finalen Repräsentation. Dieses Modell wurde zum de-facto Standard der OMR und wird weiterhin verwendet, teilweise unter leicht abweichenden Bezeichnungen. 2019 war die Veröffentlichung die am häufigsten zitierte Publikation.

Seit dem Aufkommen von Deep Learning ab 2016 ersetzen maschinelle Lernverfahren zunehmend händisch entwickelte Heuristiken und Merkmale. Die Notenzeilenverarbeitung, die Musiksymbolerkennung und die Rekonstruktion der Musiknotation machten dadurch signifikante Fortschritte. Sequenz-zu-Sequenz-Modelle versuchen teilweise, OMR direkt durchzuführen: Sie wandeln ein Notenbild unmittelbar in eine vereinfachte Sequenz erkannter Noten um.

Ausgaben, Datensätze und Forschungsprojekte

OMR-Systeme erzeugen häufig eine Version der Noten, die akustisch wiedergegeben werden kann. Dafür wird meist eine MIDI-Datei erstellt, die mithilfe eines Synthesizers in eine Audiodatei umgewandelt werden kann. MIDI speichert jedoch keine vollständige Information über den visuellen Notensatz, also darüber, wie die Noten konkret angeordnet waren.

Soll eine Ausgabe gedruckt und von Menschen gut gelesen werden können, müssen auch präzise Layoutinformationen des Notensatzes rekonstruiert werden. Dafür eignen sich MEI und MusicXML. Für andere Zwecke, etwa die Extraktion von Metainformationen oder das bloße Durchsuchbarmachen eines Dokuments, kann ein geringeres Verständnis der Noten ausreichen.

Die Entwicklung von OMR-Systemen hängt stark von den verwendeten Datensätzen ab. Ein ausreichend großer und vielfältiger Datensatz hilft, Systeme für unterschiedliche Eingaben zu entwickeln. Die Veröffentlichung solcher Datensätze kann wegen des Urheberrechts an Musiknoten schwierig sein. Das OMR Dataset Projekt sammelte und überblickte unter anderem CVC-MUSCIMA, MUSCIMA++, DeepScores, PrIMuS, HOMUS, den SEILS-Datensatz und die Universal Music Symbol Sammlung.

Ein Wettbewerb zur Notenzeilenerkennung sollte vor 2016 die Erkennung und Entfernung der Notenlinien verbessern. Nachdem sehr gute Ergebnisse erreicht worden waren und moderne Ansätze häufig keine ausdrückliche Notenzeilenerkennung mehr benötigen, wurde der Wettbewerb nicht weitergeführt. Ein wichtiges Ergebnis war der frei verfügbare CVC-MUSCIMA-Datensatz mit 1000 hochwertigen Bildern handgeschriebener Noten. 50 Musiker transkribierten jeweils eine Seite aus 20 unterschiedlichartigen musikalischen Werken. MUSCIMA++ ist eine Weiterentwicklung und enthält für 140 ausgewählte Seiten zusätzliche detaillierte Annotationen.

Das Projekt Single Interface for Music Score Searching and Analysis (SIMSSA) soll große Mengen elektronischer Noten effizient durchsuchbar machen und gilt als vermutlich größtes Forschungsprojekt der optischen Notenerkennung. Zu seinen erfolgreich abgeschlossenen Unterprojekten zählen das Liber-Usualis-Projekt und das Cantus-Ultimus-Projekt. Das internationale Projekt Towards Richer Online Music Public-Domain Archives (TROMPA) verfolgt ebenfalls das Ziel, gemeinfreie digitale Musikressourcen zugänglicher zu machen.

Geschichte und verfügbare Software

Die Forschung zur optischen Notenerkennung begann in den späten 1960er-Jahren am MIT, als Scanner für Forschungszwecke erschwinglicher wurden. Wegen des begrenzten Arbeitsspeichers konnten die ersten Versuche nur wenige Takte verarbeiten. 1971 veröffentlichte David Prerau den ersten digitalen Scan von Musiknoten. 1984 entwickelte eine Forschungsgruppe der Waseda-Universität den spezialisierten Roboter WABOT (WAseda roBOT), der gedruckte Noten lesen und einen Sänger auf einer elektrischen Orgel begleiten konnte. 1991 entstand mit MIDISCAN, heute SmartScore, die erste kommerzielle Lösung der Musitek Corporation. Smartphones mit geeigneten Kameras und ausreichender Rechenleistung ermöglichten später mobile OMR-Anwendungen, die aufgenommene Fotos direkt auf dem Gerät verarbeiten.

Von zahlreichen wissenschaftlichen OMR-Projekten wurden nur wenige so weit entwickelt, dass sie Anwendern zur Verfügung gestellt werden konnten. Zu den akademischen beziehungsweise quelloffenen Systemen zählen Aruspix, Audiveris, CANTOR, Gamera, DMOS, OpenOMR und Rodan.

Viele kommerzielle Desktopanwendungen der letzten 20 Jahre verschwanden wegen mangelnden kommerziellen Erfolgs wieder vom Markt. Einige wenige Anbieter entwickeln, warten und verkaufen weiterhin OMR-Produkte. Behauptungen über Erkennungsraten von nahezu 100 % sind kaum vergleichbar, weil die Kriterien dafür unbekannt sind. Mobile Projekte wurden eingestellt oder seit 2017 nicht mehr aktualisiert; OMR-Anwendungen für iPhone und iPad sind beziehungsweise waren im Apple Store verfügbar.

Genannt werden unter anderem capella-scan, ForteScan Light beziehungsweise ScanScore, MIDI-Connections Scan, MP Scan, NoteScan, OMeR, PDFtoMusic, PhotoScore, Scorscan, SharpEye, VivaldiScan und SmartScore. SmartScore wurde früher als MIDISCAN verkauft; die Light-Version von PhotoScore wird in Sibelius verwendet, und mehrere Produkte verwenden das SharpEye SDK.

Weiterlesen