Was ist Unicode? // deutsch the native web GmbH https://www.youtube.com/watch?v=qtYkYEAY100 Transkript (automatisch erstellt) 0:00 hi in der vergangenen woche haben wir uns mit der frage beschäftigt welche programmiersprachen man sich 2021 angucken sollte um als entwicklerin oder 0:09 als entwickler sich eben persönlich weiterentwickeln zu können diese woche widmen wir uns einem thema von dem die meisten entwicklerinnen und 0:16 entwickler wahrscheinlich schon gehört haben bei dem ich aber immer wieder feststelle dass kaum jemand genau weiß was dahinter 0:22 steckt und wie es im detail funktioniert die rede ist von unicode und das ist eigentlich gar nicht so schwierig zu verstehen 0:28 es ist sogar sehr sehr hilfreich wenn man versteht was unicode ist das ist nur eben wie gesagt oft nicht so verbreitet prinzipiell ist es ja erst einmal so 0:35 dass computer ja nur zwei zustände kennen nämlich strohmann und strom aus dass wird dargestellt als eine 1 und eine null also ein steht für strom ist 0:44 an 0 steht für stromes aus und diese information eben eine null oder eins die wird als bezeichnet mehrere bits kann man zusammenfassen in 0:53 größerer einheiten weil einfach nur mit einem einzigen biss zu arbeiten dass etwas los auf dauer und die einheit die mandat verwendet ist dann eben das 1:00 sogenannte byd und ein weit ist die zusammenfassung von 8 bit mit 8 bit war ja jedes bild zwei zustände kennt und 2 x 2 x 2 und so weiter zustände acht mal 1:10 hat man eben 256 mögliche zustände und das ist eine hervorragende möglichkeit in 256 zuständen also in einem weit ein zeichen unterzubringen und dann hat man 1:21 eben 256 verschiedene möglichkeiten welche zeichen man repräsentieren kann und 256 zeichen wird erstmal sehr sehr viel aber man muss ja auch bedenken man 1:31 benötigt großbuchstaben und benötigt kleinbuchstaben und braucht die ziffern es gibt gewisse satzzeichen die man abbilden will und so weiter und so fort 1:38 und ganz ganz wichtig ist natürlich man muss sich darauf einigen welches zeichen durch welche zahl repräsentiert wird also welches muster sozusagen für 1:47 welches zeichen steht und ein solches system für eine abbildung von zahlencodes auf zeichen die hat schon vor vielen jahrzehnten stattgefunden 1:55 das ist nämlich der sogenannte ascii codes der ast sägt ist benannt nach dem american standard code for information interchange das ist er ist nicht danach 2:04 benannt sondern das ist der american standard code for information interchange und wichtig bei dem es dass er aber nicht mit 8 bit arbeitet sondern 2:10 nur mit sie und damit ergeben sich 128 verschiedene möglichkeiten die ersten 32 möglichkeiten also die ersten 32 zeichen 2:20 sozusagen sind reserviert für steuerzeichen da sind so dinge hinterlegt wie der tabulator garriott return leyen kitas gibt das spezielle 2:27 blieb zeichen dass dafür gedacht ist ein piepston über den lautsprecher des pcs auszugeben und dann bleiben eben von den 128 möglichen zeichen nach abzug der 32 2:38 sonderzeichen noch 96 positionen übrig die man dann eben für die verschiedenen buchstaben zu fahren satzzeichen usw verwenden kann und da gibt es also im us 2:48 trikot gewisse standardvorgaben zum beispiel die 65 ist das große a die 97 ist das kleine 32 ist die lehrstelle und so weiter und so fort und 2:58 darauf hat man sich eben geeinigt darauf hat man sich verständigt und damit wurde es dann eben möglich informationen zwischen verschiedenen computersystemen 3:05 und zwischen verschiedenen anwendungen auszutauschen das ist auch so weit erst mal wunderbar allerdings ist das ganze erstmal sehr 3:13 aus einer englischen bzw amerikanischen sicht entwickelt worden und das ist im englischen auch erstmal kein großes problem denn außer den üblichen 26 3:22 buchstaben gibt es keine großartigen weiteren sonderzeichen im englischen insofern kommt man dort mit diesen 96 übrigen zeichen die der us trikot zur 3:30 verfügung stellt wunderbar hin in anderen sprachen sieht das natürlich ein bisschen anders aus und da kann man dann auf die idee zu sagen was ist denn mit 3:39 dem 8 bit eines weiß was ja in den sieben bild von passt sie zunächst mal nicht verwendet worden ist da hat man die idee gehabt durch das 8bit wird ja 3:47 der raum sozusagen von 128 auf die vollen 256 möglichen zeichen erweitert also man erhält noch mal 128 zeichen dazu dass man die länderspezifisch 3:58 belegen könnte und da gibt es dann verschiedene standards ibm unter anderem mit einem solchen standard geschaffen das sogenannte oem charakter sad wo dann 4:06 auch linien zeichnen um zum grammer um tabellen zu zeichnen enthalten sind wo bestimmte box zeichen enthalten sind und kästen zu zeichnen 4:14 und wo eben sonstige sonderzeichen drin sind das problem ist nur dass es diese abbildung für jedes land individuell gibt wäre ja jedes land oder jede 4:23 sprache andere sonderzeichen braut und zb in der in der deutschen oem variante ist man auf die idee gekommen dass der code 129 für das kleine hügel steht im 4:34 griechischen steht genau derselbe code die 129 für das große besser also das sind insofern zwei mal derselbe numerische code aber eben zwei 4:42 unterschiedliche interpretationen und insofern hat eben jeder sprache beziehungsweise jedes land da seine eigene ab bildungs vorschrift noch 4:51 schwieriger wird es bei einigen ländern wie zum beispiel russland wo es nicht nur eine solche abbildungen gibt oder eine variante wie diese oberen 128 4:59 zeichen genutzt werden können sondern direkt mehrere varianten und die asiatischen sprachen sind in dieser hinsicht auch schwierig umzusetzen weil 5:07 asiatische sprachen eben aus einfach weitaus mehr als 128 zeichen bestehen das heißt da ist überhaupt nicht genug platz vorhanden um in 8 bit oder um in 5:16 einem bald alle potenziellen möglichen zeichen einer sprache überhaupt unterzubringen das ganze hat sich damit das nicht ganz 5:23 so ein bürger wird hat sie sich weiterentwickelt zum sogenannten ansi standard und da wurden dann verschiedene code pages definiert für eben 5:29 verschiedene sprachen und dann hat man zum beispiel wenn man deutsch schreiben wollte hat man mit der code page 437 gearbeitet wenn man griechische 5:37 schreiben wollte hat man mit der code page 737 gearbeitet und man musste eben wissen wenn man einen text dokument öffnen wollte zu welcher code page das 5:45 ganze eben passt damit die richtigen zeichen verwendet werden konnten das besondere an diesen cages war dass die ersten 128 zeichen die also den 5:53 sieben bild entsprechen die waren überall gleich weil das die bastille standard entspricht und die 228 zeichen die waren dann eben entsprechend 6:01 individuell verschieden ein großes problem dabei ist dass man nicht gleichzeitig mehrere sprachen verwenden kann weil man ja nur entweder 6:08 die eine oder die andere chor page geladen haben kann weil ich ja ansonsten einem weit sozusagen mehrere bedeutungen gleichzeitig zuordnen können müsste und 6:17 das kann ich dann nicht mehr scheiden oder nicht mehr unterscheiden abhilfe schaffen da gewisse spezial code pages die sozusagen die wichtigsten 6:24 sonderzeichen aus verschiedenen sprachen enthalten aber das gibt es natürlich nicht für jede beliebige sprachkombination und insofern sind 6:32 diese spezial code pages wie der name eben schon sagt relativ selten außerdem lösen die weiterhin nicht das problem der asiatischen sprachen die eben den 6:40 raum sozusagen der mit 8 bit überhaupt abbildbar ist eben weit springen einfach weil sie viel mehr zeichen enthalten als eben in 8 bit abbildend abbildbar wehren 6:49 und in den asiatischen ländern haben sich dann die sogenannten double byd charakters durchgesetzt wo eben ein zeichen nicht nur durch ein byte 6:57 repräsentiert wird sondern je nach zeichen gelegentlich auch durch zwei bald und damit hat man eben den raum den möglichen zeichen vorrat raum sozusagen 7:05 deutlich erweitert und hat eben viel mehr möglichkeiten geschaffen aber diese doppelbett charakters haben natürlich auch ihre probleme 7:13 das ist zum beispiel wenn man durch eine zeichenkette integrieren will sehr sehr einfach das vorwärts zu tun weil man beim parsen ja direkt weiß auch das 1 1 7:20 bei tod oder ein zweiter zeichen ist das erkennt man nämlich am ersten brett wenn man aber durch eine zeichenkette rückwärts durch gehen will dann weiß man 7:27 dass eben nicht das heißt man muss gucken nicht nur was ist das vorige zeichen sondern auch was ist das vor vorige zeichen um dann entscheiden zu 7:34 können ob das vorige zeichen nur die zweite hälfte eines zeichens darstellt oder ob es ein eigenständiges zeichen ist und das macht das ganze eben sehr 7:41 sehr umständlich auch so vermeintlich triviale aufgaben wie zum beispiel die länge eines strings zu bestimmen also aus wie vielen zeichen besteht einen 7:48 string das ist gar nicht so einfach weil man nicht mehr nach der anzahl der beiz gehen kann sondern man muss den stream wirklich zeichen für zeichen für zeichen 7:55 pausen und das ganze ist natürlich auch wieder nicht kompatibel zu den code pages im europäischen raum im amerikanischen raum und so weiter das 8:04 heißt jedes land jede sprache hat er im grunde genommen ihr eigenes vorgehen und um diesen ganzen würde ein ende zu bereiten 8:11 dafür wurde unicode erfunden und wie das funktioniert damit fangen wir an uns morgen zu beschäftigen da gucken wir uns nämlich die codes coins in unicode an 8:19 und das ist die wichtigste grundlage um erstmal zu begreifen wie unicode funktioniert das heißt heute das war vor allem die herleitung was ist die 8:26 motivation hinter unicode wofür braucht man so und damit möchte ich mich für heute auch verabschieden vielen dank dass ihr 8:33 mit dabei gewesen sein ich hoffe euch hat das video gefallen mich würde interessieren was ihr schon für erfahrungen mit unicode gesammelt 8:40 habt oder generell mit solchen encoding ob er gute erfahrungen habt ob die schlechte erfahrungen gemacht habe ob ihr damit schon mal probleme hatte im 8:47 größeren stil schreibt das gerne mal in die kommentare und ansonsten wünsche ich euch einen guten start in die woche abonniert den 8:55 kanal verzehrt das noch nicht gemacht habt denkt dran die glocke zu aktivieren und dann passt auf euch auf bleibt gesund und wir sehen uns morgen wieder 9:00 ciao