Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).
Was ist Unicode? // deutsch
Das Wichtigste aus dem Video
Tipp auf eine Zeit – das Video springt genau dorthin.
Transkriptautomatisch erstellt · 68 Zeilen
- hi in der vergangenen woche haben wir uns mit der frage beschäftigt welche programmiersprachen man sich 2021 angucken sollte um als entwicklerin oder
- als entwickler sich eben persönlich weiterentwickeln zu können diese woche widmen wir uns einem thema von dem die meisten entwicklerinnen und
- entwickler wahrscheinlich schon gehört haben bei dem ich aber immer wieder feststelle dass kaum jemand genau weiß was dahinter
- steckt und wie es im detail funktioniert die rede ist von unicode und das ist eigentlich gar nicht so schwierig zu verstehen
- es ist sogar sehr sehr hilfreich wenn man versteht was unicode ist das ist nur eben wie gesagt oft nicht so verbreitet prinzipiell ist es ja erst einmal so
- dass computer ja nur zwei zustände kennen nämlich strohmann und strom aus dass wird dargestellt als eine 1 und eine null also ein steht für strom ist
- an 0 steht für stromes aus und diese information eben eine null oder eins die wird als bezeichnet mehrere bits kann man zusammenfassen in
- größerer einheiten weil einfach nur mit einem einzigen biss zu arbeiten dass etwas los auf dauer und die einheit die mandat verwendet ist dann eben das
- sogenannte byd und ein weit ist die zusammenfassung von 8 bit mit 8 bit war ja jedes bild zwei zustände kennt und 2 x 2 x 2 und so weiter zustände acht mal
- hat man eben 256 mögliche zustände und das ist eine hervorragende möglichkeit in 256 zuständen also in einem weit ein zeichen unterzubringen und dann hat man
- eben 256 verschiedene möglichkeiten welche zeichen man repräsentieren kann und 256 zeichen wird erstmal sehr sehr viel aber man muss ja auch bedenken man
- benötigt großbuchstaben und benötigt kleinbuchstaben und braucht die ziffern es gibt gewisse satzzeichen die man abbilden will und so weiter und so fort
- und ganz ganz wichtig ist natürlich man muss sich darauf einigen welches zeichen durch welche zahl repräsentiert wird also welches muster sozusagen für
- welches zeichen steht und ein solches system für eine abbildung von zahlencodes auf zeichen die hat schon vor vielen jahrzehnten stattgefunden
- das ist nämlich der sogenannte ascii codes der ast sägt ist benannt nach dem american standard code for information interchange das ist er ist nicht danach
- benannt sondern das ist der american standard code for information interchange und wichtig bei dem es dass er aber nicht mit 8 bit arbeitet sondern
- nur mit sie und damit ergeben sich 128 verschiedene möglichkeiten die ersten 32 möglichkeiten also die ersten 32 zeichen
- sozusagen sind reserviert für steuerzeichen da sind so dinge hinterlegt wie der tabulator garriott return leyen kitas gibt das spezielle
- blieb zeichen dass dafür gedacht ist ein piepston über den lautsprecher des pcs auszugeben und dann bleiben eben von den 128 möglichen zeichen nach abzug der 32
- sonderzeichen noch 96 positionen übrig die man dann eben für die verschiedenen buchstaben zu fahren satzzeichen usw verwenden kann und da gibt es also im us
- trikot gewisse standardvorgaben zum beispiel die 65 ist das große a die 97 ist das kleine 32 ist die lehrstelle und so weiter und so fort und
- darauf hat man sich eben geeinigt darauf hat man sich verständigt und damit wurde es dann eben möglich informationen zwischen verschiedenen computersystemen
- und zwischen verschiedenen anwendungen auszutauschen das ist auch so weit erst mal wunderbar allerdings ist das ganze erstmal sehr
- aus einer englischen bzw amerikanischen sicht entwickelt worden und das ist im englischen auch erstmal kein großes problem denn außer den üblichen 26
- buchstaben gibt es keine großartigen weiteren sonderzeichen im englischen insofern kommt man dort mit diesen 96 übrigen zeichen die der us trikot zur
- verfügung stellt wunderbar hin in anderen sprachen sieht das natürlich ein bisschen anders aus und da kann man dann auf die idee zu sagen was ist denn mit
- dem 8 bit eines weiß was ja in den sieben bild von passt sie zunächst mal nicht verwendet worden ist da hat man die idee gehabt durch das 8bit wird ja
- der raum sozusagen von 128 auf die vollen 256 möglichen zeichen erweitert also man erhält noch mal 128 zeichen dazu dass man die länderspezifisch
- belegen könnte und da gibt es dann verschiedene standards ibm unter anderem mit einem solchen standard geschaffen das sogenannte oem charakter sad wo dann
- auch linien zeichnen um zum grammer um tabellen zu zeichnen enthalten sind wo bestimmte box zeichen enthalten sind und kästen zu zeichnen
- und wo eben sonstige sonderzeichen drin sind das problem ist nur dass es diese abbildung für jedes land individuell gibt wäre ja jedes land oder jede
- sprache andere sonderzeichen braut und zb in der in der deutschen oem variante ist man auf die idee gekommen dass der code 129 für das kleine hügel steht im
- griechischen steht genau derselbe code die 129 für das große besser also das sind insofern zwei mal derselbe numerische code aber eben zwei
- unterschiedliche interpretationen und insofern hat eben jeder sprache beziehungsweise jedes land da seine eigene ab bildungs vorschrift noch
- schwieriger wird es bei einigen ländern wie zum beispiel russland wo es nicht nur eine solche abbildungen gibt oder eine variante wie diese oberen 128
- zeichen genutzt werden können sondern direkt mehrere varianten und die asiatischen sprachen sind in dieser hinsicht auch schwierig umzusetzen weil
- asiatische sprachen eben aus einfach weitaus mehr als 128 zeichen bestehen das heißt da ist überhaupt nicht genug platz vorhanden um in 8 bit oder um in
- einem bald alle potenziellen möglichen zeichen einer sprache überhaupt unterzubringen das ganze hat sich damit das nicht ganz
- so ein bürger wird hat sie sich weiterentwickelt zum sogenannten ansi standard und da wurden dann verschiedene code pages definiert für eben
- verschiedene sprachen und dann hat man zum beispiel wenn man deutsch schreiben wollte hat man mit der code page 437 gearbeitet wenn man griechische
- schreiben wollte hat man mit der code page 737 gearbeitet und man musste eben wissen wenn man einen text dokument öffnen wollte zu welcher code page das
- ganze eben passt damit die richtigen zeichen verwendet werden konnten das besondere an diesen cages war dass die ersten 128 zeichen die also den
- sieben bild entsprechen die waren überall gleich weil das die bastille standard entspricht und die 228 zeichen die waren dann eben entsprechend
- individuell verschieden ein großes problem dabei ist dass man nicht gleichzeitig mehrere sprachen verwenden kann weil man ja nur entweder
- die eine oder die andere chor page geladen haben kann weil ich ja ansonsten einem weit sozusagen mehrere bedeutungen gleichzeitig zuordnen können müsste und
- das kann ich dann nicht mehr scheiden oder nicht mehr unterscheiden abhilfe schaffen da gewisse spezial code pages die sozusagen die wichtigsten
- sonderzeichen aus verschiedenen sprachen enthalten aber das gibt es natürlich nicht für jede beliebige sprachkombination und insofern sind
- diese spezial code pages wie der name eben schon sagt relativ selten außerdem lösen die weiterhin nicht das problem der asiatischen sprachen die eben den
- raum sozusagen der mit 8 bit überhaupt abbildbar ist eben weit springen einfach weil sie viel mehr zeichen enthalten als eben in 8 bit abbildend abbildbar wehren
- und in den asiatischen ländern haben sich dann die sogenannten double byd charakters durchgesetzt wo eben ein zeichen nicht nur durch ein byte
- repräsentiert wird sondern je nach zeichen gelegentlich auch durch zwei bald und damit hat man eben den raum den möglichen zeichen vorrat raum sozusagen
- deutlich erweitert und hat eben viel mehr möglichkeiten geschaffen aber diese doppelbett charakters haben natürlich auch ihre probleme
- das ist zum beispiel wenn man durch eine zeichenkette integrieren will sehr sehr einfach das vorwärts zu tun weil man beim parsen ja direkt weiß auch das 1 1
- bei tod oder ein zweiter zeichen ist das erkennt man nämlich am ersten brett wenn man aber durch eine zeichenkette rückwärts durch gehen will dann weiß man
- dass eben nicht das heißt man muss gucken nicht nur was ist das vorige zeichen sondern auch was ist das vor vorige zeichen um dann entscheiden zu
- können ob das vorige zeichen nur die zweite hälfte eines zeichens darstellt oder ob es ein eigenständiges zeichen ist und das macht das ganze eben sehr
- sehr umständlich auch so vermeintlich triviale aufgaben wie zum beispiel die länge eines strings zu bestimmen also aus wie vielen zeichen besteht einen
- string das ist gar nicht so einfach weil man nicht mehr nach der anzahl der beiz gehen kann sondern man muss den stream wirklich zeichen für zeichen für zeichen
- pausen und das ganze ist natürlich auch wieder nicht kompatibel zu den code pages im europäischen raum im amerikanischen raum und so weiter das
- heißt jedes land jede sprache hat er im grunde genommen ihr eigenes vorgehen und um diesen ganzen würde ein ende zu bereiten
- dafür wurde unicode erfunden und wie das funktioniert damit fangen wir an uns morgen zu beschäftigen da gucken wir uns nämlich die codes coins in unicode an
- und das ist die wichtigste grundlage um erstmal zu begreifen wie unicode funktioniert das heißt heute das war vor allem die herleitung was ist die
- motivation hinter unicode wofür braucht man so und damit möchte ich mich für heute auch verabschieden vielen dank dass ihr
- mit dabei gewesen sein ich hoffe euch hat das video gefallen mich würde interessieren was ihr schon für erfahrungen mit unicode gesammelt
- habt oder generell mit solchen encoding ob er gute erfahrungen habt ob die schlechte erfahrungen gemacht habe ob ihr damit schon mal probleme hatte im
- größeren stil schreibt das gerne mal in die kommentare und ansonsten wünsche ich euch einen guten start in die woche abonniert den
- kanal verzehrt das noch nicht gemacht habt denkt dran die glocke zu aktivieren und dann passt auf euch auf bleibt gesund und wir sehen uns morgen wieder
- ciao
Zum Nachlesen
UTF-8UTF-8 (Abkürzung für 8-Bit UCS Transformation Format, wobei UCS wiederum Universal Coded Character Set abkürzt) ist die am weitesten verbreitete Kodierung …
American Standard Code for Information InterchangeDer American Standard Code for Information Interchange (ASCII, alternativ US-ASCII, ausgesprochen [ˈæski], deutsch „Amerikanischer Standard-Code für den …
ZeichenkodierungEine Zeichenkodierung (englisch character encoding, kurz encoding) erlaubt die eindeutige Zuordnung von Schriftzeichen (i. A. Buchstaben oder Ziffern) und …
Unicode[ ˈjuːnikoːt]) legt fest, wie Schrift elektronisch gespeichert werden kann, z. B. auf einem Computer oder Telefon. Der durch den Standard festgelegte …