Informatik Grundlagen – Textkodierung ASCII und Unicode
Karteikarten zum Thema „Informatik“ · 14 Karten · von atrio. Beispiele: Wie viele Bit verwendet der ursprüngliche ASCII-Standard pro Zeichen? · Welche Zeiche…
Karten
14 KartenWie viele Bit verwendet der ursprüngliche ASCII-Standard pro Zeichen?
Rückseite
ASCII nutzt 7 Bit pro Zeichen und kodiert damit 128 Zeichen (0–127), darunter 95 druckbare und 33 Steuerzeichen.
Welche Zeichen sind im ASCII-Bereich 0–31 und 127 definiert?
Rückseite
Das sind Steuerzeichen wie NUL (0), LF (10), CR (13) und DEL (127), die Gerätesteuerung und Textformatierung regeln, keine druckbaren Symbole.
Was ist der grundlegende Unterschied zwischen ASCII und Unicode?
Rückseite
ASCII deckt 128 Zeichen für englischen Text ab, Unicode weist jedem Zeichen weltweit einen eindeutigen Codepoint (bis 0x10FFFF) zu – über 1,1 Millionen mögliche Zeichen.
Was bezeichnet der Begriff Codepoint in Unicode?
Rückseite
Ein Codepoint ist eine abstrakte Zahl (z. B. U+0041 für 'A'), die ein Zeichen identifiziert, unabhängig von seiner konkreten Byte-Darstellung in einer Kodierung.
Wie viele Ebenen (Planes) definiert Unicode und wie groß ist jede?
Rückseite
Unicode definiert 17 Ebenen (Plane 0–16), jede mit 65.536 Codepoints (2^16), insgesamt 1.114.112 mögliche Codepoints (0x0000–0x10FFFF).
Was ist die Basic Multilingual Plane (BMP) und welchen Bereich deckt sie ab?
Rückseite
Die BMP (Plane 0) umfasst Codepoints U+0000 bis U+FFFF und enthält die meisten gebräuchlichen Zeichen aller modernen Schriftsysteme.
Wie kodiert UTF-8 Codepoints der BMP (U+0000 bis U+FFFF)?
Rückseite
UTF-8 nutzt 1 bis 3 Bytes: ASCII (U+0000–U+007F) bleibt 1 Byte (0xxxxxxx), U+0080–U+07FF wird 2 Byte, U+0800–U+FFFF wird 3 Byte.
Welches Bitmuster kennzeichnet ein 1-Byte-UTF-8-Zeichen?
Rückseite
1-Byte-Sequenzen beginnen mit 0 (0xxxxxxx) und sind identisch mit ASCII – das höchste Bit ist immer 0, die unteren 7 Bit tragen den Codepoint.
Wie erkennt man das erste Byte einer 2-Byte-UTF-8-Sequenz?
Rückseite
Das Lead-Byte beginnt mit 110 (110xxxxx), gefolgt von einem Trail-Byte mit 10 (10xxxxxx) – zusammen kodieren sie 11 Bit des Codepoints.
Welches Bitmuster haben Lead- und Trail-Bytes bei 3-Byte-UTF-8-Sequenzen?
Rückseite
Lead-Byte: 1110xxxx, zwei Trail-Bytes: je 10xxxxxx – zusammen 16 Bit für Codepoints U+0800 bis U+FFFF (z. B. chinesische Zeichen).
Für welche Codepoints wird 4-Byte-UTF-8 benötigt und wie sieht das Muster aus?
Rückseite
Codepoints U+10000 bis U+10FFFF (Supplementary Planes) nutzen 4 Byte: Lead 11110xxx, drei Trail-Bytes 10xxxxxx – insgesamt 21 Bit Payload.
Was ist der Byte Order Mark (BOM) und welchen Codepoint hat er?
Rückseite
Der BOM (U+FEFF) steht am Dateianfang und signalisiert die Byte-Reihenfolge: EF BB BF für UTF-8, FE FF für UTF-16BE, FF FE für UTF-16LE.
Was ist der Unterschied zwischen Big-Endian und Little-Endian bei UTF-16?
Rückseite
Big-Endian speichert das höherwertige Byte zuerst (Netzwerkstandard), Little-Endian das niedrigwertige zuerst (x86-Prozessoren) – der BOM klärt die Reihenfolge.
Warum ist UTF-8 abwärtskompatibel zu ASCII?
Rückseite
Alle ASCII-Zeichen (0–127) werden in UTF-8 exakt als einzelnes Byte mit führender 0 kodiert – jede ASCII-Datei ist damit valides UTF-8.