Unicode & UTF-8 – Wenn ASCII nicht reicht
Unicode-Nummern, UTF-8-Bitfolgen und ein Blick in echte Textdateien mit dem Hexeditor.
- Zeichencodierung: Sie verstehen, warum Unicode mit UTF-8 codiert wird.Verstehen
- Zeichencodierung: Sie können ein Unicode-Emoji (z. B. U+F16) in UTF-8 umwandeln: Hexadezimal → Binär (mit Tabelle) Einsetzen ins passende Bitmuster (eine der 4 UTF-8-Varianten)Anwenden
- UTF-8-Praxis: Sie können die UTF-8-Bytes einer eigenen Textdatei mit einem Hexeditor prüfen und Umlaute sowie Emojis darin identifizieren.Analysieren
Überblick
ASCII kennt keine Umlaute und keine Emojis. In diesem Modul lernen Sie mit Unicode den weltweiten Zeichenkatalog und mit UTF-8 die verbreitetste Codierung kennen – und prüfen in der praktischen Übung, was wirklich in einer Textdatei steckt.
Dieses Modul baut auf dem Modul «Zeichencodierung – Wie aus Text Bits werden» auf. Zum Üben liegt das Arbeitsblatt UTF-8 – Zeichen in Bytes bei.
ASCII reicht nicht mehr
Schreiben Sie den Satz «Grüsse aus München! 😊» und versuchen Sie, jedes Zeichen in der ASCII-Tabelle zu finden. Sie scheitern: ä, ü und das Emoji fehlen – die 128 ASCII-Zeichen reichen für die Zeichen der Welt bei weitem nicht aus.
Wie lösen Computer dieses Problem? Genau darum geht es in diesem Modul.
Unicode – ein Katalog für alle Zeichen
Unicode ist ein internationaler Standard, der jedem Zeichen eine eindeutige Nummer zuordnet – Buchstaben vieler Sprachen, mathematische Symbole, Spielkarten, Hieroglyphen und Emojis. Das Unicode-Konsortium pflegt diesen Katalog und erweitert ihn laufend: Version 17 (2025) umfasst 159'801 Zeichen.
| Zeichen | Beschreibung | Unicode-Nummer |
|---|---|---|
| A | Lateinischer Grossbuchstabe A | 65 (U+0041) |
| ä | Kleinbuchstabe a mit Umlaut | 228 (U+00E4) |
| や | Hiragana-Buchstabe Ya (Japanisch) | 12452 (U+3084) |
| ☀ | Sonne mit Strahlen | 9728 (U+2600) |
| 🐒 | Affe | 128018 (U+1F412) |
Wichtig: Unicode sagt nur die Nummer – wie aus der Nummer Bits werden, ist eine separate Frage.
Lokal gespeichert — melde dich an, um Antworten dauerhaft zu sichern.
LoginUTF-8 – die Übersetzung in Bits
UTF-8 ist das heute am weitesten verbreitete Verfahren, um Unicode-Nummern in Bits zu übersetzen. Seine Stärke: Die Zeichengröße ist variabel – häufige Zeichen sparen Platz.
| Zeichen | Nummer | UTF-8-Bitfolge | Bytes |
|---|---|---|---|
| A | 65 | 01000001 | 1 |
| ä | 228 | 11000011 10100100 | 2 |
| ☀ | 9728 | 11100010 10011000 10000000 | 3 |
| 🐒 | 128018 | 11110000 10011111 10010000 10010010 | 4 |
Zwei zentrale Eigenschaften:
- Zeichen 0–127 benötigen 1 Byte, das mit 0 beginnt → UTF-8 ist dort identisch mit ASCII (abwärtskompatibel!).
- Für alles andere werden 2 bis 4 Bytes verwendet – ein Umlaut wie ä ist also nicht «ein Zeichen = ein Byte».
Lokal gespeichert — melde dich an, um Antworten dauerhaft zu sichern.
LoginUTF-8 im Detail: das Präfix-System
Wie weiss der Computer, wie viele Bytes zu einem Zeichen gehören? Über die Bitmuster am Anfang jedes Bytes (Ihr Wissen aus dem Binär-Modul hilft jetzt):
| Unicode-Bereich | Bitmuster | Bytes |
|---|---|---|
| 0 – 127 | 0xxxxxxx | 1 |
| 128 – 2047 | 110xxxxx 10xxxxxx | 2 |
| 2048 – 65535 | 1110xxxx 10xxxxxx 10xxxxxx | 3 |
| ab 65536 | 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx | 4 |
Das erste Byte verrät die Bytetotal-Länge (Anzahl führender 1er), jedes Fortsetzungs-Byte beginnt mit 10. Die x-Stellen werden mit der Binärzahl der Unicode-Nummer aufgefüllt.
Beispiel ä (Nr. 228): 228 = 11100100₂ (8 Bits → 2-Byte-Muster) → 110 + 00011 + 10 + 100100 = 11000011 10100100 – genau wie in der Tabelle oben.
Note
Cheatsheet: UTF-8 von Hand codieren
Vier Schritte – immer gleich, ob Umlaut oder Emoji:
- In Binär umwandeln: Rechne die Unicode-Nummer (Codepoint) ins Binärsystem um.
- Bitmuster wählen: Anhand der Grösse der Zahl entscheiden, wie viele Bytes nötig sind (1–4) – siehe Tabelle oben.
- Von hinten einfügen: Die Binärbits von rechts nach links in die x-Stellen des Musters einsetzen.
- Mit Nullen auffüllen: Die noch leeren vorderen x-Stellen mit 0 füllen.
| Schritt | Beispiel © (U+00A9 = 169) |
|---|---|
| 1. Binär | 169 = 10101001₂ (8 Bits) |
| 2. Muster | 169 ≤ 2047 → 2 Bytes: 110xxxxx 10xxxxxx |
| 3. Einfügen | von rechts: 11000010 10101001 |
| 4. Auffüllen | 11000010 10101001 = C2 A9 ✓ |
Lokal gespeichert — melde dich an, um Antworten dauerhaft zu sichern.
LoginChallenge
⭐ Aufgabe: Ein Emoji in UTF-8
Codieren Sie das Sonnensymbol ☀ (U+2600, Dezimal 9728) in UTF-8 – in 4 Schritten:
- Nummer 9728 in Binär umrechnen (wie viele Bits brauchen Sie?)
- Passendes Bitmuster wählen
- Die Bits der Nummer in die x-Stellen einsetzen
- Ergebnis in Bytes (Binärblöcken) notieren
Lösung: 9728 = 10011000 10000000₂ (16 Bits) → Muster 3: 1110xxxx 10xxxxxx 10xxxxxx → 11100010 10011000 10000000 – genau wie in der UTF-8-Tabelle oben.
Zusatzaufgabe (Rückwärts): Welcher Code steckt in 11110000 10011111 10010000 10010010? Streichen Sie die Präfixe (11110, 10, 10, 10), fassen die restlichen Bits zusammen und rechnen in Dezimal um → 128018 → Zeichen 🐒.
Challenge
Praktische Übung: Ihre Textdatei in Bits
Sie prüfen jetzt selbst, was wirklich in einer Textdatei steckt: Tippen Sie einen kurzen Satz mit einem Umlaut und einem Emoji, speichern Sie ihn als Unicode-Test.txt und öffnen Sie die Datei im Online-Hexeditor HexEd.it.
Checklist
Speicherbedarf abschätzen
Mit UTF-8 können Sie Textgrössen abschätzen – das brauchen Sie auch für die Frage «warum ist die Datei so gross?»:
- Reiner englischer Text (nur ASCII): 1 Zeichen = 1 Byte
- Jeder Umlaut / jedes Emoji: 2–4 Bytes
- Deutscher Text: meist knapp über 1 Byte pro Zeichen im Schnitt
Deshalb ist eine .txt-Datei meist viel kleiner als ein .docx-Dokument mit demselben Text: Word speichert zusätzlich Formatierungen, Bilder und Metadaten in einem Container-Format. Grundlage ist aber immer die Zeichencodierung.
Lokal gespeichert — melde dich an, um Antworten dauerhaft zu sichern.
LoginWarning
Häufige Fehler
- «Unicode und UTF-8 sind dasselbe.» Nein – Unicode ist der Katalog (Nummern), UTF-8 das Übersetzungsverfahren in Bits.
- «ä = 228, also 1 Byte.» Die Nummer 228 stammt aus Unicode; in UTF-8 braucht ä 2 Bytes (
C3 BC). - «Ein Emoji ist immer gleich gross.» UTF-8-Emojis brauchen meist 4 Bytes – egal wie «klein» sie aussehen.
- «Auf allen Handys sieht ein Emoji gleich aus.» Die Nummer ist gleich, aber jede Plattform zeichnet ihr eigenes Emoji-Bild.
Challenge
⭐ Für Schnelle: Der Mojibake-Fall
Sie öffnen eine Webseite und sehen statt «Grüsse» nur «Grüsse». Diese Fehldarstellung heisst Mojibake («Zeichensalat»). Überlegen Sie: Was ist hier passiert, wenn die Bytes C3 BC sind, aber der Browser Latin-1 (1 Byte = 1 Zeichen) annimmt? Welches Zeichen ergibt das Byte C3 in Latin-1?
Reflection
Reflexion
- Was hat Sie am Zusammenspiel von Unicode-Nummer und UTF-8-Bitfolge überrascht?
- Wo sind Ihnen UTF-8 und Codierungsprobleme im Alltag schon begegnet (Webseiten, Dateinamen, Chat-Nachrichten)?
- Wie sicher fühlen Sie sich, ein Zeichen von der Nummer bis zur Bitfolge zu verfolgen? (1 = gar nicht … 5 = sehr)
Quellen & Attribution
- Gymnasium Kirchenfeld — „Unicode / UTF-8 (GYM1, Information und Daten)“ (), CC BY-SA 4.0 (https://creativecommons.org/licenses/by-sa/4.0/) · Lizenzdetails SA
- Gymnasium Kirchenfeld — „Praktische Übung: Textdatei in HexEd.it (GYM1)“ (), CC BY-SA 4.0 (https://creativecommons.org/licenses/by-sa/4.0/) · Lizenzdetails SA
- Computer Science Field Guide (University of Canterbury) — „Data Representation – Text“ (), CC BY-SA 4.0 (https://creativecommons.org/licenses/by-sa/4.0/) · Lizenzdetails SA
- HexEd.it – Online-Hexeditor (Tool) Christian Rusche