L Lyrnify

Fortschritt im Lernpfad

0 von 10 abgeschlossen (0%)

Unicode & UTF-8 – Wenn ASCII nicht reicht

lock
Bevorstehend

Unicode-Nummern, UTF-8-Bitfolgen und ein Blick in echte Textdateien mit dem Hexeditor.

Ziele dieses Moduls
  • Zeichencodierung: Sie verstehen, warum Unicode mit UTF-8 codiert wird.
    Verstehen
  • Zeichencodierung: Sie können ein Unicode-Emoji (z. B. U+F16) in UTF-8 umwandeln: Hexadezimal → Binär (mit Tabelle) Einsetzen ins passende Bitmuster (eine der 4 UTF-8-Varianten)
    Anwenden
  • UTF-8-Praxis: Sie können die UTF-8-Bytes einer eigenen Textdatei mit einem Hexeditor prüfen und Umlaute sowie Emojis darin identifizieren.
    Analysieren

Überblick

ASCII kennt keine Umlaute und keine Emojis. In diesem Modul lernen Sie mit Unicode den weltweiten Zeichenkatalog und mit UTF-8 die verbreitetste Codierung kennen – und prüfen in der praktischen Übung, was wirklich in einer Textdatei steckt.

Dieses Modul baut auf dem Modul «Zeichencodierung – Wie aus Text Bits werden» auf. Zum Üben liegt das Arbeitsblatt UTF-8 – Zeichen in Bytes bei.

ASCII reicht nicht mehr

Schreiben Sie den Satz «Grüsse aus München! 😊» und versuchen Sie, jedes Zeichen in der ASCII-Tabelle zu finden. Sie scheitern: ä, ü und das Emoji fehlen – die 128 ASCII-Zeichen reichen für die Zeichen der Welt bei weitem nicht aus.

Wie lösen Computer dieses Problem? Genau darum geht es in diesem Modul.

Unicode – ein Katalog für alle Zeichen

Unicode ist ein internationaler Standard, der jedem Zeichen eine eindeutige Nummer zuordnet – Buchstaben vieler Sprachen, mathematische Symbole, Spielkarten, Hieroglyphen und Emojis. Das Unicode-Konsortium pflegt diesen Katalog und erweitert ihn laufend: Version 17 (2025) umfasst 159'801 Zeichen.

ZeichenBeschreibungUnicode-Nummer
ALateinischer Grossbuchstabe A65 (U+0041)
äKleinbuchstabe a mit Umlaut228 (U+00E4)
やHiragana-Buchstabe Ya (Japanisch)12452 (U+3084)
☀Sonne mit Strahlen9728 (U+2600)
🐒Affe128018 (U+1F412)

Wichtig: Unicode sagt nur die Nummer – wie aus der Nummer Bits werden, ist eine separate Frage.

Antwort wird geladen...

Lokal gespeichert — melde dich an, um Antworten dauerhaft zu sichern.

Login

UTF-8 – die Übersetzung in Bits

UTF-8 ist das heute am weitesten verbreitete Verfahren, um Unicode-Nummern in Bits zu übersetzen. Seine Stärke: Die Zeichengröße ist variabel – häufige Zeichen sparen Platz.

ZeichenNummerUTF-8-BitfolgeBytes
A65010000011
ä22811000011 101001002
☀972811100010 10011000 100000003
🐒12801811110000 10011111 10010000 100100104

Zwei zentrale Eigenschaften:

  • Zeichen 0–127 benötigen 1 Byte, das mit 0 beginnt → UTF-8 ist dort identisch mit ASCII (abwärtskompatibel!).
  • Für alles andere werden 2 bis 4 Bytes verwendet – ein Umlaut wie ä ist also nicht «ein Zeichen = ein Byte».
Antwort wird geladen...

Lokal gespeichert — melde dich an, um Antworten dauerhaft zu sichern.

Login

UTF-8 im Detail: das Präfix-System

Wie weiss der Computer, wie viele Bytes zu einem Zeichen gehören? Über die Bitmuster am Anfang jedes Bytes (Ihr Wissen aus dem Binär-Modul hilft jetzt):

Unicode-BereichBitmusterBytes
0 – 1270xxxxxxx1
128 – 2047110xxxxx 10xxxxxx2
2048 – 655351110xxxx 10xxxxxx 10xxxxxx3
ab 6553611110xxx 10xxxxxx 10xxxxxx 10xxxxxx4

Das erste Byte verrät die Bytetotal-Länge (Anzahl führender 1er), jedes Fortsetzungs-Byte beginnt mit 10. Die x-Stellen werden mit der Binärzahl der Unicode-Nummer aufgefüllt.

Beispiel ä (Nr. 228): 228 = 11100100₂ (8 Bits → 2-Byte-Muster) → 110 + 00011 + 10 + 100100 = 11000011 10100100 – genau wie in der Tabelle oben.

Note

Cheatsheet: UTF-8 von Hand codieren

Vier Schritte – immer gleich, ob Umlaut oder Emoji:

  1. In Binär umwandeln: Rechne die Unicode-Nummer (Codepoint) ins Binärsystem um.
  2. Bitmuster wählen: Anhand der Grösse der Zahl entscheiden, wie viele Bytes nötig sind (1–4) – siehe Tabelle oben.
  3. Von hinten einfügen: Die Binärbits von rechts nach links in die x-Stellen des Musters einsetzen.
  4. Mit Nullen auffüllen: Die noch leeren vorderen x-Stellen mit 0 füllen.
Schritt Beispiel © (U+00A9 = 169)
1. Binär 169 = 10101001₂ (8 Bits)
2. Muster 169 ≤ 2047 → 2 Bytes: 110xxxxx 10xxxxxx
3. Einfügen von rechts: 11000010 10101001
4. Auffüllen 11000010 10101001 = C2 A9 ✓

Antwort wird geladen...

Lokal gespeichert — melde dich an, um Antworten dauerhaft zu sichern.

Login

Challenge

⭐ Aufgabe: Ein Emoji in UTF-8

Codieren Sie das Sonnensymbol ☀ (U+2600, Dezimal 9728) in UTF-8 – in 4 Schritten:

  1. Nummer 9728 in Binär umrechnen (wie viele Bits brauchen Sie?)
  2. Passendes Bitmuster wählen
  3. Die Bits der Nummer in die x-Stellen einsetzen
  4. Ergebnis in Bytes (Binärblöcken) notieren

Lösung: 9728 = 10011000 10000000₂ (16 Bits) → Muster 3: 1110xxxx 10xxxxxx 10xxxxxx → 11100010 10011000 10000000 – genau wie in der UTF-8-Tabelle oben.

Zusatzaufgabe (Rückwärts): Welcher Code steckt in 11110000 10011111 10010000 10010010? Streichen Sie die Präfixe (11110, 10, 10, 10), fassen die restlichen Bits zusammen und rechnen in Dezimal um → 128018 → Zeichen 🐒.

Challenge

Praktische Übung: Ihre Textdatei in Bits

Sie prüfen jetzt selbst, was wirklich in einer Textdatei steckt: Tippen Sie einen kurzen Satz mit einem Umlaut und einem Emoji, speichern Sie ihn als Unicode-Test.txt und öffnen Sie die Datei im Online-Hexeditor HexEd.it.

Checklist

0/4

Speicherbedarf abschätzen

Mit UTF-8 können Sie Textgrössen abschätzen – das brauchen Sie auch für die Frage «warum ist die Datei so gross?»:

  • Reiner englischer Text (nur ASCII): 1 Zeichen = 1 Byte
  • Jeder Umlaut / jedes Emoji: 2–4 Bytes
  • Deutscher Text: meist knapp über 1 Byte pro Zeichen im Schnitt

Deshalb ist eine .txt-Datei meist viel kleiner als ein .docx-Dokument mit demselben Text: Word speichert zusätzlich Formatierungen, Bilder und Metadaten in einem Container-Format. Grundlage ist aber immer die Zeichencodierung.

Antwort wird geladen...

Lokal gespeichert — melde dich an, um Antworten dauerhaft zu sichern.

Login

Warning

Häufige Fehler

  • «Unicode und UTF-8 sind dasselbe.» Nein – Unicode ist der Katalog (Nummern), UTF-8 das Übersetzungsverfahren in Bits.
  • «ä = 228, also 1 Byte.» Die Nummer 228 stammt aus Unicode; in UTF-8 braucht ä 2 Bytes (C3 BC).
  • «Ein Emoji ist immer gleich gross.» UTF-8-Emojis brauchen meist 4 Bytes – egal wie «klein» sie aussehen.
  • «Auf allen Handys sieht ein Emoji gleich aus.» Die Nummer ist gleich, aber jede Plattform zeichnet ihr eigenes Emoji-Bild.

Challenge

⭐ Für Schnelle: Der Mojibake-Fall

Sie öffnen eine Webseite und sehen statt «Grüsse» nur «Grüsse». Diese Fehldarstellung heisst Mojibake («Zeichensalat»). Überlegen Sie: Was ist hier passiert, wenn die Bytes C3 BC sind, aber der Browser Latin-1 (1 Byte = 1 Zeichen) annimmt? Welches Zeichen ergibt das Byte C3 in Latin-1?

Reflection

Reflexion

  • Was hat Sie am Zusammenspiel von Unicode-Nummer und UTF-8-Bitfolge überrascht?
  • Wo sind Ihnen UTF-8 und Codierungsprobleme im Alltag schon begegnet (Webseiten, Dateinamen, Chat-Nachrichten)?
  • Wie sicher fühlen Sie sich, ein Zeichen von der Nummer bis zur Bitfolge zu verfolgen? (1 = gar nicht … 5 = sehr)

Quellen & Attribution

  • Gymnasium Kirchenfeld — „Unicode / UTF-8 (GYM1, Information und Daten)“ (), CC BY-SA 4.0 (https://creativecommons.org/licenses/by-sa/4.0/) · Lizenzdetails SA
  • Gymnasium Kirchenfeld — „Praktische Übung: Textdatei in HexEd.it (GYM1)“ (), CC BY-SA 4.0 (https://creativecommons.org/licenses/by-sa/4.0/) · Lizenzdetails SA
  • Computer Science Field Guide (University of Canterbury) — „Data Representation – Text“ (), CC BY-SA 4.0 (https://creativecommons.org/licenses/by-sa/4.0/) · Lizenzdetails SA
  • HexEd.it – Online-Hexeditor (Tool) Christian Rusche