Wofür Unicode in Text gedacht ist
Antworten von Schnittstellen und Quelltext enthalten Zeichen häufig als Escape-Sequenz. Hier wird daraus wieder lesbarer Text.
Zum Beispiel
Eingabe \u0047\u0072\u00fc\u00df\u0065, Ergebnis Grüße – fünf Escape-Sequenzen, ein Wort.
Bedienung
- Den Inhalt mit den Escape-Sequenzen einfügen
- Dekodieren lassen; das Ergebnis erscheint im Ausgabefeld
- Bleiben Reste wie \u stehen, liegt meist eine doppelte Maskierung vor (etwa \\u4f60); dann zuerst einen Backslash entfernen
- Den Inhalt prüfen und übernehmen
Zu beachten:Behandelt werden ausschließlich Escape-Sequenzen, keine Kodierungsumstellung – eine Umwandlung zwischen Zeichensätzen gehört nicht dazu. Das Ergebnis wird als Unicode-Codepunkte gelesen, Zeichen außerhalb der BMP werden über Surrogatpaare korrekt zusammengesetzt. Mehrfach maskierte Inhalte wie \u005cu4f60 müssen mehrfach oder von Hand aufgelöst werden.
Die wichtigsten Möglichkeiten
- Unterstützt \uXXXX nach JavaScript-Schreibweise
- Unterstützt hexadezimale Zeichenreferenzen der Form 你
- Unterstützt dezimale Zeichenreferenzen der Form 你
- Gemischt vorkommende Schreibweisen werden in einem Durchgang aufgelöst
Ergänzende Hinweise
Warum bleiben nach dem Zurückwandeln Reste übrig?
Der Inhalt war womöglich mehrfach maskiert; dann ist zuerst eine Ebene Backslash zu entfernen oder zweimal zu dekodieren.
Wird die Form 你 verstanden?
Ja, sowohl hexadezimale als auch dezimale Zeichenreferenzen werden erkannt.
Worin unterscheidet sich das von der URL-Dekodierung?
Die URL-Dekodierung verarbeitet die Form %XX; hier werden die Formen \u und &#; verarbeitet – zwei verschiedene Dinge.
Wird der Text auf einem Server gespeichert?
Nein, dekodiert wird lokal im Browser.
Wofür es verwendet wird
- Zeichenfolgen aus einer Schnittstellenantwort lesbar machen
- Unicode-Escapes in einer Konfigurationsdatei nachsehen
- Im Quelltext hinterlegte Escapes gegen den erwarteten Text prüfen
Verwandte Werkzeuge
Nach der Arbeit mit Unicode in Text folgen meist diese Schritte: