Wofür Text in Unicode gedacht ist
Für Konfigurationsdateien, die nur ASCII zulassen, wird Text hier in Escape-Sequenzen übersetzt.
Funktionen
- Jedes Zeichen wird als \uXXXX ausgegeben
- Zeichen außerhalb der BMP, etwa Emoji, erscheinen als korrektes Surrogatpaar aus zwei \u
- Die Ausgabe lässt sich unmittelbar in eine JavaScript-Zeichenkette einfügen
- Umgewandelt wird lokal, der Inhalt verlässt das Gerät nicht
Typische Anwendungen: Zeichen in eine Konfiguration schreiben, die nur ASCII zulässt, Im Quelltext Zeichenketten erzeugen, die nicht versehentlich verändert werden, Inhalte für die Übertragung zwischen Systemen als reines ASCII aufbereiten.
Arbeitsschritte
- Den umzuwandelnden Text einfügen
- Kodieren lassen und die Sequenz übernehmen
- Das Ergebnis vollständig in den Quelltext oder die Konfiguration einfügen
- Erwartet die Zielumgebung die Form &#x, muss sie entsprechend ersetzt werden
Zum Beispiel
Grüße hinein → \u0047\u0072\u00fc\u00df\u0065 (eine Sequenz je Zeichen).
Grenzen und Voraussetzungen
Ausgegeben wird nach UTF-16-Codeeinheiten: Zeichen innerhalb der BMP ergeben ein einzelnes \uXXXX, Zeichen außerhalb – etwa Emoji – ein Paar aus zwei \u. Das entspricht der tatsächlichen Speicherung in JavaScript-Zeichenketten. HTML-Zeichenreferenzen der Form &#x sowie Base64- oder Prozentkodierung werden nicht erzeugt.
Häufige Fragen
Warum belegt ein Emoji zwei \u-Sequenzen?Emoji liegen in der Unicode-Ergänzungsebene und werden in UTF-16 als Surrogatpaar gespeichert; ausgegeben werden deshalb zwei \uXXXX – dasselbe Verhalten wie in JavaScript.
Lässt sich die Form &#x ausgeben?Nein, ausgegeben wird die Form \u. Brauchen Sie HTML-Zeichenreferenzen, ändern Sie das Format selbst.
Lässt sich das Ergebnis direkt verwenden?Ja, eine Zeichenkette in der Form \u ist in JavaScript ein gewöhnliches Zeichenketten-Literal.
Wird lange eingefügter Text nach außen gegeben?Nein, umgewandelt wird lokal.
Kombinierbar mit
Diese Werkzeuge werden häufig zusammen mit Text in Unicode verwendet: