Zum Hauptinhalt springen
8 Leitfäden & Referenzen 5 Kodierungsstandards 6 Interaktive Werkzeuge

Unicode- & Text-Leitfäden für Entwickler

Praktische Entwickler-Leitfäden zu Unicode, Textkodierung, Codepunkten, Graphem-Clustern und Zeichenverarbeitung.

Entwickler-Leitfäden durchsuchen

Nach Aufgabe beginnen

Konkrete Programmierherausforderungen in Textverarbeitung, Zeichenzählung und Konvertierung lösen.

Graphemes

Measure String & Emoji Length Accurately

Why "👨‍👩‍👧‍👦".length is 11 in JavaScript, and how to use Intl.Segmenter or Array.from for true grapheme cluster counts.

RegExp

Validate Text & Match Emoji in Regex

Using \p{Extended_Pictographic} and \p{L} with the ES2024 /v flag to safely match international alphabets and emoji.

UTF-8

Inspect UTF-8 Byte Serialization

Understand the 1-to-4 byte allocation, continuation byte bitmasks (10xxxxxx), and variable-length bit distribution.

WHATWG URL

Encode URL Query Parameters Correctly

Component vs fragment percent-encoding, space as %20 vs +, and preventing double-encoding vulnerabilities.

HTML Entities

Escape Characters in HTML & XML

When to use named entities vs hex numeric character references, and how to escape ampersands without breaking entities.

Surrogates

Handle UTF-16 Surrogate Pairs

How characters outside the BMP (U+10000..U+10FFFF) are encoded as high (D800..DBFF) and low (DC00..DFFF) surrogates.

CSS

Insert Special Characters in CSS

Using backslash hex escapes in CSS content: "..." properties, handling trailing space delimiters, and fallback fonts.

UAX #15

Compare & Normalize Unicode Strings

Resolve visual duplicates: NFC vs NFD, canonical equivalence (é as U+00E9 vs e + U+0301), and secure identifier storage.

Leitfäden nach Programmiersprache

Sprachspezifische String-Architekturen, Laufzeitmethoden und die Vermeidung von Unicode-Fallstricken.

Unicode- & Textverarbeitungskonzepte

Grundlegende Architektur hinter Zeichendarstellungen, Segmentierung und Äquivalenz.

Kodierungs- & Serialisierungsreferenzen

Normative Byte-Level-Spezifikationen für moderne Web- und Anwendungskommunikation.

Entwickler-Werkzeuge

Interaktive Werkzeuge zum Prüfen von Zeichen, Normalisieren von Strings und Konvertieren von Escapesequenzen.

Autoritative Standards & Quellenherkunft

Die gesamte technische Dokumentation, Codebeispiele und Kodierungstabellen auf CopyCharacter werden gegen normative Spezifikationen des Unicode-Konsortiums (Unicode 17.0), der WHATWG URL- und HTML-Living-Standards, ECMAScript (ECMA-262) und des World Wide Web Consortium (W3C) verifiziert.