Aller au contenu principal
8 Guides et références 5 Normes d'encodage 6 Outils interactifs

Guides Unicode et texte pour développeurs

Guides pratiques pour développeurs sur Unicode, l'encodage du texte, les points de code, les clusters de graphèmes, l'échappement et la gestion des caractères dans les langages de programmation.

Rechercher dans les guides pour développeurs

Parcourir par tâche

Résolvez des défis de programmation concrets en traitement de texte, comptage de caractères et conversions.

Graphemes

Measure String & Emoji Length Accurately

Why "👨‍👩‍👧‍👦".length is 11 in JavaScript, and how to use Intl.Segmenter or Array.from for true grapheme cluster counts.

RegExp

Validate Text & Match Emoji in Regex

Using \p{Extended_Pictographic} and \p{L} with the ES2024 /v flag to safely match international alphabets and emoji.

UTF-8

Inspect UTF-8 Byte Serialization

Understand the 1-to-4 byte allocation, continuation byte bitmasks (10xxxxxx), and variable-length bit distribution.

WHATWG URL

Encode URL Query Parameters Correctly

Component vs fragment percent-encoding, space as %20 vs +, and preventing double-encoding vulnerabilities.

HTML Entities

Escape Characters in HTML & XML

When to use named entities vs hex numeric character references, and how to escape ampersands without breaking entities.

Surrogates

Handle UTF-16 Surrogate Pairs

How characters outside the BMP (U+10000..U+10FFFF) are encoded as high (D800..DBFF) and low (DC00..DFFF) surrogates.

CSS

Insert Special Characters in CSS

Using backslash hex escapes in CSS content: "..." properties, handling trailing space delimiters, and fallback fonts.

UAX #15

Compare & Normalize Unicode Strings

Resolve visual duplicates: NFC vs NFD, canonical equivalence (é as U+00E9 vs e + U+0301), and secure identifier storage.

Guides par langage de programmation

Architectures de chaînes, comportement à l'exécution et pièges Unicode propres à chaque langage.

Concepts Unicode et traitement du texte

Architecture fondamentale régissant les représentations de caractères, la segmentation et l'équivalence.

Références d'encodage et de sérialisation

Spécifications normatives au niveau des octets pour la communication web et applicative moderne.

Outils pour développeurs

Postes de travail interactifs pour inspecter des caractères, normaliser des chaînes et convertir des séquences d'échappement.

Normes faisant autorité et provenance des sources

Toute la documentation technique, les extraits de code et les tableaux d'encodage de CopyCharacter sont vérifiés par rapport aux spécifications normatives du Consortium Unicode (Unicode 17.0), des standards vivants URL et HTML du WHATWG, d'ECMAScript (ECMA-262) et du World Wide Web Consortium (W3C).