Ce que fait cet outil
La taille du texte calcule exactement l'espace occupé par votre texte, en octets, kilo-octets et caractères, en utilisant le codage UTF-8, la norme pour le Web et la plupart des systèmes modernes. C'est l'outil dont vous avez besoin lorsqu'une limite est mesurée en octets plutôt qu'en caractères, ce qui est plus courant que prévu.
Pourquoi les octets diffèrent des caractères
En UTF-8, tous les caractères ne font pas un octet. Les lettres et les chiffres en anglais simple occupent chacun un octet. Ainsi, pour un texte simple, le nombre d'octets correspond au nombre de caractères. Mais les lettres accentuées prennent deux octets, de nombreux symboles et caractères non latins en prennent deux ou trois, et les emoji peuvent en prendre quatre. Cela signifie qu’une chaîne de 100 caractères peut faire bien plus de 100 octets. Lorsqu'un système mesure une limite en octets, compter les caractères vous induira en erreur, cet outil affiche la taille réelle des octets.
Quand la taille des octets compte
Les champs de base de données sont souvent définis avec des limites d'octets, de sorte qu'une valeur qui correspond à des caractères peut toujours être rejetée pour avoir dépassé la limite d'octets. Certaines API et protocoles mesurent les charges utiles en octets. Les messages SMS, les budgets de taille de fichier et certains champs de formulaire se soucient tous des octets. Les développeurs qui vérifient si une valeur correspond à une colonne ou si une charge utile est inférieure à une limite de taille ont besoin du nombre d'octets et non du nombre de caractères.
Lire le résultat
L'outil affiche trois nombres mis à jour au fur et à mesure que vous tapez : le nombre total d'octets sous UTF-8, l'équivalent en kilo-octets pour un texte plus volumineux et le nombre de caractères bruts à des fins de comparaison. Lorsque le nombre d'octets et de caractères divergent, cet écart correspond au contenu non-ASCII de votre texte, aux accents, aux symboles et aux emoji qui occupent chacun plus d'un octet. Tout est calculé dans votre navigateur, de sorte que même les textes sensibles restent sur votre appareil.
Caractères contre octets
Un caractère et un octet ne sont pas toujours la même chose. En ASCII simple, un caractère équivaut à un octet, mais en UTF-8, l'encodage standard du Web, les lettres accentuées, les emoji et les caractères non latins prennent chacun deux, trois ou quatre octets. Cet outil mesure à la fois : le nombre de caractères et la taille réelle en octets sous UTF-8. La différence est importante chaque fois qu'une limite est définie en octets plutôt qu'en caractères, ce qui est plus courant que ce à quoi la plupart des gens s'attendent.
Pourquoi la taille des octets est importante
Les champs de base de données sont souvent dimensionnés en octets, de sorte qu'une limite VARCHAR peut être atteinte avec moins de caractères que prévu si le texte contient des caractères multi-octets. Les charges utiles du réseau, les limites de taille des messages et les quotas de stockage sont mesurés en octets. Certaines API limitent le corps des requêtes en fonction de la taille en octets. Si vous avez déjà vu un texte rejeté parce qu'il était "trop long" alors que le nombre de caractères semblait correct, les caractères multi-octets et une limite basée sur les octets en étaient probablement la cause. Mesurer la taille des octets à l’avance évite cette surprise.
UTF-8 et caractères multi-octets
UTF-8 code les lettres et les chiffres latins de base dans un seul octet chacun, de sorte que le texte anglais brut a un nombre de caractères et d'octets égal. Mais «é» fait deux octets, de nombreux caractères asiatiques font trois octets et les emoji en font généralement quatre. Ainsi, une chaîne de 100 caractères peut contenir entre 100 et 400 octets selon son contenu. Cet outil affiche la taille exacte en octets, la taille en kilo-octets et le nombre de caractères ensemble, afin que vous puissiez voir précisément comment votre texte se mesure par rapport à n'importe quelle limite, qu'elle soit définie en caractères ou en octets.