Was dieses Tool macht
Textgröße berechnet mithilfe der UTF-8-Kodierung, dem Standard für das Web und die meisten modernen Systeme, genau, wie viel Platz Ihr Text in Bytes, Kilobytes und Zeichen einnimmt. Es ist das Tool, das Sie benötigen, wenn ein Grenzwert in Bytes und nicht in Zeichen gemessen wird, was häufiger vorkommt, als man erwartet.
Warum sich Bytes von Zeichen unterscheiden
In UTF-8 besteht nicht jedes Zeichen aus einem Byte. Einfache englische Buchstaben und Ziffern belegen jeweils ein Byte, sodass bei einfachem Text die Byteanzahl mit der Zeichenanzahl übereinstimmt. Aber Buchstaben mit Akzent benötigen zwei Bytes, viele Symbole und nicht-lateinische Zeichen zwei oder drei und Emojis auch vier. Dies bedeutet, dass eine Zeichenfolge mit 100 Zeichen weit über 100 Bytes lang sein kann. Wenn ein System eine Grenze in Bytes misst, führt Sie das Zählen der Zeichen in die Irre. Dieses Tool zeigt die tatsächliche Bytegröße an.
Wenn die Bytegröße wichtig ist
Datenbankfelder werden oft mit Byte-Grenzwerten definiert, sodass ein Wert, der als Zeichen passt, trotzdem abgelehnt werden kann, weil er die Byte-Grenze überschreitet. Einige APIs und Protokolle messen Nutzlasten in Bytes. Bei SMS-Nachrichten, Dateigrößenbudgets und bestimmten Formularfeldern kommt es alle auf Bytes an. Entwickler, die prüfen, ob ein Wert in eine Spalte passt oder ob eine Nutzlast unter einer Größenbeschränkung liegt, benötigen die Anzahl der Bytes, nicht die Anzahl der Zeichen.
Das Ergebnis lesen
Das Tool zeigt drei Zahlen an, die während der Eingabe aktualisiert werden: die Gesamtbytes unter UTF-8, das Äquivalent in Kilobytes für größeren Text und die Anzahl der einfachen Zeichen zum Vergleich. Wenn die Byte- und Zeichenanzahl voneinander abweichen, handelt es sich bei dieser Lücke um den Nicht-ASCII-Inhalt Ihres Textes, die Akzente, Symbole und Emojis, die jeweils mehr als ein Byte beanspruchen. Alles wird in Ihrem Browser berechnet, sodass auch vertraulicher Text auf Ihrem Gerät bleibt.
Zeichen versus Bytes
Ein Zeichen und ein Byte sind nicht immer dasselbe. Im einfachen ASCII-Format ist ein Zeichen ein Byte, aber in UTF-8, der Standardkodierung des Webs, benötigen Akzentbuchstaben, Emojis und nicht-lateinische Zeichen jeweils zwei, drei oder vier Bytes. Dieses Tool misst beides: die Zeichenanzahl und die wahre Größe in Bytes unter UTF-8. Der Unterschied ist immer dann von Bedeutung, wenn ein Grenzwert in Bytes und nicht in Zeichen definiert wird, was häufiger vorkommt, als die meisten Leute erwarten.
Warum die Bytegröße wichtig ist
Die Größe von Datenbankfeldern wird oft in Bytes angegeben, sodass eine VARCHAR-Grenze durch weniger Zeichen als erwartet erreicht werden kann, wenn der Text Multibyte-Zeichen enthält. Netzwerknutzlasten, Nachrichtengrößenbeschränkungen und Speicherkontingente werden in Bytes gemessen. Einige APIs begrenzen Anforderungstexte nach Bytegröße. Wenn Ihr Text jemals abgelehnt wurde, weil er „zu lang“ war, obwohl die Zeichenanzahl in Ordnung schien, waren wahrscheinlich Multibyte-Zeichen und eine bytebasierte Begrenzung die Ursache. Durch die vorherige Messung der Bytegröße wird diese Überraschung vermieden.
UTF-8- und Multibyte-Zeichen
UTF-8 kodiert die grundlegenden lateinischen Buchstaben und Ziffern jeweils in einem einzigen Byte, sodass einfacher englischer Text die gleiche Zeichen- und Byteanzahl aufweist. Aber „é“ besteht aus zwei Bytes, viele asiatische Zeichen sind drei Bytes und Emojis sind normalerweise vier Bytes. Eine Zeichenfolge mit 100 Zeichen kann also je nach Inhalt zwischen 100 und 400 Bytes lang sein. Dieses Tool zeigt die genaue Bytegröße, die Kilobytegröße und die Zeichenanzahl zusammen an, sodass Sie genau sehen können, wie Ihr Text mit jedem Grenzwert übereinstimmt, unabhängig davon, ob er in Zeichen oder Bytes definiert ist.