
Ett 16-bitars kodningsschema kallas UTF-16 (Unicode Transformation Format-16). Det är en av de teckenkodningar som ingår i Unicode-standarden och som gör det möjligt att representera text från nästan alla skriftsystem i världen.
UTF-16 kodar varje tecken med hjälp av en eller två 16-bitars kodenheter, alltså två eller fyra byte. De flesta vanliga tecken – exempelvis latinska bokstäver, grekiska, kyrilliska och de östasiatiska skrifterna – ryms inom Unicode-blocket Basic Multilingual Plane (BMP) och representeras med en enda 16-bitarsenhet. Mer sällsynta tecken, som vissa historiska skrifter, specialsymboler och emojis, kodas däremot med så kallade surrogatpar, det vill säga två på varandra följande 16-bitarsenheter.
UTF-16 används bland annat internt i flera operativsystem och programmeringsmiljöer, till exempel Windows API och Java, där den länge har varit den naturliga representationen av text.
En annan central Unicode-kodning är UTF-8 (Unicode Transformation Format-8). Till skillnad från UTF-16 är UTF-8 en kodning med variabel längd: varje tecken representeras av en till fyra byte, beroende på tecknets kodpunkt. ASCII-tecken tar bara en byte, vilket gör UTF-8 särskilt effektivt för texter som övervägande består av latinska bokstäver.
UTF-8 är idag det absolut vanligaste teckenkodningsschemat på internet och stöds av alla moderna webbläsare och operativsystem. Över 98 procent av alla webbsidor kodas numera i UTF-8.
Kort svarat kallas ett 16-bitars kodningsschema UTF-16. Kodningen bygger på 16-bitarsenheter och hanterar såväl vanliga som mer ovanliga tecken genom surrogatpar. För webben är dock UTF-8, med sin variabla längd på en till fyra byte, det helt dominerande valet – tack vare kompatibiliteten med ASCII och det breda stödet i alla moderna system.
Hälsa och Sjukdom © https://www.sjukdom.online