Significado de Unicode
Sustantivo propio masculino. Del inglés unicode, de uni-, «uno», y code, «código».
Unicode es un estándar internacional que asigna un número único a cada carácter, símbolo o signo de cualquier sistema de escritura del mundo, para representarlo del mismo modo en cualquier sistema informático.
No define cómo se guardan esos números en binario dentro de un archivo: esa tarea corresponde a codificaciones concretas construidas sobre Unicode, como UTF-8.
Qué es Unicode
Antes de Unicode, cada región o fabricante tenía su propia tabla de caracteres, pensada casi siempre para un solo idioma o un grupo reducido de ellos. Un mismo número podía representar una letra distinta según qué tabla se usara, lo que hacía muy difícil intercambiar textos entre sistemas o idiomas distintos sin que se corrompieran. Unicode resuelve ese problema creando una única tabla universal: cada carácter posible, de cualquier alfabeto existente, recibe un número (llamado punto de código) que no cambia según el sistema, el idioma o el programa que lo use.
Unicode es, en sí mismo, solo una lista de asignaciones entre caracteres y números: no especifica cómo se convierten esos números en los ceros y unos que realmente se guardan en un archivo. Esa conversión la definen codificaciones construidas sobre Unicode, como UTF-8, que reparten los puntos de código en distintos patrones de bits según convenga a cada uso.
Lo mantiene un consorcio internacional dedicado exclusivamente a ampliar y estandarizar el repertorio de caracteres, y lo usan prácticamente todos los sistemas operativos, navegadores y lenguajes de programación actuales.
Origen de la palabra Unicode
Del inglés unicode, formado por el prefijo uni-, «uno, único», y code, «código», para expresar la idea de un único código de caracteres válido para cualquier idioma, frente a la fragmentación de tablas anteriores.
El proyecto nació hacia finales del siglo XX, impulsado por varias empresas de tecnología que compartían el mismo problema: sus productos necesitaban representar textos en distintos idiomas, pero cada uno usaba tablas de caracteres incompatibles entre sí. El estándar se ha ido ampliando desde entonces, versión tras versión, para incluir cada vez más sistemas de escritura, símbolos técnicos y otros signos que antes quedaban fuera de cualquier tabla informática.
Elementos del estándar Unicode
| Elemento | En qué consiste |
|---|---|
| Punto de código | El número único que Unicode asigna a cada carácter. |
| Plano | Un bloque de puntos de código agrupados, que organiza el repertorio completo por zonas. |
| Forma de codificación | La regla concreta que convierte un punto de código en bits, como UTF-8 o UTF-16. |
| Base de datos de caracteres | La información asociada a cada carácter: su nombre, su categoría y cómo se comporta en un texto. |
Ejemplos de uso de Unicode
Gracias a Unicode, el mismo mensaje de texto puede combinar letras latinas, cirílicas y símbolos matemáticos sin errores.
El desarrollador comprobó que la aplicación soportaba correctamente Unicode antes de lanzarla en varios idiomas.
La base de datos antigua no admitía Unicode completo, así que algunos nombres se guardaban con errores.
Cada emoji tiene asignado su propio punto de código dentro de Unicode.
Actualizaron el sistema a una versión más reciente de Unicode para poder mostrar nuevos símbolos.
Sinónimos y palabras relacionadas
Sinónimos: estándar Unicode, repertorio universal de caracteres.
Antónimos: codificaciones locales o de un solo idioma, como las tablas anteriores a Unicode.
No es lo mismo que:
- UTF-8: Unicode asigna los números a los caracteres; UTF-8 es una de las formas concretas de convertir esos números en bits. Ver significado de codificación de caracteres.
- ASCII: cubre solo 128 caracteres del alfabeto inglés; Unicode incluye ese mismo conjunto y lo amplía a prácticamente cualquier sistema de escritura existente.
- Fuente tipográfica: Unicode define qué carácter representa cada número; la fuente decide cómo se dibuja visualmente ese carácter en la pantalla, un problema distinto.
Preguntas frecuentes sobre Unicode
¿Unicode y UTF-8 son lo mismo?
No. Unicode es la tabla que asigna un número a cada carácter; UTF-8 es una codificación concreta que decide cómo se representan esos números en bits dentro de un archivo o una transmisión de datos.
¿Por qué a veces aparecen cuadros o símbolos raros en lugar de una letra?
Casi siempre porque la fuente tipográfica usada no incluye el dibujo de ese carácter concreto, aunque Unicode sí tenga asignado un número para él; el problema está en la representación visual, no en el estándar.
¿Unicode incluye los emojis?
Sí. Cada emoji tiene asignado su propio punto de código dentro de Unicode, igual que cualquier otra letra o símbolo, y el estándar añade nuevos emojis en versiones sucesivas.