Detector de Codificación de Archivos de Texto – Identifica la Codificación de Caracteres

Sube un archivo de texto o pega texto para detectar su codificación de caracteres (UTF-8, UTF-16, ASCII, Windows-1251, ISO-8859-1 y más).

¿Qué es el Detector de Codificación de Archivos de Texto?

Esta herramienta analiza archivos de texto o texto pegado para identificar la codificación de caracteres utilizada. La codificación de caracteres define cómo se asignan los bytes a caracteres (letras, números, símbolos). Las codificaciones comunes incluyen UTF-8, UTF-16, ASCII, Windows-1251 (cirílico) e ISO-8859-1 (latino).

Cómo funciona en teoría: El detector examina la secuencia de bytes de su entrada. Busca marcas de orden de bytes (BOM) que indican UTF-8, UTF-16 o UTF-32. Verifica la presencia de bytes nulos (comunes en UTF-16/32). Valida secuencias de bytes UTF-8 según la especificación UTF-8. Si todos los bytes están en el rango 0-127, es ASCII. Si los bytes están en el rango 128-255 y no forman UTF-8 válido, la codificación es probablemente una página de códigos de byte único como Windows-1251 o ISO-8859-1. La herramienta proporciona una vista previa hexadecimal para verificación técnica.

Esto ayuda a desarrolladores, traductores y analistas de datos a identificar problemas de codificación que causan texto ilegible (mojibake).

Cómo usar:

  1. Opción 1: Haz clic en «Elegir archivo» y selecciona un archivo de texto (.txt, .csv, .json, .xml, .html, .css, .js, .py, .log, etc.).
  2. Opción 2: Pega texto directamente en el área de texto.
  3. Haz clic en el botón «Detectar Codificación».
  4. Visualiza los resultados: tamaño del archivo, codificación(es) detectada(s) y una vista previa hexadecimal de los primeros 200 bytes.
  5. Usa el botón «Limpiar» para reiniciar todos los campos.

Consejos: La herramienta puede detectar múltiples codificaciones posibles. Si ves «UTF-8 con BOM» o «UTF-8 (sin BOM)», el archivo es probablemente UTF-8. Si ves «Windows-1251 / ISO-8859-1 / Otro», el archivo usa una codificación de byte único común para idiomas occidentales o cirílicos.

Leave a Reply