Envie um arquivo de texto ou cole texto para detectar sua codificação de caracteres (UTF-8, UTF-16, ASCII, Windows-1251, ISO-8859-1 e mais).
O que é o Detector de Codificação de Arquivos de Texto?
Esta ferramenta analisa arquivos de texto ou texto colado para identificar a codificação de caracteres utilizada. A codificação de caracteres define como os bytes são mapeados para caracteres (letras, números, símbolos). As codificações comuns incluem UTF-8, UTF-16, ASCII, Windows-1251 (cirílico) e ISO-8859-1 (latino).
Como funciona na teoria: O detector examina a sequência de bytes da sua entrada. Ele procura marcas de ordem de byte (BOM) que indicam UTF-8, UTF-16 ou UTF-32. Verifica a presença de bytes nulos (comuns em UTF-16/32). Valida sequências de bytes UTF-8 de acordo com a especificação UTF-8. Se todos os bytes estão no intervalo 0-127, é ASCII. Se os bytes estão no intervalo 128-255 e não formam UTF-8 válido, a codificação é provavelmente uma página de código de byte único como Windows-1251 ou ISO-8859-1. A ferramenta fornece uma visualização hexadecimal para verificação técnica.
Isso ajuda desenvolvedores, tradutores e analistas de dados a identificar problemas de codificação que causam texto ilegível (mojibake).
Como usar:
- Opção 1: Clique em “Escolher arquivo” e selecione um arquivo de texto (.txt, .csv, .json, .xml, .html, .css, .js, .py, .log, etc.).
- Opção 2: Cole texto diretamente na área de texto.
- Clique no botão “Detectar Codificação”.
- Visualize os resultados: tamanho do arquivo, codificação(ões) detectada(s) e uma visualização hexadecimal dos primeiros 200 bytes.
- Use o botão “Limpar” para redefinir todos os campos.
Dicas: A ferramenta pode detectar múltiplas codificações possíveis. Se você vir “UTF-8 com BOM” ou “UTF-8 (sem BOM)”, o arquivo é provavelmente UTF-8. Se você vir “Windows-1251 / ISO-8859-1 / Outro”, o arquivo usa uma codificação de byte único comum para idiomas ocidentais ou cirílicos.