文本文件编码检测器 – 识别字符编码格式

上传文本文件或粘贴文本以检测其字符编码(UTF-8、UTF-16、ASCII、Windows-1251、ISO-8859-1 等)。

什么是文本文件编码检测器?

该工具分析文本文件或粘贴的文本,以识别所使用的字符编码。字符编码定义了字节如何映射到字符(字母、数字、符号)。常见的编码包括 UTF-8、UTF-16、ASCII、Windows-1251(西里尔文)和 ISO-8859-1(拉丁文)。

理论工作原理: 检测器检查输入的字节序列。它查找指示 UTF-8、UTF-16 或 UTF-32 的字节顺序标记(BOM)。检查空字节(常见于 UTF-16/32)。根据 UTF-8 规范验证 UTF-8 字节序列。如果所有字节都在 0-127 范围内,则为 ASCII。如果字节在 128-255 范围内且不构成有效的 UTF-8,则编码可能是单字节代码页,如 Windows-1251 或 ISO-8859-1。该工具提供十六进制预览以供技术验证。

这有助于开发人员、翻译人员和数据分析师识别导致乱码(mojibake)的编码问题。

使用方法:

  1. 选项1: 点击”选择文件”并选择一个文本文件(.txt、.csv、.json、.xml、.html、.css、.js、.py、.log 等)。
  2. 选项2: 直接在文本区域中粘贴文本。
  3. 点击 “检测编码” 按钮。
  4. 查看结果:文件大小、检测到的编码以及前200字节的十六进制预览。
  5. 使用 “清空” 按钮重置所有字段。

提示: 该工具可能检测到多种可能的编码。如果您看到”UTF-8 带 BOM”或”UTF-8(无 BOM)”,文件很可能是 UTF-8。如果您看到”Windows-1251 / ISO-8859-1 / 其他”,文件使用的是西方语言或西里尔语言常见的单字节编码。

Leave a Reply