Подбор кодировки для текстового файла

Загрузите текстовый файл или вставьте текст для определения его кодировки (UTF-8, UTF-16, ASCII, Windows-1251, ISO-8859-1 и другие).

Что такое Детектор кодировки текстовых файлов?

Этот инструмент анализирует текстовые файлы или вставленный текст для определения используемой кодировки символов. Кодировка символов определяет, как байты сопоставляются с символами (буквами, цифрами, символами). Распространённые кодировки включают UTF-8, UTF-16, ASCII, Windows-1251 (кириллица) и ISO-8859-1 (латиница).

Как это работает в теории: Детектор исследует байтовую последовательность вашего ввода. Он ищет маркеры порядка байтов (BOM), которые указывают на UTF-8, UTF-16 или UTF-32. Проверяет наличие нулевых байтов (обычны для UTF-16/32). Валидирует UTF-8 последовательности согласно спецификации UTF-8. Если все байты находятся в диапазоне 0-127 — это ASCII. Если байты в диапазоне 128-255 и не образуют корректный UTF-8 — вероятно, это однобайтовая кодовая страница, например Windows-1251 или ISO-8859-1. Инструмент предоставляет шестнадцатеричный просмотр для технической проверки.

Это помогает разработчикам, переводчикам и аналитикам данных выявлять проблемы с кодировкой, вызывающие нечитаемый текст (кракозябры).

Как использовать:

  1. Вариант 1: Нажмите «Выберите файл» и выберите текстовый файл (.txt, .csv, .json, .xml, .html, .css, .js, .py, .log и др.).
  2. Вариант 2: Вставьте текст непосредственно в текстовое поле.
  3. Нажмите кнопку «Определить кодировку».
  4. Посмотрите результаты: размер файла, определённую кодировку(и) и шестнадцатеричный просмотр первых 200 байт.
  5. Используйте кнопку «Очистить» для сброса всех полей.

Советы: Инструмент может определить несколько возможных кодировок. Если вы видите «UTF-8 с BOM» или «UTF-8 (без BOM)», файл скорее всего в UTF-8. Если вы видите «Windows-1251 / ISO-8859-1 / Другая», файл использует однобайтовую кодировку, распространённую для западных или кириллических языков.

Leave a Reply