Загрузите текстовый файл или вставьте текст для определения его кодировки (UTF-8, UTF-16, ASCII, Windows-1251, ISO-8859-1 и другие).
Что такое Детектор кодировки текстовых файлов?
Этот инструмент анализирует текстовые файлы или вставленный текст для определения используемой кодировки символов. Кодировка символов определяет, как байты сопоставляются с символами (буквами, цифрами, символами). Распространённые кодировки включают UTF-8, UTF-16, ASCII, Windows-1251 (кириллица) и ISO-8859-1 (латиница).
Как это работает в теории: Детектор исследует байтовую последовательность вашего ввода. Он ищет маркеры порядка байтов (BOM), которые указывают на UTF-8, UTF-16 или UTF-32. Проверяет наличие нулевых байтов (обычны для UTF-16/32). Валидирует UTF-8 последовательности согласно спецификации UTF-8. Если все байты находятся в диапазоне 0-127 — это ASCII. Если байты в диапазоне 128-255 и не образуют корректный UTF-8 — вероятно, это однобайтовая кодовая страница, например Windows-1251 или ISO-8859-1. Инструмент предоставляет шестнадцатеричный просмотр для технической проверки.
Это помогает разработчикам, переводчикам и аналитикам данных выявлять проблемы с кодировкой, вызывающие нечитаемый текст (кракозябры).
Как использовать:
- Вариант 1: Нажмите «Выберите файл» и выберите текстовый файл (.txt, .csv, .json, .xml, .html, .css, .js, .py, .log и др.).
- Вариант 2: Вставьте текст непосредственно в текстовое поле.
- Нажмите кнопку «Определить кодировку».
- Посмотрите результаты: размер файла, определённую кодировку(и) и шестнадцатеричный просмотр первых 200 байт.
- Используйте кнопку «Очистить» для сброса всех полей.
Советы: Инструмент может определить несколько возможных кодировок. Если вы видите «UTF-8 с BOM» или «UTF-8 (без BOM)», файл скорее всего в UTF-8. Если вы видите «Windows-1251 / ISO-8859-1 / Другая», файл использует однобайтовую кодировку, распространённую для западных или кириллических языков.