Détecteur d’Encodage de Fichiers Texte – Identifiez l’Encodage des Caractères

Téléchargez un fichier texte ou collez du texte pour détecter son encodage de caractères (UTF-8, UTF-16, ASCII, Windows-1251, ISO-8859-1 et plus).

Qu'est-ce que le Détecteur d'Encodage de Fichiers Texte ?

Cet outil analyse des fichiers texte ou du texte collé pour identifier l'encodage de caractères utilisé. L'encodage de caractères définit comment les octets sont mappés aux caractères (lettres, chiffres, symboles). Les encodages courants incluent UTF-8, UTF-16, ASCII, Windows-1251 (cyrillique) et ISO-8859-1 (latin).

Comment cela fonctionne en théorie : Le détecteur examine la séquence d'octets de votre entrée. Il recherche les marques d'ordre des octets (BOM) qui indiquent UTF-8, UTF-16 ou UTF-32. Il vérifie la présence d'octets nuls (courants en UTF-16/32). Il valide les séquences d'octets UTF-8 selon la spécification UTF-8. Si tous les octets sont dans la plage 0-127, c'est ASCII. Si les octets sont dans la plage 128-255 et ne forment pas un UTF-8 valide, l'encodage est probablement une page de code à un octet comme Windows-1251 ou ISO-8859-1. L'outil fournit un aperçu hexadécimal pour une vérification technique.

Cela aide les développeurs, traducteurs et analystes de données à identifier les problèmes d'encodage qui causent un texte illisible (mojibake).

Comment utiliser :

  1. Option 1 : Cliquez sur « Choisir un fichier » et sélectionnez un fichier texte (.txt, .csv, .json, .xml, .html, .css, .js, .py, .log, etc.).
  2. Option 2 : Collez du texte directement dans la zone de texte.
  3. Cliquez sur le bouton « Détecter l’Encodage ».
  4. Visualisez les résultats : taille du fichier, encodage(s) détecté(s) et un aperçu hexadécimal des 200 premiers octets.
  5. Utilisez le bouton « Effacer » pour réinitialiser tous les champs.

Conseils : L’outil peut détecter plusieurs encodages possibles. Si vous voyez « UTF-8 avec BOM » ou « UTF-8 (sans BOM) », le fichier est probablement en UTF-8. Si vous voyez « Windows-1251 / ISO-8859-1 / Autre », le fichier utilise un encodage à un octet courant pour les langues occidentales ou cyrilliques.

Leave a Reply