Détecteur d'encodage de texte
Importez un fichier texte pour estimer son encodage probable (ASCII, UTF-8, UTF-16 ou Latin-1/Windows-1252).
Comment ça marche
Un fichier texte qui s'affiche avec des caractères bizarres ("é" au lieu de "é") souffre souvent d'un problème d'encodage mal détecté par le logiciel qui l'ouvre. Cet outil analyse les octets bruts du fichier : s'ils forment une séquence UTF-8 valide, il l'identifie (ASCII si tous les octets sont inférieurs à 128, UTF-8 sinon) ; sinon il vérifie la présence d'un BOM UTF-16, et en dernier recours suppose du Latin-1/Windows-1252, un encodage sur un octet où toute séquence de bytes est techniquement valide.
Pourquoi la confiance est-elle parfois "faible" ?
Contrairement à UTF-8 (qui a une structure interne vérifiable) ou UTF-16 (identifiable par son BOM), l'encodage Latin-1/Windows-1252 n'a aucune signature : n'importe quelle suite d'octets y est valide. Quand aucun autre encodage ne correspond, l'outil propose Latin-1 par défaut, mais avec une confiance faible car ce n'est qu'une supposition raisonnable.
Pourquoi un fichier UTF-8 est-il parfois détecté comme ASCII ?
ASCII est un sous-ensemble strict d'UTF-8 : si tous les octets du fichier sont inférieurs à 128 (0x80), le fichier est valide aussi bien en ASCII qu'en UTF-8. L'outil affiche alors "ASCII" car c'est l'encodage le plus restrictif et le plus universellement compatible qui décrit correctement le fichier.
Traitement 100% local : l'analyse s'effectue entièrement dans votre navigateur via WebAssembly, votre fichier ne quitte jamais votre appareil.