工具用的顺手吗?
你的反馈能帮助我们做得更好
识别文本文件字符编码格式,解决乱码问题,支持多语言内容分析。
点击选择文件文件编码检测
检测文本文件的字符编码 (UTF-8, GBK, ASCII 等)
文件编码检测
概览
了解工具能解决的问题、计算或处理逻辑,以及数据边界。
文本文件保存的不是“字符外观”,而是按某种字符编码写入的字节。读取程序若采用了不同编码,同一串字节就可能显示成乱码。文件编码检测用于推测应该以哪套规则解读这些字节;它是只读检查,不会转换、修复或重新下载文件。
本页一次选择一个文件。编码推测和换行检查取文件开头最多 10,000 字节作为样本,结果区显示主要编码、BOM 标记、换行符格式、文件名和文件大小。页面没有语言识别结果,也不会给出多个候选编码的排名。
BOM 是出现在数据流起始位置的编码签名。当前检测会先检查三种签名;命中时,BOM 结果与主要编码按签名确定,而不是继续依赖统计推测。
| 文件开头字节 | 主要编码 | BOM 结果 |
|---|---|---|
EF BB BF | UTF-8 | Yes (UTF-8) |
FE FF | UTF-16 BE | Yes (UTF-16 BE) |
FF FE | UTF-16 LE | Yes (UTF-16 LE) |
若三种签名都未出现,BOM 显示 No,主要编码则根据样本的字节分布推测。无 BOM 不等于不是 UTF-8;它只表示文件开头没有被本页识别的上述签名。尤其是纯 ASCII 内容,同一字节序列也完全符合 UTF-8,因此仅凭短样本通常无法证明文件最初由哪种软件、哪套编码保存。
这是建议优先尝试的解码名称。没有 BOM 时应把它视为线索,再用原软件、导入设置或人工阅读核对。
表示文件起始字节是否匹配 UTF-8、UTF-16 BE 或 UTF-16 LE 的签名。它不代表文本质量,也不代表文件没有损坏。
可能显示 CRLF (Windows)、LF (Unix/Linux/macOS)、CR (Classic macOS) 或 None。结果只给出一个类别,不统计各种换行的数量。
用于确认选中的对象。大小按 1024 进位显示 B、KB、MB、GB 或 TB,并最多保留两位小数。
例如,一个以 EF BB BF 开头、正文使用 CRLF 分行的 CSV 样本,会显示 UTF-8、Yes (UTF-8) 与 CRLF (Windows)。这只说明样本的签名和换行表现,不检查 CSV 列结构是否正确。
EF BB BF 签名;生效时间:2003-11,核验日期:2026-09-15。指南
按步骤完成操作,并通过示例核对输入与结果。
先复制一份原文件,避免其他软件自动保存后改变字节。点击上传区域或拖入一个待查文件;选择新文件会替换本页当前结果。
若 BOM 为 Yes,可先按对应 UTF 编码打开副本;若为 No,则把主要编码作为第一候选,不要把推测结果直接当成定论。
用编辑器或导入对话框明确选择候选编码,检查中文、生僻字、引号、货币符号和行尾是否正常。若仍乱码,回到未被改写的原文件尝试其他合理编码。
脚本报错、版本差异或表格导入错行时,再查看 CRLF、LF、CR 或 None。检测结果描述现状,不会替你改写换行符。
主要编码、BOM、换行符、文件名和大小均可单独复制,便于附在问题单或交接记录中;本页不会生成转换后的文件。
场景
查看这项工具在不同工作与生活流程中的用法。
运营或数据人员拿到来源不明的 CSV,可先记录主要编码与 BOM,再在表格软件的导入界面显式选择编码。结果用于缩小尝试范围,不验证分隔符、列数或日期格式。
开发团队发现代码或配置文件每行都被标记为修改时,可比较换行符结果,并确认编码是否因编辑器保存设置发生变化。随后应按仓库规范处理,而不是只凭系统标签批量替换。
迁移日志、报表或接口样本前,先检测每类代表文件,再用目标系统实际打开并抽查特殊字符。若同一大文件可能拼接了不同来源,需分段检查,不能只依赖文件开头。
问答
集中解答高频疑问与容易混淆的问题。
可能。UTF-8 不要求一定带 BOM;No 只表示没有识别到本页检查的三种起始签名。此时主要编码来自样本推测,仍应在实际读取软件中验证。
两者未必矛盾。只含 ASCII 范围字符的字节同时也是有效 UTF-8,文件本身若没有额外标记,检测器很难从内容还原保存软件当时选择的标签。
因为当前结果区只展示单个检测名称。即使内部推测能够形成强弱判断,页面也没有提供可见的可信度字段或候选排序;需要更高把握时,请用目标软件试开并核对原始来源。
不能。本页只读取并报告,不修改文件字节,也不提供编码转换下载。请先确认源编码,再在可信的编辑器或转换流程中处理副本,并复核是否有替换字符或内容丢失。
须知
使用前了解适用范围、结果限制与必要提醒。
编码是推测,不是证明。没有可识别 BOM 时,短文本、纯英文、相近的传统编码、错误字节和混合编码都可能导致误判。检测只分析开头最多 10,000 字节;若文件后段换了编码或换行风格,结果不会反映该变化。
BOM 覆盖有限。当前 BOM 字段只明确识别 UTF-8、UTF-16 BE 和 UTF-16 LE 三种签名,不应据此断言文件没有其他格式的签名。
换行结果是单一概括。样本同时含多种换行时,检测优先显示 CRLF,其次 LF,再次 CR;不会报告混合比例。换行判断还依赖样本能否按候选编码正确解读;对 UTF-16 等多字节文本,CRLF 可能被显示为 LF,应在十六进制视图或目标软件中复核。
上传控件不限制扩展名。图片、压缩包、可执行文件等二进制内容也可能被选择,但给出的编码或换行结果通常没有文本语义。文件会先由浏览器完整读取,再从开头取样;超大文件可能受设备内存和浏览器能力限制,因此不能承诺固定的最大可处理体积。
文件内容检测在当前浏览器内完成。此检测流程没有把文件内容发送到服务器的步骤,但这不等同于对设备、浏览器扩展或网络环境作整体安全保证;极敏感文件仍应在受控设备与环境中处理。
推荐
查找相关工具、专题与可用的 API 能力。