Unicode 编解码 - 在线工具

文本与 Unicode 转义互转(\uXXXX / U+XXXX / HTML 实体),并支持字符码点查询

使用说明

Unicode 编码器 / 解码器:把文本转换为 Unicode 转义序列,或把 \uXXXX 这类转义还原成可读文本。支持 \uXXXX(JSON / JavaScript 常用)、U+XXXX(Unicode 标准记法)、&#xXXXX; 与 &#NNNNN;(HTML 实体)四种写法,也提供字符码点查询。

编码时可选择「保留 ASCII 字符」:只把中文、emoji 等非 ASCII 字符转成转义,英文字母与数字保持原样,例如「Hello 世界」编码为「Hello \u4e16\u754c」,既保证兼容性又便于阅读。非基本平面的字符(如 emoji)会按 UTF-16 代理对输出,与 JavaScript、JSON 的行为一致。

解码时不需要选择写法:粘贴任意形式的转义(可混用,例如 \u4f60\u597d、U+4F60、你、你)都会自动识别并还原;\u{1F600} 这类 ES6 写法与代理对也能正确解析。若遇到非法码点(超出 U+10FFFF 或孤立代理项),会原样保留并在结果中提示,不会生成损坏的字符。

常见问题

\uXXXX 和 U+XXXX 有什么区别?

\uXXXX 是 JSON、JavaScript 等语言里的转义写法,程序读取时会还原成字符;U+XXXX 是 Unicode 标准中表示码点的记法,常见于文档与字符表。二者表示同一个字符,只是使用场景不同,本工具都能生成。

为什么 emoji 编码后变成两个 \u?

emoji 位于 Unicode 辅助平面(码点大于 U+FFFF),在 UTF-16 中需要用「代理对」表示,即一个高代理项加一个低代理项,所以会看到连续两个 \uXXXX。这与 JavaScript、JSON 的处理方式一致,解码时工具会自动把它们合并回原来的 emoji。

中 和 中 是什么?

它们是 HTML 字符实体,分别用十六进制与十进制表示同一个码点,浏览器会把它们渲染成对应字符(如「中」)。在网页源码中写入实体可以避免编码问题,本工具支持这两种形式与文本互转。

只编码中文、保留英文怎么做?

编码模式下打开「保留 ASCII 字符」即可:英文字母、数字与常见符号保持原样,只转换中文、日文、emoji 等非 ASCII 字符,结果是「Hello \u4e16\u754c」而不是整串转义。

解码时提示有无法转换的码点怎么办?

说明内容中存在非法码点(大于 U+10FFFF,或孤立的代理项),例如手写转义时写错了数字。工具会把这些片段原样保留而不是生成损坏字符,请检查对应位置的数值是否正确。

「码点查询」能看什么?

会逐个列出前 200 个字符的 Unicode 码点(U+ 形式)、十进制码点、HTML 实体与 UTF-8 字节,方便核对字符编码、排查乱码或准备转义数据。

同类工具