unicode编码表字符对照表|á,é,í,ó,ú,ñ西班牙语字母表大写_西班牙语

注意：下面这两段是代理区。即第1——16平面的间接表示，四个字节的汉字就在这里表示D800-DBFF：High-half zone of UTF-16DC00-DFFF：Low-half zone of UTF-16iPhone emoji问题牵出的Unicode代理区的思考

在程序员和产品讨论emoji字符占用的字节数的时候，有人说2个、有人说4个、还有开发说iPhone的表情是iOS自定特定的。究竟emoji是几个字符呢？答案是4个，下面详细介绍一下：

在输入框输入一个emoji——微笑，然后通过UTF-8转化工具，看看它的编码是这样：

可以看到Unicode编码是 D83D-DE03。utf-8的编码是F09F-9883。常见字符Unicode很少四个字节的，这个不寻常的。通常utf-8是1到3个字节的，也就是说在Unicode编码空间的第0个平面上。可以简单推测：既然emoji的utf-8是4个字节，说明在1，2...16个平面中的某一个。

这里有必要说明一下utf-8的编码规则如图所示：

我们再看看“微笑”的emoji符号的Unicode：D83D-DE03，已经超过了表格中最大的0X10FFFF了，怎么回事？？？下面我们根据utf-8的值：F09F-9883.来反推Unicode对应的数值吧，看看究竟是为什么：

得出的结果是0x1-F603，我把这个值叫做UTF-16.这个结果跟Unicode：D83D-DE03的值相差很大，所以，中间肯定经过了一些转换步骤，这个转换就是utf-16的代理！！！

UTF是"Unicode/UCS Transformation Format"的首字母缩写，即把Unicode字符转换为某种格式之意。上面第二张图片展示的是utf-8和unicode的对应表，这只是一个简单的对应，却非常好用。

在正常情况下一个Unicode两个字节，在转化uft-8的时候，根据协议，两个两个字节，对应一个uft-8这样完成转化或者称为映射！

其实在第0个平面中，专门有一个代理区域，不表示任何字符，只用于指向第1到第16个平面中的字符，这段区域是：D800——DFFF.。其中0xD800——0xDBFF是前导代理(lead surrogates).0xDC00——0xDFFF是后尾代理(trail surrogates).

一个代理对儿（前导，后尾），就表示一个utf-16的字符。就那emoji的微笑来说，前导是代理：D83D；后尾代理是：DE03。根据下图可以得出utf-16的值是：0x1-F603。这就照应上了。

具体的公式是：0x10000 + (前导-0xD800) * 0x400 + (后导-0xDC00) = utf-16编码。

就我们说的例子emoji而言，代入前导和后导，结果是：0x10000+(0xD83D - 0xD800)*0x400 + (0xDE03-0xDC00) = 0x1F603

作为程序员的我们，笔者做一个形象的比喻：这对儿（前导代理，后尾代理）就像一个指针，指向了第1——16平面上的每一个码位。经过计算，不难得出：16个平面 * 每个平面码位65536 = 1,048,576个，前导X后尾代理，可以表示的码位也是1,048,576个（哈！真是一个完美的解决方案）如上图所示。

这样做的好处是：程序根据Unicode的第一个字节来判断：（伪代码）

[objc] view plain copyif(Unicode第一个字节 >=0xD8 && Unicode <=0xDB){//这是代理区域，表示第1——16平面的字符。每四个字节表示一个单元}else{//这是正常映射区域，表示第0个平面。每两个字节表示一个单元。}

这样的结果是：根据这个协议判断，计算机可以知道两个字节，还是四个自己表示一个字符。

● emoji 没什么特别的，也是正常的Unicode编码，只是通过代理区实现● 这里说的utf-8和utf-16，其实本质上是一样的。只是utf-8是一个直接的映射。而utf-16需要根据代理区的（前导代理，后尾代理）来映射。utf-16比utf-8多了一步而已！● 话又说回来：如果不是代理区域的出现，就emoji 微笑的unicode： 0X1-F603来说。计算机甚至不知道这是一个字符，还是两个字符！所以，搞了一个Unicode：D83D-DE03来表示unicode： 0X1-F603，防止计算机解码混淆！

THE END

unicode编码表字符对照表

干货丨如何在键盘上打出西班牙语，分钟包教包会看这里！

回纥诸州和突厥诸州

码对照表anguawei

unicode编码表字符对照表

对照表zhiyinjixu

如何在indows上输入口音种方式