我们新建mysql数据库的时候,需要指定数据库的字符集,一般我们都是选择utf8这个字符集,但是还会又一个utf8mb4这个字符集,好像和utf8有联系,下面晨阳SEO就来浅析一下这两者的区别。
mysql数据库中utf8与utf8mb4字符集MySQL在5.5.3之后增加了这个utf8mb4的编码,mb4就是mostbytes4的意思,专门用来兼容四字节的unicode。好在utf8mb4是utf8的超集,除了将编码改为utf8mb4外不需要做其他转换。当然,为了节省空间,一般情况下使用utf8也就够了。可以简单的理解utf8mb4是目前最大的一个字符编码,支持任意文字。
为什么mysql有utf8和utf8mb4两种几乎差不多的字符集
utf8是Mysql中的一种字符集,只支持最长三个字节的UTF-8字符,也就是Unicode中的基本多文本平面。
Mysql中的utf8为什么只支持持最长三个字节的UTF-8字符呢?我想了一下,可能是因为Mysql刚开始开发那会,Unicode还没有辅助平面这一说呢。
那时候,Unicode委员会还做着“个字符足够全世界用了”的美梦。Mysql中的字符串长度算的是字符数而非字节数,对于CHAR数据类型来说,需要为字符串保留足够的长。当使用utf8字符集时,需要保留的长度就是utf8最长字符长度乘以字符串长度,所以这里理所当然的限制了utf8最大长度为3,比如CHAR()Mysql会保留字节长度。
至于后续的版本为什么不对4字节长度的UTF-8字符提供支持,我想一个是为了向后兼容性的考虑,还有就是基本多文种平面之外的字符确实很少用到。
要在Mysql中保存4字节长度的UTF-8字符,需要使用utf8mb4字符集,但只有5.5.3版本以后的才支持。我觉得,为了获取更好的兼容性,应该总是使用utf8mb4而非utf8.对于CHAR类型数据,utf8mb4会多消耗一些空间,根据Mysql官方建议,使用VARCHAR替代CHAR。
为什么要使用utf8mb4字符集
既然utf8应付日常使用完全没有问题,那为什么还要使用utf8mb4呢?低版本的MySQL支持的utf8编码,最大字符长度为3字节,如果遇到4字节的字符就会出现错误了。三个字节的UTF-8最大能编码的Unicode字符是0xFFFF,也就是Unicode中的基本多文平面(BMP)。
也就是说,任何不在基本多文平面的Unicode字符,都无法使用MySQL原有的utf8字符集存储。这些不在BMP中的字符包括哪些呢?最常见的就是Emoji表情(Emoji是一种特殊的Unicode编码,常见于ios和android手机上),和一些不常用的汉字,以及任何新增的Unicode字符等等。
那么utf8mb4比utf8多了什么的呢
utf8mb4比utf8多了emoji编码支持。如果实际用途上来看,可以给要用到emoji的库或者说表,设置utf8mb4。比如评论要支持emoji可以用到。
新建mysql库的排序规则
utf8_unicode_ci比较准确,utf8_general_ci速度比较快。通常情况下utf8_general_ci的准确性就够我们用的了,在我看过很多程序源码后,发现它们大多数也用的是utf8_general_ci,所以新建数据库时一般选用utf8_general_ci就可以了,如果是utf8mb4那么对应的就是utf8mb4_general_ciutf8mb4_unicode_ci。