开发微信公众号用户昵称带表情时过滤表情
Incorrect string value: "xF0x9Fx98x84xF0x9F"
开发微信公众号,当用户访问该公众号时,我们一般会将用户的帐号信息保存起来做一下记录如:OPEN_ID、昵称、性别、所在城市、国家、头像、关注状态等等这些微信官方提供的用户参数。
环境:mysql数据库
而当用户昵称中带有表情时,往数据库汇总执行插入操作时,就会报昵称字段不正确Incorrect string value: "xF0x9Fx98x84xF0x9F"。
并且数据库的字符集就是utf8mb4。想尽了能想到的办法依然解决不掉,最后使用了下下策:将标签过滤掉。
过滤掉字符串中的表情
/**
* 检测是否有emoji字符
*
* @param source
* @return 一旦含有就抛出
*/
public static boolean containsEmoji(String source) {
if (StringUtils.isBlank(source)) {
return false;
}
int len = source.length();
for (int i = 0; i < len; i++) {
char codePoint = source.charAt(i);
if (isEmojiCharacter(codePoint)) {
//do nothing,判断到了这里表明,确认有表情字符
return true;
}
}
return false;
}
private static boolean isEmojiCharacter(char codePoint) {
return (codePoint == 0x0) ||
(codePoint == 0x9) ||
(codePoint == 0xA) ||
(codePoint == 0xD) ||
((codePoint >= 0x20) && (codePoint <= 0xD7FF)) ||
((codePoint >= 0xE000) && (codePoint <= 0xFFFD)) ||
((codePoint >= 0x10000) && (codePoint <= 0x10FFFF));
}
/**
* 过滤emoji 或者 其他非文字类型的字符
*
* @param source
* @return
*/
public static String filterEmoji(String source) {
source = source.replaceAll("[\ud800\udc00-\udbff\udfff\ud800-\udfff]", "*");
if (!containsEmoji(source)) {
return source;//如果不包含,直接返回
}
//到这里铁定包含
StringBuilder buf = null;
int len = source.length();
for (int i = 0; i < len; i++) {
char codePoint = source.charAt(i);
if (isEmojiCharacter(codePoint)) {
if (buf == null) {
buf = new StringBuilder(source.length());
}
buf.append(codePoint);
} else {
buf.append("*");
}
}
if (buf == null) {
return source;//如果没有找到 emoji表情,则返回源字符串
} else {
if (buf.length() == len) {//这里的意义在于尽可能少的toString,因为会重新生成字符串
buf = null;
return source;
} else {
return buf.toString();
}
}
}
声明:该文观点仅代表作者本人,牛骨文系教育信息发布平台,牛骨文仅提供信息存储空间服务。
