java过滤utf8mb4表情符号

创建时间：2015-09-16 投稿人：浏览次数：9403

一、mysql设置utf8mb4编码

目前mysql5.5以上的版本是可以支持utf8mb4编码的，我用的是mysql5.6。关于mysql设置存储utf8mb4，参考http://www.w2bc.com/Article/8533，也可以在navicat中选择某一个属性，直接设置，如下图。

二、过滤表情符

我最终的目的是把文本从mysql再导入到R语言中来进行文本处理，但目前R3.2.2版本貌似并不支持utf8mb4，只能使用utf8来读取文本，但是mysql里使用的是utf8mb4，对于含有表情符的文本，读入到R中就是NA，是不行的，所以考虑过滤掉这些表情符号。使用java过滤表情符，其实就是查找替换的过程，使用pattern，和matcher这两个类就可以解决。

java过滤表情符代码：

定义了Filter接口：

public interface Filter {
	String filter(String str);
}

表情符过滤器类EmojiFilter：

import java.util.regex.Matcher;
import java.util.regex.Pattern;

public class EmojiFilter implements Filter {

	@Override
	public  String filter(String str) {
		
		if(str.trim().isEmpty()){
			return str;
		}
		String pattern="[ud83cudc00-ud83cudfff]|[ud83dudc00-ud83dudfff]|[u2600-u27ff]";
		String reStr="";
		Pattern emoji=Pattern.compile(pattern);
		Matcher  emojiMatcher=emoji.matcher(str);
		str=emojiMatcher.replaceAll(reStr);
		return str;
	}

}

逐行过滤文本main:

import java.io.*;
public class main {

	public static void main(String[] args) {
		
		String fin="F:/in.txt";
		String fon="F:/out.txt";
		EmojiFilter filter=new EmojiFilter();
		
		try {
			
			File filename = new File(fin); 
			InputStreamReader reader = new InputStreamReader(
					new FileInputStream(filename));
			BufferedReader br = new BufferedReader(reader); 
			
			File writename = new File(fon); 
			writename.createNewFile(); 
			BufferedWriter out = new BufferedWriter(new FileWriter(writename));  
			
	
			String line = "";
			line = br.readLine();
			
			while(line!=null){
				System.out.println(line);
				line=filter.filter(line);
				out.write(line+"
");
				out.flush(); 
				line = br.readLine();
			}
			

			out.close(); 
			
			
		} catch (Exception e) {
			e.printStackTrace();
		} 
		
		
	}

}

基础上可以过滤掉emoji表情符啦！！再导入mysql中，采用utf8编码，实测没有错误！

参考：http://blog.csdn.net/kobejayandy/article/details/44179925

emoji处理：http://blog.csdn.net/ugg/article/details/44225723

声明：该文观点仅代表作者本人，牛骨文系教育信息发布平台，牛骨文仅提供信息存储空间服务。

上一篇： java 判断字符串中是否包含emoj表情及过滤，完美解决。
下一篇： java代码过滤emoji表情

热门文章: CTF writeup 2_南邮网络攻防训...; SSM框架——详细整合教程（...; Linux Shell脚本编程－－curl命...; HttpClient使用详解; Java面试题全集（上）; JAVA设计模式之单例模式; java.lang.OutOfMemoryError: PermGen ...; TCP协议中的三次握手和四次...; form表单的两种提交方式，su...; String,StringBuffer与StringBuilder...

最新文章: Java之品优购课程讲义_day20（7）; 剑指 Offer - 8：跳台阶; Netty权威指南_札记02_NIO编程; mysql时间属性之时间戳和datetime之...; 虚拟现实或许可以拯救古埃及的“...; spring cloud服务注册中心eureka---集群...; Java SE 第六章; HTTP请求+数据库; HIDL学习笔记之HIDL C++（第二天）; ubuntu系统下指定tomcat运行时为JDK1.8...