java截取中英文字符串
题目:
编写一个截取字符串的函数,输入为一个字符串和字节数,输出为按字节截取的字符串。 但是要保证汉字不被截半个,如“我ABC”4,应该截为“我AB”,输入“我ABC汉DEF”,6,应该输出为“我ABC”而不是“我ABC+汉的半个”。
GB2312、GBK、GB18030,CP936以及CNS11643都满足条件 -- 中文是占用2个字节的,英文是占用1一个字节 。
package com.demo.runnable; import java.io.UnsupportedEncodingException; public class AbsDemo { /** * * @param text 目标字符串 * @param length 截取长度 * @param encode 采用的编码方式 * @return * @throws UnsupportedEncodingException */ public String substring(String text, int length, String encode)throws UnsupportedEncodingException { if (text == null) { return null; } StringBuilder sb = new StringBuilder(); int currentLength = 0; for (char c : text.toCharArray()) { currentLength += String.valueOf(c).getBytes(encode).length;//汉字为2字节,英文1字节 if (currentLength <= length) {//若当前长度小于等于要截取的长度,增加字符c sb.append(c); } else { break; } } return sb.toString(); } public void test() throws Exception { String text = "我ABC汉DEF"; int length1 = 3; int length2 = 6; String[] encodes = new String[] { "GB2312" }; for (String encode : encodes) { System.out.println(new StringBuilder().append("用").append(encode) .append("编码截取字符串 -- 【").append(text).append("】").append( length1).append("个字节的结果是【").append( substring(text, length1, encode)).append("】") .toString()); // System.out.println(new StringBuilder().append("用").append(encode) // .append("编码截取字符串 -- 【").append(text).append("】").append( // length2).append("个字节的结果是【").append( // substring(text, length2, encode)).append("】") // .toString()); // } } public static void main(String[] args) throws Exception { new AbsDemo().test(); } }
测试结果:
用GB2312编码截取字符串 -- 【我ABC汉DEF】3个字节的结果是【我A】
用GB2312编码截取字符串 -- 【我ABC汉DEF】6个字节的结果是【我ABC】
用GBK编码截取字符串 -- 【我ABC汉DEF】3个字节的结果是【我A】
用GBK编码截取字符串 -- 【我ABC汉DEF】6个字节的结果是【我ABC】
用GB18030编码截取字符串 -- 【我ABC汉DEF】3个字节的结果是【我A】
用GB18030编码截取字符串 -- 【我ABC汉DEF】6个字节的结果是【我ABC】
用CP936编码截取字符串 -- 【我ABC汉DEF】3个字节的结果是【我A】
用CP936编码截取字符串 -- 【我ABC汉DEF】6个字节的结果是【我ABC】
用CNS11643编码截取字符串 -- 【我ABC汉DEF】3个字节的结果是【我A】
用CNS11643编码截取字符串 -- 【我ABC汉DEF】6个字节的结果是【我ABC】
声明:该文观点仅代表作者本人,牛骨文系教育信息发布平台,牛骨文仅提供信息存储空间服务。
- 上一篇: subString中英文截取问题以及方法
- 下一篇: Java实现BASE64编解码