Java判断文件编码格式

转自：http://blog.csdn.net/zhangzh332/article/details/6719025

一般情况下我们遇到的文件编码格式为GBK或者UTF-8。由于中文Windows默认的编码是GBK，所以一般只要判定UTF-8编码格式。

对于UTF-8编码格式的文本文件，其前3个字节的值就是-17、-69、-65，所以，判定是否是UTF-8编码格式的代码片段如下：

Java代码

java.io.File f=new java.io.File("待判定的文本文件名");

try{

java.io.InputStream ios=new java.io.FileInputStream(f);

byte[] b=new byte[3];

ios.read(b);

ios.close();

if(b[0]==-17&&b[1]==-69&&b[2]==-65)

System.out.println(f.getName()+"编码为UTF-8");

else System.out.println(f.getName()+"可能是GBK");

}catch(Exception e){

e.printStackTrace();

}

上述代码只是简单判定了是否是UTF-8格式编码的文本文件，如果项目对要判定的文本文件编码不可控（比如用户上传的一些HTML、XML等文本），可以采用一个现成的开源项目：cpdetector，它所在的网址是：。它的类库很小，只有500K左右，利用该类库判定文本文件的代码如下（由于cpdetector的算法使用概率统计，所以结果并不是100%准确的，但是是迄今为止我见过的最准确的....@_@）：

/*------------------------------------------------------------------------

detector是探测器，它把探测任务交给具体的探测实现类的实例完成。

cpDetector内置了一些常用的探测实现类，这些探测实现类的实例可以通过add方法

加进来，如ParsingDetector、 JChardetFacade、ASCIIDetector、UnicodeDetector。

detector按照“谁最先返回非空的探测结果，就以该结果为准”的原则返回探测到的

字符集编码。

--------------------------------------------------------------------------*/

cpdetector.io.CodepageDetectorProxy detector =

cpdetector.io.CodepageDetectorProxy.getInstance();

/*-------------------------------------------------------------------------

ParsingDetector可用于检查HTML、XML等文件或字符流的编码,构造方法中的参数用于

指示是否显示探测过程的详细信息，为false不显示。

---------------------------------------------------------------------------*/

detector.add(new cpdetector.io.ParsingDetector(false));

/*--------------------------------------------------------------------------

JChardetFacade封装了由Mozilla组织提供的JChardet，它可以完成大多数文件的编码

测定。所以，一般有了这个探测器就可满足大多数项目的要求，如果你还不放心，可以

再多加几个探测器，比如下面的ASCIIDetector、UnicodeDetector等。

---------------------------------------------------------------------------*/

detector.add(cpdetector.io.JChardetFacade.getInstance());

//ASCIIDetector用于ASCII编码测定

detector.add(cpdetector.io.ASCIIDetector.getInstance());

//UnicodeDetector用于Unicode家族编码的测定

detector.add(cpdetector.io.UnicodeDetector.getInstance());

java.nio.charset.Charset charset = null;

File f=new File("待测的文本文件名");

try {

charset = detector.detectCodepage(f.toURL());

} catch (Exception ex) {ex.printStackTrace();}

if(charset!=null){

System.out.println(f.getName()+"编码是："+charset.name());

}else

System.out.println(f.getName()+"未知");

上面代码中的detector不仅可以用于探测文件的编码，也可以探测任意输入的文本流的编码，方法是调用其重载形式：

charset=detector.detectCodepage(待测的文本输入流,测量该流所需的读入字节数);

上面的字节数由程序员指定，字节数越多，判定越准确，当然时间也花得越长。要注意，字节数的指定不能超过文本流的最大长度。

判定文件编码的具体应用举例：

属性文件(.properties)是Java程序中的常用文本存储方式，象STRUTS框架就是利用属性文件存储程序中的字符串资源。它的内容如下所示：

#注释语句

属性名=属性值

读入属性文件的一般方法是：

FileInputStream ios=new FileInputStream("属性文件名");

Properties prop=new Properties();

prop.load(ios);

ios.close();

利用java.io.Properties的load方法读入属性文件虽然方便，但如果属性文件中有中文，在读入之后就会发现出现乱码现象。发生这个原因是load方法使用字节流读入文本，在读入后需要将字节流编码成为字符串，而它使用的编码是“iso-8859-1”,这个字符集是ASCII码字符集，不支持中文编码，所以这时需要使用显式的转码:

String value=prop.getProperty("属性名");

String encValue=new String(value.getBytes("iso-8859-1"),"属性文件的实际编码");

Java判断文件编码格式

继续阅读

Java小案例——随机数猜测随机数猜测

nginx location中斜线的位置的重要性

27 Best Free Eclipse Plug-ins for Java Developer to be ProductiveCode Quality PluginsText Editor PluginsDependency ManagementVersion Control Integration PluginsFramework Development Continuous Integration Related PluginsOther Utility Plugins

Java String.format方法的简单使用

neo4j之cypher使用文档

GitHub连夜封杀！这份阿里 10W 字内部 Java 字面试手册到底有多强？

QR码编码原理三（日本汉字和中文编码）

spark/scala关于【资源文件】加载方法概述外部文件加载方案测试资源文件打包入jar包中小结

mybatis_入门程序Mybatis入门

AOP编程_Android优雅权限框架(1)概念基础，2021金三银四前言正文大纲正文

Effective Java 8:通用程序设计

OOM三种类型

工厂模式-三种类型

【递归】高效率求2的n次幂

win10本地scala和spark安装安装scala安装spark

scala (3) Function 和 Method