poi解析word带格式

一、Java POI 如何操作word 格式

1、环境支持 1.1 添加poi支持：包下载地址http://www.apache.org/dyn/closer.cgi/poi/release/ 1.2 POI对Excel文件的读取操作比较方便，POI还提供对Word的DOC格式文件的读取。

但在它的发行版本中没有发布对Word支持的模块，需要另外下载一个POI的扩展的Jar包。下载地址为http://www.ibiblio.org/maven2/org/textmining/tm-extractors/0.4/ 下载extractors-0.4_zip这个文件package com.ray.poi.util;import java.io.ByteArrayInputStream;import java.io.File;import java.io.FileInputStream;import java.io.FileOutputStream;import java.io.IOException;import org.apache.poi.poifs.filesystem.DirectoryEntry;import org.apache.poi.poifs.filesystem.DocumentEntry;import org.apache.poi.poifs.filesystem.POIFSFileSystem;import org.textmining.text.extraction.WordExtractor；/** * 读写doc * @author wangzonghao * */public class POIWordUtil { /** * 读入doc * @param doc * @return * @throws Exception */ public static String readDoc(String doc) throws Exception { // 创建输入流读取DOC文件 FileInputStream in = new FileInputStream(new File(doc)); WordExtractor extractor = null; String text = null； // 创建WordExtractor extractor = new WordExtractor（)； // 对DOC文件进行提取 text = extractor.extractText(in); return text； } /** * 写出doc * @param path * @param content * @return */ public static boolean writeDoc(String path, String content) { boolean w = false; try { // byte b[] = content.getBytes("ISO-8859-1"); byte b[] = content.getBytes(); ByteArrayInputStream bais = new ByteArrayInputStream(b); POIFSFileSystem fs = new POIFSFileSystem(); DirectoryEntry directory = fs.getRoot(); DocumentEntry de = directory.createDocument("WordDocument", bais); FileOutputStream ostream = new FileOutputStream(path); fs.writeFilesystem(ostream); bais.close(); ostream.close(); } catch (IOException e) { e.printStackTrace(); } return w； } }测试package com.ray.poi.util;import junit.framework.TestCase;public class POIUtilTest extends TestCase { public void testReadDoc() { try{ String text = POIWordUtil.readDoc("E:/work_space/poi/com/ray/poi/util/demo.doc"); System.out.println(text); }catch(Exception e){ e.printStackTrace(); } } public void testWriteDoc() { String wr; try { wr = POIWordUtil.readDoc("E:/work_space/poi/com/ray/poi/util/demo.doc"); boolean b = POIWordUtil.writeDoc("c:\\demo.doc",wr); } catch (Exception e) { // TODO Auto-generated catch block e.printStackTrace(); } }}。

二、如何样能让poi读取的word按原来的格式显示在页面

怎么样能让poi读取的word按原来的格式显示在页面因为poi读取word 没法读取到空格和回车.这个问题要如何解决呢poi java------解决方案--------------------public static void main(String[] args) { File file = new File("D:/test.doc"); try { FileInputStream fis = new FileInputStream(file); HWPFDocument hwpfd = new HWPFDocument(fis); WordExtractor wordExtractor = new WordExtractor(hwpfd); String[] paragraph = wordExtractor.getParagraphText(); for (int i = 0; i < paragraph.length;="" i++)="" {="" system.out.println(paragraph[i]);="" }}="" catch="" (filenotfoundexception="" e)="" {="" e.printstacktrace();="" }="" catch="" (ioexception="" e)="" {="" e.printstacktrace();="" }="">

三、如何样能让poi读取的word按原来的格式显示在页面

怎么样能让poi读取的word按原来的格式显示在页面

因为poi读取word 没法读取到空格和回车.这个问题要如何解决呢

poi java

------解决方案--------------------

public static void main(String[] args) {

File file = new File("D:/test.doc");

try {

FileInputStream fis = new FileInputStream(file);

HWPFDocument hwpfd = new HWPFDocument(fis);

WordExtractor wordExtractor = new WordExtractor(hwpfd);

String[] paragraph = wordExtractor.getParagraphText();

for (int i = 0; i

四、Java POI 如何操作word 格式

五、Java 利用poi 可以直接读取word中的表格保持样式生成新的word么

1.读取word 2003及word 2007需要的jar包读取 2003 版本（.doc）的word文件相对来说比较简单，只需要 poi-3.5-beta6-20090622.jar 和 poi-scratchpad-3.5-beta6-20090622.jar 两个 jar 包即可，而 2007 版本（.docx）就麻烦多，我说的这个麻烦不是我们写代码的时候麻烦，是要导入的 jar 包比较的多，有如下 7 个之多： 1. openxml4j-bin-beta.jar 2. poi-3.5-beta6-20090622.jar 3. poi-ooxml-3.5-beta6-20090622.jar 4 .dom4j-1.6.1.jar 5. geronimo-stax-api_1.0_spec-1.0.jar 6. ooxml-schemas-1.0.jar 7. xmlbeans-2.3.0.jar其中 4-7 是 poi-ooxml-3.5-beta6-20090622.jar 所依赖的 jar 包（在 poi-bin-3.5-beta6-20090622.tar.gz 中的 ooxml-lib 目录下可以找到）。

2.换行符号硬换行：文件中换行，如果是键盘中使用了"enter"的换行。软换行：文件中一行的字符数容量有限，当字符数量超过一定值时，会自动切到下行显示。

对程序来说，硬换行才是可以识别的、确定的换行，软换行与字体大小、缩进有关。3.读取的注意事项值得注意的是： POI 在读取不会读取 word 文件中的图片信息；还有就是对于 2007 版的 word(.docx)，如果 word 文件中有表格，所有表格中的数据都会在读取出来的字符串的最后。

4.读取word文本内容代码1 import java.io.File; 2 import java.io.FileInputStream; 3 import java.io.InputStream; 4 5 import org.apache.poi.POIXMLDocument; 6 import org.apache.poi.POIXMLTextExtractor; 7 import org.apache.poi.hwpf.extractor.WordExtractor; 8 import org.apache.poi.openxml4j.opc.OPCPackage; 9 import org.apache.poi.xwpf.extractor.XWPFWordExtractor;10 11 public class Test {12 public static void main(String[] args) {13 try {14 InputStream is = new FileInputStream(new File("2003.doc"));15 WordExtractor ex = new WordExtractor(is);16 String text2003 = ex.getText();17 System.out.println(text2003);18 19 OPCPackage opcPackage = POIXMLDocument.openPackage("2007.docx");20 POIXMLTextExtractor extractor = new XWPFWordExtractor(opcPackage);21 String text2007 = extractor.getText();22 System.out.println(text2007);23 24 } catch (Exception e) {25 e.printStackTrace();26 }27 }28 }。

六、java解析word文档有哪些方法

java读取word文档时，虽然网上介绍了很多插件poi、java2Word、jacob、itext等等，poi无法读取格式（新的API估计行好像还在处于研发阶段，不太稳定，做项目不太敢用）；java2Word、jacob容易报错找不到注册，比较诡异，我曾经在不同的机器上试过，操作方法完全一致，有的机器不报错，有的报错，去他们论坛找高人解决也说不出原因，项目部署用它有点玄；itxt好像写很方便但是我查了好久资料没有见到过关于读的好办法。

经过一番选择还是折中点采用rtf最好，毕竟rtf是开源格式，不需要借助任何插件，只需基本IO操作外加编码转换即可。rtf格式文件表面看来和doc没啥区别，都可以用word打开，各种格式都可以设定。

----- 实现的功能：读取rtf模板内容（格式和文本内容），替换变化部分，形成新的rtf文档。----- 实现思路：模板中固定部分手动输入，变化的部分用$info$表示，只需替换$info$即可。

1、采用字节的形式读取rtf模板内容2、将可变的内容字符串转为rtf编码3、替换原文中的可变部分，形成新的rtf文档主要程序如下：public String bin2hex(String bin) {char[] digital = "0123456789ABCDEF".toCharArray();StringBuffer sb = new StringBuffer("");byte[] bs = bin.getBytes();int bit;for (int i = 0; i < bs.length;i++)="" {bit="(bs[i]" &="" 0x0f0)="">> 4;sb.append("\\'");sb.append(digital[bit]);bit = bs[i] & 0x0f;sb.append(digital[bit]);}return sb.toString(); }public String readByteRtf(InputStream ins, String path){ String sourcecontent =""; try{ ins = newFileInputStream(path); byte[] b= new byte[1024];if (ins == null) {System.out.println（"源模板文件不存在"）；}int bytesRead = 0;while (true) {bytesRead = ins.read(b, 0, 1024); // return final read bytescountsif(bytesRead == -1) {// end of InputStreamSystem.out.println（"读取模板文件结束"）；break;}sourcecontent += new String(b, 0, bytesRead); // convert to stringusing bytes} }catch(Exception e){ e.printStackTrace(); } return sourcecontent ；}以上为核心代码，剩余部分就是替换，从新组装java中的String.replace(oldstr,newstr)；方法可以实现，在这就不贴了。源代码部分详见附件。

运行源代码前提：c盘创建YQ目录，将附件中"模板.rtf"复制到YQ目录之下，运行OpreatorRTF.java文件即可，就会在YQ目录下生成文件名如：21时15分19秒_cheney_记录.rtf的文件。 package com;import java.io.File;import java.io.FileInputStream;import java.io.FileWriter;import java.io.IOException;import java.io.InputStream;import java.io.PrintWriter;import java.text.SimpleDateFormat;import java.util.Date;public class OperatorRTF {public String strToRtf(String content){char[] digital = "0123456789ABCDEF".toCharArray();StringBuffer sb = new StringBuffer("");byte[] bs = content.getBytes();int bit;for (int i = 0; i < bs.length;="" i++)="" {bit="(bs[i]" &="" 0x0f0)="">> 4;sb.append("\\'");sb.append(digital[bit]);bit = bs[i] & 0x0f;sb.append(digital[bit]);}return sb.toString();}public String replaceRTF(String content,String replacecontent,intflag){String rc = strToRtf(replacecontent);String target = "";if(flag==0){target = content.replace("$timetop$",rc);}if(flag==1){target = content.replace("$info$",rc);}if(flag==2){target = content.replace("$idea$",rc);}if(flag==3){target = content.replace("$advice$",rc);}if(flag==4){target = content.replace("$infosend$",rc);}return target;}public String getSavePath() {String path = "C:\\YQ";File fDirecotry = new File(path);if (!fDirecotry.exists()) {fDirecotry.mkdirs();}return path;}public String ToSBC(String input){char[] c =input.toCharArray();for (int i =0; i < c.length;="" i++){if="" (c[i]="=" 32){c[i]="(char)" 12288;continue;}if="" (c[i]="">< 127){c[i]="(char)" (c[i]="" +="" 65248);}}return="" newstring(c);}public="" void="" rgmodel(string="" username,="" string="" content)="" {//="" todo="" auto-generated="" method="" stubdate="" current="new" date();simpledateformat="" sdf="new" java.text.simpledateformat("yyyy-mm-ddhh:mm:ss");string="" targetname="sdf.format(current).substring(11,13)" +="" "时"；targetname="" +="sdf.format(current).substring(14,16)" +="" "分"；targetname="" +="sdf.format(current).substring(17,19)" +="" "秒"；targetname="" +="_" +="" username="" +"_记录.rtf";string="" strpath="getSavePath();String" sourname="strpath+"\\"+"模板.rtf";String" sourcecontent="" ;inputstream="" ins="null;try{ins" =="" new="" fileinputstream(sourname);byte[]="" b="new" byte[1024];if="" (ins="=" null)="" {system.out.println（"源模板文件不存在"）；}int="" bytesread="0;while" (true)="" {bytesread="ins.read(b," 0,="" 1024);="" return="" final="" read="" bytescountsif(bytesread="=" -1)="" {//="" end="" of="" inputstreamsystem.out.println（"读取模板文件结束"）；break;}sourcecontent="" +="">

七、java poi导出word 可以设置格式吗

1. 读取word 2003及word 2007需要的jar包

2. 读取 2003 版本（.doc）的word文件相对来说比较简单，只需要 poi-3.5-beta6-.jar 和 poi-scratchpad-3.5-beta6-.jar 两个 jar 包即可，而 2007 版本（.docx）就麻烦多，我说的这个麻烦不是我们写代码的时候麻烦，是要导入的 jar 包比较的多，有如下 7 个之多：

3. 1. openxml4j-bin-beta.jar

4. 2. poi-3.5-beta6-.jar

5. 3. poi-ooxml-3.5-beta6-.jar

6. 4 .dom4j-1.6.1.jar

7. 5. geronimo-stax-api_1.0_spec-1.0.jar

8. 6. ooxml-schemas-1.0.jar

9. 7. xmlbeans-2.3.0.jar

10. 其中 4-7 是 poi-ooxml-3.5-beta6-.jar 所依赖的 jar 包（在 poi-bin-3.5-beta6-.tar.gz 中的 ooxml-lib 目录下可以找到）。

11. 2.换行符号

12. 硬换行：文件中换行，如果是键盘中使用了"enter"的换行。

13. 软换行：文件中一行的字符数容量有限，当字符数量超过一定值时，会自动切到下行显示。

14. 对程序来说，硬换行才是可以识别的、确定的换行，软换行与字体大小、缩进有关。

15. 3.读取的注意事项

16. 值得注意的是： POI 在读取不会读取 word 文件中的图片信息；还有就是对于 2007 版的 word(.docx)，如果 word 文件中有表格，所有表格中的数据都会在读取出来的字符串的最后。

17. 4.读取word文本内容代码

1 import java.io.File;

2 import java.io.FileInputStream;

3 import java.io.InputStream;

5 import org.apache.poi.POIXMLDocument;

6 import org.apache.poi.POIXMLTextExtractor;

7 import org.apache.poi.hwpf.extractor.WordExtractor;

8 import org.apache.poi.openxml4j.opc.OPCPackage;

9 import org.apache.poi.xwpf.extractor.XWPFWordExtractor;

11 public class Test {

12 public static void main(String[] args) {

13 try {

14 InputStream is = new FileInputStream(new File("2003.doc"));

15 WordExtractor ex = new WordExtractor(is);

16 String text2003 = ex.getText();

17 System.out.println(text2003);

19 OPCPackage opcPackage = POIXMLDocument.openPackage("2007.docx");

20 POIXMLTextExtractor extractor = new XWPFWordExtractor(opcPackage);

21 String text2007 = extractor.getText();

22 System.out.println(text2007);

24 } catch (Exception e) {

25 e.printStackTrace();

26 }

27 }

28 }

八、java读取带格式word内容

// 表格类型

List<XWPFTable> tableList = doc.getTables();

for (int i = 0; i < tableList.size(); i++) {

System.out.println(i);

XWPFTable table = tableList.get(i);

System.out.println(table.getText());

}

获取表格中内容可以用这个，但是你说的格式是什么意思，每个字的字体之类的吗？

转载请注明出处51数据库 » poi解析word带格式