Apache POI Word-テキスト抽出

この章では、Javaを使用してWord文書から単純なテキストデータを抽出する方法について説明します。 Word文書からメタデータを抽出する場合は、Apache Tikaを使用してください。

docxファイルの場合、Wordファイルから単純なデータを抽出して返すクラスorg.apache.poi.xwpf.extractor.XPFFWordExtractorを使用します。同様に、見出し、脚注、表データなどを抽出するさまざまな方法があります。 Wordファイルから。.

次のコードは、Wordファイルから単純なテキストを抽出する方法を示しています-

import java.io.FileInputStream;
import org.apache.poi.xwpf.extractor.XWPFWordExtractor;
import org.apache.poi.xwpf.usermodel.XWPFDocument;

public class WordExtractor {

   public static void main(String[] args)throws Exception {

      XWPFDocument docx = new XWPFDocument(new FileInputStream("create_paragraph.docx"));

     //using XWPFWordExtractor Class
      XWPFWordExtractor we = new XWPFWordExtractor(docx);
      System.out.println(we.getText());
   }
}

上記のコードを* WordExtractor.java。*として保存し、次のようにコンパイルしてコマンドプロンプトから実行します-

$javac WordExtractor.java
$java WordExtractor

次の出力が生成されます。

At finddevguides.com, we strive hard to provide quality tutorials for self-learning
purpose in the domains of Academics, Information Technology, Management and Computer
Programming Languages.

Apache-poi-word-text-extraction

Apache POI Word-テキスト抽出