如何使用pdfbox访问所有PDF元数据

4
我有一段简单的JAVA代码,使用TIKA库获取PDF文件的元数据,并列出以下元数据。
Tika代码:
Metadata metadata = new Metadata();
tika.parse(file, metadata);
String[] metadataNames = metadata.names();
for (String name : metadataNames) {
    System.out.println(name + " : " + metadata.get(name));
}

输出:

date : 1996-11-19T09:00:46Z
pdf:PDFVersion : 1.1
access_permission:modify_annotations : true
access_permission:can_print_degraded : true
dcterms:created : 1996-10-22T07:44:27Z
Last-Modified : 1996-11-19T09:00:46Z
dcterms:modified : 1996-11-19T09:00:46Z
dc:format : application/pdf; version=1.1
title : Test
Last-Save-Date : 1996-11-19T09:00:46Z
access_permission:fill_in_form : true
meta:save-date : 1996-11-19T09:00:46Z
pdf:encrypted : false
dc:title : Test
modified : 1996-11-19T09:00:46Z
Content-Type : application/pdf
meta:creation-date : 1996-10-22T07:44:27Z
created : Tue Oct 22 00:44:27 PDT 1996
access_permission:extract_for_accessibility : true
access_permission:assemble_document : true
xmpTPg:NPages : 64
Creation-Date : 1996-10-22T07:44:27Z
access_permission:extract_content : true
access_permission:can_print : true
producer : Acrobat Distiller 2.1 for Power Macintosh
access_permission:can_modify : true

我正在使用下面的代码来使用PDF Box获取元数据,但我不想指定元数据键,而是想获取所有可用的元数据键并对它们进行迭代。 当使用PDF Box库时,通用访问所有元数据键/值对的最佳方法是什么?
public static void main(String args[]) {
        PDFTextStripper pdfStripper = null;
        PDDocument pdDoc = null;
        COSDocument cosDoc = null;
        File file = new File("test/test.pdf");
        try {

            PDFParser parser = new PDFParser(new FileInputStream(file));
            parser.parse();
            cosDoc = parser.getDocument();
            pdfStripper = new PDFTextStripper();
            pdDoc = new PDDocument(cosDoc);
            pdfStripper.setStartPage(1);
            pdfStripper.setEndPage(5);
            String parsedText = pdfStripper.getText(pdDoc);
            // System.out.println(parsedText);

            PDDocumentCatalog cat = pdDoc.getDocumentCatalog();
            PDMetadata metadata = cat.getMetadata();

            if (metadata != null) {
                System.out.println(metadata.getInputStreamAsString());
            }

            printMetadata(pdDoc);

    } catch (IOException e) {
            // TODO Auto-generated catch block
            e.printStackTrace();
        }
    }


public static void printMetadata(PDDocument document) throws IOException {
        PDDocumentInformation info = document.getDocumentInformation();
        PDDocumentCatalog cat = document.getDocumentCatalog();
        PDMetadata metadata = cat.getMetadata();

        System.out.println("Page Count=" + document.getNumberOfPages());
        System.out.println("Title=" + info.getTitle());
        System.out.println("Author=" + info.getAuthor());
        System.out.println("Subject=" + info.getSubject());
        System.out.println("Keywords=" + info.getKeywords());
        System.out.println("Creator=" + info.getCreator());
        System.out.println("Producer=" + info.getProducer());
        System.out.println("Creation Date=" + formatDate(info.getCreationDate()));
        System.out.println("Modification Date=" + formatDate(info.getModificationDate()));
        System.out.println("Trapped=" + info.getTrapped());   
        if (metadata != null) {
            System.out.println("Metadata=" + metadata.getStream());
        }
    }

输出:

 Page Count=64
    Title=test
    Author=null
    Subject=null
    Keywords=null
    Creator=null
    Producer=Acrobat Distiller 2.1 for Power Macintosh
    Creation Date=10/22/96 12:44 AM
    Modification Date=11/19/96 1:00 AM
Trapped=null
1个回答

4

很抱歉,没有简单的方法可以遍历所有元数据值。你可以使用PDDocumentInformation对象上的反射并遍历getter,但是你还必须处理不同的返回类型。此时,您可能会硬编码您上面所做的内容。

而且,这仅适用于PDDocumentInformation对象。

浏览XMP,真正有趣的元数据可能存在于其中,因为它可以包含不同的模式(DublinCore、XMPMM等等,请参见Jempbox),甚至包括自定义元数据。

在Tika上,我们正在努力使更多的XMP元数据可用(刚添加了XMPMM,即将添加Photoshop)...如果您有任何请求,请告诉我们

最后,如果您开始使用XMP和PDFBox,请建议您一段时间内坚持使用Jempbox(请参见这里)。


有没有可能直接访问Tika中的pdfbox对象,以便暴露给可能需要它的任何人所有其方法?我在Python中使用tika,并且希望能够从其中访问pdfbox。 - Johnson
你需要做什么?使用“Python中的tika”是指通过Python调用tika-server吗?还是使用绑定(binding)? - Tim Allison

网页内容由stack overflow 提供, 点击上面的
可以查看英文原文,
原文链接