如何使用pdf.js正确地从pdf中提取文本

21

我对ES6和Promise不熟悉。我正在尝试使用pdf.js将pdf文件的所有页面中的文本提取成一个字符串数组。当提取完成后,我想以某种方式解析该数组。假设pdf文件(通过typedarray正确传递)有4页,我的代码如下:

let str = [];
PDFJS.getDocument(typedarray).then(function(pdf) {
  for(let i = 1; i <= pdf.numPages; i++) {
    pdf.getPage(i).then(function(page) {
      page.getTextContent().then(function(textContent) {
        for(let j = 0; j < textContent.items.length; j++) {
          str.push(textContent.items[j].str);
        }
        parse(str);
      });
    });
  }
});

它设法工作了,但是问题在于我的parse函数被调用了4次。我只想在完成所有的4个页面提取后才调用parse


2
类似于https://dev59.com/B5zha4cB1Zd3GeqPDE9B#40494019--使用Promise.all收集页面承诺,不要忘记链接then。 - async5
1
@async5 它起作用了!我最初尝试了这个,稍微修改后它可以工作,但是你提供的答案看起来更正确。请将其回复为答案,以便我可以接受它。谢谢! - Sangbok Lee
6个回答

30
https://dev59.com/B5zha4cB1Zd3GeqPDE9B#40494019 相似--使用 Promise.all 收集页面的 promise,并且不要忘记链接 then 函数:

function gettext(pdfUrl){
  var pdf = pdfjsLib.getDocument(pdfUrl);
  return pdf.then(function(pdf) { // get all pages text
    var maxPages = pdf.pdfInfo.numPages;
    var countPromises = []; // collecting all page promises
    for (var j = 1; j <= maxPages; j++) {
      var page = pdf.getPage(j);

      var txt = "";
      countPromises.push(page.then(function(page) { // add page promise
        var textContent = page.getTextContent();
        return textContent.then(function(text){ // return content promise
          return text.items.map(function (s) { return s.str; }).join(''); // value page text 
        });
      }));
    }
    // Wait for all pages and join text
    return Promise.all(countPromises).then(function (texts) {
      return texts.join('');
    });
  });
}

// waiting on gettext to finish completion, or error
gettext("https://cdn.mozilla.net/pdfjs/tracemonkey.pdf").then(function (text) {
  alert('parse ' + text);
}, 
function (reason) {
  console.error(reason);
});
<script src="https://npmcdn.com/pdfjs-dist/build/pdf.js"></script>


1
"未捕获的引用错误:PDFJS未定义" - Martin Thoma
1
有没有办法识别页眉和页脚?它们都在文本的开头,但它们与其余文本之间没有明显的分界线。 - webduvet
2
@MartinThoma PDFJS现在已经被弃用了,请使用pdfjsLib代替。 - Mike Poole

21

根据最新版本的"pdfjs-dist": "^2.0.943",这是@async5更干净的更新版本。

import PDFJS from "pdfjs-dist";
import PDFJSWorker from "pdfjs-dist/build/pdf.worker.js"; // add this to fit 2.3.0

PDFJS.disableTextLayer = true;
PDFJS.disableWorker = true; // not availaible anymore since 2.3.0 (see imports)

const getPageText = async (pdf: Pdf, pageNo: number) => {
  const page = await pdf.getPage(pageNo);
  const tokenizedText = await page.getTextContent();
  const pageText = tokenizedText.items.map(token => token.str).join("");
  return pageText;
};

/* see example of a PDFSource below */
export const getPDFText = async (source: PDFSource): Promise<string> => {
  Object.assign(window, {pdfjsWorker: PDFJSWorker}); // added to fit 2.3.0
  const pdf: Pdf = await PDFJS.getDocument(source).promise;
  const maxPages = pdf.numPages;
  const pageTextPromises = [];
  for (let pageNo = 1; pageNo <= maxPages; pageNo += 1) {
    pageTextPromises.push(getPageText(pdf, pageNo));
  }
  const pageTexts = await Promise.all(pageTextPromises);
  return pageTexts.join(" ");
};

这是相应的TypeScript声明文件,如果有人需要,我已经使用了它。

declare module "pdfjs-dist";

type TokenText = {
  str: string;
};

type PageText = {
  items: TokenText[];
};

type PdfPage = {
  getTextContent: () => Promise<PageText>;
};

type Pdf = {
  numPages: number;
  getPage: (pageNo: number) => Promise<PdfPage>;
};

type PDFSource = Buffer | string;

declare module 'pdfjs-dist/build/pdf.worker.js'; // needed in 2.3.0

如何使用缓冲区从文件中获取PDFSource的示例(来自节点类型):

file.arrayBuffer().then((ab: ArrayBuffer) => {
  const pdfSource: PDFSource = Buffer.from(ab);
});

7

这里是一个更短的(不一定更好)版本:

async function getPdfText(data) {
    let doc = await pdfjsLib.getDocument({data}).promise;
    let pageTexts = Array.from({length: doc.numPages}, async (v,i) => {
        return (await (await doc.getPage(i+1)).getTextContent()).items.map(token => token.str).join('');
    });
    return (await Promise.all(pageTexts)).join('');
}

在这里,data是一个字符串或ArrayBuffer(或者你可以改为接受url等参数)。
所以,只需导入pdf.js:
let pdfjsLib = await import("https://cdn.jsdelivr.net/npm/pdfjs-dist@3.6.172/+esm").then(m => m.default);
pdfjsLib.GlobalWorkerOptions.workerSrc = "https://cdn.jsdelivr.net/npm/pdfjs-dist@3.6.172/build/pdf.worker.min.js";
// or via npm, unpkg, etc.

使用方法如下:

let buffer = await fetch("https://arxiv.org/pdf/2305.07617.pdf").then(r => r.arrayBuffer());
let text = await getPdfText(buffer);

2
这是另一个使用awaitPromise.all的TypeScript版本,基于其他答案编写:
import { getDocument } from "pdfjs-dist";
import {
  DocumentInitParameters,
  PDFDataRangeTransport,
  TypedArray,
} from "pdfjs-dist/types/display/api";

export const getPdfText = async (
  src: string | TypedArray | DocumentInitParameters | PDFDataRangeTransport
): Promise<string> => {
  const pdf = await getDocument(src).promise;

  const pageList = await Promise.all(Array.from({ length: pdf.numPages }, (_, i) => pdf.getPage(i + 1)));

  const textList = await Promise.all(pageList.map((p) => p.getTextContent()));

  return textList
    .map(({ items }) => items.map(({ str }) => str).join(""))
    .join("");
};

pdfjs-dist/types/display/api 现在变成了 pdfjs-dist/types/src/display/api(至少在版本3.8.162中)。 - user358041

1

我自己也不知道如何做,但幸好有async5的代码可以借鉴。我复制了他的代码并更新到新版本的pdf.js。 我进行了最小的更改,并且还有权利不将所有页面分组成单个字符串。此外,我使用了一个正则表达式来删除PDF不幸创建的许多空白空间(它不能解决所有情况,但绝大多数情况下都可以)。 我所做的方式应该是大多数人感觉舒适的工作方式,但是请随意删除正则表达式或进行任何其他更改。

// pdf-to-text.js v1, require pdf.js ( https://mozilla.github.io/pdf.js/getting_started/#download )
// load pdf.js and pdf.worker.js
function pdfToText(url, separator = ' ') {
    let pdf = pdfjsLib.getDocument(url);
    return pdf.promise.then(function(pdf) { // get all pages text
        let maxPages = pdf._pdfInfo.numPages;
        let countPromises = []; // collecting all page promises
        for (let i = 1; i <= maxPages; i++) {
            let page = pdf.getPage(i);
            countPromises.push(page.then(function(page) { // add page promise
                let textContent = page.getTextContent();
                return textContent.then(function(text) { // return content promise
                    return text.items.map(function(obj) {
                        return obj.str;
                    }).join(separator); // value page text
                });
            }));
        };
        // wait for all pages and join text
        return Promise.all(countPromises).then(function(texts) {
            for(let i = 0; i < texts.length; i++){
                texts[i] = texts[i].replace(/\s+/g, ' ').trim();
            };
            return texts;
        });
    });
};

// example of use:
// waiting on pdfToText to finish completion, or error
pdfToText('files/pdf-name.pdf').then(function(pdfTexts) {
    console.log(pdfTexts);
    // RESULT: ['TEXT-OF-PAGE-1', 'TEXT-OF-PAGE-2', ...]
}, function(reason) {
    console.error(reason);
});

0
如果您使用PDFViewer组件,这里是我的解决方案,不涉及任何Promise或异步操作:
function getDocumentText(viewer) {
    let text = '';
    for (let i = 0; i < viewer.pagesCount; i++) {
        const { textContentItemsStr } = viewer.getPageView(i).textLayer;
        for (let item of textContentItemsStr)
            text += item;
    }
    return text;
}

网页内容由stack overflow 提供, 点击上面的
可以查看英文原文,
原文链接