java pdf解析器_Java的高级PDF解析器

最新推荐文章于 2024-06-30 03:36:37 发布

吃月亮的人

最新推荐文章于 2024-06-30 03:36:37 发布

阅读量879

点赞数

文章标签： java pdf解析器

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_42302763/article/details/114140012

版权

本文介绍了如何使用iText Java库进行PDF解析，包括提取完整页面文本、解析图片、查找链接以及获取PDF文档的元信息。通过TextExtractionStrategy实现自定义文本过滤，对于AcroForm表单字段，iText可以方便地获取其值。

摘要由CSDN通过智能技术生成

小编典典

目前，iText是我选择的PDF工具。

完整的可见文字

“可见”是一个艰难的过程。您可以使用com.itextpdf.text.pdf.parse包的类来解析所有可分析的文本…但是这些类对CLIPPING不了解。您可以很容易地将解析器限制为页面大小。

// all text on the page, regardless of position

PdfTextExtractor.getTextFromPage(reader, pageNum);

实际上，您实际上需要采用TextExtractionStrategy(已过滤策略)的替代。它很快就变得很有趣，但是我认为您可以在这里“开箱即用”获得所需的一切。

图片

是的，通过相同的包类。图像侦听器不像文本侦听器那样受支持，但确实存在。

链接

是。链接是指向各种PDF页面的“注释”。找到它们很简单，只需遍历每个页面的“注释数组”并挑选链接注释即可。

PdfDictionary pageDict = myReader.getPageN(1);

PdfArray annots = pageDict.getAsArray(PdfName.ANNOTS);

ArrayList dests = new ArrayList();

if (annots != null) {

for (int i = 0; i < annots.size(); ++i) {

PdfDictionary annotDict = annots.getAsDict(i);

PdfName subType = annotDict.getAsName(PdfName.SUBTYPE);

最低0.47元/天解锁文章

吃月亮的人

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
java pdf解析器_Java的高级PDF解析器

小编典典目前，iText是我选择的PDF工具。完整的可见文字“可见”是一个艰难的过程。您可以使用com.itextpdf.text.pdf.parse包的类来解析所有可分析的文本…但是这些类对CLIPPING不了解。您可以很容易地将解析器限制为页面大小。// all text on the page, regardless of positionPdfTextExtractor.getTextFr...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。