Python与Tika的对比案例

发布时间：2020-10-29 09:20:17 阅读：201 作者：小新栏目：编程语言

Python开发者专用服务器限时活动，0元免费领，库存有限，领完即止！点击查看>>

这篇文章给大家分享的是有关Python与Tika的对比案例的内容。小编觉得挺实用的，因此分享给大家做个参考。一起跟随小编过来看看吧。

PDF文件表格样例

Python解析结果

其他样式解析，如Tika

1、TEXT格式

  Tika tika = new Tika();        tika.setMaxStringLength(100 * 1024 * 1024);        try (InputStream stream = new FileInputStream(new File("600060_2018_zB.pdf"))) {            return tika.parseToString(stream);        }

Text格式解析结果

Python与Tika的对比案例

2、XHTML格式

       ContentHandler handler = new ToXMLContentHandler();        AutoDetectParser parser = new AutoDetectParser();        Metadata metadata = new Metadata();        try (InputStream stream = new FileInputStream(new File("600060_2018_zB.pdf"))) {            parser.parse(stream, handler, metadata);            return handler.toString();        }

XHTML格式解析结果

Python与Tika的对比案例

解析PDF常用组件（PdfBox、iText、Tika等）都无法将表格数据解析成有规则的格式。解析后格式基本是TEXT、XHTML等导致处理表格数据变的非常复杂。

根据对比我们可以发现，用Python解析PDF的表格数据更为简单方便。

感谢各位的阅读！关于Python与Tika的对比案例就分享到这里了，希望以上内容可以对大家有一定的帮助，让大家可以学到更多知识。如果觉得文章不错，可以把它分享出去让更多的人看到吧！

亿速云「云服务器」，即开即用、新一代英特尔至强铂金CPU、三副本存储NVMe SSD云盘，价格低至29元/月。点击查看>>

向AI问一下细节

Python与Tika的对比案例

猜你喜欢

最新资讯

相关推荐

开发者交流群：

相关标签