开源 PDF 表格抽取神器来了:一键提取 PDF 表格数据,还提供 Web 可视化操作界面!
在信息爆炸的今天,我们经常面临着从大量 PDF 文档中提取关键数据的挑战。无论是财务报表、市场调研数据还是法律文档,这些PDF 文件中蕴含的表格信息往往需要被转换为可操作的数据格式,以便进行进一步的分析和处理。然而,手动从 PDF 中提取表格数据不仅耗时,而且容易出错,这对于追求效率和精确度的专业人士来说是一个不小的难题。
本文我将介绍一个开源的 PDF 表格抽取工具 —— camelot[1]。

camelot 使用示例
camelot 快速上手
- 新建 camelot 项目
- 安装 Ghostscript[2],它用于解析 PDF 文件。macOS 用户可以使用
brew 来安装 Ghostscript。
brew install ghostscript- 使用 pip 安装 camelot
pip install "camelot-py[base]"- 新建
main.py 文件并输入以下内容
import camelottables = camelot.read_pdf('foo.pdf')
tables.export('foo.csv', f='csv', compress=False)
- 运行
main.py 程序
python3 main.py对于 macOS 或 Linux 系统的用户来说,在运行
/ghostscript/_gsprint.py", line 267, in raise RuntimeError("Please make sure that Ghostscript is installed")
可以在运行程序前,先配置
export DYLD_LIBRARY_PATH=/opt/homebrew/Cellar/ghostscript/10.03.1/lib/成功运行 main.py 程序之后,在 camelot 项目根目录下生成对应的 csv 文件。
excalibur 快速上手
为了方便用户使用 camelot,camelot 团队提供了一个 Web 工具 —— excalibur[3]。
- 使用 pip 安装 excalibur
pip install excalibur-py- 初始化数据库
excalibur initdb- 启动 excalibur 服务器
excalibur webserver当服务器成功启动后,在浏览器中打开
之后,点击 Upload PDF 按钮选择本地 PDF 文件,就可以开始抽取表格了。此外 excalibur 还提供的检测表格的功能,使用效果如下图所示:
-
08.03
《崩坏因缘精灵》强力拥抱任务完成攻略
-
08.03
蓝色星原旅谣烹饪攻略:实用实用技巧与高效食谱分享
-
08.03
蓝色星原旅谣强力奇波全攻略:技能搭配、实战实用技巧与培养建议
-
08.03
蓝色星原旅谣断风磐阵营成员全解析:角色背景与技能说明
-
08.03
《遗忘之海》第三章全流程任务攻略:详细步骤、关键提示与隐藏要素
-
08.03
遗忘之海渡桥岛遗迹跑图全攻略:高效路线与隐藏点位详细说明
推荐专题
热门阅读
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏