脚本所需的依赖包及版本:
pymupdf>=1.23.0
安装命令:
pip install pymupdf>=1.23.0
接收图片
识别图片内容(第一轮:全局识别)
read_image 工具识别图片内容判断文字存在性
提取并整理文字
数字二次聚焦校验(静默执行,不展示给用户)
read_image,但这次在 prompt 中只要求识别特定数字串区域[待确认:第一轮识别为X,第二轮识别为Y]| 易混淆数字对速查表: | 数字 | 关键视觉特征 |
|---|---|---|
| 8 | 上下两个封闭圆圈,像雪人/沙漏 | |
| 6 | 仅下方一个封闭圆圈,顶部向左弯弧 | |
| 9 | 仅上方一个封闭圆圈,底部向下竖线 | |
| 0 | 完整封闭椭圆,无开口 | |
| 3 | 右侧开口,两个弧形朝右 | |
| 5 | 顶部横线+左侧竖线+下方圆弧 | |
| S | 类似5但上下对称,无横线 | |
| O | 比0更圆的封闭图形 |
接收 PDF 文件
调用脚本提取文字
python scripts/pdf_text_extractor.py <pdf_file_path>处理提取结果
格式化输出
7w4.net提供免费和付费技能下载。
.md 文件[?] 标注并给出 2 个备选,如 158****8[?可能为6]624用户操作:上传一张包含文字的图片
智能体处理:
read_image 工具识别图片用户操作:上传 PDF 并要求"提取这个 PDF 的文字"
智能体处理:
python scripts/pdf_text_extractor.py ./document.pdf./extracted_from_pdf.md用户操作:上传扫描版 PDF
智能体处理:
这个 Skill 功能定位明确,文档和脚本都写得很规范,图片和 PDF 文字提取的流程清晰,还特别针对数字识别做了二次校验以提高准确率。不足之处是 PDF 脚本不支持扫描版文档(只能处理文字版 PDF),且部分校验步骤过于复杂可能影响实际效果。总体来说是一个质量不错但功能有一定局限性的文档处理工具。