name: pdf-master description: 全能 PDF 智能处理技能,覆盖 25 项能力五大核心(Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名)、九大增值(表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵)、四大扩展(智能压缩、排版保留翻译、合同风险审查、发票验真归档)、七大壁垒(电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除)。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求,或提到"转Word""OCR""加水印""压缩到xxMB""审查合同""批量盖章""彻底删除"等指令时触发。飞书机器人场景原生支持。
一站式 PDF 处理系统,25 项能力按四层组织。本文件是路由与流程主控:所有能力的详细执行规程、质量标准、错误降级、价值话术均在 references/ 中按需加载。
每个请求严格按 5 步执行:
收到 PDF 后先运行 scripts/pdf_info.py 获取:页数、大小、加密状态、文本层有无、扫描件占比、元数据。未检测不得开始处理。
| 检测结果 | 路由 |
|---|---|
| 有文本层 | 文本型管道(PyMuPDF / pdfplumber) |
| 无文本层、纯图像 | OCR 管道(先读 references/ocr-config.md) |
| 部分文本+部分图像 | 混合管道(文本页直取,图像页 OCR) |
| 加密文件 | 索要密码;无法提供则终止并说明 |
用「能力路由总表」匹配用户指令到能力编号。匹配规则:
20 个带标准路由的 Few-Shot 示例见 references/few-shot-examples.md,路由拿不准时先查它。
小葱技能站7w4.net每天更新,海量AI技能等你发现。
以下情况必须先确认再动手:
scripts/ 下脚本,不重复造轮子references/error-handling.md 的降级链处理,不得静默失败交付时四件事缺一不可:
references/quality-standards.md 对应能力的验收项自检并报告(如"表格 12 个全部原生可编辑,图片偏移 <5px")references/value-messaging.md 取,不得编造数字第一层 · 五大核心(详细规程 references/capabilities-core.md)
| # | 能力 | 触发关键词 | 脚本 |
|---|---|---|---|
| 1 | PDF↔Office 高保真互转 | 转Word / 转Excel / 转PPT | pdf_convert.py |
| 2 | 扫描件 OCR 精准识别 | OCR / 识别 / 扫描件转文字 | pdf_ocr.py |
| 3 | PDF 内直接编辑 | 改文字 / 改参数 / 替换图片 | —(规程执行) |
| 4 | 安全保护(加密/权限/水印) | 加密 / 加水印 / 禁止打印 | pdf_watermark.py |
| 5 | 批量自动化处理 | 批量合并 / 拆分 / 重命名 | pdf_merge.py pdf_split.py |
第二层 · 九大增值(详细规程 references/capabilities-value.md)
| # | 能力 | 触发关键词 | 脚本 |
|---|---|---|---|
| 6 | 表格精准提取 | 提取表格 / 表格转Excel | pdf_extract_tables.py |
| 7 | 图文混排解析 | 提取图文 / 解析内容 | —(规程执行) |
| 8 | 智能摘要 | 摘要 / 总结 / 提炼重点 | —(LLM 执行) |
| 9 | 自动脱敏 | 脱敏 / 打码 / 隐藏敏感信息 | —(规程执行) |
| 10 | 元数据清洗 | 清洗元数据 / 擦除痕迹 | pdf_info.py --scrub |
| 11 | 名称/编号自动化 | 自动命名 / 重命名 | —(规程执行) |
| 12 | 两版差异对比 | 对比 / diff / 版本差异 | —(规程执行) |
| 13 | 文档即问即答 | 问答 / 这份文件说了什么 | —(RAG 规程) |
| 14 | 规格参数对比矩阵 | 规格对比 / 参数对比 | —(规程执行) |
第三层 · 四大扩展(详细规程 references/capabilities-pro.md)
| # | 能力 | 触发关键词 | 脚本 |
|---|---|---|---|
| 15 | PDF 智能压缩 | 压缩 / 压到xxMB / 缩小 | pdf_compress.py |
| 16 | PDF 翻译(保留排版) | 翻译 / 翻成中文 / 双语对照 | —(规程执行) |
| 17 | 合同智能审查 | 审查合同 / 合同体检 / 标风险 | —(规程执行) |
| 18 | 发票/票据自动归档 | 归档发票 / 报销汇总 / 验真 | —(规程执行) |
第四层 · 七大壁垒(详细规程 references/capabilities-pro.md)
| # | 能力 | 触发关键词 | 脚本 |
|---|---|---|---|
| 19 | 电子签名与审批流 | 签名 / 电子签 / 批量盖章 / 审批流 | —(规程执行) |
| 20 | 批量内容替换 | 批量替换 / 统一改价格 / 换Logo | pdf_batch_replace.py |
| 21 | PDF 表单创建 | 生成表单 / 可填写PDF / 问卷转表单 | —(规程执行) |
| 22 | 图纸精准测量 | 测量图纸 / 量尺寸 / 算面积 | —(规程执行) |
| 23 | 翻页电子书制作 | 翻页书 / 电子书 / 手册转网页 | —(规程执行) |
| 24 | 印刷级导出 | 印刷导出 / CMYK / 出血区 / 转曲 | —(规程执行) |
| 25 | 密文级敏感信息删除 | 彻底删除 / 永久抹除 / 不是涂黑 | pdf_redact.py |
| 约束项 | 限制 | 超限处理 |
|---|---|---|
| 单文件大小 | ≤100MB | 建议先压缩(#15)或拆分(#5) |
| 单任务页数 | ≤200 页 | 引导用户指定页范围 |
| OCR 单批 | ≤50 页 | 自动分批,批间报进度 |
| 并发任务 | ≤3 | 排队并告知预计等待 |
| 单任务超时 | 5 分钟 | 熔断,保留中间结果,报告已完成部分 |
| 批量替换 | ≤500 文件/批 | 分批执行 |
| 密文删除 | ≤200 文件/批 | 分批执行 |
| 批量确认阈值 | >10 文件 | 必须先确认清单 |
references/security-compliance.md| 文件 | 何时读取 |
|---|---|
references/capabilities-core.md |
执行能力 1-5 前 |
references/capabilities-value.md |
执行能力 6-14 前 |
references/capabilities-pro.md |
执行能力 15-25 前 |
references/few-shot-examples.md |
意图路由拿不准时 |
references/quality-standards.md |
交付前自检 |
references/error-handling.md |
任何环节失败时 |
references/security-compliance.md |
涉密/脱敏/删除/签名任务前 |
references/command-guide.md |
用户问"你能做什么"时 |
references/value-messaging.md |
交付时取价值话术 |
references/tech-spec.md |
需要理解技术栈/管线细节时 |
references/ocr-config.md |
OCR 任务调参或识别效果差时 |
references/feishu-setup.md |
飞书部署/联调/排障时 |
整体质量中等偏下,存在明显的内容错配问题。核心功能框架和模块化设计做得不错,覆盖了常用的PDF处理场景。但后端文档和业务逻辑描述明显是"小红书爆款分析"的内容,与这个"PDF处理专家"的定位完全不符,容易造成误导。支付集成部分描述详细但代码缺失,核心依赖配置也不完整。谨慎使用,或等待开发者修复后再体验。