文档审核

👤 qiuqiu 📦 v1.0.1 ⭐ 4.5 ⬇️ 4.2K 下载
📄 办公效率 免费

📖 技能介绍

文档审核技能 (Document Review Skill)

概述

对任意类型的文档进行全维度审核,采用双层架构:

层级 执行者 职责 特点
L1 量化层 Python 脚本 格式检查、文字错误检测、结构分析、数据提取 快速、确定性、可复现
L2 语义层 AI 模型 逻辑冲突检测、事实核查、逻辑混乱分析、综合评判 深度理解、语义推理、联网验证

四大核心问题

问题类型 说明 执行层级 优先级
逻辑冲突 前后矛盾、论述打架、论据与结论不一致 L2 语义层 高
事实冲突 数据矛盾、时间线错误、引用来源冲突 L2 语义层(+联网核查) 高
文字错误 错别字、语病、标点错误、格式不一致 L1 量化层 中
逻辑混乱 结构散乱、论证跳跃、归因谬误、重复冗余 L2 语义层 中

辅助评分维度

脚本在 L1 层同时计算四个辅助评分,作为文档质量的量化参考:

维度 权重 说明
格式规范性 20% 标题层级、段落长度、结构完整性
内容逻辑性 30% 论据匹配、过渡自然、无矛盾
表述清晰度 20% 模糊词汇、句子长度、术语一致性
方案可行性 30% 执行步骤、资源需求、风险评估

支持的文档格式

格式 扩展名 提取方式 备注
Word .docx pandoc → python-docx → 原始XML 三级回退
PDF .pdf pymupdf → pdftotext → OCR 扫描版自动 OCR
PPT .pptx python-pptx 含表格、备注
纯文本 .txt 自动编码检测 GBK/UTF-8/GB18030
Markdown .md 直接读取 —

平台集成提示:如果 WorkBuddy 的 docx/pdf/pptx 专用 Skill 可用,优先调用它们提取内容——它们对表格、图片、批注的处理更完善。脚本作为通用回退方案。


使用流程

1. 定位文件

# Windows - 搜索文件
Get-ChildItem -Path . -Recurse -Include *.docx,*.pdf,*.pptx,*.txt,*.md -ErrorAction SilentlyContinue | Where-Object { $_.Name -like "*关键词*" } | Select-Object FullName, LastWriteTime

2. 选择审核模式

模式 命令参数 检查内容 适用场景
快速扫描 --mode quick 仅 L1 层:格式+文字错误 快速过一遍,找明显问题
标准审核 --mode standard L1 全部 + L2 逻辑冲突+逻辑混乱 日常文档审核
深度审核 --mode deep L1 全部 + L2 全部 + 联网事实核查 重要文档(投标、合同、发布稿)

3. 执行 L1 量化审核(脚本)

# 单文件审核
python scripts/review_document.py "文档路径" --mode standard --output markdown

# 批量审核(多文件汇总)
python scripts/review_document.py "文件1.docx" "文件2.pdf" --batch --output json

# 排除指定检查类型
python scripts/review_document.py "文档路径" --exclude text_errors,feasibility

# 增量审核(仅审核修改部分)
python scripts/review_document.py "新版本.docx" --diff "旧版本.docx"

# 指定术语词典
python scripts/review_document.py "文档路径" --glossary "术语表.json"

术语表格式(JSON):

{
  "terms": {
    "AI": ["人工智能", "ai", "A.I."],
    "ROI": ["投资回报率", "roi"]
  },
  "preferred": {
    "AI": "AI",
    "ROI": "ROI"
  }
}

发现更多技能插件,请访问7w4.net。

4. 执行 L2 语义审核(AI)

脚本完成后会输出结构化的文档摘要和 L1 检查结果。基于此,AI 执行以下分析:

4.1 逻辑冲突检测

读取脚本提取的章节结构和关键论点,用以下提示词驱动 AI 分析:

请仔细阅读以下文档内容,逐一标注所有逻辑冲突:
1. 前后矛盾的表述(列出矛盾双方及各自位置)
2. 论据与结论不一致的地方
3. 同一约束条件相互矛盾的地方(如"必须"与"可选"并存)
4. 范围矛盾(标题承诺"全面"但内容只覆盖部分)

输出格式:
[冲突类型] 位置A: "原文表述" ↔ 位置B: "原文表述"
分析: 矛盾原因说明
建议: 具体修改方案

4.2 事实冲突检测

提取文档中的数据、时间、引用,执行联网核查:

请从以下文档中提取所有事实性陈述,分类核查:
- 数据类:比例、金额、人数、排名(全文交叉对比一致性)
- 时间类:日期、期限、里程碑(核查时间线逻辑)
- 引用类:法规名称及条款号、标准编号(联网验证是否现行有效)
- 名称类:人物、公司、产品名(交叉验证一致性)

对每个需联网核查的项目,使用 WebSearch 工具验证。
输出格式:
[核查状态: ✓一致/✗冲突/⚠无法确认] 位置: "原文表述"
依据: 核查来源或冲突说明
建议: 修改方案

4.3 逻辑混乱分析

请分析以下文档的逻辑结构,检查:
1. 结构散乱:同一话题分散在多个章节
2. 论证跳跃:A→C 缺少 B 作为过渡
3. 归因谬误:相关性当作因果性
4. 重复冗余:同一内容反复出现
5. 归类不清:不同层级内容混放
6. 主语不清:句子主语频繁切换,代词指代不明

输出格式:
[问题类型] 位置: 问题描述
建议: 重组/删减/补充方案

5. 生成审核报告

脚本支持多种输出格式:

# Markdown 报告(默认)
python scripts/review_document.py "文档路径" --output markdown

# JSON 结构化数据(供 AI 进一步处理)
python scripts/review_document.py "文档路径" --output json

# Word 文档(可直接发送给同事)
python scripts/review_document.py "文档路径" --output word --output-file "审核报告.docx"

AI 综合报告生成后,使用 present_files 交付给用户,并用 show_widget 输出可视化报告(评分雷达图 + 问题分布图)。


审核报告模板

# 文档审核报告

**审核文档**: [文档名称]
**审核时间**: YYYY-MM-DD HH:mm
**文档类型**: [技术方案/商务文档/研究报告/etc.]
**文档规模**: XX页 / XX字
**审核模式**: [快速扫描/标准审核/深度审核]

---

## 📊 评分概览

| 维度 | 评分 | 等级 |
|------|------|------|
| 格式规范性 | XX | [优/良/中/差] |
| 内容逻辑性 | XX | [优/良/中/差] |
| 表述清晰度 | XX | [优/良/中/差] |
| 方案可行性 | XX | [优/良/中/差] |
| **综合** | **XX** | **[等级]** |

---

## 📋 问题概览

| 问题类型 | 高 | 中 | 低 | 合计 |
|----------|---|---|---|------|
| 逻辑冲突 | X | X | X | X |
| 事实冲突 | X | X | X | X |
| 文字错误 | X | X | X | X |
| 逻辑混乱 | X | X | X | X |
| **合计** | **X** | **X** | **X** | **X** |

---

## 🔍 详细问题

### 逻辑冲突

#### [高] 问题标题
- **位置**: 第X页 / [章节名]
- **冲突点A**: [原文表述]
- **冲突点B**: [原文表述]
- **分析**: [矛盾原因]
- **建议**: [修改方案]
- **状态**: [待处理/已修复/已忽略]

> 其余问题类型同此格式

---

## 💡 综合改进建议

### 必须修改(高优先级)
1. [最重要的问题及修改方案]

### 建议修改(中优先级)
2. [次要问题及修改方案]

### 可选优化(低优先级)
3. [小问题或风格优化]

---

## 🎯 总结

**整体评价**: [100字以内]

**建议**: [修改后可直接使用 / 需重大修改后使用]

**最薄弱环节**: [维度名](XX分),建议重点关注。

问题严重程度分级

等级 说明 扣分 处理建议
高 严重影响可信度或合规性(数据错误、法规引用错误、核心结论矛盾) 15分/处 必须修改
中 影响专业性或阅读体验(次要逻辑混乱、少量错别字、格式不统一) 8分/处 建议修改
低 轻微问题(表述可更精炼、个别用词可优化) 3分/处 可选修改

批量审核

对多份文档执行批量审核时,脚本生成汇总报告:

python scripts/review_document.py doc1.docx doc2.pdf doc3.pptx --batch --output json --output-file "批量审核结果.json"

汇总报告包含: - 每份文档的单独评分和问题数 - 跨文档一致性检查(相同数据/术语在不同文档中是否一致) - 整体质量排名


增量审核

对比文档修改前后的版本,仅审核变更部分:

python scripts/review_document.py "新版本.docx" --diff "旧版本.docx"

输出: - 新增内容审核 - 修改内容复审 - 已修复问题确认 - 新引入问题检测


平台集成

与 WorkBuddy 文档 Skill 联动

场景 联动方式
内容提取 优先调用 docx/pdf/pptx 专用 Skill,脚本作为回退
报告交付 用 present_files 展示报告文件
可视化 用 show_widget 输出评分雷达图和问题分布图
在线编辑审核 与 tencent-local-office-edit 联动,审核后直接在编辑器中修改
标注回写 将高优先级问题作为批注写回 .docx 原文档

标注回写流程

  1. 脚本生成审核报告(含问题位置和原文片段)
  2. AI 提取高优先级问题,生成批注内容
  3. 调用 tencent-local-office-edit 的 save_file 将批注写入原文档
  4. 用户在编辑器中查看标注并进行修改
  5. 修改后重新审核,确认问题已解决

审核技巧

AI 辅助审核的关键策略

  1. 数据交叉验证:提取全文所有数值数据,对比同一指标在不同位置的表述是否一致
  2. 时间线梳理:提取所有时间节点,按顺序排列,检查是否有倒置或矛盾
  3. 术语统一检查:提取所有专业术语,确认全文写法统一(可用术语词典辅助)
  4. 标题层级检查:检查 H1/H2/H3 是否逐级包含、无跳跃
  5. 代词指代检查:确认"它/这/那"等指代明确,无歧义

联网核查优先级

  1. 必须核查:法规名称及条款号、国家标准编号、认证体系名称
  2. 建议核查:市场数据、行业排名、竞争对手信息
  3. 可选核查:一般性引用、历史事件描述

依赖项

# 核心依赖
pip install python-docx pymupdf python-pptx

# 可选依赖(增强功能)
pip install pytesseract pillow  # OCR 支持
pip install chardet              # 编码检测

注意事项

  1. 客观中立:审核时保持客观,避免主观偏好影响判断
  2. 有据可查:事实冲突需注明依据(来源/法规/常识)
  3. 明确位置:每个问题需标注具体位置(页码/章节/段落)
  4. 可操作建议:修改建议需具体可执行,而非泛泛而谈
  5. 区分优先级:避免将所有问题都列为高优先级
  6. 尊重原文意图:修改建议应保留原文核心意思
  7. 大文件处理:超过 500 页的文档建议使用增量审核或分章节审核
  8. 编码兼容:Windows 环境下 .txt 文件可能使用 GBK 编码,脚本已做自动检测

版本历史

  • v7.0 (2026-07-10) - 双层架构版本:
  • 统一审核框架:四大核心问题 + 辅助评分维度
  • 双层架构:L1 脚本量化 + L2 AI 语义
  • 新增审核模式:快速扫描/标准审核/深度审核
  • 新增批量审核和增量审核
  • 新增排除规则和术语词典支持
  • 补全 .pptx 格式支持
  • 新增 OCR 回退和编码自动检测
  • 新增 Word 格式导出
  • 新增平台集成:show_widget 可视化、present_files 交付、标注回写
  • 清除硬编码测试路径
  • 消除重复报告模板

  • v6.0 (2026-04-22) - 通用审核版本

  • v5.0 (2026-03-19) - 知识共建激励版本
  • v4.0 (2026-03-19) - 竞品分析专项版本
  • v3.0 (2026-03-07) - 快速定位优化版本
  • v2.0 (2026-03-07) - 功能完善版本
  • v1.0 - 初始版本

🤖 AI 评测

这个文档审核工具质量较好,优势在于审核全面细致,支持多种文档格式检查,还能自动评分和改进建议。不足之处是某些深度审核功能需要AI配合使用,实际表现可能不稳定;另外安装配置比较麻烦,需要安装好几个软件包。日常使用标准审核模式基本够用,但重要文档建议手动复查AI审核的结果。

📊 多维度评分

适应性4.4
规范性4.2
有效性4.7
可靠性4.3
可信度4.9

📁 包含文件 (4 个)

📄 SKILL.md 11.9 KB
📄 references/review_criteria.md 7.3 KB
📄 scripts/extract_docx.py 3.7 KB
📄 scripts/review_document.py 61.9 KB