聊天记录提纯器 (Chat Distill)
核心能力
将杂乱的多轮聊天记录(微信、飞书、钉钉、Slack 等)蒸馏成高精度、生产级的 26-Scheme Prompt 蓝图——覆盖角色、背景、任务、利益相关者、优先级、风险、验收、决策推理、质量标准等 26 个正交维度,确保生成的 Prompt 零歧义、可直接执行。
执行流水线
第一步:原始数据预处理
- 读取用户提供的聊天记录(文本粘贴、文件上传、截图 OCR 均可)
- 标注发言人身份(A/B/C 或姓名),保留时间线顺序
来源于7w4.net。
- 识别并标记噪音类型:寒暄、表情包描述、语音转文字错别字、重复确认、跑题闲聊
第二步:核心意图挖掘
- 目标识别:从对话中提取最终想要交付的资产/动作(文案、方案、代码、报告等)
- 约束提取:字数、语气、格式、deadline、禁止事项等硬性要求
- 偏好信号:用户提及的参考案例、风格倾向、"不要 XX 要 XX"类对比表达
- 隐含推理:老板对草稿的批评 -> 反转为正向约束;讨论中的犹豫/妥协 -> 标记为低置信度
- 多维信号采集:利益相关者关系、优先级线索、风险暗示、验收标准、版本迭代痕迹等
第三步:噪音过滤
完全移除以下内容:
- 寒暄问候("在吗""哈喽""谢谢")
- 情绪填充("哈哈""牛""6")
- 冗余确认("收到""好的""明白")
- 跑题闲聊(与核心目标无关的支线对话)
- 语音转文字的明显错别字(自动修正)
第四步:26-Scheme 结构化编译
将提纯后的信息填入二十六柱框架:
核心六柱(基础层)
1. Role(角色与人设)
- 根据业务领域定义高度具体的专家身份
- 禁用泛化标签("助手""AI"),使用精准人设("资深汽车文案""敏捷产品经理")
2. Context(背景与意图)
- 合成业务场景、市场痛点、目标受众
- 提取对话中触发此任务的显性/隐性动因
3. Task(核心指令与流水线)
- 按时间顺序拆解执行步骤为 SOP
- 每步用强动词开头("撰写""分析""生成")
4. Output Format(输出格式)
- 指定精确的响应布局(Markdown 表格、JSON schema、编号列表、特定标签等)
- 若对话未明确,根据任务类型推断最佳视觉与结构格式
5. Constraints(约束与红线)
- 列出所有硬边界:长度限制、禁用措辞、强制语气、数据范围
- 将口语化要求翻译为可执行参数("别太枯燥" -> "保持活泼有力的语气,避免行业术语")
6. Examples(Few-Shot 示例)
- 提取对话中提及的参考案例、已接受的草稿、模板
- 若对话缺少示例,根据业务上下文生成一组高质量的 Input/Output 对
扩展十四柱(增强层)
7. Stakeholders(利益相关者与受众)
- 识别决策者、执行者、受影响方、最终受众
- 标注各方关注点和潜在冲突
8. Priority & Weight(优先级与权重)
- 区分 Must-have / Should-have / Could-have
- 标注各需求的权重和紧迫程度
9. Success Metrics(成功指标与 KPI)
- 定义可量化的成功标准(转化率、通过率、响应时间等)
- 标注基线值和目标值
10. Timeline & Milestones(时间线与里程碑)
- 提取所有 deadline、交付节点、评审时间
- 标注关键路径和缓冲期
11. Resources & Dependencies(资源与依赖)
12. Tone & Voice(语气与品牌声音)
- 定义具体的语言风格:正式/活泼/技术/情感化
- 标注品牌调性一致要求
13. Domain Knowledge(领域知识与术语表)
14. Risk & Mitigation(风险与应对)
15. Edge Cases(边界与异常处理)
- 列出特殊情况、极端输入、空值场景
- 定义 fallback 行为
16. Validation Criteria(验收标准)
- 定义明确的验收检查清单
- 标注质量门禁和 Review 流程
17. Iteration & Version(迭代历史与版本)
- 记录讨论中的版本演进(v1->v2->v3 关键变更)
- 标注当前版本号和待定项
18. Deliverable Spec(交付物规格)
- 精确定义交付物格式、文件名、存储位置
- 标注是否需要多版本交付
19. Compliance & Ethics(合规与伦理)
- 标注法律合规要求(数据隐私、版权、广告法等)
- 定义伦理红线
20. Localization & Culture(本地化与文化适配)
高阶六柱(决策与质量层)
21. Anti-Goals / Out of Scope(反目标与排除范围)
- 明确标注"不要做什么"——比 Constraints 范围更广的战略拒绝
- 提取讨论中明确排除的方向、被否决的方案、不关注的用户群
- 防止 LLM 在已被否决的方向上浪费资源
22. Assumptions & Preconditions(假设与前提条件)
- 列出讨论中默认成立的前提假设(显性和隐性)
- 区分"已验证的事实"和"基于经验的假设"
- 标注每个假设的不确定性等级(确定/很可能/猜测)
23. Decision Log(决策记录与推理链)
- 记录关键决策点:"为什么选 A 不选 B"
- 提取决策者、决策时间、核心推理逻辑
- 标注被否决的替代方案及其否决理由
24. Quality Standards(质量标准)
- 定义"好"的标准——不只是一票通过/不通过的 Validation
- 包含审美、体验、精确度等非二元维度
- 与 Success Metrics 互补:Metrics 是量化 KPI,Quality 是定性标准
25. Feedback Mechanism(反馈收集机制)
- 产出物如何收集反馈:审阅人、审阅渠道、反馈格式
- 标注迭代触发条件:什么信号意味需要重做
- 定义反馈闭环的时效要求
26. Data Sources(数据源与可信度)
- 列出输入数据来源、格式、可信度等级
- 标注数据的局限性(时效性、样本偏差、覆盖率)
- 区分"权威数据"和"参考数据",防止 LLM 混用
第五步:质量校验
编译完成后执行以下检查:
- 零信息丢失:所有具体数字、deadline、专有名词、功能列表、负面约束 100% 保留
- 去口语化:最终 prompt 中不得出现任何口语俚语、结巴、对话填充词
- 隐含推断:批评反转为正向标准、模糊表述具体化
- 槽口完整性:26 个槽口逐一检查,空槽须标注"对话中未提及,已根据上下文推断"
- 可执行性:生成的 prompt 应可直接输入任意 LLM 执行而无歧义
第六步:输出
生成最终 prompt,包裹在单个 Markdown 代码块中,使用以下精确结构:
# 1. Role (角色与人设)
- [精准专家身份]
# 2. Context (背景与意图)
- [业务场景、痛点、触发动因]
# 3. Task (核心指令与流水线)
- [SOP 步骤列表]
# 4. Output Format (输出格式)
- [精确结构要求]
# 5. Constraints (约束与红线)
- [硬边界列表]
# 6. Examples (Few-Shot 示例)
- **Input**: [示例输入]
- **Output**: [示例理想输出]
# 7. Stakeholders (利益相关者与受众)
- [决策者、执行者、受众]
# 8. Priority & Weight (优先级与权重)
- [Must/Should/Could 分级]
# 9. Success Metrics (成功指标与 KPI)
- [可量化标准]
# 10. Timeline & Milestones (时间线与里程碑)
- [关键节点和 deadline]
# 11. Resources & Dependencies (资源与依赖)
- [所需输入和外部依赖]
# 12. Tone & Voice (语气与品牌声音)
- [语言风格和品牌调性]
# 13. Domain Knowledge (领域知识与术语表)
- [专有名词和术语标准]
# 14. Risk & Mitigation (风险与应对)
- [风险点和应对策略]
# 15. Edge Cases (边界与异常处理)
- [特殊情况和 fallback]
# 16. Validation Criteria (验收标准)
- [验收检查清单]
# 17. Iteration & Version (迭代历史与版本)
- [版本演进和当前状态]
# 18. Deliverable Spec (交付物规格)
- [格式、命名、存储]
# 19. Compliance & Ethics (合规与伦理)
- [法律和伦理红线]
# 20. Localization & Culture (本地化与文化适配)
- [多语言和文化要求]
# 21. Anti-Goals / Out of Scope (反目标与排除范围)
- [明确排除的方向和被否决的方案]
# 22. Assumptions & Preconditions (假设与前提条件)
- [默认成立的前提,标注不确定性等级]
# 23. Decision Log (决策记录与推理链)
- [关键决策点、推理逻辑、否决的替代方案]
# 24. Quality Standards (质量标准)
- [定性标准:审美、体验、精确度等非二元维度]
# 25. Feedback Mechanism (反馈收集机制)
- [审阅人、渠道、迭代触发条件、时效要求]
# 26. Data Sources (数据源与可信度)
- [数据来源、格式、可信度等级、局限性]
使用方式
输入格式
用户可通过以下方式提供聊天记录:
- 直接粘贴:将聊天记录文本粘贴到对话中
- 文件上传:上传 .txt / .md / .json 格式的聊天导出文件
- 截图:提供聊天截图(通过 OCR 识别)
- 语音转文字:粘贴语音转文字结果(自动修正错别字)
辅助工具
配套脚本 scripts/distill.py 可用于批量处理聊天记录文件:
python scripts/distill.py input.txt [output.md]
精简模式
当聊天记录较短或场景简单时,可使用 --compact 参数仅输出核心六柱:
python scripts/distill.py input.txt output.md --compact
特殊场景处理
多人会议记录
- 识别主持人、汇报人、参与者角色
- 按议题分组而非时间线组织
- 决策项和待办项单独标注
- Stakeholders 槽口标注所有参会方的角色与权限
老板批评型对话
- 将所有批评反转为目标约束
- "太技术了" -> 约束:"避免工程术语,面向非专业读者"
- "不够吸引人" -> 约束:"使用情感化语言,增强场景代入感"
- Risk 槽口标注"未满足老板预期"的风险及应对
多轮迭代型对话
- 只保留最新版本的反馈
- 标注版本演进路径(v1->v2->v3 的关键变更点)
- 最终 prompt 基于最新版本生成
- Iteration & Version 槽口完整记录演进
跨语言对话
- 若聊天记录中混合中英文,输出 prompt 的语言跟随用户最终交付目标
- 专有名词保留原文,不强行翻译
- Localization 槽口标注多语言需求
参考资源
详细框架指南见 references/26-scheme-guide.md
完整示例库见 references/examples.md
原始规范文档见 references/original-spec.md