Pyannote · SenseVoice · Gleaning · RAG · HDBSCAN

Audio2Knowledge

端到端客服录音知识库提取系统

GitHub 仓库版本 v1.0

项目概述

Audio2Knowledge 是一个企业级的端到端客服录音知识库提取系统。它能够将大量客服对话录音批量转换为结构化的高质量知识库语料,为 RAG 智能客服提供可靠的数据基础。

与传统 ASR 方案不同,本系统专门针对客服录音的复杂场景进行了深度优化——强噪声环境、多人对话交织、方言口音等挑战,通过深度学习说话人分离与 LLM 多轮清洗机制,确保最终输出的知识库质量。

数据 说明
7 处理阶段
端到端 全自动流水线
企业级 高可靠架构

Audio2Knowledge:从杂乱客服录音到结构化知识库

一条端到端流水线:把强噪声、多人交织的客服录音,提炼成一条条结构化 Q&A 知识。

核心特性

Gleaning 多轮清洗

LLM 驱动的迭代优化流程,每轮自动评分,未达标内容回炉重造,专门针对客服对话的专业清洗策略

亮点:质量阈值 0.90(达标即停)

双缓存压缩系统

活跃/非活跃缓冲区轮换机制,写入与压缩完全解耦,Snapshot 隔离保证数据一致性

亮点:零阻塞写入

三阶段智能压缩

Embedding 预筛选 + LLM 精确判断 + 智能合并,在保留完整信息的前提下高效压缩

亮点:40%+ 压缩率

异步并发引擎

基于 ThreadPoolExecutor 的任务调度,支持指数退避重试与优先级调度

亮点:16 路 LLM 并发

七阶段处理流水线

从原始 MP3 录音到高质量结构化知识库,全程自动化、无需人工干预。

七阶段处理流水线

七阶段:音频输入 → 说话人分离 → 音频切分 → 语音识别 → Gleaning 清洗 → QA 提取 → 智能压缩 → 知识库。

  1. 原始录音输入(MP3 / WAV)——自动格式检测与完整性校验,统一转换为 16kHz WAV 标准格式,规范化文件命名与目录结构
  2. 说话人分离(Pyannote 3.1)——基于深度学习的精确说话人识别,生成 RTTM 毫秒级时间戳文件,支持 CUDA GPU 加速
  3. 音频切分(torchaudio)——依据 RTTM 时间戳对完整音轨进行毫秒级精确切分,按说话人和静音段生成规整子音频片段
  4. 语音识别(SenseVoice-Small)——阿里开源多语言 ASR 模型本地推理,支持中英文及方言识别,按说话人分段输出规整文本(时间戳保留在切分片段的文件名中)
  5. Gleaning 智能清洗(Qwen-Plus)——LLM 多轮迭代清洗,自动评分 + 未达标回炉重造,专业术语标准化与口语冗余清理
  6. 问答对提取(LLM 驱动)——自动识别与提取结构化 QA 对,含来源文件、置信度、时间戳等完整元数据,双缓存异步写入
  7. 智能压缩(三阶段策略)——Embedding 预筛 + LLM 精确判断 + 智能合并,40%+ 压缩率,避免知识库无限膨胀

系统架构

双缓存知识库架构

双缓存知识库架构:A/B 缓冲轮换 + 快照压缩

新 QA 写入活跃缓冲区,压缩在其快照副本上进行;缓冲 A/B 轮换并做尾部增量同步——写入与压缩用独立锁彻底解耦。

  • Snapshot 隔离保证数据一致性
  • 尾部增量同步防止数据丢失
  • 写入与压缩完全解耦

三阶段智能压缩策略

三阶段智能压缩:完全去重 → 向量聚类预筛 → LLM 判断 → 合并

完全去重 →(量大时)Qwen3-Embedding + HDBSCAN 聚类预筛 → Qwen-Plus 判定可合并组 → LLM 融合,知识库 40%+ 更精简。

  1. Embedding 预筛选:先做完全去重,QA 对较多时再用 Qwen3-Embedding-8B 取向量 + HDBSCAN 密度聚类发现相似簇
    • 成效:大幅减少两两比对量
  2. LLM 精确判断:Qwen-Plus 批量分析语义相似度,精确标记可合并组
    • 成效:语义级判定,避免纯向量近似导致的误合并
  3. 智能合并:LLM 融合 QA 对,保留完整关键信息,更新元数据追踪合并历史
    • 成效:40%+ 压缩率

技术栈

处理阶段 核心技术 说明
说话人分离 pyannote/speaker-diarization-3.1 基于深度学习的精确说话人识别模型
语音识别 SenseVoice-Small 阿里开源多语言 ASR 模型,本地部署
文本清洗 / QA 提取 qwen-plus-latest 阿里云通义千问大语言模型
向量计算 Qwen3-Embedding-8B 语义相似度计算与聚类预筛选
聚类算法 HDBSCAN 密度聚类,自动发现相似簇,大幅减少两两比对量

系统架构层

  • 配置管理:分层 YAML 配置系统,环境变量 > 本地 > 环境 > 默认,支持多环境部署
  • 并发控制:ThreadPoolExecutor 异步调度 + 指数退避重试 + 动态资源管理
  • 音频处理:PyTorch 生态 torchaudio 库,毫秒级切分精度,CUDA GPU 加速

技术指标

指标 数值
处理流水线 7 阶段全自动
LLM 并发通道 16 路
Gleaning 质量阈值 0.90(达标即停止迭代)
知识库压缩率 40%+
模型部署 ASR / 说话人分离 / Embedding 全本地推理

应用场景

RAG 知识库构建

将历史客服录音批量转化为结构化 QA 语料,向量化存储后支持语义检索,为智能客服提供精准知识基础,知识库持续补充与优化

客服质量分析

自动提取常见问题类型与频率,识别优秀回复话术模板,对客服回复质量进行自动评分,量化服务质量并优化培训体系

产品需求洞察

从海量咨询中挖掘用户痛点、功能建议与改进意见,分析需求变化趋势,辅助产品决策和优先级排序

合规风险监控

实时识别敏感话题、不当言论、违规承诺和超范围服务等潜在法律风险点,及时预警帮助企业防范合规问题

总结

Audio2Knowledge 不仅仅是一个语音识别工具,更是一个完整的音频知识提取解决方案。通过端到端自动化流水线、Gleaning 多轮清洗机制、双缓存压缩系统和异步并发处理引擎,将杂乱的客服录音转化为高质量的结构化知识库。

查看 GitHub 源码 →