知识库 RAG
上传公司资料、产品文档、客户背景,让 LLM 翻译时自动注入相关上下文,避免 "AI 翻译腔"。
最后更新:
2026-05-13
知识库 RAG(Retrieval-Augmented Generation)让 LLM "知道你的业务"。本指南覆盖上传、检索机制、与术语表的协同。
1. 它解决什么问题
LLM 默认按通用语料翻译,碰到行业黑话 / 公司术语 / 客户特殊背景时只能"猜"。结果常常是:
- 翻译"绝对正确"但读起来像 AI
- 重要的上下文("我们的 Phoenix-7 是激光裁切设备")被忽略
- 同一概念前后翻得不一致
RAG 通过把相关文档片段塞进 prompt 解决上述所有问题。
2. 工作原理
对话句子 → ✦ Embedding → 向量检索 top-k 相关片段
↓
┌─ 把 top-k 片段塞进 LLM prompt
↓
LLM 翻译,输出带业务上下文的译文
整条管线 200-400 ms,对体感无影响。
3. 上传文档
- CrossMeet → Settings → Knowledge Base
- 点 Add Document
- 选择 PDF / DOCX / TXT / MD 文件(支持中英日韩等)
- 等待索引(10 秒到 2 分钟,看文档大小)
成功后,会显示文档标题、片段数、最后索引时间。
支持的格式
- PDF(含扫描版 OCR)
- DOCX / DOC
- TXT / MD
- HTML
- PPTX(实验性)
不支持
- 加密 PDF(请先解密)
- 图片(除非 PDF 内嵌且文字可识别)
- 视频 / 音频
4. 分组(Knowledge Base)
类似 Glossary 的分组,按客户 / 项目组织:
acme-corp— Acme 公司所有产品手册 + 财报摘要internal-wiki— 团队内部 wiki 节选competitor-brief— 竞品分析报告
激活一个或多个组后,只检索这些组的内容。
5. 检索机制
每次新句子到达 ASR,CrossMeet 会:
- 取该句子 + 前 N 句(默认 3 句)为 query
- 在激活的 KB 组中向量检索 top-k 相关片段(默认 k=3)
- 拼到 LLM prompt 的 "Reference" 区
- LLM 生成时同时参考 Glossary + RAG + 历史
可在 Settings → Knowledge Base → Retrieval 调整:
top_k:检索片段数(1-10,默认 3)chunk_size:每片段字数(128-1024,默认 512)similarity_threshold:相似度阈值(0-1,低于则不注入)
6. 何时用 Glossary,何时用 RAG?
| 场景 | 用 Glossary | 用 RAG |
|---|---|---|
| 单一术语强制译法 | ✅ | ❌ |
| 品牌 / 人名保留 | ✅ | ❌ |
| 长篇业务背景 | ❌ | ✅ |
| 客户产品描述 | ⚠️ 概念可能要 RAG | ✅ |
| 行业黑话整体氛围 | ❌ | ✅ |
推荐组合:Glossary 锁定关键词,RAG 补充业务上下文。两者并行不冲突。
7. 隐私
RAG 索引完全本地:
- 文档解析、分块、embedding 全部在本地完成(CPU 或 GPU)
- 向量数据库存于
%APPDATA%\CrossMeet\rag\ - 不上传任何文档内容到 CrossMeet 服务器
- 云端 LLM(GPT / Claude)调用时,只发送 top-k 检索到的片段(约 1.5 KB 文本),不发送原始文档
如担心云端泄漏,可改用本地 LLM(Ollama + Llama 3 等),全离线。
8. Embedding 引擎选择
Settings → Knowledge Base → Embedding Engine:
| 引擎 | 速度 | 质量 | 隐私 |
|---|---|---|---|
| OpenAI text-embedding-3-small | 快 | 优 | 文档片段会发到 OpenAI |
| 任意 OpenAI 兼容 embedding endpoint(含 Aliyun text-embedding 经兼容入口) | 中-快 | 良-优 | 取决于服务商 |
推荐:日常会议用 OpenAI(快),敏感文档用本地 bge-m3。
9. 最佳实践
- 小而精:每个 KB 组 < 50 个文档,否则检索噪声变大
- 每场会议激活相关组:不要常驻所有组
- 重要文档结构化:标题清晰、段落分明,提升 chunking 质量
- 定期清理过期文档:旧的产品手册、过时的合同要删除
10. 常见问题
Q: 索引一个文档要多久?
- 50 页 PDF:约 30 秒(OpenAI embedding),1.5 分钟(本地 bge-m3)
- 200 页 DOCX:约 2 分钟(OpenAI),5 分钟(本地)
Q: 文档更新了怎么办?
- KB 页找到文档,点 Re-index 重新索引
- 或删掉重新上传
Q: 能从云盘 / SharePoint 同步吗?
- v0.3 计划支持。当前只支持本地文件上传。
Q: 检索质量差怎么办?
- 检查 chunk_size 是否合适(太小丢上下文,太大稀释相似度)
- 检查文档质量(OCR 后的扫描 PDF 噪声大,建议重新生成)
- 换 embedding 引擎(中文文档建议 bge-m3)