AI 引擎配置(ASR / TTS / LLM)
切换、调优 CrossMeet 的 3 类 AI 引擎:语音识别(ASR)、语音合成(TTS)、翻译大模型(LLM)。
最后更新:
2026-05-13
CrossMeet 把 AI 能力拆成 3 个可独立切换的引擎:ASR(听)、LLM(翻)、TTS(说)。本指南覆盖每类引擎的选型、API key 配置、本地引擎安装、调优。
1. 整体架构
你说话 → 麦克风 → ASR → 原文 → LLM → 译文 → TTS → vMic → 对方
↓ ↑
VAD / 分段 Glossary + RAG 注入
每个引擎都可单独切换、并存使用。例如:本地 Whisper(ASR)+ Claude(LLM)+ Aliyun TTS。
2. ASR(语音识别)
选型对比
| 引擎 | 速度 | 准确率 | 离线 | 成本 | 适合 |
|---|---|---|---|---|---|
| Whisper-faster(本地) | 中(GPU 快) | 优 | ✅ | 免费 | 隐私敏感 / 长时段 |
| Whisper API | 快 | 优 | ❌ | $6/M 秒 | 偶尔使用 |
| 阿里云 ASR | 快 | 中文最佳 | ❌ | 按秒计费 | 中文为主 |
| Qwen3-ASR | 快 | 中文优秀 | ❌ | 按 token 计费 | 中文 + 多模态 |
推荐组合
- 日常工程对话:Whisper-faster 本地 + GPU(隐私 + 零成本)
- 重要客户会议:Whisper API(云端,稳定)
- 中文为主:阿里云 ASR + Qwen3 备份
配置 API key
Settings → AI Engines → 找到目标引擎卡片 → 填 API key + Region
本地 Whisper 安装
- AI Engines → Whisper-faster 卡片 → Install Local
- 选模型大小(按硬件):
- base (300 MB) — 8 GB 内存可用,质量基础
- medium (1.5 GB) — 16 GB 内存,质量良
- large-v3 (3 GB) — 16 GB+ 内存 + GPU 6 GB+,质量优
- 等待下载(5-15 分钟)
- 启用 GPU:勾选 Use CUDA (需 NVIDIA 驱动 ≥ 525)
关键参数
Settings → ASR → Advanced:
| 参数 | 默认 | 说明 |
|---|---|---|
vad_threshold |
0.3 | 静音检测灵敏度,嘈杂环境调低(0.2) |
min_silence_ms |
500 | 静音多少 ms 视为一句结束 |
partial_freq_ms |
300 | partial 转写发送频率 |
language |
auto | 强制语言(auto-detect 偶尔会判错) |
prompt |
(空) | LLM-style 提示,帮助识别专有名词 |
调优建议:开会前在 settings 试一句标准发音,调到舒服为止。
3. LLM(翻译大模型)
选型对比
| 引擎 | 翻译质量 | 速度 | 上下文窗口 | 成本 |
|---|---|---|---|---|
| Claude 3.5 Sonnet | 最高 | 快 | 200K | $3/M in, $15/M out |
| GPT-4o | 高 | 快 | 128K | $2.5/M in, $10/M out |
| GPT-4o-mini | 良 | 极快 | 128K | $0.15/M in, $0.6/M out |
| Gemini 1.5 Pro | 高 | 中 | 1M | $1.25/M in, $5/M out |
| Qwen3-Max | 高(中英最佳) | 快 | 128K | 按 token 计费 |
| 本地 Llama 3.1 70B (Ollama) | 中 | 慢 | 128K | 免费 |
推荐
- 商务正式:Claude 3.5 Sonnet(最自然,最少 AI 翻译腔)
- 预算敏感:GPT-4o-mini(成本极低,质量够日常)
- 本地隐私:Ollama + Llama 3 / Qwen2 70B(需 64 GB+ 内存或 GPU)
Prompt 模板自定义
Settings → LLM → Prompt Templates:
You are a professional translator.
Translate from {source_lang} to {target_lang}.
Glossary (MUST follow):
{glossary}
Reference (use if relevant):
{rag_chunks}
Context (previous 3 sentences):
{history}
Sentence to translate:
{text}
Output ONLY the translation, no explanation:
变量列表:
{source_lang}/{target_lang}— 源 / 目标语言代码{glossary}— 激活的术语表{rag_chunks}— RAG 检索到的片段{history}— 前 N 句对话{text}— 当前要翻译的句子
4. TTS(语音合成)
详见 虚拟麦克风。
关键参数
Settings → TTS → Advanced:
| 参数 | 默认 | 说明 |
|---|---|---|
voice |
引擎默认 | 选择音色(每个引擎有多个) |
speed |
1.0 | 语速 0.5-2.0 |
pitch |
0 | 音调 -10 ~ +10 |
stability |
0.5 | 仅 ElevenLabs,音色稳定性 |
多音色支持
可为不同语种 / 不同人设置不同音色:
- 英文(主):OpenAI TTS -
alloy(中性,专业) - 中文(主):Aliyun TTS -
xiaoyun(女声,温和) - 日文(副):Edge TTS -
ja-JP-NanamiNeural
Settings → TTS → Multi-Voice 配置。
5. 引擎切换的快捷键
主界面顶部 dropdown 可临时切换:
Ctrl+1— 切 ASR 到引擎 1(Settings 里定义)Ctrl+2— 切 LLM 到引擎 2Ctrl+3— 切 TTS 到引擎 3
适合会议中突然需要切到本地引擎(敏感话题)。
6. API key 获取
| 服务 | 获取地址 | 配置项 |
|---|---|---|
| OpenAI | platform.openai.com | API key |
| Anthropic | console.anthropic.com | API key |
| Google AI | aistudio.google.com | API key |
| 阿里云 | dashscope.console.aliyun.com | API key + Region |
| Azure | portal.azure.com | Endpoint + Key + Region |
7. 私有部署 / 自托管
CrossMeet 兼容 OpenAI API 格式,可指向私有 endpoint:
Settings → LLM → Custom Endpoint
Base URL: https://your-proxy.com/v1
API Key: your-internal-key
Model: claude-3-5-sonnet(任意名称,由代理转发)
适合:企业代理、Ollama 本地、One-API / LiteLLM 中转。
8. 局域网共享(LAN API)
把本机的引擎暴露给局域网其他设备:
- Settings → Networking → LAN API
- 开启 → 选择要暴露的引擎(ASR / TTS / LLM)
- 设置访问 token
- 局域网其他设备的 CrossMeet 配置:
- Base URL:
http://your-ip:7860/v1 - API Key: 你设置的 token
- Base URL:
适合:一台 GPU 工作站服务 10 个人的轻量笔记本。
9. 故障排查
| 问题 | 排查 |
|---|---|
| ASR 识别全是乱码 | 检查 language 是否 auto,可能识别成了错误语种 |
| LLM 翻译漏字 | 检查 prompt 是否完整 / glossary 是否过大塞爆 context |
| TTS 没声音 | 看 Audio settings → 输出设备是否正确 |
| 云引擎超时 | 检查 API key 余额、网络可达性、是否被防火墙拦截 |
| 本地引擎慢 | 看 GPU 是否启用、模型大小是否太大 |
更多见 故障排查。