AI 引擎配置(ASR / TTS / LLM)

切换、调优 CrossMeet 的 3 类 AI 引擎:语音识别(ASR)、语音合成(TTS)、翻译大模型(LLM)。

最后更新: 2026-05-13

CrossMeet 把 AI 能力拆成 3 个可独立切换的引擎:ASR(听)、LLM(翻)、TTS(说)。本指南覆盖每类引擎的选型、API key 配置、本地引擎安装、调优。

1. 整体架构

你说话 → 麦克风 → ASR → 原文 → LLM → 译文 → TTS → vMic → 对方
       ↓                                              ↑
       VAD / 分段                                  Glossary + RAG 注入

每个引擎都可单独切换、并存使用。例如:本地 Whisper(ASR)+ Claude(LLM)+ Aliyun TTS。

2. ASR(语音识别)

选型对比

引擎 速度 准确率 离线 成本 适合
Whisper-faster(本地) 中(GPU 快) 免费 隐私敏感 / 长时段
Whisper API $6/M 秒 偶尔使用
阿里云 ASR 中文最佳 按秒计费 中文为主
Qwen3-ASR 中文优秀 按 token 计费 中文 + 多模态

推荐组合

  • 日常工程对话:Whisper-faster 本地 + GPU(隐私 + 零成本)
  • 重要客户会议:Whisper API(云端,稳定)
  • 中文为主:阿里云 ASR + Qwen3 备份

配置 API key

Settings → AI Engines → 找到目标引擎卡片 → 填 API key + Region

本地 Whisper 安装

  1. AI Engines → Whisper-faster 卡片 → Install Local
  2. 选模型大小(按硬件):
    • base (300 MB) — 8 GB 内存可用,质量基础
    • medium (1.5 GB) — 16 GB 内存,质量良
    • large-v3 (3 GB) — 16 GB+ 内存 + GPU 6 GB+,质量优
  3. 等待下载(5-15 分钟)
  4. 启用 GPU:勾选 Use CUDA (需 NVIDIA 驱动 ≥ 525)

关键参数

Settings → ASR → Advanced

参数 默认 说明
vad_threshold 0.3 静音检测灵敏度,嘈杂环境调低(0.2)
min_silence_ms 500 静音多少 ms 视为一句结束
partial_freq_ms 300 partial 转写发送频率
language auto 强制语言(auto-detect 偶尔会判错)
prompt (空) LLM-style 提示,帮助识别专有名词

调优建议:开会前在 settings 试一句标准发音,调到舒服为止。

3. LLM(翻译大模型)

选型对比

引擎 翻译质量 速度 上下文窗口 成本
Claude 3.5 Sonnet 最高 200K $3/M in, $15/M out
GPT-4o 128K $2.5/M in, $10/M out
GPT-4o-mini 极快 128K $0.15/M in, $0.6/M out
Gemini 1.5 Pro 1M $1.25/M in, $5/M out
Qwen3-Max 高(中英最佳) 128K 按 token 计费
本地 Llama 3.1 70B (Ollama) 128K 免费

推荐

  • 商务正式:Claude 3.5 Sonnet(最自然,最少 AI 翻译腔)
  • 预算敏感:GPT-4o-mini(成本极低,质量够日常)
  • 本地隐私:Ollama + Llama 3 / Qwen2 70B(需 64 GB+ 内存或 GPU)

Prompt 模板自定义

Settings → LLM → Prompt Templates

You are a professional translator.
Translate from {source_lang} to {target_lang}.

Glossary (MUST follow):
{glossary}

Reference (use if relevant):
{rag_chunks}

Context (previous 3 sentences):
{history}

Sentence to translate:
{text}

Output ONLY the translation, no explanation:

变量列表:

  • {source_lang} / {target_lang} — 源 / 目标语言代码
  • {glossary} — 激活的术语表
  • {rag_chunks} — RAG 检索到的片段
  • {history} — 前 N 句对话
  • {text} — 当前要翻译的句子

4. TTS(语音合成)

详见 虚拟麦克风

关键参数

Settings → TTS → Advanced

参数 默认 说明
voice 引擎默认 选择音色(每个引擎有多个)
speed 1.0 语速 0.5-2.0
pitch 0 音调 -10 ~ +10
stability 0.5 仅 ElevenLabs,音色稳定性

多音色支持

可为不同语种 / 不同人设置不同音色:

  • 英文(主):OpenAI TTS - alloy(中性,专业)
  • 中文(主):Aliyun TTS - xiaoyun(女声,温和)
  • 日文(副):Edge TTS - ja-JP-NanamiNeural

Settings → TTS → Multi-Voice 配置。

5. 引擎切换的快捷键

主界面顶部 dropdown 可临时切换:

  • Ctrl+1 — 切 ASR 到引擎 1(Settings 里定义)
  • Ctrl+2 — 切 LLM 到引擎 2
  • Ctrl+3 — 切 TTS 到引擎 3

适合会议中突然需要切到本地引擎(敏感话题)。

6. API key 获取

服务 获取地址 配置项
OpenAI platform.openai.com API key
Anthropic console.anthropic.com API key
Google AI aistudio.google.com API key
阿里云 dashscope.console.aliyun.com API key + Region
Azure portal.azure.com Endpoint + Key + Region

7. 私有部署 / 自托管

CrossMeet 兼容 OpenAI API 格式,可指向私有 endpoint:

Settings → LLM → Custom Endpoint
Base URL: https://your-proxy.com/v1
API Key: your-internal-key
Model: claude-3-5-sonnet(任意名称,由代理转发)

适合:企业代理、Ollama 本地、One-API / LiteLLM 中转。

8. 局域网共享(LAN API)

把本机的引擎暴露给局域网其他设备:

  1. Settings → Networking → LAN API
  2. 开启 → 选择要暴露的引擎(ASR / TTS / LLM)
  3. 设置访问 token
  4. 局域网其他设备的 CrossMeet 配置:
    • Base URL: http://your-ip:7860/v1
    • API Key: 你设置的 token

适合:一台 GPU 工作站服务 10 个人的轻量笔记本。

9. 故障排查

问题 排查
ASR 识别全是乱码 检查 language 是否 auto,可能识别成了错误语种
LLM 翻译漏字 检查 prompt 是否完整 / glossary 是否过大塞爆 context
TTS 没声音 看 Audio settings → 输出设备是否正确
云引擎超时 检查 API key 余额、网络可达性、是否被防火墙拦截
本地引擎慢 看 GPU 是否启用、模型大小是否太大

更多见 故障排查

10. 相关

立即开始

准备好让每段对话都像母语一样自然

无需信用卡 随时取消 本地优先
~100ms
端到端延迟
30+
支持语种
4
ASR 引擎
WIN 10/11
原生支持