前言
- 以 Ubuntu 系统为例,需要安装的依赖包如下:
- docker
- ffmpeg(sudo apt install -y ffmpeg)
- pipx 或 uv(uvx)
STT(ASR)Docker 服务部署和 Openclaw 配置
- Speaches Docker 部署(STT 和 TTS 二合一:Faster-whisper + Piper/Kokoro)
docker run \
-d \
-p 8000:8000 \
--name speaches-voices \
--volume hf-hub-cache:/home/ubuntu/.cache/huggingface/hub \
--restart unless-stopped \
ghcr.io/speaches-ai/speaches:latest-cpu
- 必需先行手动下载模型
- 官方可用列表(主要来源于 huggingface,Systran,另有其他贡献者)
uvx speaches-cli registry ls --task automatic-speech-recognition | jq '.data | [].id'
- 下载指定模型
uvx speaches-cli model download Systran/faster-whisper-base
- 核查是否成功
uvx speaches-cli model ls --task text-to-speech | jq '.data | map(select(.id == "Systran/faster-whisper-base"))'
- 配置 STT
{
"tools": {
"media": {
"audio": {
"enabled": true,
"maxBytes": 2000000,
"models": [
{
"type": "cli",
"command": "curl",
"args": [
"http://localhost:8000/v1/audio/transcriptions",
"-F", "file=@{{MediaPath}}",
"-F", "model=Systran/faster-whisper-base"
],
"timeoutSeconds": 20
}
]
}
}
}
}
### TTS 服务部署和 Openclaw 配置
1. 安装 edge-tts(远程调用微软公司的 TTS 语音服务。占用资源少,执行快,且免费,但无法保护隐私)
- pipx install edge-tts(Python,只命令行。推荐,Ubuntu 24.04 及以后版本必选项)
- pip install edge-tts(Python,命令行 + 脚本 API)
- npm install @travisvn/edge-tts(NodeJS,命令行 + 脚本 API)
2. 配置 edge-tts(配置文件 ~/.openclaw/openclaw.json)
```json
{
"messages": {
"tts": {
"auto": "inbound", ("always" 回答总是携带语音,"inbound" 如果收到语音回答携带语音)
"provider": "cli", (tts-local-cli 也可以,和 tts-local-cli 插件没关系)
"providers": {
"cli": { (tts-local-cli 也可以,和 tts-local-cli 插件没关系)
"command": "edge-tts",
"args": [
"--text", "{{Text}}",
"--voice", "zh-CN-XiaoxiaoNeural",
"--write-media", "{{OutputPath}}"
],
"outputFormat": "mp3",
"timeoutMs": 20000
}
}
}
}
}
- 测试
- 部署结果测试
用法:edge-tts --help,简要测试:edge-tts --text "世界人民大团结万岁,Hello, world!" --write-media test.mp3
- 配置结果测试
/tts status 查看状态,/tts audio "OPenClaw 小龙虾,AI 时代的颠覆者"
备注