简体中文 | English
面向 audio.cpp 的会话式桌面客户端:TTS、ASR、模型库与下载管理、音色库、会话与集合,以及服务端控制。
本软件为第三方客户端,不含 audio.cpp 本体,也不分发模型权重;两者需另行获取并遵循各自许可。
- 工作台:语音合成(TTS)与语音识别(ASR)。
- 模型库:模型管理与下载,下载仓库可切换。
- 音色库:管理用于克隆的参考音色。
- 会话与集合:以会话组织生成记录,并可将会话归入集合。
- 服务端控制:配置并启动 audio.cpp 服务端。
- 中英双语界面。
目前仅测试了 TTS / ASR,其它功能可能尚未完善。
模型规格库来源:取自官方 audio.cpp 仓库与文档,并由本项目补充(描述、体量、内存 / 显存估算等)。
以下模型的主要功能已做过基础测试:
| 模型 | 任务 |
|---|---|
| BreezeTTS 2 | TTS / 克隆 / 语音设计 |
| OmniVoice | TTS / 克隆 / 语音设计 |
| Qwen3-TTS 1.7B Base | TTS / 克隆 |
| Qwen3-TTS 1.7B CustomVoice | TTS / 内置音色 |
| Qwen3-TTS 1.7B VoiceDesign | TTS / 语音设计 |
| IndexTTS-2.5 | TTS / 克隆 / 情感控制 |
| Qwen3-ASR 1.7B | ASR |
其它模型走同一套通用控制台,但尚未测试;不同模型对指令的遵循程度不一。欢迎反馈,也欢迎提出适配需求。
- Windows 10/11(x64)。当前仅面向 Windows。
- 预编译的发布包已自带 Microsoft Visual C++ 运行库,无需单独安装 VC++ Redistributable。 (从源码构建仍需 MSVC 工具链。)
- 一份 audio.cpp 构建:把含
audiocpp_server.exe的版本目录放到应用根目录下的audio.cpp/<版本>/。获取地址:https://github.com/0xShug0/audio.cpp。 - 构建里必须保留
model_specs/目录(audio.cpp/<版本>/model_specs/):应用通过它 获知该版本 audio.cpp 支持哪些模型,从而兼容不同版本的后端。缺少它,将无法 获取该版本支持的模型列表。
需要 Flutter SDK(启用 Windows 桌面)。在 app/ 目录下:
flutter pub get
flutter run -d windows
应用根目录默认为仓库根目录,首次运行会在其中创建 data/、models/、audio.cpp/
(均已在 gitignore 中)。
package_release.bat
会构建 release、组装运行布局、编译顶层启动器(windows_launcher/launcher.cs),
并在 dist/ 下生成 ZIP。
打包后的目录结构:
audio_cpp_desk-<版本>/
audio.cpp Desk.exe 启动器(设置应用根目录,再启动 bin\audio_cpp_desk.exe)
bin/ Flutter 程序(exe + DLL + data/flutter_assets)
data/ 运行期数据(首次运行创建)
models/ 已下载模型(首次运行创建)
audio.cpp/ 你的 audio.cpp 版本(把构建放这里,保留 model_specs/)
| 路径 | 说明 |
|---|---|
app/ |
Flutter 桌面应用 |
windows_launcher/ |
打包后顶层 exe 的原生启动器源码 |
tools/audio2wav/ |
自编音频转码器(Media Foundation;用 build.bat 编译) |
package_release.bat |
发布打包脚本 |
本项目采用 Apache License 2.0 许可——见 LICENSE。上游致谢见 NOTICE(audio.cpp,© ShugoAI LLC)。
