华为「难题 4:远场目标说话人精准提取」课题成果,面向 iCAN 竞赛的端侧演示程序。
在单一音频模态、3–4 麦克风、16 kHz 的约束下,从含干扰说话人、混响与噪声的远场录音中精准提取目标说话人的语音。
完整演示程序在 发行版(Releases) 里,两个站点内容完全一致,哪个能打开就用哪个:
| 站点 | 怎么下 |
|---|---|
| GitHub | v1.0 发行版 → 下载 bionic-ear.zip(229 MB,单个文件,不用合并) |
| Gitee | v1.0 发行版 → 下载 part01、part02、part03、合并.bat(受 100 MB 附件上限切成了 3 个分卷,需要合并) |
两个页面下方的「Source code (zip / tar.gz)」是平台自动生成的源码包,里面只有本说明和第三方许可声明,与演示程序无关,无需下载。
拿到包之后校验(可选):该 zip 的 SHA256 应为
F9B549B86D10BCE6FBBEC722EBFE333E83F5E8E41ABD3FFB8F5E523344E4DAB7
(压缩包 229.3 MB,解压后约 730 MB)
从网上下载的文件会被 Windows 打上「来自互联网」标记,双击时会弹蓝色的「Windows 已保护你的电脑」。先解锁,后面全程不再弹窗。
- 图形方式:分别右键这 4 个文件 →「属性」→ 勾选底部的「解除锁定」→ 确定
- 命令行方式(一次解锁全部):在该文件夹的地址栏输入
powershell回车,执行
Get-ChildItem -File | Unblock-File方法一(推荐):双击 合并.bat,同目录下自动生成 bionic-ear.zip。
方法二(备用):若 合并.bat 被拦截,在该文件夹的地址栏输入 cmd 回车,粘贴执行:
copy /b bionic-ear.part01+bionic-ear.part02+bionic-ear.part03 bionic-ear.zip- 把
bionic-ear.zip解压到纯英文路径下(如D:\bionic-ear\),路径里不要带中文,也不要放在桌面 - 进入解压出的文件夹(解压后默认叫
bionic-ear),双击仿生之耳.exe,会自动打开浏览器窗口 - 网页里选一段录音(自带 18 条样本在
素材\里),点「开始分离」 - 在「试听对比」里先听原始参考麦,再听分离后的两路
出问题先双击 诊断.bat,它会逐项打印检查结果。
硬要求:至少 3 声道,前 3 路是 2 cm 间距的线性三麦。
本程序没有数字签名,Windows 上可能被拦两次,原因不同、处理方式也不同。
下载来的文件带「来自互联网」标记时会弹这个,跟下一条不是一回事。 点「更多信息」→「仍要运行」即可;或者先做上面第 1 步的「解除锁定」。
Windows 11 的「智能应用控制」只放行有数字签名、且云端有信誉的程序。本包里的 Python、torch 等运行库都没有签名,所以在开着这个功能的电脑上,点「开始分离」会直接失败:
[WinError 4551] 应用程序控制策略已阻止此文件。 Error loading
"...\runtime\Lib\site-packages\torch\lib\shm.dll" or one of its dependencies.
处理(实测:多数电脑不用重启就能恢复):
- 关闭它:设置 → 隐私和安全性 → Windows 安全中心 → 应用和浏览器控制 → 智能应用控制 → 关闭
- 把程序完全退出:点网页最下面的「退出程序」,或在任务管理器里结束
pythonw.exe - 重新双击
仿生之耳.exe,再点「开始分离」
三步走完仍报同样的错,再重启电脑,然后重复第 3 步。
切记:先「完全退出程序」再重开。在原来的窗口里直接重试,会报另一条看起来毫不相干的错
module 'torch' has no attribute '_utils'—— 那不是包坏了,退出重开就没了。注意:关闭「智能应用控制」后无法再次打开,除非重装或重置 Windows。若这台电脑不允许关闭该功能,请换一台电脑运行本包。
本程序完全在本地运行,不联网、不上传任何音频,网页只监听 127.0.0.1,可放心运行。
| 目录 | 说明 |
|---|---|
仿生之耳.exe / 启动.bat |
启动入口 |
诊断.bat |
出问题先双击这个,逐项打印检查结果 |
runtime/ |
运行环境(Python + torch/numpy/scipy),不要删、不要改、不要单独移动 |
app/ |
程序本体(分离引擎、网页界面、模型) |
素材/ |
18 条演示样本(正负向、三种房间、1–10 m 距离、方位/SIR/SNR 扫描) |
结果/ |
分离结果输出到这里 |
使用说明.txt |
详细使用文档(含两类 Windows 拦截的完整说明与实测报错原文) |
环境要求:Windows 10 / 11 64 位;不需要装 Python、不需要显卡、不需要联网,纯 CPU 运行,一条 4 秒录音约 1–3 秒出结果。
- 单一音频模态、3–4 麦克风、16 kHz;前 3 路为 2 cm 间距的线性三麦阵列
- 分离骨干:空间分支 Conv-TasNet
- 全流程本地运行,网页只监听 127.0.0.1,不上传任何音频
演示样本由 LibriSpeech(CC BY 4.0)仿真生成。 运行环境中的第三方组件许可声明与全文见 THIRD_PARTY_LICENSES.md。
© 2026 仿生之耳 保留所有权利,仅供竞赛评审使用。
GitHub:https://github.com/deserted1011/ConvTasNet-Spatial
Gitee :https://gitee.com/deserted1011/ConvTasNet-Spatial
| 项目 | 仿生之耳 远场目标说话人精准提取系统 | | 队伍名称 | 拾音客 | | 参赛赛道 | 软件赛道 |