受够了通话回音刺耳?换上A-68,3天搞定85dB回音消除+5米远场拾音。
一个让硬件工程师破防的经典场景
凌晨两点。
你蹲在实验室,面前的通话样机第 17 次发出尖锐的啸叫。
喇叭音量调到 60%,回音准时出现。降到 40%,客户说声音太小听不清。换了个进口 DSP 方案,BOM 成本爆炸,老板的预算表上画满了红色问号。上了软件 AEC,CPU 占用率直接飙到 65%,功耗翻了一倍,电池续航从 8 小时变成 3 小时。
你的测试手机里,对端同事发来一条消息:"还是能听到我自己的回声,像在对着山谷喊话。"
做过通话类产品的朋友,看到这里大概已经血压上来了。
回音消除这件事,说起来只有一行需求文档——"通话时对方听不到自己的声音"——做起来却是声学、算法、硬件、结构四座大山一起压过来。
但今天要聊的这颗芯片,用了不到 25mA 的功耗,把这四座山一次性搬走了。

90dB 回音消除,到底难在哪?
先聊点硬核的。
声学回音消除(AEC)的本质是一个自适应滤波问题。喇叭播放的信号 x(n),经过房间的声学路径 h(n),被麦克风拾取为回音信号 y(n) = x(n) * h(n)。麦克风收到的总信号是 d(n) = s(n) + y(n),其中 s(n) 是你真正想要的人声。
AEC 的任务是:根据已知的 x(n) 和观测到的 d(n),估计出 h(n),然后算出 ŷ(n),最终得到 ŝ(n) = d(n) - ŷ(n)。
听起简单,实际上一堆坑:
第一,声学路径 h(n) 是时变的。 你动一下身体,房间的反射路径就变了。会议室里有人走过,h(n) 当场翻脸。传统的固定系数滤波器根本跟不上。
第二,回音路径长度决定了滤波器阶数。 100ms 的回音延迟(A-68 的支持上限),在 16KHz 采样率下意味着 1600 个采样点的冲激响应。自适应滤波器要对这 1600 个系数实时更新、实时卷积——不是在服务器上跑,是在一颗 25mA 的芯片上跑。
第三,双工检测是地狱级难题。 双方同时说话时,麦克风信号里人声和回音混在一起,滤波器必须判断"现在只有回音可以更新系数"还是"有人在说话不能乱调"。判断错了,要么回音漏过去,要么把对方的人声当成回音给消了——也就是所谓的"吃字"。
第四,非线性失真是压垮骆驼的最后一根稻草。 功放不是理想器件,喇叭也不是。信号经过功放和喇叭之后产生的谐波失真,在数学上已经不能用线性卷积 y(n)=x(n)*h(n) 来描述了。传统 AEC 对非线性分量束手无策。
市面上大多数"自带 AEC"的通话芯片,做到 40~50dB 的消除量就不错了。因为 50dB 以上,非线性分量开始主导残差。
那 A-68 的 85~90dB 是怎么做到的?
答案藏在两个地方:专用的声学 DSP 架构,和严格的参考信号链路设计。
A-68 的解法:把声学问题下沉到硅片
A-68 不是一颗通用 MCU 跑了套 AEC 库。它是 JKIN 语音处理技术专门为语音通话场景打造的一颗硬件声学处理模组,内部 DSP 对 AEC 的 NLMS 滤波器、双工检测器、非线性后处理做了全流水线硬件加速。
这意味着什么?
你在 STM32 上一个采样点要跑几十条指令的 NLMS 系数更新,在 A-68 上是单周期硬件卷积 + 硬件系数更新。不是"代码优化"级别的快,是架构级别的省。
所以它能做到:
-
85~90dB 的 AEC 消除量:包含了线性回音消除 + 非线性残余回音的后处理压制
-
100ms 的延迟覆盖:等效 1600 阶自适应滤波器,覆盖普通房间到中型会议室
-
全双工不断续:硬件双工检测器,双讲状态下既不吃字也不漏回音
-
25mA 封顶:稳压、ADC/DAC、I2S 时钟全算在内,不是纯 DSP 核心功耗
对比一下行业常见方案的 AEC 能力:
|
方案
|
功耗
|
AEC 消除量
|
双工能力
|
开发周期
|
| --- | --- | --- | --- | --- |
|
MCU + WebRTC AEC 软件库
|
50~80mA
|
30~45dB
|
一般,容易吃字
|
2~4 周调参
|
|
进口 DSP 芯片 + 自研算法
|
40~60mA
|
60~75dB
|
较好
|
2~3 个月
|
|
A-68 模组
|
≤25mA
|
85~90dB
|
全双工
|
3 天
|
A-68 并不只是"参数更好看"——它直接把 AEC 这件事从"算法工程"变成了"接线工程"。

消回音的第一步,也是最关键的一步:参考信号
技术聊完了,说回实战。
A-68 要做到 85dB 以上的 AEC,有一个不可绕过的前提:参考信号要对。
A-68 的 17 脚(LIN)是回音参考信号输入端。把你产品功放的输出信号(或者输入端,看功放类型),接到 17 脚,DSP 就知道"喇叭在播什么",然后从麦克风信号里精准减掉。
这个信号接错了,AEC 直接报废。 不管 DSP 多强。
实际情况分三种:
情况一:用的是 AB 类功放。
最简单。功放输出正极串一个 10KΩ 电阻接到 17 脚,再对地并一个 2KΩ 电阻分压。2KΩ 可以微调,信号太大就换小一点,太小就换大一点。AB 类输出就是模拟音频,直接取。
情况二:用的是 D 类功放,能找到输入端。
更简单。直接从功放输入端取信号给 17 脚——D 类功放输出是 PWM 方波,不能用,但输入端的模拟音频是干净的。
情况三:用的是 D 类功放,输入端取不到。
必须做 LC 低通滤波把 PWM 方波转回正弦波:8Ω 喇叭用 22μH + 1μF,4Ω 喇叭用 15μH + 2.2μF。滤波后的信号再衰减到合适电平接入 17 脚。
一个常被忽略的细节:A-68 的 17 脚输入阻抗是 47KΩ,ADC 最大输入是 1Vrms。功放输出动辄几伏甚至十几伏,不做衰减直接怼进去,信号削顶失真,滤波器拿什么参考?不烧芯片就算运气好了。
降噪这件事,A-68 比你想象的要狠
说完消回音,聊降噪。
噪声消除(ENC)和回音消除(AEC)在 A-68 上是两个独立模块,但共享 DSP 的硬件加速资源。这意味你开启消回音的同时,降噪效果不会被挤压——两个都是满血输出。
A-68 的降噪分了两个层次:
第一层:稳态噪音压制(单麦模式)
风扇的嗡嗡声、空调的低频轰鸣、电器马达的滋滋声——这些频率稳定、波形规律的噪音,A-68 用频域降噪算法直接识别并压制。
最大压制 40dB。 不需要第二颗麦克风。
这就够了吗?对录音笔、监控拾音器这样的产品来说,够了。这些场景里噪音源稳定,人声是唯一需要保留的"非稳态信号",频域降噪的区分度足够。
第二层:波束成型(双麦模式)
这才真正见功力。
当你面对的不是空调声而是脚步声、汽车喇叭、别人的聊天声——这些非稳态噪音——单凭频域分析是不够的。它们和人声一样,频率在变、波形在变。
A-68 的双麦波束成型(Beamforming)换了一个维度解决问题:空间维度。
两颗麦克风按特定方式摆放,DSP 实时计算声源到达两个麦克风的时间差和相位差,反推出声源的空间位置。在拾音波束夹角内的声音——认定为人声——保留;夹角外的声音——认定为噪音——压制。
最大压制 90dB。
这不是滤波器"衰减了 90dB",是你在波束外喊话,拾到的人声信号真的只剩下原来的一亿分之一。
而这套波束成型有两种玩法:
玩法一:反馈式主副麦。 主麦靠近嘴巴,副麦远离嘴巴、朝向噪音源。DSP 要求主麦人声幅度比副麦大 6dB 以上,然后基于这个幅度差做自适应降噪。适合耳麦、对讲机、手机——说话人位置固定且靠近设备的场景。
玩法二:夹角拾音束。 两颗麦克风朝向一致、同平面放置,间距 3~18cm。在麦克风阵列正前方形成一个锥形的拾音范围,默认 60° 夹角。角度内说话的声音保留,角度以外的声音——哪怕离麦克风只有 20 厘米——直接归零。适合门禁对讲、会议设备、电梯应急通话——说话人在固定位置,但环境噪音极复杂。
一个真实的使用场景:深圳某地铁站广播室,背景噪音常年 75~80dB,用了夹角拾音束后,值班员说话拾音清晰度接近安静办公室水平。拾音束外的到站广播、乘客喧哗、闸机蜂鸣声全部被空间过滤。

5 米远场拾音:不止是灵敏度的问题
A-68 的规格书上写了拾音距离 10cm~500cm。看上去就是数字,但背后有几个关键设计值得展开。
第一,远场拾音依赖的不是"麦克风灵敏度越高越好"——灵敏度太高反而会把环境噪音一并放大。A-68 的做法是:远场模式下 DSP 内部增益上限放开,配合波束成型的空间过滤,让远处的人声在降噪之后仍然是干净的高信噪比信号。
第二,远场效果和麦克风选型强相关。规格书的 5 米是基于 -29dB 数字硅麦测的参考值。如果你需要 5 米以上,换 -26dB 甚至 -22dB 的麦克风,效果还能往上走。A-68 本身对麦克风的增益链路是开放的,不像某些方案把前端增益锁死。
第三,远场模式下 DSP 同时开了 AEC / ENC / Beamforming 三个模块,功耗仍然是 25mA。没有因为"模式切换"就翻倍——这就是硬件 DSP 架构和软件方案的本质差距。
三种模式,一套硬件:你的产品你做主
A-68 不是"出厂烧死"的单一功能模组。根据固件不同,它可以扮演三个角色:
|
你需要的功能
|
对应的模式
|
能同时开的有啥
|
| --- | --- | --- |
|
只要降噪,不要通话
|
纯降噪模式
|
单麦 ENC 或双麦波束
|
|
全双工通话 + 降噪
|
消回音模式
|
AEC + ENC + 波束成型,三件齐开
|
|
两路独立降噪录音
|
立体声降噪模式
|
两路独立 ENC
|
选型的核心矛盾只有一个:要不要消回音。
要消回音,选模式二。硬件上多走一根线,把功放信号接到 17 脚。多花 10 分钟焊接,换回来的是满血全双工通话体验。
不要消回音,选模式一。最简配置:A-68 + 一颗数字硅麦 + 5V 供电,三根线接通就能干活。
你的产品到底适不适合 A-68?
不废话,直接对号入座:
可视门铃 / 楼宇对讲 —— 喇叭离麦克风不到 5 厘米,回音是物理定律决定的。A-68 的 AEC + 双麦波束,喇叭音量全开、访客也听不到自己的回声。
车载蓝牙通话 —— 车内风噪 + 路噪 + 音响回音三重叠加。反馈式主副麦,主麦放驾驶位遮阳板,副麦放副驾 A 柱,全双工通话像在安静房间里聊天。
会议室全向麦 —— 3~5 米半径内多人自由发言。夹角拾音束 + 远场模式,谁说话都清晰。一个 A-68 搞定一个中型会议室,不需要 4 麦 6 麦的阵列。
安防 IPC 摄像头 / 监控拾音器 —— 室外风噪、雨声、车流噪音,单麦频域降噪不够用。双麦波束模式,麦克风间距拉到 15cm,拾音束外噪音直接归零。
电梯应急通话 —— 极端噪音 + 窄小空间。夹角拾音束把有效拾音范围锁定在通话器正前方 60°,电机声、机械碰撞声全部在波束之外。
录音笔 / 采访设备 —— 远场拾音 + 纯降噪模式。不需要第二颗麦,一枚 A-68 就能让 3 米外的采访录音听起来像领夹麦。

接入有多简单?
A-68 是模组,不是裸芯片。
尺��� 23.5mm × 19mm,比一枚一元硬币还小。19 脚半孔焊盘,间距 2.54mm,可以直接焊在 PCB 上,也可以用转接板飞线评估。
最小系统只要四根线:5V 供电、GND、一颗数字硅麦的数据和时钟。上电 15ms 后开始输出 I2S 数字音频和模拟音频,两路同时有效。
没有寄存器要配,没有算法参数要调。你选的固件版本决定了 A-68 的行为。 硬件连对线,剩下的全在芯片里跑。
工作温度 -45°C~+85°C,北方冬天户外门禁、南方夏天暴晒的 IPC 外壳里,都能正常干活。
模拟输出信号幅度较小,不能直接推耳机和喇叭——这是模组的天花板,不是缺陷。后端该接 MIC IN 还是 MIC IN,该过功放还是过功放。
一句话总结
如果你在做通话类产品、拾音类产品,或者任何需要"听得清、没回音"的音频产品——
A-68 用指甲盖大小的体积和 25mA 的功耗,给了你 85dB 回音消除、90dB 降噪、5 米远场拾音,以及三个工作日从接线到出样的完整路径。
算法不用写、参数不用调、功耗不用愁。
剩下的,就是你怎么设计声学结构、怎么选麦克风、怎么用好那颗参考信号。
产品资料:A-68 语音处理模组规格书 V1.0(JKIN 语音处理技术)
声明:本文内容基于公开产品资料撰写,实际效果与产品声学设计、麦克风选型、结构布局相关。建议联系 JKIN 授权经销商获取评估板和最新固件支持。
—— 专注声学,传递美好。JKIN 语音处理技术。
本文来自博客园,作者:德宇AI语音,转载请注明原文链接:https://www.cnblogs.com/dyAI/articles/22166132
联系:18179417525语音处理模块,芯片降噪消回音
浙公网安备 33010602011771号