音频技术调研报告一、音频基础概念声音强度与 dBdB分贝源自电学。在实际电路中放大器的放大倍数往往很大——例如收音机从天线接收到喇叭输出总共要放大约 2 万倍。直接用绝对数值表示放大倍数既不直观也不方便。更关键的是人耳对声音强度的感受是非线性的电功率从 0.1W 增到 1.1W 时听感差异明显而从 10W 增到 11W 时几乎无人能分辨。因此引入 dB 来表征声音强度增益电流增益XdB 20log(Io/Ii)电压增益XdB 20log(Vo/Vi)功率增益XdB 10log(Po/Pi)音频信号链路人的说话频率基本在 300Hz~3400Hz 范围内。传统音频电路的信号链路如下麦克风声电转换→前置放大器Preamp微弱信号初步放大→ADC模拟转数字→DSP数字信号处理→DAC数字转模拟→输出放大器驱动扬声器/耳机→扬声器电声转换链路左右两端为模拟信号蓝色正弦波形中间 DSP 处理段为数字信号红色二进制码流10100101。随着技术发展模拟电路逐渐被推向链路两端集成到设备内部信号链中出现更多数字接口。集成电路设计人员正在将换能器内的 ADC、DAC 和调制器集成到信号链一端这样 PCB 上不必走任何模拟音频信号也减少了器件数量。数字音频链路简化为麦克风数字接口输出→DSP / CODEC编解码数字处理→放大器→扬声器全链路以数字信号传输CODEC 内部集成了 ADC 和 DAC 功能。二、音频处理流程1. 声电转换通过咪头、话筒等终端设备将声音振动转换为电流或电压的变化值。声波推动振膜振动带动线圈在磁场中运动产生与声波幅度成正比的模拟电信号。2. 采样与量化ADC采样是将模拟信号转换为数字信号的第一步需要确定两个关键参数采样率——每秒采样次数Hz影响音频的高中低频表现力。根据奈奎斯特采样定律采样频率必须至少是信号最高频率的两倍。人耳可识别最高频率约 20kHz因此 44.1kHz 采样率即可满足需求。采样过程相当于在连续的正弦波上等间隔取点采样率越高取点越密还原的波形越精确。采样深度——每个采样点的位宽决定音频层次的细腻程度。8bit 表示 2^8256 级16bit 表示 2^1665536 级。8bit 是最低采样位宽低于此值声音难以被人耳识别。位宽越高每个采样点能表示的电压分层越细量化误差越小。量化则是用四舍五入将采样信号分级取整。例如传感器采集电压范围 0~3.3V采样位数为 8bit则量化精度为 3.3V/256 ≈ 0.0128V。某个采样点电压 1.652V四舍五入为 1.65V对应量化等级 128。3. 编码与压缩编码是将十进制数字代码转换为二进制编码。最常用的是 PCMPulse Code Modulation脉冲编码调制代表无损的原始数字音频信号添加文件头后即可存储为 WAV 文件。PCM 信号未经任何压缩处理不易受杂波及失真影响动态范围宽、音质好。声道分为单声道和立体声双声道。以 PCM 采样为例单声道每次采样数据为一个量化整数双声道一次采样有两个量化整数按左右声道依次交替存储。16bit 位宽时每个采样值占 2 字节还涉及大端序/小端序的字节序问题——高字节在前还是低字节在前需要收发双方约定一致。码率计算采样率 × 采样大小 × 声道数。例如 44.1kHz、16bit、双声道的 PCM 编码 WAV 文件码率为 44.1K×16×2 1411.2Kbps数据速率 176.4KB/s。一分钟音频需要约 10MB 空间因此必须压缩。音频帧与视频不同音频数据是流式的本身没有明确的帧概念。实际应用中一般取 2.5ms~60ms 为一帧。例如采样率 8kHz、位宽 16bit、20ms 一帧、双通道一帧数据大小为 8000×16bit×0.02s×2 5120bit 640byte。压缩原理基于人耳的两种特性频谱掩蔽效应人耳可察觉频率范围 20Hz~20kHz范围外的信号属于冗余时域掩蔽效应强音与弱音同时出现时弱信号听不到也属于冗余常用编码格式有 G.711、MP3、AAC、OGG、WMA、Opus、FLAC、APE、m4a、AMR 等。4. 解码与数模转换DAC解码是将压缩格式音频还原为数字信号。DAC 则将处理后的数字信号转换为模拟信号输出到扬声器或耳机。常用输出格式有 WAV、MP3 等。三、数字音频接口数字音频信号的传输标准可分为板级和板间两类接口适用场景特点I2S / PCM / PDM同一电路板芯片间短距离数字音频传输Intel HDAPC 声卡子系统高清音频S/PDIF / Ethernet AVB板间长距离、电缆连接专业音频I2S——内部音频数据总线I2SInter-IC Sound Bus是飞利浦 1986 年定义的数字音频传输标准用于编解码器 CODEC、DSP、ADC、DAC 等器件间的数字音频数据传输。它将数据和时钟信号分离避免了时差诱发的失真。I2S 接口的典型连接方式是主设备通过 3~4 根线与从设备相连时钟线与数据线各自独立走线数据在时钟上升沿/下降沿采样传输。I2S 有 3 个主要信号SCLK位时钟 BCLK频率 2 × 采样频率 × 采样位数对应数字音频的每一位数据LRCK帧时钟切换左右声道0为左声道1为右声道频率等于采样频率SDATA串行数据二进制补码表示的音频数据MSB 先传MCLK主时钟可选为采样频率的 256 或 384 倍用于系统同步在时序上LRCK 信号电平翻转时开始新声道的传输SDATA 数据在 SCLK 的驱动下逐位串行输出。I2S 包括左右两个声道数据在主设备发出的字选择信号WS控制下进行切换。PCM 接口——单声道PCM 接口是最简单的音频接口由时钟脉冲BCLK、帧同步信号FS、接收数据DR和发送数据DX组成。FS 上升沿触发数据传输频率等于采样率。FS 信号之后开始数据字传输单个数据位按顺序传输1 个时钟周期传 1 个数据字。发送 MSB 时信号等级首先降到最低以避免不同终端接口使用不同数据方案时造成 MSB 丢失。PCM 接口容易实现原则上支持任何数据方案和采样率理论上也可传输多声道数字音频。PCM 和 I2S 的区别在于数据相对于帧时钟FSYNC/WS的位置、时钟极性和帧长度。I2S 上传输的也是 PCM 类型数据可以说 I2S 是 PCM 接口的特例。TDM——多声道传输TDMTime Division Multiplexing时分复用可应用在 I2S、PCM 协议上没有统一标准以芯片规定为准。PCM-TDM可传多达 16 路数据。如 7 麦克风矩阵一般用 TDM 传输同时传 7 路麦克风输入和 3 路以上音频反馈信号I2S-TDM如瑞芯微 RV1106 支持 8 通道 I2S-TDMPDM 接口PDMPulse Density Modulation脉冲密度调制用 1 位输出0 或 1表示模拟信号采样率远高于 PCM也被称为 Oversampled 1-bit Audio。与 PCM 的区别在于PCM 使用等间隔采样每次采样的模拟分量幅度表示为 N 位数字分量N 量化深度结果直观PDM 则使用远高于 PCM 采样率的时钟调制模拟分量只有 1 位输出通过 0 和 1 的密度变化来表示信号幅度——密度越高代表幅度越大。PDM 数字化的正弦波表现为一系列疏密变化的 0/1 脉冲。在接收端需要用到抽取滤波器Decimation Filter将密密麻麻的 0 和 1 代表的密度分量转换为幅值分量而 PCM 方式得到的已经是幅值相关的数字分量。四、CODEC 编解码器CODECCOmpression DECompression是多媒体数字信号编解码器主要负责音频 DAC 和 ADC。它决定了最终模拟输入输出的质量直接影响音频的输入/输出效果。理想情况下录音只需 ADC 转换并存储放音只需 DAC 转换并输出。但实际录音会受到外界声源干扰、麦克风信号衰减和物理链路杂音的影响。CODEC 可以实现回声消除、噪声抵消、ALC/Limiter 等功能。例如打电话时听不到自己的声音就是 Audio Codec 在起作用。CODEC 分为两类内置 CODEC集成在 SoC 内部如瑞芯微方案通过内部总线连接无需额外芯片成本低但灵活性和音质稍逊外置 CODEC独立芯片如 NAU8822L包含扬声器、耳机和差分/立体声线路输出驱动器集成立体声差分话筒前置 PA 放大器、WM8960 等音质更好、功能更丰富通过 I2S 总线与主控连接CODEC 中的常见概念概念说明Signal Gain信号增益调节信号波幅大小Band EQ带宽均衡器调整特定频段电平防止某频段比例过重ALC自动电平控制对模拟信号限幅通过增益使电压落在系统范围内需配置 Max/Min 阈值dB及 Attack Rate增益增大/电压降低和 Release Rate增益减小/电压增高Limiter限幅器检测信号强度超阈值时进行截断处理或增益调整PA功率放大器驱动扬声器、耳机等输出显著降低外部组件需求HP高通/陷波滤波器过滤影响人声质量的多余高频成分五、音频处理算法5.1 音频处理面临的问题常见拾音设备多针对中近场声音灵敏度有限。声音传播到 10m 外时音量衰减至约 40dB听感类似窃窃私语且会被环境噪声和麦克风底噪淹没。门锁场景下人与门锁距离 1~2m属于中远距离拾音。信号处理面临的核心问题被称为3A 问题回声问题信回比低可达 -45dB、扬声器失真、回声路径变化、回声混响拖尾RT60 可达 1.2s噪声问题噪声谱多样冲击噪声、粉色噪声、类人声噪声空间特性多样强反射、散射场、点干扰增益问题多目标声源切换时增益速度与稳定性的平衡声源动态范围大5.2 3A 算法3A 算法是针对上述三个问题的经典解决方案。其处理流水线为麦克风→AEC声学回声消除→ANS自适应噪声抑制→AGC自动增益控制→ENCODER编码器其中 AEC 模块带有自适应反馈回路用于回声路径的实时收敛。AI 算法既可以嵌入传统算法改善效果也可以直接替换传统算法。AEC回声消除采集扬声器音频与本地音源的差异两者相减得到回声特征。传统 AEC 模块中已能嵌入 AI 计算使收敛处理更好、抖动更低。ANS自适应噪声抑制环境噪声过滤因噪声分类多降噪算法千差万别。通过频域分析识别并抑制非语音成分。AGC增益控制即声音音量大小控制自动调节输出电平到合适范围。传统 3A 算法既可以纯软件实现也可以内置在硬件中。5.3 MIC 阵列波束成形门锁等中距离拾音场景具有一定确定性方向角度在一定范围内使用环境较安静。此时可采用多 MIC 阵列 多通道 I2STDM 软件算法方案降噪。其原理类似相控阵雷达阵列中不同 MIC 采集的音源存在相位差 α由于 MIC 间距固定相位差只与音源方向角 θ 有关。通过控制接收波之间的相对相位和幅度可以将接收增益集中在音源方向形成指向性波束同时在其他方向上信号接收增益很小抑制干扰。这样既实现了 AEC 又实现了 AGC。波束成形的效果可视化表现为以音源方向为中心形成一个高增益的波束主瓣其他方向则为低增益的旁瓣实现了空间选择性拾音。同理该技术也可应用于音频定向发射——通过控制多个扬声器的输出相位使声波在特定方向叠加增强、其他方向相互抵消实现定向播放。这项技术只需芯片支持多通道 I2S 和内置 DSP 算力即可实现。将 3A 算法与 MIC 阵列结合可支持超远距离的超清拾音。5.4 语音智能处理语音智能算法如识别不同人的语音特征、哭声检测、异常声音检测、变声等与视频处理不同——音频信息是前后关联的必须对所有连续音频帧进行处理不能像视频那样选择性处理。音频是时域信号数字处理不方便。大部分算法通过 FFT 变换直接处理频域信号因此 FFT 是绕不开的核心算法。典型的频域处理流程为对512 点采样音频帧做 FFT 变换 → 得到时频二维数组横轴为频率 10Hz~10kHz纵轴为帧序列→ 结合噪声帧的频谱信息 → 通过 RNN 模型进行特征提取与降噪处理 → 输出频谱图语谱图以绿黄红色彩表示能量分布→ FFT 逆变换还原为时域信号基于频域分析可以做出多种应用育儿设备通过声纹特征检测婴儿哭声区分哭闹、笑声等不同状态触发相应提醒声纹识别提取说话人的声学特征基频、共振峰、声道特性等建立声纹模型可用于门锁开锁等身份验证场景变声与声音模拟合成通过修改语音信号的基频和频谱包络实现男变女、机器人声等变声效果也可用于声音合成六、降噪算法详解6.1 降噪与增强的目标针对远场语音对讲如门铃场景必须做的就是降噪 增强过滤环境音增强人声。处理前后的语谱图对比可以直观看到——降噪后人声频段300Hz~3400Hz的能量更集中背景噪声频段被显著抑制。6.2 噪声分类从通信系统角度噪声分为加性噪声和乘性噪声乘性噪声与信号相关联如信号衰减、房间混响、多普勒效应以信号乘积形式出现也叫信道噪声加性噪声与信号不相关简单叠加如自然噪声、电子元器件热噪声按是否平稳加性噪声又分为类型特点举例稳态噪声声学特性不随时间变化或变化缓慢设备底噪、风扇声非稳态噪声统计特性随时间变化开关门声、背景人声└ 瞬态噪声持续极短时间敲击声、键盘声稳态噪声由于在时间维度上没有变化很容易通过对之前出现过的噪声进行建模然后用相同的模型对以后出现的噪声进行抑制。非稳态噪声尤其是瞬态噪声则需要更多依靠区分其与正常语音之间的差异——如果更像是语音则保留反之则抑制。值得注意的是这些噪声往往不是单独存在的。例如手机底噪一直存在同时又在人声鼎沸的地铁站稳态和瞬态噪声会同时出现。6.3 五种软件降噪算法ITU-T G.114 规定高质量语音可接受时延为 300ms。门铃对讲一般在 PCM 编码后直接降噪播放不再进行压缩编码耗时过长。第一招线性滤波器利用硬件厂商已知的噪声特性用高通滤波器消除低频噪声用陷波滤波器消除特定频段持续噪声。算力要求极低但必须事先知道噪声出现的频段。实际使用中一般先做噪声频段检测再设计线性滤波器或滤波器组来消除噪声。第二招谱减法取一段非人声音频记录噪声频谱能量从所有音频频谱中减去该能量。对稳态噪声有效但非稳态噪声会导致噪声残留或人声损伤。一般用于离线稳态噪声处理不需要 NPU。第三招基于统计模型的实时降噪实时降噪最常用的算法类别。利用统计方法估算每个频点对应的噪声和语音分量实时建模并更新噪声再从原始音源中扣除。基于两个假设噪声比人声在时域和频域上更平稳所有噪声满足加性条件。这解释了为什么瞬态噪声难以抑制、混响场景下人声失真严重。算法流程涉及 STFT → FFT → 功率谱 → 分位数噪声估计 → 语音存在概率估计 → 噪声更新 → 抑制系数计算 → ISTFT。一般用 DSP 即可实现不需要 NPU。第四招子空间算法将噪声和人声投影到高维空间使不易分离的信号变成可分的子空间。包括非负矩阵分解和字典法建模。适合去除特定噪声如风噪但每种噪声需单独建模噪声类型不定时难以穷尽。第五招基于机器学习的 AI 降噪通过数据训练神经网络进行降噪噪声鲁棒性好能兼顾稳态、非稳态甚至瞬态噪声。例如咖啡馆混合噪声场景下传统算法对语谱损伤大、高频信息丢失而 AI 算法在保留语谱的同时降噪效果更好——从语谱图对比可以明显看到AI 降噪后的高频细节保留更完整人声频段更清晰。基于 RNN 神经网络的降噪算法对非连续性噪声有更好的抑制效果。其处理流程为音频帧 FFT 变换 → 噪声帧频谱信息输入 → RNN 模型处理频域二维数组帧 × 频率→ 特征提取与降噪 → 输出降噪后频谱图 → FFT 逆变换。RNN 降噪算法算力需求仅 42MFLOPS对标 ResNet50 的 4.12GFLOPSNPU 只需 20MAC 即可用不用 NPU 均可。6.4 AI 智能降噪处理流程AI 智能降噪的完整处理流程包括音频采集 → 预处理分帧、加窗→ FFT 变换 → 特征提取 → 神经网络推理噪声抑制掩码预测→ 频谱修正 → ISTFT 重构 → 音频输出。整个过程以帧为单位实时处理保证低延迟。七、总结与方案建议7.1 音频系统架构总结设计基本音频功能时ADC/DAC 转换是必备基础模块CPU 编码得到 PCM 格式原始音频数据。如果音源噪声过大需要考虑降噪算法传统方式使用 ADCDSP 搭配已基本被淘汰目前主流方案是将 ADC/DAC 模拟信号处理 数字音频接口驱动 音频设备驱动组合成 CODEC 芯片配合 CPUNPU 可选模块间用 I2S、PCM 总线通信。音频对讲直接走音频设备驱动更复杂的音频后处理压缩编码、存储、变声、均衡等从 I2S 取数据结合算法处理有音频保存需求时涉及编码压缩和解压大量使用傅里叶变换——将时域信息解析为频域信息。时域上连续变化的正弦波信号经过 FFT 变换后表现为频域上离散的频谱峰值直观展示了信号包含的各频率分量及其幅度。例如 MP3 压缩利用人耳对高频不敏感的特性将时域信号转换为频域信号并划分频段对高频加大压缩比甚至忽略对低频用小压缩比以 1:10 甚至 1:12 的比率压缩。对于 FFT 算法传统用 DSP 计算流行用 CPU 计算嘉楠则将其固化为算子放入专门的音频处理模块 APU通过硬件加速 FFT 运算。涉及 AI 智能需求AI 降噪、人声识别时需要加入神经网络模型。是否需要 NPU 取决于计算量——例如 RNN 降噪算法按 44kHz 采样率、512 点 FFT、1/4 帧移率计算每秒约需 13GOPS 算力很多 DSP 就能实现。音频计算属于高动态范围浮点计算这是 DSP 的优势且 DSP 可编程。因此NPU DSP 是 AI 应用的绝佳组合——NPU 负责神经网络推理DSP 负责高精度浮点信号处理两者互补。现代智能语音芯片正沿着这一方向融合 AI 技术。7.2 友商方案对比各厂商音频处理方案差异明显厂商方案君正DSP NPU嘉楠自研 AudioPU瑞芯微传统 CODEC NPU物奇科技ADC NPU7.3 配置建议针对中低端市场定位建议两类音频配置方案一AD/DA 转换器 多通道 I2S CPU 内置 DSP支持简单 3A 降噪算法和多 MIC 阵列支持语音对讲要支持语音记录需增加 emmc 类 flash 接口要支持更强语音智能需外置 DSP 或 NPU方案二Codec 模块 I2S普通双通道 CPUCODEC 直接完成降噪处理支持语音对讲要支持语音记录需添加 DSP 或增强 CPU 性能 emmc flash 接口要支持更强语音智能需外置 DSP 或 NPU