译自英文

计算机听觉是人工智能领域的一个分支,专注于利用机器学习和信号处理技术,使机器能够分析、解释和理解音频信号,包括语音、音乐和环境声音。

计算机听觉是人工智能的一个子领域,专注于音频信息的自动分析与理解。它涵盖了机器感知、表示和推理声音的计算方法,借鉴了机器学习、数字信号处理和心理声学的原理。与专注于转写口语的语音识别不同,计算机听觉旨在处理完整的听觉事件频谱,从单个音符到繁忙街道的嘈杂声,并从中提取有意义的语义内容。

该术语在1990年代末出现,作为计算机视觉的对应概念,强调听觉对智能系统与视觉同等重要。该领域的早期工作集中于手工设计的特征,如梅尔频率倒谱系数和过零率,但2010年代深度学习的出现将范式转向从原始波形或频谱图进行端到端学习。现代计算机听觉系统部署在从虚拟助手和助听器到自动驾驶车辆和工业监控的各种应用中。

核心任务与表示

计算机听觉处理多个典型任务。自动语音识别将口语转换为文本,这一问题随着神经网络transformer架构的发展取得了显著进展。音乐信息检索包括和弦估计、节拍跟踪和流派分类等任务,这些任务需要对时间结构和和声内容进行建模。环境声音分类识别非语音、非音乐的声音,如警笛、玻璃破碎或鸟鸣,通常使用基于频谱图图像的卷积网络。

一个核心挑战是音频表示的选择。原始波形是高维的,包含精细的时间细节和广泛的频谱结构。常见的替代方案包括短时傅里叶变换频谱图、梅尔频谱图和常数Q变换,每种方案在时间和频率分辨率之间进行不同的权衡。学习表示,如自动编码器或对比学习产生的表示,也变得流行,因为它们可以适应特定领域的统计特性。

深度学习架构

深度学习的兴起改变了计算机听觉。最初为图像开发的卷积神经网络被改编用于频谱图,将其视为时间和频率为轴心的二维输入。像ResNetU-Net这样的架构已被用于源分离和音频去噪等任务。循环网络,特别是长短期记忆单元,曾是序列音频建模的标准,但已在很大程度上被transformer及其变体所取代。

2017年引入的Transformer带来了自注意力机制,可以捕捉音频序列中的长距离依赖。像wav2vec 2.0和HuBERT这样的模型,分别由Google DeepMind和Meta开发,使用大规模未标记音频语料库上的自监督学习来产生稳健的表示。这些预训练模型随后可以用相对较少的标记数据进行微调以完成特定任务,这一范式已成为该领域的标准。多头注意力机制允许模型同时关注音频的不同方面,如音高、节奏和音色。

训练与优化

训练音频模型面临独特的挑战。音频数据通常很长,需要仔细处理内存和计算。诸如数据增强的技术,包括时间拉伸、音高偏移和添加背景噪声,对于提高泛化能力至关重要。批量归一化层归一化有助于稳定训练,而dropout模型剪枝用于减少过拟合和计算成本。

优化通常依赖于随机梯度下降的变体,如Adam,配合学习率调度,先预热然后衰减。损失函数因任务而异:分类使用交叉熵,语音识别使用连接主义时间分类,回归任务如音高估计使用均方误差。课程学习,即先训练模型于较简单的示例,已被证明可以改善复杂音频任务的收敛性。

应用与系统

计算机听觉嵌入在许多商业产品中。像Amazon Alexa和Apple Siri这样的虚拟助手依赖语音识别和说话人识别。音乐流媒体服务使用音频分析进行推荐和自动标签。在医疗保健中,计算机听觉通过分析咳嗽声音辅助诊断呼吸系统疾病,并监测睡眠呼吸暂停。自动驾驶车辆使用麦克风检测紧急车辆警笛,补充视觉传感器。

工业应用包括预测性维护,其中麦克风监听机械中的异常声音,以及识别玻璃破碎或烟雾报警器的智能家居设备。在创意领域,计算机听觉支持自动音乐转写、混音工具和生成式音频模型。像MIT CSAILStanford AI LabBerkeley AI Research这样的机构的研究团队继续推动边界,通常与Sony AINokia Bell Labs等行业实验室合作。

挑战与未来方向

尽管取得了进展,计算机听觉仍面临重大障碍。对现实世界噪声和混响的鲁棒性仍然有限,模型在未见过的录音条件下测试时常常失败。该领域还面临可解释性的困难:很难解释为什么模型以某种方式分类声音,这在安全关键应用中是有问题的。在公共空间收集音频数据时会出现隐私问题,关于语音克隆和深度伪造音频的伦理使用也存在持续争论。

未来方向包括多模态学习,其中音频与视觉和文本信息结合,以及持续学习,其中模型适应新声音而不忘记旧声音。大型语言模型与音频编码器的集成是一个活跃领域,使系统能够用自然语言描述声音或回答关于音频内容的问题。随着硬件的改进,使用像AWS TrainiumGroq加速器这样的专用芯片,边缘设备上的实时计算机听觉正变得更加可行,为助听器、可穿戴设备和机器人开辟了新的可能性。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·audio-processing·machine-learning·signal-processing
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史