基于频谱图转换器的音频场景分类

袁双; 杨立东; 郭勇; 牛大伟; 张丹丹

doi:10.16798/j.issn.1003-0530.2023.04.014

摘要

音频场景分类是场景理解重要的一环，学习音频场景特征并精准分类能加强机器与环境的交互能力，在大数据时代其重要性不言而喻。鉴于分类任务表现依赖数据集规模，但实际任务中又面临数据集严重不足的情况，本文提出了数据增强和网络模型预训练策略，将频谱图转换器模型和音频场景分类任务相结合。首先，提取音频信号对数梅尔能量频谱图输入模型，然后通过模型动态交互能力，加强音频序列空间关系，最后由标记向量完成分类。将本文方法在DCASE2019task1和DCASE2020task1公开数据集上进行测试，分类准确率分别达到了96.489%和93.227%，与已有算法相比有明显的提升，说明本方法适用高精度音频场景分类任务，为高精度智能设备感知环境内容、检测环境动态打下了基础。

单位
内蒙古科技大学

全文

访问全文

收藏分享被引浏览

更新时间：2024-03-19 03:21

基于频谱图转换器的音频场景分类

摘要

全文

产品服务

站内浏览

服务支持

联系方式

科研之友