鸟类物种音频频谱图(CUB-200 对齐版)
鸟类物种音频频谱图数据集CUB-200 对齐版包含 9,270 张频谱图图像覆盖 200 个北美鸟类物种199 个有数据与 CUB-200-2011 图像基准对齐采用相同的类别 ID 和物种名称。音频录音来自 Xeno-canto 和 eBird 开源资料库。数据集适用于多模态鸟类分类、基于 ImageNet 预训练模型的迁移学习以及音视频特征融合研究。数据集简介数据集概述数据集按照 CUB-200-2011 的命名规范组织文件夹格式为 {class_id:03d}.{Species_Name}类别 ID 范围 1-200每个物种文件夹包含该物种的所有频谱图图像。频谱图生成遵循标准化流程音频重采样至 22,050 Hz 单声道静音移除丢弃峰值振幅低于全局最大值 1/4 的帧信号分割为 10 秒无重叠窗口最后一个窗口不足 10 秒时零填充使用汉宁窗进行短时傅里叶变换窗口大小 51250% 重叠频率掩蔽保留 100 Hz – 16,000 Hz 范围对数功率转换最终渲染为 224×224 像素 RGB PNG 图像使用 viridis 色彩映射。超过 10 秒的录音生成多个分段图像命名为 _seg0、_seg1 等。数据集包含 metadata.csv每张频谱图的文件路径、类别 ID、物种名、录音 ID、分段编号和完整的频谱图生成脚本audio_to_spectrogram.py确保数据可复现性。该数据集为多个鸟类学和机器学习研究方向提供支持核心应用包括纯音频鸟类物种分类将频谱图作为图像输入、与 CUB-200-2011 图像数据集配对的多模态学习研究、基于 ImageNet 预训练 CNN 的迁移学习实验以及音视频特征融合框架开发。研究人员可以训练深度学习模型从声学特征识别鸟类物种开发跨域深度特征组合方法整合视觉和听觉信息提升分类准确率或探索自监督学习和对比学习技术在多模态生物声学数据中的应用。数据集的统计特征显示物种数据分布不均192 个物种数据充足7 个物种数据量少于 10 张1 个物种完全缺失为研究长尾分布下的分类算法、少样本学习和数据增强技术提供了真实场景。通过提供与经典视觉基准对齐的音频频谱图数据该数据集推动了多模态生物多样性监测、自动化物种识别系统、生态声学研究以及野外鸟类调查智能化工具的发展。数据集来源该数据集从 Xeno-canto 和 eBird 开源鸟类声音资料库收集音频录音覆盖 200 个北美鸟类物种与 CUB-200-2011 图像数据集对齐通过标准化音频处理流程22,050 Hz 重采样、静音移除、10 秒分段、短时傅里叶变换、频率掩蔽、对数功率转换生成 9,270 张 224×224 像素 RGB 频谱图图像专为多模态鸟类物种分类研究而构建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-57文件大小827M原创声明本数据集为整理作品