IEMOCAP

关注
义项:情感识别多模态数据集

IEMOCAP是交互式情感双人动作捕捉数据库(Interactive Emotional Dyadic Motion Capture Database)的简称,由南加州大学语音分析与解释实验室(SAIL)采集,是一个表演性质的多模态、多说话人情感语料库。[1] 数据库含约 12 小时音视频资料,覆盖语音、视频、面部动作捕捉与文本转写,记录了多名演员在即兴与剧本场景中的双人互动,并由多名标注者给出类别与维度情感标注。[2] 它是语音情感识别与对话情感识别等研究中最常用的公开基准之一。[3]

百科 图文
目录
  1. 定义
  2. 背景
  3. 内容
  4. 影响与争议
  5. 参见

定义

IEMOCAP的全称为 Interactive Emotional Dyadic Motion Capture Database,中文可译作「交互式情感双人动作捕捉数据库」。它是一个以英语为语言的表演型情感语料库,其特点可概括为情感标注、多模态、表演性质与双人互动四个方面。[2]

数据库中的每个语句都同时带有类别标注与维度标注。类别涵盖愤怒、快乐、兴奋、悲伤、沮丧、恐惧、惊讶、其他与中性;维度涵盖效价、激活度与支配度。[2]

背景

该数据库面向若干研究用途采集,包括情感表达的识别与分析、人类双人互动的分析,以及情感敏感的人机界面与虚拟代理设计。[2] 采集方表示,细致的动作捕捉数据、用于诱发真实情感的互动情境以及数据库规模,使其成为研究多模态和表达性人际交流的补充资源。[1]

在已有的情感数据库中,IEMOCAP的互动情境、动作捕捉细节与数据库规模被认为构成了独特补充。它以双人对话为基本单位,同时记录语音、视频与面部动作捕捉,可支持对情感在互动中如何表达以及如何随时间变化的研究。[1][2]

内容

数据库由 10 名专业演员参与录制,男女各 5 人,共分 5 个会话,每个会话由不同的一对演员完成双人对话。[2] 情感诱发方式分为即兴表演与剧本表演两类,剧本场景用于引导特定的情感表达,即兴部分则由演员自由发挥。[1]

数据库共包含 10,039 个语句单元,其中 5,225 个出自剧本表演、4,784 个出自即兴表演,平均时长约 4.5 秒。[4] 每条语句由至少 3 名标注者独立标注。[2] 可用模态包括语音、视频、面部动作捕捉、头部运动与角度信息以及对话转写,转写文本还提供词级、音节级与音素级对齐。[2]

发布方总共放出约 12 小时的音视频数据,并附带两名对话者的音频与视频,以及其中一名对话者的面部、头部与手部动作捕捉数据。[5] 语句级别的类别与维度标注同样随数据一并提供。[5]

影响与争议

该数据库已被广泛用于语音情感识别、多模态情感识别与对话情感识别等任务,成为衡量模型性能的常用基准。[3] 不少对话情感识别研究以其为评测对象,DialogueRNN、DialogueGCN 等模型都在该数据集上报告结果。[6]

在众多评测中,最常用的是四类情感子集,即中性、愤怒、悲伤,以及把兴奋并入其中的快乐,共 5,531 条语句;常见的划分方式为会话 1 至 3 作训练、会话 4 作验证、会话 5 作测试。[7] 评测指标通常包括加权准确率与未加权平均召回率,后者为各类别召回率的平均值。[8] 为降低说话人差异的影响,常见协议采用留一说话人方式,使训练集与测试集之间不存在说话人重叠。[9]

数据集也存在若干限制:情感由表演产生而非完全自然;类别分布不均衡;并存在大量未确定标注,有分析指出约 2,507 条语句的情感标签为未知类别,约占样本总量的四分之一。[10] 在四类评测中,各类别识别率差异明显,快乐类别的准确率通常显著低于悲伤与愤怒。[11]

参见

参考资料

  1. IEMOCAP- Home . usc.edu [引用日期2026-09-27]
  2. IEMOCAP- Information . usc.edu [引用日期2026-09-27]
  3. IEMOCAP is a multimodal dataset widely used in the SER field . ieee.org [引用日期2026-09-27]
  4. Motivation and Background . tamu.edu [引用日期2026-09-27]
  5. IEMOCAP- Release . usc.edu [引用日期2026-09-27]
  6. 2024.findings-emnlp.536(PDF) . aclanthology.org [引用日期2026-09-27]
  7. pdf . frontiersin.org [引用日期2026-09-27]
  8. li21j_interspeech(PDF) . isca-archive.org [引用日期2026-09-27]
  9. xia16_interspeech(PDF) . isca-archive.org [引用日期2026-09-27]
  10. show . uvt.nl [引用日期2026-09-27]
  11. su20_interspeech(PDF) . isca-archive.org [引用日期2026-09-27]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-27T14:54:16Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
南加州大学 语音情感识别 多模态情感分析 对话情感识别 情感计算
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。