英文题目:Emotion-Based Film Music Retrieval with Handcrafted and Deep Models

会议身份:conference:icmc:2026:conference-paper-id:paper-23

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#对比学习 #用户研究 #变分自编码器 #音乐 #音乐检索

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Lucas Ong:机构信息未能从会议 PDF 纯文本可靠映射
  • Ruby Crocker:机构信息未能从会议 PDF 纯文本可靠映射
  • George Fazekas:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

影视配乐检索以目标效价-唤醒坐标为输入,输出情感一致的配乐片段,难点在于声学特征与主观感知的非线性映射及段内情绪时变性。手工路径先将每段十五秒切分为五秒片段并提取音色节奏响度和声共七十二维特征,经低方差与高相关过滤及径向基核主成分分析降至六维后做聚类形成固定簇,再按曲目到簇质心距离排序返回同簇曲目。深度路径将拼接嵌入送入变分深度嵌入以高斯混合为潜先验学习可聚类潜空间,并将二维效价-唤醒坐标编码后经共享投影头与音频潜表示做温度缩放对比对齐,使查询坐标可直接投影检索。与固定簇只能返回同簇固定曲目不同,深度路径在全潜空间按余弦相似度做任意坐标近邻排序,实现了从离散簇选择到连续情绪插值的机制差异,可在平静与紧张之间平滑过渡。在FME-24聚类评测任务下,手工模型的Silhouette得分为0.15,高于VaDE+CL模型的Silhouette得分0.09。用户研究进一步显示手工组高相关比例占优而深度组零相关比例更高,且两组约半数认可簇内一致性,表明客观可分性未完全转化为感知相关性。该结论适用边界受限于短片段商业影视配乐的近似匹配,尚不支持极端情绪与长时叙事情绪追踪外推;原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,先保留哪些关键信息?

这篇解读的输入是论文正文与本次收到的官方原图像素,目标是让刚进入语音音乐音频方向的研究生能复述方法并核对实验条件。必须保留的信息包括数据集规模与标注方式、两条路线的输入表示与检索动作、训练与评估的具体条件、以及作者自己承认的局限。输出是一套按学习依赖展开的说明,不做超出证据的效果承诺。

任务不是给音乐分类,而是按目标情感找配乐。用户给一个情感坐标,系统返回若干电影音乐片段。论文用效价-唤醒度表示情感,白话说就是一张平面图,横轴管愉快还是不愉快,纵轴管激动还是平静。英文是 Valence–Arousal,缩写为 V–A。后文统一用效价-唤醒度指代这张图,用检索指代按坐标找曲子的动作。

下面先看这张情感图长什么样,它决定了后文所有查询输入和距离计算的含义。图中 4 个象限分别对应高唤醒正效价、高唤醒负效价、低唤醒负效价、低唤醒正效价,中心是中性点。

效价-唤醒度 × 基于情感的检索: 效价-唤醒度负责把听感变成可计算的输入,效价表示正负向,唤醒度表示强度,基于情感的检索负责把这个坐标变成取歌动作,二者搭配的理由是分类标签太粗而坐标可以连续查询,组合后系统不再先给歌曲贴标签,而是直接回答哪首曲子的感受位置离目标坐标最近。

读图前需要明确,这张图只是情感表示的约定,不是模型结构图。它告诉我们查询是一个 2 维点,检索质量取决于音频表示能否反映这个点的位置。

看图路径: 1. 先确认横轴为效价从负到正,纵轴为唤醒度从低到高;2. 再看四个象限各举了哪些词,例如兴奋与愉悦在第一象限;3. 最后把中心 neutral 理解为后续两模型都偏向聚集的中性区

原论文 Figure 1:Russell’s Circumplex Model of Emotions \\[21\\]

论文图 1。原论文 Figure 1:“Russell’s Circumplex Model of Emotions [21]”。

这张罗素环形模型的像素显示横轴从左到右由负效价走向正效价,纵轴从下到上由低唤醒走向高唤醒。第一象限附近出现兴奋愉悦高兴等词,第二象限出现紧张愤怒等词,第三象限出现抑郁厌倦疲倦等词,第四象限出现满足放松平静等词。中心标为中性。后文手工聚类的簇中位坐标大多挤在中性附近,这与该图的宽分布形成对照,说明数据本身没有铺满全图,这是理解后文分离度低的关键。

已有路线在解决什么,本文为何还要做检索?

音乐情感识别已有不少工作从音频特征预测情感,常用思路是把音色节奏能量旋律等特征映射到类别或维度。论文把重点放在另一端,也就是反过来用:给定想要的情感,直接找出情感位置相近的音乐。这对作曲和剪辑找情绪匹配素材更直接。

在表示上,类别表示给离散标签,方便分类但容易丢掉细微差别,也没有统一的情绪集合。维度表示用连续坐标,本文采用 2 维效价-唤醒度,取值通常在负 1 到正 1 之间,便于解释和做距离计算。论文关注的是感知到的情感,也就是听得出是什么情绪,而不是作曲者本意或听者实际被唤起的情绪。多人标注取共识是实践上的折中。

在方法上,手工特征路线强调用可解释的声学描述子加降维和聚类,深度路线强调用预训练嵌入加生成式聚类。论文提到 VGGish 和 L3-Net 这类原本为声音事件检测设计的嵌入,在音乐和语音情感任务上表现较好,说明借用外部表示是合理的起点。变分深度嵌入则是在变分自编码器框架下用多个高斯刻画潜先验,适合聚类,再借用类似 CLIP 的思想把音频潜表示和情感坐标对齐。

同条件对照的要点是输入是否都是电影音乐、目标是否都是按坐标检索、监督是否都来自感知标注、运行阶段是否都是查询时检索而非离线分类。本文两条路线都满足这四点,因此可以在同一数据集上比较。不同的是表示学习方式,一个是固定特征加固定簇,一个是可学习的连续潜空间。

问题如何形式化,一条样本要走完哪些步骤?

形式化后输入是一个 2 维查询点,输出是按情感相关度排序的曲目列表。库中每首曲子都有音频和若干个效价-唤醒度标注。系统需要先把音频变成可比的表示,再把查询变成同一尺度下的表示,最后算距离或相似度排序。

以一条 15 秒电影音乐片段为例,先切分再表示再聚合再检索。手工路线把它切成 3 段 5 秒,提特征后降维聚类,整首曲子用中位距离和中位情感代表,查询时先找最近的簇。深度路线把它变成约 1 秒一张的谱图序列,提预训练嵌入后过编码器得到潜向量,查询坐标过情感编码器和共享投影头后按余弦相似度找最近的嵌入。

教学例子仅为走通流程,不代表真实数值。假设查询点偏向平静愉悦,系统应返回落在第四象限附近的曲子,而不是只返回同类型或同作曲家的曲子。评价时既看簇是否紧致分离,也看人是否觉得返回的歌情绪对得上。时间变化被简化了,因为最终每首曲子只用一个中位坐标参与排序,这意味着段落内的情绪起伏在检索阶段被抹平。

两条路线全景:各自输入什么,输出什么?

全景上有两条并行的路线,共用同一个数据集和同一种查询接口。手工路线输入是波形经 Librosa 算出的时频和音乐特征,输出是簇编号加簇内排序。深度路线输入是 VGGish 加 OpenL3 拼成的嵌入,输出是潜空间中按相似度排序的前若干邻居。

手工路线更像基线,步骤固定透明,适合检查特征与情感是否真的有结构。深度路线更像可微的检索器,簇主要承担情感表示的作用,真正干活的是连续空间中的最近邻。论文的判断是两者都捕捉到情感相关结构,但深度路线选择更灵活更细。

两条路线都要面对同一个数据现实,可用标注样本只有数百量级,切分后样本数放大但情感标注仍要聚合。这种小数据加聚合的设定,决定了后文所有关于泛化和细粒度的讨论都要打折扣。

手工路线如何从波形走到簇坐标?

手工路线先把每段 15 秒切成 3 段 5 秒,共得到 1227 个音频样本。作者说明更短的段常常没多少声音,更长的段在小数据下收益有限。特征分 4 类,音色节奏响度和和声,包括梅尔频率倒谱系数均值方差、谱质心、谱带宽、谱对比度、速度、起音强度、均方根能量的均值方差、拍点相关能量、色度特征均值方差等。跳长 1024、傅里叶点数 4096 是时间和频率分辨率的折中。初始每样本 72 维。

降维分 3 步,先去掉低方差和高相关特征,从 72 维降到 35 维,再用径向基核的核主成分分析降到 6 维。作者说径向基核主成分分析比线性主成分分析在聚类指标上略好,也更能照顾非线性。这里的阈值是方差小于 0.15 去掉,相关大于 0.75 去掉,核参数为 0.1。聚类用 Scikit-learn 的 k-Means,通过轮廓系数选 k。

下图是选择 k 的依据,横轴是候选簇数,纵轴是轮廓系数,越高表示样本与其簇更匹配而与其他簇更分离。

看图路径: 1. 先看横轴为聚类数,纵轴为轮廓系数;2. 再看曲线从左侧高点随 k 增大总体下降的趋势;3. 最后定位文中所选 k 等于 7 在下降段中的位置

原论文 Figure 2:Silhouette Scores Across k for Handcrafted Clusters

论文图 2。原论文 Figure 2:“Silhouette Scores Across k for Handcrafted Clusters”。

该曲线的像素显示纵轴大约在 0.13 到 0.22 之间,横轴从几个簇延伸到约 30 个簇。曲线总体随簇数增大而下降,左侧较小 k 处较高,随后在 7 附近出现转折再继续走低。论文据此选 k 等于 7。需要提醒的是轮廓系数高不等于情感对,簇在声学上分得开,还要看簇中位情感是否分得开。

手工音频特征 × k-Means: 手工音频特征负责把波形转成音色节奏响度和和声方面的数字,k-Means 负责把这些数字按距离分成若干堆,二者搭配的理由是特征含义透明且聚类过程可检查,组合后每个簇可以算一个中位情感坐标,检索就变成先找最近簇再按到簇心距离排序。

检索动作是先对每个簇算中位效价-唤醒度,再对查询算欧氏距离找最近簇,簇内按到簇心距离排序。为避免同一首歌的多个切分段重复出现,用中位聚合保证每首只出现 1 次。代价是固定簇带来固定返回,换一个相近查询很可能命中同一簇,细粒度不足。论文还指出这些簇中位点在情感空间里靠得较近,这是后文定量分离度低的人为表现之一。

深度路线如何把声音和坐标放进同一空间?

深度路线先把每段 15 秒变成 15 张约 1 秒的谱图,共得到 6135 个样本。音频先转单声道并对齐跳长,再分别提 128 维 VGGish 和 512 维 OpenL3,拼接成 640 维。模型用 PyTorch 实现,编码器和解码器各 3 层,宽度为 512、256、128,带批归一化、泄漏修正线性单元和丢弃。编码器输出 32 维潜表示以及高斯重参数化所需的均值和对数方差,解码器从潜空间重构嵌入。

情感分支单独处理,先对每首的多个人工标注做中位聚合,再过一个线性层到 64 维、激活、归一化,最后到 32 维。音频潜表示和情感表示再各自过一个共享的 32 维投影头,结构是线性加批归一化加激活,这种设计在对比学习中常被用来提升表示质量。投影后归一化,再算余弦相似度。

变分深度嵌入 × 对比学习: 变分深度嵌入负责把高维音频嵌入压成有混合高斯先验的潜空间并能重构,对比学习负责把音频潜表示和情感坐标表示拉到同一个空间里对齐,二者搭配的理由是只重构不管情感则检索无依据,只对齐不管分布则潜空间容易塌缩,组合后同一簇的音频与情感更靠近,不同样本被推开,查询坐标可以直接投影后按余弦相似度找邻居。

总损失是变分深度嵌入损失加对比损失,权重由系数控制。变分部分包括重构均方误差、潜分布散度和簇分配散度,分别把样本拉向所属高斯、把软分配贴向全局簇分布。对比部分按簇内为正、其他为负计算相似度,温度系数取 0.1。簇均值用编码后音频空间的 k-Means 初始化。先验设 6 个高斯,但训练后自然收敛为 3 个主导簇,作者认为可能是大致情绪分组,也可能是数据不平衡所致,留待未来验证。

预训练音频嵌入 × 共享投影头: 预训练音频嵌入负责提供已经从大量声音中学到的表示,文中用 VGGish 和 OpenL3 拼接,共享投影头负责把音频分支和效价-唤醒度分支都映射到同维向量再归一化,二者搭配的理由是直接从波形学表示在小数据上不稳定,而投影头给出可比的相似度尺度,组合后新查询不需要重训,只需过情感编码器和投影头即可检索。

检索时先把库中投影后的音频嵌入存好,新查询只过情感编码器和投影头,再按余弦相似度取前若干个。这种做法的优点是查询点可以在连续空间中平滑移动,例如从平静滑向紧张时返回也渐变,而不是在固定簇之间跳变。代价是高维空间中欧氏或余弦距离的绝对数值不如低维直观,相对排序仍可用,但解释性下降。

训练与非训练部分各自如何计算?

手工路线没有神经网络训练阶段,需要说清真实计算过程。计算包括特征提取、按方差和相关过滤、核主成分分析拟合、k-Means 迭代、轮廓系数网格搜索选 k、以及簇中位情感聚合。所谓学习只是无监督聚类加模型选择,没有梯度更新,也没有情感标签直接参与特征权重优化,情感只在事后用来给簇命名和检索。

深度路线有明确训练,200 轮,用 AdamW 优化器,学习率 1 乘 10 的负 5 次方,权重衰减 1 乘 10 的负 4 次方,配合单周期学习率调度和梯度裁剪稳定训练。损失曲线随轮数下降,重构项下降明显,分布项缓慢下降,对比项和簇项处于较低水平。训练结束后投影嵌入被预计算,查询阶段不再更新权重。

需要指出的缺项是原文未报告批量大小、随机种子、划分方式和早停规则,也未评估返回个数 k 的敏感度。复现时应先固定这些再谈指标,否则同样的代码也可能得到不同的簇形状。

数据、切分、指标与听测条件是否一致?

数据条件是理解一切数字的前提,下表把分散在正文中的规模信息收拢。比较问题是库有多大、标注有多密、过滤后剩多少。公平条件是两条路线都用同一批过滤后的 FME-24 标注,指标方向是规模越大、标注越密通常越有利于学到细粒度,但本文恰好是小数据。

条件指标规模 A规模 B比较对象
曲库构成曲目数、类型数、作曲家数300 首、21 类、156 人同一曲库数据集总量
标注密度标注人数、每人标数、每段平均标注185 人、10 段、4-5 个同一标注池标注覆盖
过滤后可用标注样本数、原始样本数409 个、600 个同一过滤流程有效样本

上表说明曲库看似覆盖 21 种类型和 156 位作曲家,但真正带情感标注且经纠错后可用的只有 409 个样本。185 人每人标 10 段,平均每段 4 到 5 个标注,再聚合成一个中位点,意味着个体差异在检索前就被压缩。这是后文情感区间窄的来源之一。

下表把两条路线的样本放大方式与关键超参数并置。比较问题是同样的 15 秒如何变成不同的训练行数。公平条件是切分逻辑各自固定,指标方向是行数多不等于监督多,因为情感标签仍是曲目级聚合。

条件指标手工路线深度路线比较对象
切分时长、段数、总行数15 秒、3 段、1227 行15 秒、15 张、6135 行样本放大
表示维度、来源、训练轮数72 维、Librosa、0 轮640 维、预训练、200 轮表示与优化
听测手工人数、深度人数、每次返回34 人、26 人、5 首同一问卷、同一任务主观样本

上表的主要收益是把可复现点 1 次讲清,手工路线初始 72 维经 1227 乘 72 的矩阵再降维,深度路线 640 维来自 128 加 512 拼接并训练 200 轮。代价是深度路线短窗约 1 秒,可能抓不住长而氛围化的电影铺底,静音或信息量低的段还会产生无效嵌入。听测每次返回 5 首,每人做 2 次不同查询的检索任务,问题覆盖相关首数、与查询的相似度、结果内部一致性、排序是否递减。前端用 React,后端用 Flask,托管与存储分别用 Firebase 和 Render。资源状态核查显示 Librosa 文档链接当前不可用,Scikit-learn、OpenL3、PyTorch、React、Flask、Firebase 与 Render 本次可达,复现时应以可达版本为准。

定量指标用 3 个聚类指标,轮廓系数越高越好,戴维斯-布尔丁指数越低越好,卡林斯基-哈拉巴斯指数越高越好。它们都衡量簇内紧致与簇间分离,但对维度和簇数敏感,不能直接当成检索好坏。论文还用查询与返回曲目之间的欧氏距离做简单的排序依据,细节放在代码仓库的笔记本中。

主结果支持什么,又在何处反证?

定量上手工路线轮廓更高、戴维斯-布尔丁更低,说明在 6 维空间中簇更紧致分离更清晰。深度路线卡林斯基-哈拉巴斯略高,说明整体簇密度尚可。作者的解释是深度路线在 32 维潜空间中工作,高维下点与点距离更均匀,欧氏距离的区分力下降,加上存在若干小而模糊的簇,拉低了前两个指标。相对差异仍可用于比较,但不能跨维度直接比绝对值。

下图是深度潜空间的降维可视化,理解时要先确认这是 t-SNE 投影,不是训练用的原始 32 维。

看图路径: 1. 先看横轴为 t-SNE 第一维,确认这是降维可视化而非原始潜空间;2. 再比较粉色蓝色黄色三块大团与边缘小散点的分布;3. 最后注意交界处颜色混杂,说明簇间并非完全分离

原论文 Figure 4:t-SNE of VaDE + CL Latent Space

论文图 4。原论文 Figure 4:“t-SNE of VaDE + CL Latent Space”。

该像素显示 3 个大色块占据主要面积,粉色在左上铺开,黄色在右上铺开,蓝色在下方聚成团,交界处有少量混色小点。原文说设 6 个高斯先验但自然收敛为 3 个主导簇,图上也以三团为主,另有若干小而不清晰的簇。这支持作者关于簇塌缩或数据不平衡的判断,也反证了先验数不等于有效簇数。

下表收拢可验证的定性结果。比较问题是在相同问卷下哪条路线让人觉得更对味。公平条件是任务与返回数一致,指标方向是相关首数越多、一致性越高越好,但样本量小且方差大,只能看作近似。

条件指标手工路线深度路线比较对象
聚类质量轮廓更高、分离更低、密度略低轮廓占优、分离占优密度占优2 模型互有胜负
检索方式固定簇返回、连续空间返回同簇常同结果按相似度取前若干灵活性

上表的主要收益是手工路线在紧致性上占优,深度路线在灵活性上占优。具体代价是手工路线簇中位情感挤在中性附近,极端情绪代表不足,深度路线听测中 0 到 3 首相关的比例更高,约 62 百分比对 73 百分比,说明灵活并未直接换来更高的命中率。未胜出项必须保留,深度路线并未在轮廓和分离上赢过基线。

下图是第一个听测问题的分布,横轴为 1 次返回中情感相关的曲目数。

看图路径: 1. 先确认横轴为一次返回中情感相关的曲目数,纵轴为人数分布;2. 再对比两种颜色柱在 0 首与 4 首等位置的高低;3. 最后结合样本量理解该图只反映粗分布而非显著性检验

原论文 Figure 8:Emotional Relevance Responses - Q1

论文图 8。原论文 Figure 8:“Emotional Relevance Responses - Q1”。

该像素显示横轴从 0 到 5,两种颜色柱在各档交错。手工路线的柱在 1 首和 4 首等位置更高,深度路线的柱在 0 首 2 首 3 首等位置更高,整体都没有压倒性集中在 5 首。这与正文描述一致,手工路线有更多人报告 4 到 5 首相关,深度路线报告 0 首的人多约 9 个百分点。约一半受访者在第三题选比较同意,认为返回曲目之间情绪一致,说明聚类抓到了一定的情感连贯,但精确命中查询仍有限。

哪些对照说明了关键选择的影响?

论文没有做完整消融,但有几处可当对照读。降维上径向基核主成分分析相对线性主成分分析在聚类指标上略好,这是选择非线性的依据。簇数上轮廓曲线支持手工路线选 7,深度路线类似分析支持设 6 个先验,但有效结构只有三团,这说明先验数与有效簇数可以不一致。

检索机制本身构成对照,固定簇返回与连续最近邻返回在同样查询下行为不同。前者稳定可解释但重复率高,后者能插值但受高维距离和短窗表示的拖累。若拿掉共享投影头,查询坐标将无法与音频嵌入直接比相似度,检索就退化为两套各自为政的空间。原文未报告拿掉对比项后的数值,因此不能断言去掉后必然变差,只能说按设计对比项承担对齐职责。

另一组隐含对照是聚合方式,用中位聚合抗离群并避免同曲重复,但代价是抹掉段内情绪变化和标注者分歧。若改用保留全部分布的表示,理论上能学到更细的差别,但小数据下估计更不稳定,论文为简单起见仍用单点。

边界在哪里,哪些验证还没有做?

数据边界最明显,可用情感标注只有 409 个,深度切分后 6135 行仍远小于变分深度嵌入原本面向的万级规模。短窗约 1 秒与电影音乐的长氛围不匹配,静音段进一步污染嵌入。情感上簇中位挤在中性附近,极端情绪学不到也检不出。

方法边界包括手工路线固定簇导致同查询同结果,簇间情感差异小。深度路线有稀疏小簇、高维距离解释性弱、短窗与静音问题。评估边界包括未测返回个数 k 的敏感度,未报告时序情绪变化的指标,用聚合后单点算距离无法反映电影音乐的动态起伏。听测样本为 34 人与 26 人,方差大,只能算近似。

未验证的推测要单独标出。把模型搬到更大或别的库上是否还成立,待验证。把变分深度嵌入的生成能力用来按目标坐标创作新音乐,待验证。把文字情绪描述与坐标联合使用能否分开更细的情绪,待验证。缺失这些不是技术错误,但不能把趋势当成每组都成立的保证,更不能承诺延迟成本或误判率得到改善,因为原文没有测量这些量。

复现先做什么,需要哪些版本与参数?

先按数据管线复现,不要先调模型。拿到 FME-24 后核对 300 首 21 类 156 人、185 人每人 10 段、平均每段 4 到 5 个标注、过滤后 409 对 600 的口径。把 15 秒按手工路线切 3 段 5 秒得到 1227 行,按深度路线切 15 张约 1 秒得到 6135 行,记录切分与编号对应关系,保证同一原曲的段可追溯。

再复现手工路线,Librosa 提 72 维特征,按方差小于 0.15、相关大于 0.75 过滤到 35 维,再用径向基核参数 0.1 的核主成分分析到 6 维。用 Scikit-learn 的 k-Means 扫 k 并看轮廓曲线,固定 k 等于 7,算簇中位情感与簇心距离排序。注意本次核查 Librosa 文档链接不可用,应锁定本地已装版本并记录函数行为。

再复现深度路线,音频转单声道,对齐跳长,提 128 维 VGGish 加 512 维 OpenL3 拼成 640 维。编码器解码器各 3 层 512、256、128,潜维 32 维,情感分支先中位聚合再经 64 维到 32 维,共享投影头 32 维。训练 200 轮,AdamW 学习率 1 乘 10 的负 5 次方,权重衰减 1 乘 10 的负 4 次方,加单周期调度与梯度裁剪,温度 0.1,簇均值用编码后 k-Means 初始化。查询时预计算库嵌入,新坐标过情感分支后按余弦相似度取前 5。代码开源、权重下载与系统可运行是三回事,本文给出前后端与托管信息,但复现检索只需音频管线加模型权重加查询接口,不必先搭全栈。

何时值得尝试这套做法?

当任务是按情绪坐标找现成配乐,且需要可解释基线时,值得先做手工路线。它用透明特征和固定簇快速验证数据里是否有情感结构,适合教学和小规模选曲。当需要连续微调,例如在平静与紧张之间平滑过渡选曲,且能接受调参与数据清洗成本时,再尝试变分深度嵌入加对比学习的路线。

不值得的情况也要明确。如果库中极端情绪很少,或标注都挤在中性附近,两种方法都难以分开细粒度,此时应先扩充曲目和标注者数量,保留标注分歧而不是只存中位点。如果音频有大量静音或过短片段,应先做语音活动或静音剔除,否则嵌入质量会拖累检索。

回到中心矛盾,紧致可解释与灵活细粒度不可兼得。小数据下手工聚类更稳,大空间下深度检索更活。未来的增量应放在数据侧和表示侧,先让情感铺满全图,再谈更复杂的对齐与生成。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 4 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 4 页

区域 2 · 查看论文原页

原文数学表达区域 3,PDF 第 4 页

区域 3 · 查看论文原页

另有 9 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 icmc-2026 论文汇总