论文解读

先按人找声音,再按位置修声音:用空间相关增强 HRTF 个性化

针对未见被试在稀疏测量下难以个性化 HRTF 的问题,该工作用图网络分别做基于被试检索的个性化和基于位置检索的上采样,再用前者输出微调后者,报告在 SONICOM 上 3 个方向时把 LSD 从 4.33 dB 降到 3.60 dB,代价是需要先测少量方向并做两阶段预训练加微调。

 · 更新于 2026-09-24 · 约 23 分钟 · 11100 字 阅读 →
论文解读

听到更多却用更少:为对话语音检索并精选一条最相关的历史

针对对话语音中固定取前几句会引入无关冗余、取全量历史又成本过高的问题,论文提出多模态检索加精选方法 MARS,只取一条声学或语义最相关的历史来辅助当前句识别,并在 1.5K 小时训练下报告了优于 179K 小时顶级系统的混合错误率,代价是依赖微调 Whisper 建库与两遍解码的额外检索计算。

 · 更新于 2026-09-24 · 约 21 分钟 · 10079 字 阅读 →
论文解读

藏在声音特征里的后门:语速与情感为何能绕过音频大模型对齐

论文提出以语速、情感、噪声、口音、音量等声学特征为触发器的后门攻击框架 HIN 与 AudioSafe 评测,在 5% 投毒下语速与情感触发达到 100% 攻击成功率而音量触发不足 6.2%,且训练损失几乎不波动,代价是防御仍需在安全性与可用性之间权衡。

 · 更新于 2026-09-24 · 约 16 分钟 · 7640 字 阅读 →
论文解读

从能转写到能听懂言外之意:HPSU 如何检验语音大模型的类人听觉

HPSU 针对真实口语中潜在意图与隐含情绪的理解缺口,用三阶段多模态半自动标注构建 2 万余中英样本与 16 个任务,并以 13 个模型与人类基线对比显示最好模型仅 62.6% 而人类达 87.3%,代价是依赖自动裁判与多模型协同标注带来的可复现性核对负担。

 · 更新于 2026-09-24 · 约 18 分钟 · 8751 字 阅读 →
论文解读

低资源下保住音高与细节:HQ-SVC 用解耦编解码加两级合成做零样本歌声转换

HQ-SVC 针对无目标说话人数据、无微调的零样本歌声转换,用冻结的解耦编解码同时取内容与音色特征,再经 EVA 模块融合音高能量并用 DDSP 加扩散两级重建 44.1 kHz 梅尔谱,在不足 80 小时数据与单张消费级 GPU 条件下取得比大资源基线更高的自然度与音高准确性,代价是音色相似度客观指标未全面领先且重建引入可接受的发音音高误差。

 · 更新于 2026-09-24 · 约 20 分钟 · 9818 字 阅读 →
论文解读

三模态互相拆台时,HuMo 如何让文本、图像与音频协同

针对文本、参考图像与音频难以协同且三元完备数据稀缺的问题,HuMo 用非完备互补数据加两阶段渐进训练实现统一控制,在主体保持与音画同步子任务上报告了超越专用基线的分数,代价是仍需两阶段 40k 步训练与分段推理引导配置。

 · 更新于 2026-09-24 · 约 18 分钟 · 8698 字 阅读 →
论文解读

从看见听见到回得得体:HumanSense 把共情拆成可测的四层阶梯

针对多模态大模型在以人为中心场景中感知尚可但理解与回应不足的问题,论文用 3882 道真人记录选择题建四层基准并以多阶段全模态强化学习做推理模型,最强证据是人类 87.5% 领先最优模型 29.7 个百分点,而代价是长上下文推理仍是瓶颈且音频任务覆盖不全。

 · 更新于 2026-09-24 · 约 17 分钟 · 8399 字 阅读 →
论文解读

自回归也能定长:IndexTTS2 用标记计数与情感解耦做可控零样本合成

IndexTTS2 针对自回归零样本语音合成难以精确控时长与情感易混入音色的问题,用语义标记数约束、风格与音色双提示解耦与 GPT 隐状态增强做级联合成,在多数据集上报告了词错误率、说话人相似度和情感相似度的领先结果,但强情感下清晰度与极端变速仍有代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10400 字 阅读 →
论文解读

不增加采样步数:用验证器引导的多轨搜索做音频超分

针对扩散音频超分一次采样方差大、关键属性易丢失的问题,论文用冻结 AudioSR 加验证器打分与随机/零阶搜索选优,在 4 kHz 到 24 kHz 语音上报告最高约 9.70% 美学、15.20% 词错误率与 46.98% 频谱距离改善,代价是 120 路候选的成倍推理开销与单验证器过拟合风险。

 · 更新于 2026-09-24 · 约 19 分钟 · 9167 字 阅读 →
论文解读

不抠嘴唇像素:用语速与情绪指令做对齐的电影配音

针对视觉特征预处理复杂且跨域易失效的问题,InstructDubber 用多模态大模型生成语速与情绪自然语言指令,再分别蒸馏时长线索与校准情绪分析以预测音素时长和韵律,在三个基准的域内与跨域零样本配音中报告了更稳的对齐,但部分时长指标仍有基线更优且推理依赖外部大模型。

 · 更新于 2026-09-24 · 约 19 分钟 · 9181 字 阅读 →
论文解读

把关键词藏起来还能无损找回来:IO-RAE 的可逆混淆

针对语音被人和自动语音识别系统窃听关键词的问题,论文用大语言模型选替换词加累积信号攻击做局部混淆、再用可逆信息隐藏嵌入扰动,在 LibriSpeech 上报告目标误导率 96.5% 与恢复音频 PESQ 4.45,代价是强扰动与可逆嵌入的存储开销和对齐依赖。

 · 更新于 2026-09-24 · 约 19 分钟 · 9092 字 阅读 →
论文解读

灵感能直接长成主歌吗:IoS 让大模型学会段落结构

论文研究给定旋律灵感与段落标签生成结构化乐段的问题,用结构三元组数据与双实例对比优化让小模型在结构契合上大幅超过直接提示与常规微调,但代价是依赖 POP909 流行乐标注与多轮构造流程且未建模整曲跨段发展。

 · 更新于 2026-09-24 · 约 19 分钟 · 9326 字 阅读 →
论文解读

从短行为模拟内部认知:用个性化权重图回归真实人格

针对直接从外部行为回归真实人格偏向观察者印象的问题,该文用 10 秒音视频生成密钥修正通用面部反应生成器得到个性化认知权重,再编码为矩阵图用二维图网络回归自陈大五特质,在 NoXI 与 UDIVA 上报告了误差与相关提升,代价是仍需扩散预训练与双损失联合训练且细粒度言语未建模。

 · 更新于 2026-09-24 · 约 15 分钟 · 7429 字 阅读 →
论文解读

噪声下不只纠错,而是让编码器和解码器都向干净表征对齐

针对 Whisper 在噪声下出现流畅但错误转写的幻觉问题,论文用自适应层注意力融合编码器分块表征再用多目标蒸馏对齐干净教师,印地语 -10 dB 等低信噪比下同时降低词错误率并提升语义分,同时增加约 0.98% 参数和约 8% 推理延迟。

 · 更新于 2026-09-24 · 约 17 分钟 · 8440 字 阅读 →
论文解读

在帧之间听见时间:TimeAudio 如何把时刻、时长与语义对齐

针对大音频语言模型时间定位不准、长音频难以端到端理解的问题,TimeAudio 用时间标记加绝对时间编码加分段令牌合并,并在 FTAR 时间任务数据上微调,在密集描述、定位与时间线摘要上报告了定位精度的提升,但密集描述的文本多样性仍有代价与边界。

 · 更新于 2026-09-24 · 约 21 分钟 · 10124 字 阅读 →
论文解读

直播不是更长的短视频:LiViBench 如何测互动理解与评论利用

针对主播与观众实时互动的直播视频理解问题,论文用多智能体加种子问题的人机协同流程构建含音频语音评论的 3168 视频 3175 题基准,并以两阶段指令微调加视频到评论检索训练 LiVi-LLM-7B,在 LiViBench 上报告 64.4% 的总准确率,代价是仍落后最优闭源模型的直播专有任务与对海量评论的依赖取舍。

 · 更新于 2026-09-24 · 约 19 分钟 · 9418 字 阅读 →
论文解读

先分离再生成:MACS 如何把混合声音拆开并对齐语义来画图

针对自然混合音频直接生成图像会丢失多源语义的问题,MACS 采用先用 UNet 分离再用解耦交叉注意力生成图像的两阶段路线,在 LLP-multi 等多任务上报告了多项指标领先,但分离数固定与文本标签依赖仍是主要代价与边界。

 · 更新于 2026-09-24 · 约 19 分钟 · 9387 字 阅读 →
论文解读

视觉对话不够吸引人:用合成语音补情感,再用交错建模学互动

针对视觉对话回复正确但不吸引人的问题,该研究用情感感知语音合成补齐音频上下文并以交错文本音频序列建模,配合三项预热任务与多模态参与度评估,在两个数据集上报告了语法与参与度两方面的提升,但合成音频的计算代价与真实人声泛化仍待验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9867 字 阅读 →
论文解读

MAVERIX:逼模型同时听和看,堵住单模态捷径的音视频理解基准

MAVERIX 用 700 段视频与 2556 道必须联合音视频才能回答的问题,测出以 Gemini 2.5 Flash-Lite 约 54.7% 选择题准确率为代表的模型与 92.8% 人类表现之间的大幅差距,代价是更长的人工标注与多轮去捷径校验流程。

 · 更新于 2026-09-24 · 约 21 分钟 · 10185 字 阅读 →
论文解读

音频里藏着文本时还硬做解耦:MDF 只拆音频再按贡献加权

针对音频与文本同质、视觉与二者异质的问题,MDF 只对音频做文本剥离得到声音分量,再用正交约束强化异质并用标签导出的贡献监督权重生成器,在 CMU-MOSI 上取得 MAE 0.692 等最好或次好结果,但视觉增益与权重估计仍受单模态预测误差限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9427 字 阅读 →