CAPQ-FAST: Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback

📄 同样是二倍速,为何有人觉得高效、有人只想跳过 英文题目:CAPQ-FAST: Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback 一句话:倍速下的感知质量由速度与内容时间密度共同决定,论文用时间信息量、每分钟词数、每分钟节拍数分别刻画视频、语音、音乐的可跟随压力并以指数族加线性融合预测平均意见分,在受控小样本上取得高相关,但语义与个性化仍在模型之外。 标签:#音频质量评估 | #多模态模型 | #语音质量评估 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jiarun Song:机构信息未在 arXiv HTML 中可靠披露 Yuxin Song:机构信息未在 arXiv HTML 中可靠披露 Fuzheng Yang:机构信息未在 arXiv HTML 中可靠披露 Weisi Lin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把倍速下“想高效看还是想跳过”的模糊意图转成可计算的跨模态感知质量,有产品嗅觉;但全篇仍是小样本主观分拟合的指数曲线加线性融合,泛化证据和统计完备性撑不起个性化推荐的大叙事。 📌 核心摘要 本文研究在线音视频倍速播放下的感知质量退化,核心观察是同一速度对不同内容可对应高效观看与选择性跳过两种相反意图。作者提出内容自适应模型 Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback (CAPQ-FAST),以播放速度 \(S\) 结合模态内时间密度预测平均意见分 Mean Opinion Score (MOS)意义下的质量:视频用时间信息量 Temporal Information (TI),语音用每分钟词数 Words Per Minute (WPM),音乐用每分钟节拍数 Beats Per Minute (BPM),再经音视频融合得到整体质量 \(Q\)。验证显示融合模型在语音视频和音乐视频上 Pearson Correlation Coefficient (PCC)达 0.976 和 0.968,优于不区分内容的同族基线。应用上用于播放速度推荐、自适应播放控制和意图粗粒度解释。局限是 72 名 22岁至28岁大学生被试、内容与语义覆盖有限,TI、WPM、BPM 只刻画时间密度而非语义重要性,外推到真实平台行为需谨慎。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 775 words

Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions

📄 当语音 Token 不再像自然语言:13 个编解码器在噪声下的语言统计学分化 英文题目:Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions 一句话:论文用 13 个神经音频编解码器 × 3 语料 × 3 噪声的 117 格全交叉网格,证明语料几乎不影响分布而量化器架构与噪声类型按指标分工主导,并用 JSD 与崩溃/爆炸签名在 DEMAND 真实噪声下建立无需解码的质量探针。 标签:#语音编码 #音频质量评估 #基准测试 评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Joonyong Park:机构信息未在 arXiv HTML 中可靠披露 Shinnosuke Takamichi:机构信息未在 arXiv HTML 中可靠披露 David M. Chan:机构信息未在 arXiv HTML 中可靠披露 Shunsuke Kando:机构信息未在 arXiv HTML 中可靠披露 Yuki Saito:机构信息未在 arXiv HTML 中可靠披露 Hiroshi Saruwatari:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把 13 个神经音频编解码器按量化器拓扑分组并做 117 格全交叉的语言统计学对照,配合 500K token 匹配采样与方差分解,把此前单语料单条件下的 Zipf 观察变成了可检验的家族条件化规范。短板是所有噪声对比锁死在 0 dB 单点、JSD 与质量关联仅在 12 个编解码器均值上计算且高度依赖 DEMAND 场景,结论的外推半径比标题暗示的小得多。 ...

2026-09-01 · 更新于 2026-09-04 · 13 min · 2714 words

A Mixed-Behavior Vote Model for Multimedia Subjective Quality Votes, Means, and Variances

📄 方差不该越过底线:用单峰约束重画 MOS 的容许区间 英文题目:A Mixed-Behavior Vote Model for Multimedia Subjective Quality Votes, Means, and Variances 一句话:针对 MOS 与方差的抛物线拟合总会跌破理论下界的问题,论文用单峰约束重定上下界并以四次多项式与混合投票模型实现区间内任意方差,在 16 个数据集上验证了拟合合规与行为可解释性,代价是仅建模一二阶矩且未触及个体与时序因素。 标签:#语音质量评估 #生成模型 #音频质量评估 #理论分析 #模型评估 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jaden Pieper:机构信息未在 arXiv HTML 中可靠披露 Stephen D. Voran:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用单峰性约束把教科书式的最大方差抛物线拉回现实,并用混合投票行为给出可解释的方差拟合与生成模型,数学闭环干净。短板是16个数据集的验证仍停留在曲线拟合层面,既无与主观实验预测或质量估计下游任务的关联,也无对投票者异质性与样本量有限性的严格统计检验,离NeurIPS/ICLR所要求的实证深度尚有距离。 📌 核心摘要 论文针对多媒体主观质量测试中平均意见得分(Mean Opinion Score,MOS)与投票方差之间的建模失配问题,指出传统缩放抛物线 \(v_d(X)=a(X-1)(5-X)\) 在拟合真实数据时几乎必然跌破理论最小方差曲线 \(v_{\min}(X)\)。方法核心是提出单峰方差区域(Unimodal Variance Region,UVR),以最大方差单峰(Maximum Variance Unimodal,MVU)投票概率质量函数(Probability Mass Function,PMF)替代全1与全5极端双峰对应的 \(v_{\max}(X)\) 作为上界,并以相邻两选项(Adjacent Two-Choice,ATC)PMF对应的 \(v_{\min}\) 作为下界;进而用四次多项式 \(v_r(Y)=(Y-1)(5-Y)(w_1(Y-3)^2+w_0)\) 重塑方差曲线,并构建混合二项投票(Mixed-BinoVotes,MBV)生成模型,通过混合参数 \(\alpha(y)\) 在BinoVotes与ATC/MVU之间插值以精确实现UVR内任意目标方差。相较于既有BinoVotes仅能产生 \(a=0.25\) 的固定抛物线方差,新模型首次实现方差形状可调且始终满足单峰与离散投票约束,并提供可解释的投票行为分解。在16个涵盖语音、图像、视频的数据集上,四次拟合均保持在UVR内,\(w_0\)在0.130至0.249之间,\(w_1\)在0.007至0.046之间,ITS2013接近纯BinoVotes行为而NISQA P501 MOS有28%文件方差落在最小方差曲线上。该框架为诊断主观实验设计缺陷与投票者行为提供了可量化工具,但局限在于仅建模一阶与二阶矩,未涉及投票者个体建模、时序依赖或与客观质量预测的联合验证。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 867 words

Evaluating Loss Functions in Differentiable Out-of-Domain Sound-Matching with Partial Parameter Distance

📄 当目标永远无法被完美复刻,我们该如何评判模仿的好坏? 英文题目:Evaluating Loss Functions in Differentiable Out-of-Domain Sound-Matching with Partial Parameter Distance 一句话:为了解决域外声音匹配中参数空间不一致导致无法自动评估的难题,论文用共享关键参数的部分参数距离搭配七组极简失配合成器对做受控筛选,证明损失函数的优劣始终跟合成方式绑定,且该距离在七组场景中有五组与盲听的最优选择一致,但结论仍受限于一秒玩具信号和内部小规模听感。 标签:#音频生成 #生成模型 #音频质量评估 #模型比较 评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Amir Salimi:机构信息未在 arXiv HTML 中可靠披露 Daniel Penner:机构信息未在 arXiv HTML 中可靠披露 Kalvin Eng:机构信息未在 arXiv HTML 中可靠披露 Abram Hindle:机构信息未在 arXiv HTML 中可靠披露 Osmar R. Zaïane:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用最小可控合成器刻意制造失配来让域外声音匹配可自动评估,部分参数距离 Partial Parameter Distance (PPD) 的提法巧妙绕开了全参数不可比的死结。短板是所有结论都锁在 1 秒玩具信号与作者自评听感上,声称验证人耳一致性却用 4 人作者小组盲评,外部有效性与真实录音泛化几乎未触及。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 693 words

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

📄 OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses 标签:#模型评估 #基准测试 #多模态模型 #音频质量评估 #可解释性 7.4/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.4/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音频质量评估 | #多模态模型 | #模型评估 #基准测试 | arxiv 👥 作者与机构 第一作者:Guangzheng Hu(Alibaba Group;University of Melbourne) 通讯作者:Hu Wei;Jin Xu 作者列表:Guangzheng Hu、Ziyue Jiang、Weixu Qiao、Lixin Zhang、Jianye Kang、Yuru Wu、Rong Bao、Niantong Li、Wei Wang、Ziyi Cheng、Xinfa Zhu、HangRui Hu、Ting He、Bing Zhao、Lin Qu、Hu Wei、Jin Xu(机构:Alibaba Group;Qwen Team;Alibaba DAMO Academy;University of Melbourne;Zhejiang University) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 716 words

Development and Feasibility Evaluation of an Edge AI as Medical Device System for Breast Cancer Multidisciplinary Team Meetings

📄 Development and Feasibility Evaluation of an Edge AI as Medical Device System for Breast Cancer Multidisciplinary Team Meetings 标签:#语音识别 #大语言模型 #音频质量评估 #医疗音频 8.4/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.4/10 | 前25% | 文档类型:应用研究 | 评分置信度:中 | #语音识别 | #大语言模型 | #音频质量评估 #医疗音频 | arxiv 👥 作者与机构 第一作者:Aarzoo Dhiman(Centre of Excellence for Data Science, Artificial Intelligence and Modelling (DAIM), Faculty of Science and Engineering, University of Hull, United Kingdom) 通讯作者:Aarzoo Dhiman 作者列表:Aarzoo Dhiman、Farzana Haque、Kartikae Grover、Lydia Brian Smith、William Stephen Jones(机构:University of Hull;Queen’s Centre for Oncology and Haematology, Hull University Teaching Hospitals NHS Foundation Trust) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 528 words

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

📄 MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models 标签:#音频质量评估 #音频大模型 #基准测试 #模型评估 #音频理解 8.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.7/1.5 🔥 8.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音频质量评估 | #音频大模型 | #基准测试 #模型评估 | arxiv 👥 作者与机构 第一作者:Yize Li(Northeastern University) 通讯作者:正文未明确标注 作者列表:Yize Li、Ningyuan Yang、Sile Yin、Sindhuja Thogarrati、Sung-En Chang、Andrew C. Singer、Xue Lin、Chuan-Che Huang、Shuo Zhang(机构:Northeastern University;Bose Corporation;Stony Brook University) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 575 words

Fourier is Frontier: Frequency-Aware Autoencoding for High-Fidelity Music Reconstruction

📄 Fourier is Frontier: Frequency-Aware Autoencoding for High-Fidelity Music Reconstruction 标签:#音乐生成 #变分自编码器 #音频质量评估 #高效推理 7.5/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #变分自编码器 | #音频质量评估 #高效推理 | arxiv 👥 作者与机构 Kangdi Wang 与 Jin Xu(通信作者)来自阿里巴巴 Qwen 团队,Yusheng Dai 来自莫纳什大学。训练数据包含约两百万条公开音轨(含 LAION-DISCO-12M 子集)与一万小时专有 48kHz 内部音乐,经自动化质量流水线过滤。 ...

2026-08-21 · 更新于 2026-09-04 · 3 min · 451 words

Tracking the Trend in How Speech Synthesizers Deceive People

📄 Tracking the Trend in How Speech Synthesizers Deceive People 标签:#语音伪造检测 #Transformer #语音合成 #音频质量评估 6.0/10 | 创新 1.1/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.6/1.5 ✅ 6.0/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #语音伪造检测 | #Transformer | #语音合成 #音频质量评估 | arxiv 👥 作者与机构 Milan Šalko、Anton Firc、Kamil Malinka、Vojtěch Staněk、Martin Perešini、Filip Pleško、Jakub Reš 来自布尔诺理工大学(Brno University of Technology)Security@FIT 实验室,捷克共和国。研究通过该校伦理委员会审批(EK:2024-002),受校内项目 FIT-S-26-9011 资助;生成内容刻意避开敏感、政治或冒犯性表述以保护被克隆的公众人物。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 407 words

MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

📄 MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques 标签:#音频质量评估 #音频大模型 #SFT #强化学习 #音乐生成 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频质量评估 | #音频大模型 | #SFT #强化学习 | arxiv 👥 作者与机构 第一作者:Jiabao Zhuang(复旦大学 Fudan NLP Group) 并列一作:Changhao Jiang、Hanchen Wang、Jiahao Chen、Zhixiong Yang、Zhenghao Xiang(均复旦大学 Fudan NLP Group) 通讯作者:Tao Gui(复旦大学 Fudan NLP Group) 作者列表:Jiabao Zhuang(复旦大学 Fudan NLP Group)、Changhao Jiang(复旦大学 Fudan NLP Group)、Hanchen Wang(复旦大学 Fudan NLP Group)、Jiahao Chen(复旦大学 Fudan NLP Group)、Zhixiong Yang(复旦大学 Fudan NLP Group)、Zhenghao Xiang(复旦大学 Fudan NLP Group)、Yifei Cao(复旦大学 Fudan NLP Group)、Jiajun Sun(复旦大学 Fudan NLP Group)、Hui Li(复旦大学 Fudan NLP Group)、Ming Zhang(复旦大学 Fudan NLP Group)、Tao Ji(复旦大学 Fudan NLP Group)、Tao Gui(复旦大学 Fudan NLP Group,通讯作者)、Qi Zhang(复旦大学 Fudan NLP Group)、Xuanjing Huang(复旦大学 Fudan NLP Group) 💡 毒舌点评 把文本生成式奖励模型里的“先写 critique 再打分”范式迁移到长歌曲多维度美学评估,并用自生成 critique 缓解训练/推理分布偏移,这一点做得比较完整,消融证据也清楚。但整体新颖性更接近领域迁移而非本质突破,且 Music Arena 相对 SongEval 的领先只有 0.55 个百分点,没有统计显著性或多 seed 验证,下游 GRPO 效果也缺少人类听感评估来兜底。人工 critique 审核的样本量、接受率与一致性均未量化,进一步削弱了数据构建可靠性。 ...

2026-08-13 · 更新于 2026-09-04 · 2 min · 406 words