Beyond .WAV: Design and Software Verification of VocalCap, a Traceable Browser-Based Audio Capture System for Vocal Biomarker Research

📄 不只留下一段波形:让每一次远程录音都能自证清白 英文题目:Beyond .WAV: Design and Software Verification of VocalCap, a Traceable Browser-Based Audio Capture System for Vocal Biomarker Research 一句话:远程自导录音只剩最终文件无法定位故障,VocalCap 用同一数据流的双产物加版本化规范与字节级溯源把采集变成可验收契约,受控边界与 39 例试点审计证实了拓扑感知等机制有效,代价是三份留存与仅限软件契约的验证范围。 标签:#语音质量评估 | #端到端 | #模型评估 评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Augusto Camargo:Institute of Mathematics and Statistics, University of São Paulo, São Paulo, Brazil 💬 毒舌点评 把浏览器采集从单个 WAV 文件扩展为带字节完整性和变换溯源的可验收会话,工程闭环完整。短板是全部验证仍停留在软件契约层面,没有声学一致性、可用性和临床意义的任何外部证据,离嗓音生物标志物研究真正可用的采集验证还有距离。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1055 words

CAPQ-FAST: Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback

📄 同样是二倍速,为何有人觉得高效、有人只想跳过 英文题目:CAPQ-FAST: Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback 一句话:倍速下的感知质量由速度与内容时间密度共同决定,论文用时间信息量、每分钟词数、每分钟节拍数分别刻画视频、语音、音乐的可跟随压力并以指数族加线性融合预测平均意见分,在受控小样本上取得高相关,但语义与个性化仍在模型之外。 标签:#音频质量评估 | #多模态模型 | #语音质量评估 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jiarun Song:机构信息未在 arXiv HTML 中可靠披露 Yuxin Song:机构信息未在 arXiv HTML 中可靠披露 Fuzheng Yang:机构信息未在 arXiv HTML 中可靠披露 Weisi Lin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把倍速下“想高效看还是想跳过”的模糊意图转成可计算的跨模态感知质量,有产品嗅觉;但全篇仍是小样本主观分拟合的指数曲线加线性融合,泛化证据和统计完备性撑不起个性化推荐的大叙事。 📌 核心摘要 本文研究在线音视频倍速播放下的感知质量退化,核心观察是同一速度对不同内容可对应高效观看与选择性跳过两种相反意图。作者提出内容自适应模型 Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback (CAPQ-FAST),以播放速度 \(S\) 结合模态内时间密度预测平均意见分 Mean Opinion Score (MOS)意义下的质量:视频用时间信息量 Temporal Information (TI),语音用每分钟词数 Words Per Minute (WPM),音乐用每分钟节拍数 Beats Per Minute (BPM),再经音视频融合得到整体质量 \(Q\)。验证显示融合模型在语音视频和音乐视频上 Pearson Correlation Coefficient (PCC)达 0.976 和 0.968,优于不区分内容的同族基线。应用上用于播放速度推荐、自适应播放控制和意图粗粒度解释。局限是 72 名 22岁至28岁大学生被试、内容与语义覆盖有限,TI、WPM、BPM 只刻画时间密度而非语义重要性,外推到真实平台行为需谨慎。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 775 words

Is Semantics Enough for Speech Mean Opinion Score Prediction?

📄 语义听得懂内容,声学才听得出破绽:MOS 预测的双耳之争 英文题目:Is Semantics Enough for Speech Mean Opinion Score Prediction? 一句话:论文把语义自监督、纯声学编解码与语义声学统一编解码放在同一冻结与微调探针下比较,证明匹配语言下协同表征上界更高而跨语言时连续语义更稳,代价是公平性与机理证据仍不完整。 标签:#语音质量评估 | #自监督学习 | #语音合成 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Tianyu Lan:机构信息未在 arXiv HTML 中可靠披露 Yufei Shi:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Honghao Sun:机构信息未在 arXiv HTML 中可靠披露 Huipeng Du:机构信息未在 arXiv HTML 中可靠披露 Zhenhua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语义主导的自监督学习与声学重建的神经音频编解码器放在同一冻结探针下硬碰硬,问题切得准。短板在于所谓统一表征几乎全是借用现成 XCodec 与 SpeechTokenizer 的封装对比,缺少对语义声学解耦的因果验证,跨语言反转也解释得过于仓促。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 870 words

Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations

📄 一次解完还是逐帧死磕:在连续编解码空间里数着步子去噪 英文题目:Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations 一句话:论文把语音增强写成连续编解码隐空间上的掩码自回归块解码,用同一 Conformer 公平比较因果与非因果策略,证明 10 步迭代能在质量与可懂度之间取得可调折中,但随机非因果并未超越因果且高斯假设偏弱。 标签:#语音增强 | #自回归模型 | #语音质量评估 评分:6.4/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Yoto Fujita:机构信息未在 arXiv HTML 中可靠披露 Simon Leglaive:机构信息未在 arXiv HTML 中可靠披露 Laurent Girin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用同一 Conformer、同一 DAC 连续表征和同一训练流程把单步非自回归、块级因果自回归、帧级因果自回归和随机与 oracle 非因果放在同一标尺下比较,权衡曲线干净可信。短板是所谓统一框架只是高斯均值回归下的掩码均方误差重训,原掩码自回归 Masked Autoregressive / MAR 中的扩散头被简化为单高斯,表达力自认较弱;非因果随机策略无实用增益,oracle 增益不可落地,方法增量感偏重。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 971 words

BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling

📄 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling 一句话:在 1.1 kbps 低码率下语义与声学互相挤压的矛盾中,BiMTokenizer 用双向 Mamba 时序建模与固定 Leech 格点量化重做单塔瓶颈,在 LibriSpeech 上以 PESQ-NB 3.56 与 WER 2.44% 超越同码率双塔基线,代价是离线双向依赖与 196560 大词表带来的自回归预测负担。 标签:#语音编码 | #端到端 | #语音合成 | #语音质量评估 | #知识蒸馏 评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 ...

2026-09-02 · 更新于 2026-09-04 · 9 min · 1876 words

When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

📄 主观分数能当奖励吗?当感知预测器遇上可懂度硬约束 英文题目:When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models 一句话:论文用 CER 三区硬约束的 GRPO 检验 AnimeScore、UTMOS、Likability 等主观预测器能否作为强化学习奖励,发现机器分数都能涨但只有部分能让人听出来,且同门奖励的 Best-of-8 已接近策略优化的效果。 标签:#语音合成 #强化学习 #语音质量评估 #零样本 评分:7.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Joonyong Park:Spellbrush Jerry Li:Spellbrush 💬 毒舌点评 亮点在于把主观奖励当作预测器—轴—基座三元组来解剖,并用 CER 分区与 Best-of-8 对照把策略优化的幻觉打回原形,诊断框架比单纯刷分更有价值。短板是每轴仅 50 句、单基座 Llasa-1B-Multilingual 的小样本证据却要支撑通用筛选启发式,且 Likability 等关键结论依赖事后分箱解释,统计功效与外推性都偏薄。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1502 words

A Mixed-Behavior Vote Model for Multimedia Subjective Quality Votes, Means, and Variances

📄 方差不该越过底线:用单峰约束重画 MOS 的容许区间 英文题目:A Mixed-Behavior Vote Model for Multimedia Subjective Quality Votes, Means, and Variances 一句话:针对 MOS 与方差的抛物线拟合总会跌破理论下界的问题,论文用单峰约束重定上下界并以四次多项式与混合投票模型实现区间内任意方差,在 16 个数据集上验证了拟合合规与行为可解释性,代价是仅建模一二阶矩且未触及个体与时序因素。 标签:#语音质量评估 #生成模型 #音频质量评估 #理论分析 #模型评估 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jaden Pieper:机构信息未在 arXiv HTML 中可靠披露 Stephen D. Voran:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用单峰性约束把教科书式的最大方差抛物线拉回现实,并用混合投票行为给出可解释的方差拟合与生成模型,数学闭环干净。短板是16个数据集的验证仍停留在曲线拟合层面,既无与主观实验预测或质量估计下游任务的关联,也无对投票者异质性与样本量有限性的严格统计检验,离NeurIPS/ICLR所要求的实证深度尚有距离。 📌 核心摘要 论文针对多媒体主观质量测试中平均意见得分(Mean Opinion Score,MOS)与投票方差之间的建模失配问题,指出传统缩放抛物线 \(v_d(X)=a(X-1)(5-X)\) 在拟合真实数据时几乎必然跌破理论最小方差曲线 \(v_{\min}(X)\)。方法核心是提出单峰方差区域(Unimodal Variance Region,UVR),以最大方差单峰(Maximum Variance Unimodal,MVU)投票概率质量函数(Probability Mass Function,PMF)替代全1与全5极端双峰对应的 \(v_{\max}(X)\) 作为上界,并以相邻两选项(Adjacent Two-Choice,ATC)PMF对应的 \(v_{\min}\) 作为下界;进而用四次多项式 \(v_r(Y)=(Y-1)(5-Y)(w_1(Y-3)^2+w_0)\) 重塑方差曲线,并构建混合二项投票(Mixed-BinoVotes,MBV)生成模型,通过混合参数 \(\alpha(y)\) 在BinoVotes与ATC/MVU之间插值以精确实现UVR内任意目标方差。相较于既有BinoVotes仅能产生 \(a=0.25\) 的固定抛物线方差,新模型首次实现方差形状可调且始终满足单峰与离散投票约束,并提供可解释的投票行为分解。在16个涵盖语音、图像、视频的数据集上,四次拟合均保持在UVR内,\(w_0\)在0.130至0.249之间,\(w_1\)在0.007至0.046之间,ITS2013接近纯BinoVotes行为而NISQA P501 MOS有28%文件方差落在最小方差曲线上。该框架为诊断主观实验设计缺陷与投票者行为提供了可量化工具,但局限在于仅建模一阶与二阶矩,未涉及投票者个体建模、时序依赖或与客观质量预测的联合验证。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 867 words

SETU: An Agentic Ecosystem for Multilingual, Persona-Aware Communication Coaching

📄 把销售话术拆成可审计的流水线:SETU 为何用多智能体而非一个大模型打分 英文题目:SETU: An Agentic Ecosystem for Multilingual, Persona-Aware Communication Coaching 一句话:面对多语言、码混、角色敏感的销售话术辅导,SETU 选择把视觉、语音、文本与相关性拆成可替换智能体并用信任加权编排做可追溯聚合,在 18 条内部视频上取得教练一致性 0.78 与可解释性 4.3/5 的试点效果,代价是小样本、闭源与未校准阈值带来的外推局限。 标签:#音视频理解 #多模态模型 #语音质量评估 #大语言模型 评分:5.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jonnalagadda Maruthi Tejas:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Uponika Barman Roy:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Tilottama Goswami:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Samir Goswami:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Mousita Dhar:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com 💬 毒舌点评 把销售话术辅导拆成可审计的多智能体流水线并显式引入买家角色与信任加权,对多语言码混的工程痛点有针对性;但仅用 18 条内部视频就敢报 0.78 相关性与 40.9% 提效,形式化公式与阈值多为描述性定义而无标定与统计支撑,可复现性与外推性均不足。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 833 words

Interpretable, Fairly Evaluated Automated L2 Speaking Assessment that Beats the Single-Human Ceiling and Why Pause Encoding Does Not Change LLM Fluency Scores

📄 会数停顿的尺子,为什么比会说话的模型更懂流利度? 英文题目:Interpretable, Fairly Evaluated Automated L2 Speaking Assessment that Beats the Single-Human Ceiling and Why Pause Encoding Does Not Change LLM Fluency Scores 一句话:这篇论文用不学习人类标签的确定性时序尺子与单一文本大模型的粗粒度判断做混合,在 130 段对话上以 0.818 的相关逼近人类共识,并用受控对比证明暂停怎么写进提示词并不改变分数,代价是结论被锁在单一亚洲口音小样本之内。 标签:#语音质量评估 #大语言模型 #可解释性 #多语言 评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Eichi Uehara:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用80人共识金标和可靠性校正天花板把“超越单人”算得干净,并用双重说话人隔离与配对自助法把可信度拉满;短板是在\(n=130\)的小样本对话上做文章却包装成通用口语评估突破,且核心流水线闭源仅留一个可视化网页,让“可复现可审计”的口号显得自我矛盾。 📌 核心摘要 针对二语(Second Language, L2)英语学习者缺乏可信口语反馈的问题,论文研究如何在不拟合人类标签的前提下实现可解释的自动化口语评分。方法核心是可解释流水线:将基于De Jong utterance fluency体系的确定性语音时序特征组合与单一文本大语言模型(Large Language Model, LLM)流利度判断做混合,全程不学习金标参数。相较已有SpeechRater、wav2vec 2.0评分器与SpeechLLM评分器,该工作不追求端到端黑盒拟合,而是把时序测量与LLM整体判断解耦,并引入可靠性校正的人类天花板作为公平参照,同时对暂停编码做严格受控对比。在ICNALE Global Rating Archive的130段对话上,混合评分与共识金标的Spearman相关达到\(0.818\),超过81%训练有素评分员个体并接近可靠性校正上限;受控实验显示三种暂停写法对LLM分数无可靠差异。实际意义在于提供了一种廉价、可解释、可审计的交付度评分范式,适用于高风险场景的辅助评分。主要局限是单一语料、十种亚洲母语偏态、90秒角色扮演对话构念以及小样本导致的统计效力边界。 ...

2026-08-29 · 更新于 2026-09-04 · 4 min · 845 words

Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study

📄 ASR 评测别急着换大模型:先分清向量度量、候选裁判与错误解释 英文题目:Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study 一句话:这篇论文的有效贡献不是宣布生成模型取代编码器,而是用 HATS 显示:层深与池化调对后紧凑 encoder 仍可与 embedding decoder 抗衡,生成模型的优势主要落在 A/B 比较和错误语言化,而这些角色必须分别验账。 标签:#语音质量评估 #大语言模型 #模型评估 #基准测试 评分:6.1/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.4/1.5 💬 毒舌点评 这篇文章最扎实之处,是不把“LLM 做 ASR 评价”当成一招鲜,而是拆成表征度量、A/B 判决和 4 级错误分级。把层深与池化摆上台面后,Sentence-CamemBERT-Large 的 90% 与 Qwen3-Embedding-8B 的 89% 说明:先把合适的 encoder 调对,常常比迷信更大 decoder 更有工程价值。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 651 words