Beyond .WAV: Design and Software Verification of VocalCap, a Traceable Browser-Based Audio Capture System for Vocal Biomarker Research

📄 不只留下一段波形:让每一次远程录音都能自证清白 英文题目:Beyond .WAV: Design and Software Verification of VocalCap, a Traceable Browser-Based Audio Capture System for Vocal Biomarker Research 一句话:远程自导录音只剩最终文件无法定位故障,VocalCap 用同一数据流的双产物加版本化规范与字节级溯源把采集变成可验收契约,受控边界与 39 例试点审计证实了拓扑感知等机制有效,代价是三份留存与仅限软件契约的验证范围。 标签:#语音质量评估 | #端到端 | #模型评估 评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Augusto Camargo:Institute of Mathematics and Statistics, University of São Paulo, São Paulo, Brazil 💬 毒舌点评 把浏览器采集从单个 WAV 文件扩展为带字节完整性和变换溯源的可验收会话,工程闭环完整。短板是全部验证仍停留在软件契约层面,没有声学一致性、可用性和临床意义的任何外部证据,离嗓音生物标志物研究真正可用的采集验证还有距离。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1055 words

DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents

📄 说了像本人,不等于接得住话:角色暗示里的时机考验 英文题目:DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents 一句话:论文用同一段用户语音对比显式规则与人设暗示下的接话时机,发现全双工模型推断代价最高达 9.7 个百分点,而内容像角色的模型仍做不出打断与附和,且安全冲突下仅一例过半守住安全侧。 标签:#语音交互 | #语音大模型 | #基准测试 | #实时处理 | #模型评估 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Puneet Mathur:University of Maryland College Park, USA Dinesh Manocha:Project Page: 💬 毒舌点评 把显式打断规则换成悲伤辅导员与911接线员的人设暗示来考全双工话轮控制,这个切口抓得准且泄漏控制做了实事。遗憾在于6个系统绝对指令遵从率普遍低于50%,近零差距模型的细排名在阈值抖动下并不稳,安全层级结论更多是30例小样本警示而非定论。 📌 核心摘要 全双工语音智能体需要根据角色推断何时倾听、附和、打断、让出或保持话轮,现有评测多只给显式话轮指令。论文提出DuplexSpeechBench-IFEval(DSB-IFEval,隐式指令遵循评测),用同一用户音频搭配5种条件协议对比显式执行与人设暗示执行。方法上以8个行为对比角色、6类会话探针、程序化合成与双通道实时编排为流水线,以确定性指令遵从分数Instruction Adherence Score(IAS,指令遵从分数)与大语言模型评价的人设内容分数Persona Adherence Score(PAS,人设遵从分数)解耦内容与时机。6系统实验显示全双工架构的蕴含差距Entailment Gap(蕴含差距)达9.7个百分点,而回合制系统内容跟随强但打断与附和几乎为0。安全冲突下仅MiniCPM-o-4.5在语义层60.0%选择安全侧,且IAS非零者仅2个系统。该基准为角色化实时语音部署提供了可复现的层级检验,但局限在英语双轮合成语音与小规模安全集。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 790 words

VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis

📄 先查账再唱歌:VoxReason 把语音的“怎么说”变成可引用的计划 英文题目:VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis 一句话:针对表达性语音在合成前就已决定交付方式却无法问责的问题,VoxReason 把交付决策显式化为带源引用的说话计划并用确定性校验器加单线索反事实检验源依赖,在 1440 例受控源标签集上证明去源记录使引用约束分降 0.488 而局部性修复同时恢复准确率与局部性,代价是仅覆盖两种语句与单一场景且不评价波形质量。 标签:#语音合成 | #SFT | #基准测试 | #模型评估 | #可解释性 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Mengzhe Geng:National Research Council Canada 💬 毒舌点评 把合成前说话计划做成带引用校验的查账任务,切断了用好听波形掩盖无据决策的退路,证伪链条设计得相当清醒。但受控到只有两种语句和单一场景的验证,更像一份自我设限的诊断说明书,离通用语音规划基准还有明显距离。 📌 核心摘要 表达性语音在波形生成前已决定情感与韵律等交付方式,但现有音频评分无法判断该决策是否得到源记录许可。VoxReason提出源引用说话计划(source-cited speaking plan)作为合成前预测对象,以确定性校验器检查引用合法性、槽位一致与单线索反事实局部性。论文在1440例源标签受控集上证明去除源记录会大幅降低引用约束得分,而局部性修复后的学习规划器同时恢复槽位准确率与反事实一致性。在波形质量完全排除于当前主张之外后,该方法为对话与叙述类语音提供了先验账本。当前结论仍被窄语句、固定场景与确定性标签映射所限定。 🔗 开源与复现资源 代码:https://github.com/MENGZHEGENG/voxreason,提供衍生切分与评估代码 模型权重:论文中未提及 数据集:RAVDESS衍生source-label切分含1440条记录,通过GitHub仓库获取,不再分发原始音频 Demo:论文中未提及 复现材料:论文提供手稿源码,planner schema,verifier评估代码和重跑表格命令 论文中引用的开源项目:未提及 资源可达性验证:code=temporarily_unreachable 🧭 深度解读 同一句话,为何换个心情就该换个说法 想象你在做一个对话助手,用户只说了一句孩子在门口玩,文字本身没有情绪。可如果病例记录写着说话人刚经历丧失,你若用欢快的语调催促,就会显得冷漠,若用低沉缓慢的安慰,反而恰当。这种差别不在文字里,而在文字背后的许可记录里。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 754 words

A Common Measure of Communication for Speech Brain-Computer Interfaces

📄 百分之百的正确,也可能只说出了百分之五:语音脑机接口需要一把共同的尺子 英文题目:A Common Measure of Communication for Speech Brain-Computer Interfaces 一句话:针对语音脑机接口词表各异导致准确率与词错误率不可比的问题,论文提出以参考分布加权的开放词汇互信息统一度量覆盖与保真,并在八个异构系统与三域选词实验中验证其排序与最高 16.3% 相对增益,代价是依赖均匀误差与词独立假设的标量近似。 标签:#语音识别 | #对比学习 | #模型评估 | #低资源 评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Dulhan Jayalath:Neural Processing Lab (PNPL), University of Oxford Benjamin Ballyk:Neural Processing Lab (PNPL), University of Oxford Oiwi Parker Jones:Neural Processing Lab (PNPL), University of Oxford 💬 毒舌点评 把词表覆盖率与词表内保真度乘进同一个互信息量,让侵入式尝试言语与非侵入感知语音终于能在同一标尺下对账,这是该领域久缺的诚实度量。代价是历史比较几乎全靠均匀误差对称信道与 \(P=1-\mathrm{WER}\) 换算硬撑,最脆弱的信道建模恰恰被平均掉了。 ...

2026-09-03 · 更新于 2026-09-04 · 4 min · 730 words

Auditory Illusion Benchmark for Large Audio Language Models

📄 听错了才是听懂了?当大音频模型遇上人类幻听 英文题目:Auditory Illusion Benchmark for Large Audio Language Models 一句话:论文把十种听觉错觉做成可对照人类听感的选择题来考大音频模型,发现最像人的模型也只有人类一半的易感度,而像人与忠于物理信号之间至今没有模型能兼得,代价是提示词稍改结果就大变。 标签:#音频理解 | #多模态模型 | #基准测试 | #模型评估 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Hayoon Kim:机构信息未在 arXiv HTML 中可靠披露 Eunice Hong:机构信息未在 arXiv HTML 中可靠披露 Kyogu Lee:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把听觉错觉从演示视频变成可跑分、可对照人类分布的基准,这个选题确实抓住了音频评测的盲区。问题是人类基线只靠20名绝对音感听者撑场面,控制准确率又普遍在随机线附近晃悠,所谓最像人的模型更像蒙对了选项而非真听错了。 📌 核心摘要 人类听觉会系统性偏离物理信号,而现有大型音频语言模型评测多围绕转录、分类、检索等客观真值任务,缺乏对主观错觉的系统检验。本文提出首个听觉错觉基准 Auditory Illusion Benchmark,覆盖音乐、声音、语音三大内容域的10种代表性错觉,并按主导机制划分为物理型与物理加知识型,同时配套错觉刺激与匹配控制刺激和人类听觉实验。方法核心是将每种错觉转化为二选一或三选一感知判断题,以人类多数投票定义错觉标签,并用人类相似准确率、现实符合率与错觉易感指数刻画模型位置。与已有视觉错觉基准相比,新意在于面向音频的参数化生成管线与人类同题对照协议,以及对自下而上声学与自上而下先验的分离讨论。关键结果是最佳模型平均错觉易感指数仅约0.455,远低于人类参照的1.0,且高易感常伴随低于随机水平的控制准确率,提示偏差多于感知;知识驱动错觉上多个模型由信号忠实反转为类人易感,提示对齐可能来自语言先验而非共享低层听觉处理。实际意义是为认知对齐提供独立于识别精度的诊断维度,可用于区分字面检测器与类人感知者,并明确高易感在交互场景与安全精密场景下的不同可取性。主要局限是人类样本特殊、合成刺激与自然经验有差距、指令措辞可带来超过模型间差异的波动,外推到一般听众与真实场景时需谨慎。 🔗 开源与复现资源 代码:https://github.com/gillosae/aib 模型权重:论文中未提及 数据集:AIB基准数据集,包含10种听觉错觉,共10385个错觉刺激和4444个对照刺激,总计14829个样本,另有包含1032个错觉刺激和534个对照刺激的mini子集,总计1566个样本,获取链接为 https://github.com/gillosae/aib Demo:论文中未提及 复现材料:论文提及提供用于系统生成基准错觉的开源实现以及通过受控听觉实验构建的人类基线数据,获取方式为访问 https://github.com/gillosae/aib,论文证据中未提及训练配置与检查点细节 论文中引用的开源项目:评估中提及 Pengi、Voxtral-Mini、MuLLaMa、Kimi-Audio-Instruct、Audio Flamingo 3、Fun-Audio-Chat、Qwen-Audio-Chat、Qwen2-Audio-Instruct、GLM-4-Voice、Gemini 3.1 Pro,论文证据中未给出上述项目的HTTPS链接 资源可达性验证:code=temporarily_unreachable;dataset=temporarily_unreachable;reproduction=temporarily_unreachable 🧭 深度解读 耳朵为什么总在骗大脑? 想象你在琴房里听老师弹了一个低音,你发誓听到了那个浑厚的根音,可频谱仪却告诉你那个频率根本没有发出。这不是你走神,而是听觉系统在主动补全。人类听声音从来不是麦克风式的忠实录音,大脑会用谐波关系、掩蔽记忆、节奏预期和语言知识去猜测世界,这种猜测大多数时候高效,偶尔就会系统性跑偏,形成听觉错觉。 ...

2026-09-03 · 更新于 2026-09-04 · 3 min · 550 words

A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation

📄 评测比模型更碎:用一套可组合的流水线让全模态分数可比、可复现 英文题目:A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation 一句话:面对文本、图像、视频、音频四模态评测工具链互不兼容导致的分数不可比与复现难,OmniEvaluator 以统一中间模式将推理与评测解耦为可组合流水线,并以产物钉扎与轻量 CPU 验证器在跨引擎与跨提示下把分数波动从数十点压到数点,代价是验证器仅判文本语义且落后最强闭源裁判约 5 点。 标签:#多模态模型 | #模型评估 | #基准测试 评分:8.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Hodong Lee:NAVER Cloud AI;Korea University Sanghee Park:NAVER Cloud AI;KAIST AI Dohoon Ryu:NAVER Cloud AI Jungwhan Kim:NAVER Cloud AI Junyeob Kim:Seoul National University Soyoon Kim:NAVER Cloud AI Geewook Kim:NAVER Cloud AI;KAIST AI 💬 毒舌点评 用统一中间模式把 4 类推理后端与 4 个评测框架打通,将 N×M pairwise 集成降至 N+M,并用产物钉扎与轻量 CPU 验证器解决分数不可比与复现难的工程痛点,思路务实且已在 HyperCLOVA X 8B Omni 研发中落地。代价是贡献偏系统整合而非建模突破,验证器仅做文本三元组二分类、准确率 85.0 仍落后最强闭源裁判约 5 个点,对视觉 grounding、音频质量与多模态生成等非文本维度无能为力。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1426 words

Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

📄 听见了却不听从:音频大模型在编码器里记住语气,在解码器里忘记语气 英文题目:Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models 一句话:论文用四段式贯穿分析追踪副语言信息从编码器到输出的演化,发现所有模型在编码器顶层都能以 82% 至 85% 线性探测到说话风格,却在输出端跌至 19.7% 至 53.7%,并用泄露度量与梯度反转实验说明这是训练目标导致的系统性利用失败而非编码失败。 标签:#语音情感识别 | #多模态模型 | #可解释性 | #模型评估 评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5 👥 作者与机构 Bhuvan Koduru:Language Technologies Institute;Carnegie Mellon University Dareen Safar B Alharthi:Language Technologies Institute;Carnegie Mellon University Rita Singh:Language Technologies Institute;Carnegie Mellon University Bhiksha Raj:Language Technologies Institute;Carnegie Mellon University 💬 毒舌点评 亮点在于用中心化核对齐(Centered Kernel Alignment, CKA)与线性探测(Linear Probing)的解离现象干净地揭示了“编码强、利用弱”的结构性鸿沟,并以训练目标作为解释变量给出可信的对照线索。短板是全篇建立在 Expresso 的 4 个说话人、7 类风格的封闭受控集上,外推性存疑,且梯度反转层(Gradient Reversal Layer, GRL)干预仅在单线性投影器上做最小化验证,离真正可用的解耦训练还很远,输出评估依赖关键词映射的启发式分桶也引入了额外噪声。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1613 words

On the Human and Computer Alignment of Attribute-Based Music Matches

📄 把“像不像”拆开问:当音乐相似度被迫按属性回答时,人与机器在哪儿对齐、又在哪儿分叉 英文题目:On the Human and Computer Alignment of Attribute-Based Music Matches 一句话:论文把整体相似度拆成旋律、和声、节奏、嗓音、音色五维度的三元组强迫选择,用 300 组强匹配与 83 位专家的 1105 次标注构建 MATCHA 基准,证明人类在属性层面可达成可度量共识、而 MiRA 的四个计算指标只能互补地部分对齐,代价是结论受限于西方音乐与强匹配采样且 AI 生成子集因伪影失效。 标签:#音乐检索 | #对比学习 | #音乐生成 | #数据集 | #模型评估 评分:7.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Roser Batlle-Roca:机构信息未在 arXiv HTML 中可靠披露 Woosung Choi:机构信息未在 arXiv HTML 中可靠披露 Joan Serrà:机构信息未在 arXiv HTML 中可靠披露 Fabio Morreale:机构信息未在 arXiv HTML 中可靠披露 Wei-Hsiang Liao:机构信息未在 arXiv HTML 中可靠披露 Xavier Serra:机构信息未在 arXiv HTML 中可靠披露 Emilia Gómez:机构信息未在 arXiv HTML 中可靠披露 Yuki Mitsufuji:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音乐相似性从玄学整体打分拆成 5 个可操作的维度,并用 83 位专家三元组强迫选择把人机对齐这件事真正落到了可度量的基准上,MATCHA 的设计比空谈版权风险要扎实得多;短板是核心结论几乎被“哪个指标本来就是为哪个属性设计的就对齐哪个属性”所解释,且 AI 生成子集有一半因生成伪影直接失效,暴露出基准构建与生成可控性之间的循环论证。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1479 words

Ontology-based Target Sound Extraction

📄 从“只会抽叶子”到“整棵树都能点名”:用本体距离重塑目标声音提取的条件空间 英文题目:Ontology-based Target Sound Extraction 一句话:为解决固定叶粒度提取无法响应粗粒度查询的问题,论文在 AudioSet 三层本体上对比多热与全本体独热两种条件化并用 CPCC 损失对齐嵌入欧氏距离与树最短路径,使单次前向在根、中间、叶三级分别达到 6.43/6.66/7.10 dB SI-SNRi,但代价是完全合成数据与单一本体限制了真实泛化验证。 标签:#音频分离 | #对比学习 | #模型评估 评分:5.7/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Carlos Hernandez-Olivan:机构信息未在 arXiv HTML 中可靠披露 Marc Delcroix:机构信息未在 arXiv HTML 中可靠披露 Tsubasa Ochiai:机构信息未在 arXiv HTML 中可靠披露 Naohiro Tawara:机构信息未在 arXiv HTML 中可靠披露 Shoko Araki:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把目标声音提取(Target Sound Extraction, TSE)从固定叶节点提升到本体(Ontology)任意层级单次前向提取,并用共表型相关系数(Cophenetic Correlation Coefficient, CPCC)把树最短路径距离显式压进嵌入(Embedding)欧氏几何,思路干净且对叶级也有增益。短板是评估完全依赖自合成的 5 秒混合与单一 AudioSet 衍生三层树,未做真实录音、跨本体泛化或主观听感,且未开源、未报告方差与显著性检验,让 0.7-1.0 dB 级提升的可信度打折扣。 ...

2026-09-02 · 更新于 2026-09-04 · 3 min · 484 words

U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement

📄 相位不再复用:当 Transformer 学会看懂复数谱图 英文题目:U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement 一句话:针对卷积难以捕捉长程时频依赖且复用含噪相位限制音质的问题,U-PAST 用复数谱图的 Transformer 编码加 U-Net 解码直接重建幅度和相位,在混响失配下取得最优 SI-SDR,并在匹配条件下以小参数取得最高 PESQ-wb,但低计算量尚未转化为时延优势。 标签:#语音增强 | #Transformer | #模型评估 评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Cao Duong Ly:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129 Jörn Anemüller:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129 💬 毒舌点评 用 1.17M 至 2.40M 参数和 4.39G 至 4.71G MACs 在混响失配下实现对全部基线的 SI-SDR 超越,证明了复数域 Transformer-U-Net 对相位感知与长程建模的协同价值,效率-鲁棒性权衡清晰。短板是所谓首个复数混合架构本质为 AST 分块嵌入与复数 U-Net 的工程拼接,未提出新注意力或复数算子,在其余 3 个条件下仍落后 TF-GridNet 1.62 dB 至 2.44 dB SI-SDR,且未开源任何代码与权重,复现与落地价值受限,低 MACs 也未转化为时延优势。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1637 words