Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice

📄 Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice 标签:#语音增强 #端到端 #模型评估 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:应用研究 | 评分置信度:中 | #语音增强 | #端到端 | #模型评估 | arxiv 👥 作者与机构 作者列表(按论文原文顺序):Reyhaneh Abbasi、Peter Balazs、Vincent Lostanlen、Clara Hollomey、Dustin J. Penn、Sarah M. Zala、Nicki Holighaus。 机构信息: Reyhaneh Abbasi:奥地利科学院(ÖAW)声学研究所(Acoustics Research Institute);维也纳大学维也纳认知、行为与神经科学博士学院(Vienna Doctoral School of Cognition, Behavior, and Neuroscience)。 Peter Balazs:奥地利科学院声学研究所;奥地利林茨跨学科转型大学(IT:U)。 Vincent Lostanlen:法国南特大学/南特中央理工/CNRS/LS2N UMR 6004。 Clara Hollomey:奥地利圣珀尔滕应用科学大学创意媒体技术研究所(Institute for Creative Media Technologies)。 Dustin J. Penn、Sarah M. Zala:维也纳兽医大学康拉德·洛伦兹动物行为学研究所(Konrad Lorenz Institute of Ethology)。 Nicki Holighaus:奥地利科学院声学研究所。 通讯作者:Reyhaneh Abbasi(reyhaneh.abbasi@oeaw.ac.at)。 💡 毒舌点评 用脊线自己合成干净目标,再让同一个脊线跟踪器来打分,这套“自产自销”的闭环在工程上确实漂亮——绕开了生物声学最缺的干净标注,还把脊线位置塞进 loss 里一鱼两吃。但 SI-SDR 的漂亮数字更像是系统内部的自洽证明:训练目标、测试参考和评价指标全部来源于同一套合成管线,离真实野外噪声到底有多远没有说清。再加上分类实验里 BootSnap 自带降噪没被拆除,增益归因也留了一笔糊涂账。方法对调性发声有效,但离“通用生物声学降噪”还有一层窗户纸。 ...

2026-08-12 · 更新于 2026-08-14 · 5 min · 889 words

X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction

📄 X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction 标签:#语音交互 #多任务学习 #模型评估 6.4/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #多任务学习 | #模型评估 | arxiv 👥 作者与机构 第一作者:Kaiqi Fu(机构未说明) 通讯作者:未说明 作者列表:Kaiqi Fu、Rime Wen、Altman Lin、Shawn Qin、Roy Gan、Hao Wang、Qian Wang(机构均未说明) 💡 毒舌点评 把 turn state 做成与 ASR head 平行的帧同步输出,粒度上确实比 utterance/chunk 级级联方案更贴近真实对话控制的需求,工程方向有价值。但整个实验只依赖 EasyTurn 中英测试集,且标注由 LLM 自动生成而无人工作一致性验证,最关键的“真实对话中能否正确抢话/让话/忽略 backchannel”并没有被端到端验证。更刺眼的是,Stage2-Turn 联合训练后 AISHELL-1 从 Stage1 的 2.57 回退到 3.94,在 Freeze-Omni 的 2.79 面前已经不再占优,原文却说“still matches or exceeds Freeze-Omni”,这个 claim 需要修正。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 843 words

AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning

📄 AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning 标签:#音频字幕生成 #强化学习 #课程学习 #数据集 #模型评估 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频字幕生成 | #强化学习 | #课程学习 #数据集 | arxiv 👥 作者与机构 第一作者:Yan Rong(机构未说明;论文脚注标注 “Work done during an internship at Kling Team”,表明其在 Kling Team 实习期间完成部分工作,但无法据此确认其所属机构) 通讯作者:Li Liu(机构未说明;论文标注为通讯作者) 作者列表:Yan Rong、Fengji Ma、Xu Li、Jinting Wang、Chen Zhang、Li Liu(正文未给出作者所属机构的完整列表,无法确认各作者机构归属) 说明:论文正文未提供任何机构的完整名称或地址列表,仅脚注出现 Kling Team 字样,归属关系无法确认。 💡 毒舌点评 用 cloze-and-choice reward 把细粒度音频字幕评估拆成局部可核查的“考题”,并用 event-conditioned tIoU 把时间戳绑定到事件语义,确实比单一标量判分和 checklist 式匹配更精细、更能抗 shortcut。但全部奖励依赖 27B LLM examiner 做判卷(ESR 的填空作答和 ECTR 的区间提取均由 Qwen3.6-27B 完成),论文没有给出 examiner 自身判卷一致性与 prompt 敏感性验证;ESR 题目的干扰项质量也没有统计性检查。开源方面,正文只有 GitHub 发布页链接(https://github.com/ryysayhi/AudioMap),未明确说明代码、模型权重和 AudioMapCap-44K 数据集是否实际发布,这会让“可复现 SOTA”的成色打折扣。此外,基准指标 Omni-Cloze、MMSU/MMAR/MMAU、TACOS 全部依赖 LLM 判分,与训练奖励使用同类 examiner,存在评估偏好与训练奖励耦合的隐患。 ...

2026-08-11 · 更新于 2026-08-14 · 2 min · 290 words

Beyond Piano: Cross-Instrument MIDI Velocity Estimation via Differentiable SoundFont Proxies

📄 Beyond Piano: Cross-Instrument MIDI Velocity Estimation via Differentiable SoundFont Proxies 标签:#音乐理解 #领域适应 #模型评估 7.3/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #领域适应 | #模型评估 | arxiv 👥 作者与机构 第一作者:Zhanhong He(未说明) 通讯作者:未说明 作者列表:Zhanhong He(未说明)、Hanyu Meng(未说明)、David Defeng Huang(未说明)、Roberto Togneri(未说明) 💡 毒舌点评 用可微分 SoundFont 代理把波形重建换成 PHE/OSF 参数匹配,提出了一条比 DDSP 波形监督更聚焦 velocity 的适配路线,并在无标签吉他数据(GAPS/FL)上取得一致提升。但核心结论仍缺少目标域真实 velocity 标签的直接验证;钢琴上的代理适配只是 sanity check,MAEVelo 10.5 与有监督的 3.9 差距明显,且在 SMD 上的响度相关未超过零样本基线。只覆盖钢琴和吉他,“cross-instrument"的普适性尚不足以服众。 ...

2026-08-11 · 更新于 2026-08-14 · 6 min · 1161 words

Dynamic Clustering for Cross-Segment Permutation Alignment in Long Speech Separation

📄 Dynamic Clustering for Cross-Segment Permutation Alignment in Long Speech Separation 标签:#语音分离 #无监督学习 #模型评估 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音分离 | #无监督学习 | #模型评估 | arxiv 👥 作者与机构 第一作者:Yuzhu Wang(机构未说明) 通讯作者:未说明 作者列表:Yuzhu Wang(机构未说明)、Archontis Politis(机构未说明)、Konstantinos Drossos(机构未说明)、Tuomas Virtanen(机构未说明) 💡 毒舌点评 方法的核心卖点是把动态说话人缓存从说话人日志迁移到分离后处理,质量加权加 TopN 保留这一组合在稀疏长语音上确实打得过 VAD 聚类类基线,且无需训练的即插即用设计很务实。但整篇评测都建立在 LibriSpeech 加模拟噪声混响的合成数据上,只用了一个 FTRNN 分离器,代码、模型、数据集一个都不放,作者似乎默认读者愿意相信他们的拼接细节没有问题。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 765 words

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

📄 From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs 标签:#音频理解 #对抗训练 #音频大模型 #鲁棒性 #模型评估 7.4/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #对抗训练 | #音频大模型 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Yuanhe Zhang、Weiliu Wang(共同第一作者;机构信息未完整披露) 作者列表:Yuanhe Zhang、Weiliu Wang、Jie Ren、Liang Lin、Zhenhong Zhou、Haoran Gao、Kun Wang、Chen Li、Li Sun、Sen Su 通讯作者:Sen Su(论文署名信息未给出完整机构映射) 💡 毒舌点评 ILL 把“人耳听不见但模型能感知”的低频输入明确为 LALM 的安全风险,并用黑盒通用波形在六个模型上验证了可迁移的破坏效果;DRG 的条件重录防御也有工程直觉。但攻击只在数字混音中评估,没有 over-the-air 实测,DRG 仅建模两类分布且要求用户重复录音,频移、调制变化和实时交互下的鲁棒性仍未证明。 ...

2026-08-11 · 更新于 2026-08-14 · 1 min · 173 words

Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue

📄 Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue 标签:#多模态模型 #端到端 #模型评估 5.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #多模态模型 | #端到端 | #模型评估 | arxiv 👥 作者与机构 共同第一作者:Esam Ghaleb(Max Planck Institute for Psycholinguistics)、Hugh Mee Wong(Utrecht University)。论文脚注标注"Equal contribution",因此按共同第一作者处理。 通讯作者:Esam Ghaleb(Max Planck Institute for Psycholinguistics,邮箱 esam.ghaleb@mpi.nl)。 作者列表:Esam Ghaleb(Max Planck Institute for Psycholinguistics)、Hugh Mee Wong(Utrecht University)、Kristina Kobrock(Osnabrück University)。 💡 毒舌点评 “这篇工作把’手势是否真的在对话中指称信息’从口号变成可计算的模型问题,并且用’语音不确定时手势增益最大’这一发现给出了有洞察的答案。但整个结论被封闭的Fribble指称游戏、标注的手势区间以及完全缺失的代码/模型发布所限制,开放性和可复现性明显拖了后腿。” ...

2026-08-11 · 更新于 2026-08-14 · 2 min · 399 words

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

📄 MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation 标签:#音乐生成 #自回归模型 #模型评估 6.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐生成 | #自回归模型 | #模型评估 | arxiv 👥 作者与机构 第一作者:Shuyu Li(浙江大学人工智能学院) 通讯作者:Kejun Zhang(浙江大学人工智能学院;长三角一体化创新中心) 作者列表:Shuyu Li(浙江大学人工智能学院)、Kejun Zhang(浙江大学人工智能学院)、Jiahe Lei(香港中文大学)、Shulei Ji(浙江大学计算机科学与技术学院)、Zihao Wang(浙江大学计算机科学与技术学院/山东大学)、Jiaxing Yu(浙江大学人工智能学院)、Wanying Wu(浙江大学竺可桢学院)、Lei Wang(蚂蚁集团) 💡 毒舌点评 用显式布局规划替代隐式全局prompt,方向正确且及时。方法整体是一个“在ACE-Step的LM token流中插入一段结构化文本”的增量式改造,胜在工程闭环完整,但结论的适用范围需要仔细甄别:相对匹配数据no-layout控制确实全面更优,这是最有力的证据;然而在外部基线对比中,生成布局只在FreeMIDI上FAD/KL最优,MuChin真实音频域FAD高达3.456(显著差于XL-Turbo的1.994和Stable Audio的2.007),CLAPScore也始终低于Stable Audio,说明显式规划并不能统一提升全局文本对齐。布局操作实验仅有4个手工挑选的成功案例和谱图可视化,无量化指标和失败案例;主观评价样本量小、无显著性检验。全文无代码/权重/demo链接,可复现性仅停留在“附录写得很详细”的层面。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 574 words

Neural Array-Generic Direction-of-Arrival Estimation Exploiting Array Transfer Functions

📄 Neural Array-Generic Direction-of-Arrival Estimation Exploiting Array Transfer Functions 标签:#声源定位 #CNN #模型评估 6.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #CNN | #模型评估 | arxiv 👥 作者与机构 第一作者:Mikko Heikkinen(未说明) 通讯作者:未说明 作者列表:Mikko Heikkinen(未说明)、Archontis Politis(未说明)、Konstantinos Drossos(未说明)、Tuomas Virtanen(未说明) 💡 毒舌点评 用复值ATF替代几何坐标作为阵列条件,是解决非自由场、带壳体散射设备泛化的正确方向,手机型阵列上的泛化结果也确有价值。但全篇只有仿真实验,缺少与Neural-SRP、GI-DOAEnet、PhaseCoder等同赛道方法的对比,也没有证明"ATF优于坐标"的消融;CoordConv、跨通道共享注意力等关键设计同样没有组件级证据;不公开代码和数据让"array-generic"更像一个精致演示,而不是可验证的结论。 📌 核心摘要 论文提出利用复值方向性阵列传递函数(ATF)作为阵列元数据,配合多通道信号谱图进行神经网络声源到达方向估计,以解决大多数深度学习DoA方法只能用于训练阵列、难以泛化到未见设备的问题。核心网络由信号卷积编码器、ATF直接性卷积编码器、跨注意力融合和DoA解码器组成,输出多源笛卡尔向量;所有二维卷积均替换为CoordConv。区别于用麦克风坐标作为元数据的方法,ATF能描述非自由场、非全向、含壳体散射的实际设备。2D单源任务中,方法F1@5°=0.75、LE=4.0°,低于MUSIC(0.97/1.5°),但LE明显优于FCGA(9.8°);3D多源任务中随着源数增加性能衰减比MUSIC更平缓,且mobile-like阵列泛化与单一阵列训练差距不大。意义在于提供了一条将物理阵列模型嵌入神经DoA估计、增强设备泛化性的路径。局限主要包括仅仿真验证、未与近年前沿阵列泛化DNN对比,且未提供代码或数据。 下文表格只列论文正文明确给出的代表性设置与结果;未报告的基线数字不作推断。 🔗 开源详情 代码:论文中未提及代码链接。论文仅给出 arXiv ID 2608.09425v1,未提供 GitHub、HuggingFace、ModelScope、项目主页或 Demo 地址。 ...

2026-08-11 · 更新于 2026-08-14 · 2 min · 376 words

SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation

📄 SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation 标签:#音视频理解 #多模态模型 #模型评估 7.7/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #模型评估 | arxiv 👥 作者与机构 彭凯(Kai Peng):大连理工大学,happypk@mail.dlut.edu.cn 申云哲(Yunzhe Shen):大连理工大学 张淼(Miao Zhang):大连理工大学 刘雷野(Leiye Liu):大连理工大学 纪伟(Wei Ji):耶鲁大学 李晶晶(Jingjing Li):卡内基梅隆大学 朴永日(Yongri Piao):大连理工大学 卢湖川(Huchuan Lu):大连理工大学 注:论文模板中包含对应作者标记,但正文未将标记映射到具体姓名,按“未明确标注”处理。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 929 words