A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores

📄 A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores 标签:#端到端 #Transformer #基准测试 8.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 🔥 8.5/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #端到端 | #Transformer | #基准测试 | arxiv 👥 作者与机构 Dongmin Kim(韩国西江大学 Music & Arts Learning (MALer) Lab) Brian Liu(独立研究者) Jose J. Valero-Mas(西班牙阿利坎特大学模式识别与人工智能小组) Dasaem Jeong(韩国西江大学 MALer Lab;联系邮箱 dasaemj@sogang.ac.kr;论文未明确标注“通讯作者”,按署名与联系邮箱推断) 💡 毒舌点评 首个多声部 OMR 基准的开创性毋庸置疑,视觉对齐 + 三编码转换 + 测试集互斥四折协议的工程链条相当完整,3.6%/5.9% 的基线让这个任务从“不可能”变成了“可挑战”。但人工校对没有第二人校验、四折标准差偏大、LMXE 由作者自己的转换管线生成并取得全面优势,使得“编码选择 > 架构选择”这个 headline 结论的公信力打了折扣。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 770 words

DIY e-HandPan: A new DIY Low-Cost Handpan Interface based on Arduino and ESP32 Microcontrollers

📄 DIY e-HandPan: A new DIY Low-Cost Handpan Interface based on Arduino and ESP32 Microcontrollers 标签:#音频交互 #端到端 #实时处理 #开源工具 #教育 7.2/10 | 创新 1/2 | 严谨 1.1/1.5 | 实验 0.7/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音频交互 | #端到端 | #实时处理 #开源工具 | arxiv 👥 作者与机构 第一作者:Benoît Collin(IBISC, University of Évry Paris-Saclay) 通讯作者:论文未明确标注通讯作者,仅提供联系邮箱 dominique.fourer@univ-evry.fr 作者列表: Benoît Collin(IBISC, University of Évry Paris-Saclay) Dominique Fourer(IBISC, University of Évry Paris-Saclay) Eric Genotelle(IBISC, University of Évry Paris-Saclay) 💡 毒舌点评 作为开源硬件系统报告,工程文档完整度相当扎实:用约 80 美元做出了带力度感知、双色 LED 教学引导和双 MCU 版本的电子手碟,对音乐教育与 Maker 社区有实际价值。但论文几乎没有对端到端演奏延迟、误触发率、长期可靠性和学习效果做量化评估,与 Panduino、Lumen、Neotone 等已有系统只停留在属性表对比,摘要中“表现力可比原声手碟”的说法没有任何对比数据支撑,离顶会“证据支撑结论”的标准还差得远。此外,Arduino 版本是否支持 LED 教学在正文中自相矛盾(2.3/4.2/5.1 描述与 3.1 矛盾),需要认真修正。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 701 words

DuplexWorld: Can voice agents help you get through the day?

📄 DuplexWorld: Can voice agents help you get through the day? 标签:#语音交互 #端到端 #基准测试 #模型评估 #大语言模型 8.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 🔥 8.5/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音交互 | #端到端 | #基准测试 #模型评估 | arxiv 👥 作者与机构 第一作者:Aryan Vijay Bhosale(Centific Global Solutions Inc.;University of Maryland,标注为在 Centific 实习期间完成工作) 通讯作者:未说明(论文未明确标注通讯作者;Abhishek Mukherji 与 Dinesh Manocha 被标注为 † 共同指导) 合作者标注:Aryan Vijay Bhosale、Harshit Rajgarhia、Akhil Pothanapalli 为 ∗ 平等贡献 作者列表: Aryan Vijay Bhosale(Centific Global Solutions Inc.;University of Maryland) Harshit Rajgarhia(Centific Global Solutions Inc.) Akhil Pothanapalli(Centific Global Solutions Inc.) Asif Shaik(Centific Global Solutions Inc.) Abhishek Mukherji(Centific Global Solutions Inc.) Dinesh Manocha(University of Maryland) 💡 毒舌点评 把导航世界装进语音智能体评测、并在同一 harness 下用 12 个指标横扫六个世界,这套基准的设计纪律和工程完成度在同类工作中罕见地高,“探索越多到达越少"的反转结论尤其有洞察力。但全部被测系统都是闭源商业 API、judge 指标未经本语料上的人类评分校验、模拟用户比真人耐心得多,三者叠加让任何"真实部署能力"的外推都底气不足;更讽刺的是,作者自己承认 GS 可以被"不作为"通过,且 Pathfinding 中从不行动的 Nova 2 Sonic 在选择性上几乎满分,说明指标体系的对抗性设计还差最后一公里。 ...

2026-08-12 · 更新于 2026-08-14 · 5 min · 947 words

Monophonic Audio Synthesizer Using FPGAs

📄 Monophonic Audio Synthesizer Using FPGAs 标签:#音频生成 #端到端 #实时处理 4.2/10 | 创新 0.8/2 | 严谨 0.5/1.5 | 实验 0.4/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 4.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频生成 | #端到端 | #实时处理 | arxiv 👥 作者与机构 第一作者:Michael Smith(Department of Electrical and Computer Engineering, University of Colorado Colorado Springs) 作者列表:Michael Smith、D.G. Perera,均署名 University of Colorado Colorado Springs 通讯作者:未说明 💡 毒舌点评 这篇报告最值得肯定的是它把失败的细节交代得比较清楚:UART 通信为何没调通、ADSR 和两个低通滤波器为何被移除、SMA 电压域问题如何影响输出,都有具体排查过程。但作为一篇 16 页的论文,最终真正能跑通的系统只是一个按键触发、音高固定为 A440、无包络、无滤波的方波输出;MIDI 控制链路从未工作,也没有任何量化指标支撑“合成器”这一核心声明。更糟的是,参考文献中混入大量与本文无直接关系的课题组自引,进一步削弱了报告的可信度。整体更像一份高年级 FPGA 课程项目报告,而不是 NeurIPS/ICML/ICLR 级别的可验证研究贡献。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 725 words

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

📄 TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation 标签:#扩散模型 #端到端 #模型评估 6.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.6/1 | 影响 0.4/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #扩散模型 | #端到端 | #模型评估 | arxiv 👥 作者与机构 第一作者:Pengyu Zhang(University of Amsterdam, Amsterdam, The Netherlands) 通讯作者:未说明 作者列表:Pengyu Zhang(University of Amsterdam)、Yangqin Jiang(University of Hong Kong)、Klim Zaporojets(Aarhus University)、Congfeng Cao(University of Amsterdam)、Paul Groth(University of Amsterdam) 💡 毒舌点评 这篇工作的核心卖点是“模态时间尺度不匹配”——不同模态的相关性随时间以不同速率漂移,同一用户在不同时间上下文需要不同的模态融合比例。这个观察有真实场景支撑,且把时间信号同时注入模态级路由和扩散图重构,形成双层互补机制,比简单给DiffMM加时间特征更有想法。实验证据链在推荐论文中算比较完整:10种子配对t检验、时间输入vs噪声输入对照、用户分层路由分析、组件消融和噪声鲁棒性都做了。但短板也明显:时间切分实验只对比DiffMM一个基线,无法支撑“对时间分布漂移特别稳健”的强结论;关键超参数、权重取值和更多配置被放到匿名仓库和附录,正文复现信息不独立;此外本文核心是电商/短视频多模态推荐,与语音、音乐、音频方向读者的直接相关性有限。 ...

2026-08-12 · 更新于 2026-08-14 · 2 min · 290 words

Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice

📄 Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice 标签:#语音增强 #端到端 #模型评估 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:应用研究 | 评分置信度:中 | #语音增强 | #端到端 | #模型评估 | arxiv 👥 作者与机构 作者列表(按论文原文顺序):Reyhaneh Abbasi、Peter Balazs、Vincent Lostanlen、Clara Hollomey、Dustin J. Penn、Sarah M. Zala、Nicki Holighaus。 机构信息: Reyhaneh Abbasi:奥地利科学院(ÖAW)声学研究所(Acoustics Research Institute);维也纳大学维也纳认知、行为与神经科学博士学院(Vienna Doctoral School of Cognition, Behavior, and Neuroscience)。 Peter Balazs:奥地利科学院声学研究所;奥地利林茨跨学科转型大学(IT:U)。 Vincent Lostanlen:法国南特大学/南特中央理工/CNRS/LS2N UMR 6004。 Clara Hollomey:奥地利圣珀尔滕应用科学大学创意媒体技术研究所(Institute for Creative Media Technologies)。 Dustin J. Penn、Sarah M. Zala:维也纳兽医大学康拉德·洛伦兹动物行为学研究所(Konrad Lorenz Institute of Ethology)。 Nicki Holighaus:奥地利科学院声学研究所。 通讯作者:Reyhaneh Abbasi(reyhaneh.abbasi@oeaw.ac.at)。 💡 毒舌点评 用脊线自己合成干净目标,再让同一个脊线跟踪器来打分,这套“自产自销”的闭环在工程上确实漂亮——绕开了生物声学最缺的干净标注,还把脊线位置塞进 loss 里一鱼两吃。但 SI-SDR 的漂亮数字更像是系统内部的自洽证明:训练目标、测试参考和评价指标全部来源于同一套合成管线,离真实野外噪声到底有多远没有说清。再加上分类实验里 BootSnap 自带降噪没被拆除,增益归因也留了一笔糊涂账。方法对调性发声有效,但离“通用生物声学降噪”还有一层窗户纸。 ...

2026-08-12 · 更新于 2026-08-14 · 5 min · 889 words

BAMU: Bitstream-Aware Marginal-Utility Allocation for Frozen Pretrained Neural Speech Codecs

📄 BAMU: Bitstream-Aware Marginal-Utility Allocation for Frozen Pretrained Neural Speech Codecs 标签:#语音编码 #CNN #端到端 #高效推理 7.1/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音编码 | #CNN | #端到端 #高效推理 | arxiv 👥 作者与机构 第一作者:Mingyu Zhao(未说明) 通讯作者:未说明 作者列表:Mingyu Zhao(未说明)、Zijian Lin(未说明)、Yutang Feng(未说明)、Jiatao Chen(未说明)、Fan Wang(未说明)、Jiehui Luo(未说明)、Yuhao Ding(未说明)、Jinchao Zhang(未说明)、Zhiyong Wu(未说明) 说明:论文文本未提供作者所属机构信息。 💡 毒舌点评 BAMU 最值得肯定的是把“真实序列化容器字节数”而非名义平均码率作为分配约束,并给出了可解码位流的完整闭环;这在神经语音编码的工程落地中是有价值的问题意识。但它本质上仍是“帧级 marginal-utility 预测 + 预算分配”的组合,且没有与 VRVQ 或其他自适应分配方法直接对比,导致“优于固定深度”这一结论的说服力打了折扣。DAC 最低码率退化被如实报告,但作者没能提出有效补救,只归因于 latent-MSE 效用目标的局限。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 707 words

Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue

📄 Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue 标签:#多模态模型 #端到端 #模型评估 5.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #多模态模型 | #端到端 | #模型评估 | arxiv 👥 作者与机构 共同第一作者:Esam Ghaleb(Max Planck Institute for Psycholinguistics)、Hugh Mee Wong(Utrecht University)。论文脚注标注"Equal contribution",因此按共同第一作者处理。 通讯作者:Esam Ghaleb(Max Planck Institute for Psycholinguistics,邮箱 esam.ghaleb@mpi.nl)。 作者列表:Esam Ghaleb(Max Planck Institute for Psycholinguistics)、Hugh Mee Wong(Utrecht University)、Kristina Kobrock(Osnabrück University)。 💡 毒舌点评 “这篇工作把’手势是否真的在对话中指称信息’从口号变成可计算的模型问题,并且用’语音不确定时手势增益最大’这一发现给出了有洞察的答案。但整个结论被封闭的Fribble指称游戏、标注的手势区间以及完全缺失的代码/模型发布所限制,开放性和可复现性明显拖了后腿。” ...

2026-08-11 · 更新于 2026-08-14 · 2 min · 399 words

ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure

📄 ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure 标签:#语音编码 #端到端 #自监督学习 #知识蒸馏 7.7/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音编码 | #端到端 | #自监督学习 #知识蒸馏 | arxiv 👥 作者与机构 Zixiang Wan:北京大学深圳研究生院(北大-腾讯合作研究,第一作者,完成腾讯实习期间工作) Xusheng Yang:北京大学深圳研究生院 Zheng Wang:腾讯 Peiji Yang:腾讯(通讯作者) 机构:北京大学深圳研究生院、腾讯 通讯作者:Peiji Yang(peijiyang@tencent.com) 论文脚注说明“本工作完成于腾讯实习期间”,对应作者标注 *。 💡 毒舌点评 这篇论文最聪明的地方是先把“音素结构清晰度”与“token 可预测性”之间的正相关做成一个受控诊断,再顺势把结论变成方法:既然音素结构有利于预测、但不利于重建,那就用冻结 SSL 特征当锚点、用浅层残差补声学、再用训练-only 教师损失精炼量化表示。整个“preserve–control–refine”链条在逻辑上是自洽的,消融也做得相当完整,650/800 bps 下的重建与下游 TTS 提升也确实可见。但论文的软肋同样明显:核心论点是“相关性”而非因果;基线对比使用 released checkpoint 对自训练 checkpoint,公平性存疑;音素分析只覆盖 50 Hz 英文 LibriSpeech,无噪声、无多说话人、无多语言验证;教师选择只比较了 W2v-BERT 2.0 和 WavLM-Large 两个 SSL 模型;代码和权重还只是“录用后发布”的承诺。更微妙的是,标题和摘要强调的 P-ACC 提升(5.12→9.65)来自 P-VQ 代理量化器,而原生 N-ACC 只有 8.72%,且基线原生 N-ACC 未报告,因此“frontier improvement”在严格意义上有一部分是代理指标上的提升。这仍然是一篇方法动机清晰、实验扎实的强工作,但离“可复现、可部署、可外推”还有距离。 ...

2026-08-11 · 更新于 2026-08-14 · 7 min · 1281 words

How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs

📄 How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs 标签:#语音识别 #语音大模型 #端到端 #鲁棒性 #模型比较 6.4/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #语音大模型 | #端到端 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Christian Huber(原文未标注所属机构) 第二作者:Alexander Waibel(原文未标注所属机构) 通讯作者:未标注 机构信息:原文正文未给出作者机构;致谢提到 KIT Campus Transfer GmbH 与 Carnegie – AI 合作项目,但这一信息不足以确认为作者所属机构,因此按“未说明”处理。 💡 毒舌点评 论文把“专用上下文偏置 vs 语音大模型”的适用边界画得比较清楚,尤其是指出语音大模型对干扰词数量和 prompt 词序都很敏感,这对选型有直接参考价值。但它始终把词序敏感性当成一种“需要规避的问题”而不是“需要量化的对象”,没有给出任何排序扰动实验;同时不释放代码、模型、评测脚本或过滤流程,核心结论几乎无法被第三方复现。更关键的是,论文对三个语音大模型的描述部分直接引用官方宣传语,却未给出实际 prompt 模板、解码参数和过滤指令,读者很难判断结果究竟来自模型能力还是评测设置。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 797 words