Monophonic Audio Synthesizer Using FPGAs

📄 Monophonic Audio Synthesizer Using FPGAs 标签:#音频生成 #端到端 #实时处理 4.2/10 | 创新 0.8/2 | 严谨 0.5/1.5 | 实验 0.4/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 4.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频生成 | #端到端 | #实时处理 | arxiv 👥 作者与机构 第一作者:Michael Smith(Department of Electrical and Computer Engineering, University of Colorado Colorado Springs) 作者列表:Michael Smith、D.G. Perera,均署名 University of Colorado Colorado Springs 通讯作者:未说明 💡 毒舌点评 这篇报告最值得肯定的是它把失败的细节交代得比较清楚:UART 通信为何没调通、ADSR 和两个低通滤波器为何被移除、SMA 电压域问题如何影响输出,都有具体排查过程。但作为一篇 16 页的论文,最终真正能跑通的系统只是一个按键触发、音高固定为 A440、无包络、无滤波的方波输出;MIDI 控制链路从未工作,也没有任何量化指标支撑“合成器”这一核心声明。更糟的是,参考文献中混入大量与本文无直接关系的课题组自引,进一步削弱了报告的可信度。整体更像一份高年级 FPGA 课程项目报告,而不是 NeurIPS/ICML/ICLR 级别的可验证研究贡献。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 725 words

myMediWhisper: Construction of Burmese Medical Speech Corpus and Whisper Fine-Tuning for Clinical Dialogue ASR

📄 myMediWhisper: Construction of Burmese Medical Speech Corpus and Whisper Fine-Tuning for Clinical Dialogue ASR 标签:#语音识别 #参数高效微调 #低资源 #鲁棒性 6.7/10 | 创新 1/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.7/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #语音识别 | #LoRA | #参数高效微调 #低资源 | arxiv 👥 作者与机构 论文标注 *Corresponding authors,但未在文本中列出具体姓名。 论文标注 †These authors contributed equally,但未在文本中列出具体姓名。 论文标注 ‡Work done during internship at LU. Lab., Myanmar,对应作者 Thet Htet San。 作者列表: Ye Kyaw Thu(National Electronics and Computer Technology Center (NECTEC), Thailand;Language Understanding Laboratory, Myanmar) Ye Bhone Lin(Language Understanding Laboratory, Myanmar;King Mongkut’s University of Technology Thonburi, Thailand) Thura Aung(Language Understanding Laboratory, Myanmar;King Mongkut’s Institute of Technology Ladkrabang, Thailand) Htet Arkar(King Mongkut’s Institute of Technology Ladkrabang, Thailand) Myat Oo Swe(King Mongkut’s Institute of Technology Ladkrabang, Thailand) Thet Htet San(King Mongkut’s Institute of Technology Ladkrabang, Thailand;标注 Work done during internship at LU. Lab., Myanmar) Min Thiha Tun(Language Understanding Laboratory, Myanmar) Thazin Myint Oo(Language Understanding Laboratory, Myanmar) Thepchai Supnithi(National Electronics and Computer Technology Center (NECTEC), Thailand) 💡 毒舌点评 论文的价值在语料和基准本身:公开缅甸语医疗语音数据、给出 FFT 与 rsLoRA-PEFT 的系统对比,这对低资源医疗 ASR 是实打实的推进。但内部数字多处对不上:正文说原始语料 28 小时 6 分 36 秒,表 1 却是 55.82 小时;增强因子写 0.5×3×2,又说扩到 198.63 小时、约 3.75 倍,按因子算应约 211.8 小时;正文称 PEFT 模型 RTF 普遍比 FFT 高,但 Medium 无增强时 PEFT RTF 0.408 明显低于 FFT 的 0.691,正文偏又引用这对数字作为 PEFT 延迟更高的证据。更麻烦的是,论文引用 myMediCon 的 19.0% WER 作为领域最佳基线,却没做任何对比说明;按各自报告口径,本文 23.44% 并不比 myMediCon 的 RNN 基线低。这些硬伤让一个本可干净利落的数据集贡献显得仓促。建议作者发布勘误表,明确 28h/52.95h/55.82h/198.63h 之间的口径关系,并给出模型权重和代码仓库。 ...

2026-08-12 · 更新于 2026-08-14 · 5 min · 1056 words

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

📄 Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models 标签:#语音交互 #对抗训练 #音频大模型 #鲁棒性 5.4/10 | 创新 1.4/2 | 严谨 0.7/1.5 | 实验 1/1.5 | 清晰 0.6/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.7/1.5 📝 5.4/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #对抗训练 | #音频大模型 #鲁棒性 | arxiv 👥 作者与机构 作者列表:Shuozhe Cheng、Kunlan Xiang、Mingxuan Li、Ji Zhang、Dongxiao Liu、Wenbo Jiang。 论文正文未列出任何作者的单位、实验室名称或完整机构信息。 邮箱信息:论文仅提供 sc8483629@gmail.com 与 wenbo_jiang@uestc.edu.cn 两个邮箱。排版中 Corresponding author 字样紧跟在 sc8483629@gmail.com 之后,但未明确标注该邮箱对应哪位作者;按常见模板惯例可推断 Shuozhe Cheng 可能是通讯作者,但此推断无法被论文正文确证。 wenbo_jiang@uestc.edu.cn 的域名为 uestc.edu.cn,可可靠推断 Wenbo Jiang 来自电子科技大学;其他作者所属机构均为“未说明”。 原文未提供作者顺序对应的机构编号列表,也未提供 ORCID 或贡献声明。 💡 毒舌点评 第一次系统地把文本 LLM 的 DoS 攻击研究拓展到端到端语音大模型,问题切入点有实际意义;四分量联合损失配合 VAD 的 pipeline 设计也具备一定工程完成度。但论文在证据链上存在多处明显瑕疵:消融表 2 的行与组件对应关系无法唯一解码,正文表述与表格数值存在直接冲突(如 FunAudioChat clean input 显存在正文写 17.26 GB、表 1 却写 20.26 GB);使用“ChatGPT 5.5”作为响应质量评测器但未提供任何可独立验证的版本信息;文本基线 Crabs/ExtendAttack 如何适配到语音输入完全没有说明;攻击成功样本的波形分析显示所谓“never stop speaking”实际产生的是大量低能量静音片段而非持续可听语音。这些问题使得当前结果只能视为初步探索,距离顶会主刊的完整证据标准尚有明显距离。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 735 words

Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis

📄 Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis 标签:#音乐理解 #变分自编码器 #无监督学习 #可解释性 7.1/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #变分自编码器 | #无监督学习 #可解释性 | arxiv 👥 作者与机构 第一作者:Seonguk Ju(机构未说明) 通讯作者:未说明(论文未标注通讯作者) 作者列表:Seonguk Ju(机构未说明)、Seola Cho(机构未说明)、Sooin Chung(机构未说明)、Danbinaerin Han(机构未说明)、Dasaem Jeong(机构未说明) 💡 毒舌点评 用 VQ-VAE 给连续音高轮廓学一套离散词表,并把“相位、时长、音高、幅度略不同但形状相似”的装饰音压成同一个 token,这个对齐鲁棒重建损失是全文最有价值的想法,且代码和 demo 均公开,算得上诚实工作。但验证盘太小:唯一可比基线是自编码器+UMAP+K-Means,没有和任何其他无监督或自监督音频表征对比;sigimsae 探针离监督模型仍差一大截;模式分析也只是几个 token 的零散案例,没有整体统计或显著性检验。作为方法研究报告成立,但距离“可直接用于语料级音乐学分析”的强声明还有明显证据缺口。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 669 words

Rationale-Guided Learning for Multimodal Emotion Recognition

📄 Rationale-Guided Learning for Multimodal Emotion Recognition 标签:#语音情感识别 #对比学习 #多模态模型 7.2/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #对比学习 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Sujung Oh(按作者列表顺序;论文未单独标注) 通讯作者:未说明(论文未提供联系邮箱或通讯作者标注) 作者列表:Sujung Oh、Jung Uk Kim、Sangmin Lee 机构:未说明(论文未提供作者单位信息) 💡 毒舌点评 把MLLM离线生成的结构化rationales作为中间监督信号,以零推理开销提升多模态对话情感识别性能,这个思路有认知科学依据,实验也做到了IEMOCAP和MELD上的SOTA。但rationales是在prompt中给定ground-truth标签后生成的"事后解释",存在明显的信息泄漏与因果幻觉风险;MELD上的优势只有0.06个W-F1点,基本处于噪声范围;且代码、模型和数据均未公开,复现门槛很高。 📌 核心摘要 该论文针对多模态对话情感识别(MERC)中现有方法将情感识别视为直接的输入-输出映射、忽略人类因果推理过程的问题,提出Rationale-Guided Learning(RGL)框架。RGL基于双过程理论将情感推理分解为直觉(Intuitive)、上下文(Contextual)和整合(Integrative)三个侧面,利用GPT-4o离线生成结构化rationales并编码为rationale banks,训练时通过对比学习将模型的视觉、文本和融合特征分别与三类rationale对齐。与已有方法的关键区别在于:MLLM仅在离线准备阶段使用一次,最终模型在训练和推理阶段都不需要运行MLLM,且显式建模了"感知→情境分析→综合判断"的推理路径。在IEMOCAP上W-F1达到73.68、Acc达到73.51,在MELD上W-F1达到67.43、Acc达到68.31,均超越现有SOTA。消融实验表明上下文rationale损失贡献最大,去掉后W-F1降至68.78。主要局限是rationales依赖MLLM在给定ground-truth标签后生成,存在标签泄漏风险,且未开源代码、模型与数据。 🔗 开源详情 代码:论文中未提及代码链接,未提供GitHub、HuggingFace、ModelScope、项目主页、Demo等地址。 模型权重:论文未提及RGL模型权重的公开下载链接;仅说明使用GPT-4o、BGE-large-en-v1.5、ViT-base、RoBERTa-large、HuBERT-base等预训练模型,但未给出这些模型权重的下载地址。 数据集:论文使用IEMOCAP和MELD两个基准数据集,但未提供具体获取URL、开源协议或下载方式。 Demo:论文中未提及在线演示地址。 复现材料:论文未提及完整复现材料;仅提供部分实现细节:AdamW优化器、学习率\(1\mathrm{e}{-5}\)、batch size 4、温度系数\(\tau=0.07\)、权重系数\(\lambda=0.3\)、\(K=128\),以及使用TalkNet-ASD进行说话人面部检测。未提供配置文件、检查点或附录代码。 论文中提及的预训练模型/工具: GPT-4o:用于离线生成rationale的多模态大语言模型;论文未提供链接。 BGE-large-en-v1.5:用于将rationale文本编码为向量的预训练文本嵌入模型;论文未提供链接。 ViT-base:视觉模态编码器;论文未提供链接。 RoBERTa-large:文本模态编码器;论文未提供链接。 HuBERT-base:音频模态编码器;论文未提供链接。 TalkNet-ASD:用于检测当前说话人面部的工具;论文未提供链接。 FacialMMT:论文中提及的实验设置参考方法;论文未提供链接。 DialogueRNN、DialogueTRM、MM-DFN、SCFA、EASUM、TelME、HAUCL、BIG-FUSION、DIB-HGCN、MAGTKD等为对比方法,论文中未描述为开源项目,也未提供链接。 🏗️ 方法概述和架构 RGL整体分为两个阶段:离线rationale生成与编码、端到端训练。该方法不是端到端联合优化MLLM生成过程,而是"预生成监督信号+模型训练"的两阶段框架。 ...

2026-08-12 · 更新于 2026-08-14 · 2 min · 294 words

Seeds Before Objectives: Rethinking Evaluation for Low-Resource Garhwali ASR

📄 Seeds Before Objectives: Rethinking Evaluation for Low-Resource Garhwali ASR 标签:#语音识别 #自监督学习 #低资源 #基准测试 7.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音识别 | #自监督学习 | #低资源 #基准测试 | arxiv 👥 作者与机构 第一作者:Karamvir Singh Batra(Thapar Institute of Engineering and Technology, Patiala, Punjab, India) 通讯作者:Jasmeet Singh(Thapar Institute of Engineering and Technology, Patiala, Punjab, India);Sahil Sharma(Ulster University, Belfast, United Kingdom) 作者列表: Karamvir Singh Batra(Thapar Institute of Engineering and Technology, Patiala, Punjab, India) Prathamjyot Singh(Thapar Institute of Engineering and Technology, Patiala, Punjab, India) Ashima Sood(Ulster University, Londonderry, United Kingdom) Jasmeet Singh(Thapar Institute of Engineering and Technology, Patiala, Punjab, India) Sahil Sharma(Ulster University, Belfast, United Kingdom) 💡 毒舌点评 用五种子×配对检验把“看起来能涨点”的 Focal CTC、matra 加权和 Hindi 迁移逐一打回原形,是低资源方言 ASR 里少见的高标准负结果研究,尤其“预训练设计比参数规模重要”的结论有实操价值。但核心负面结论建立在单一方言、8.8 小时音频和 5 个种子上,作者自己的功效分析也承认只能大致钉死“标准 CTC vs Focal”的方向,无法排除其他微小真实差异;再加上未提供模型权重、仓库实际内容有待查验,这套 benchmark 的复用门槛比论文读起来更高。 ...

2026-08-12 · 更新于 2026-08-14 · 6 min · 1258 words

The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset

📄 The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset 标签:#语音交互 #基准测试 #数据集 7.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.2/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #语音交互 | #基准测试 | #数据集 | arxiv 👥 作者与机构 第一作者:Rajmund Nagy(KTH Royal Institute of Technology) 通讯作者:未说明 作者列表与机构: Rajmund Nagy(KTH Royal Institute of Technology) Silvia Arellano García(KTH Royal Institute of Technology) Hendric Voss(Bielefeld University) Mihail Tsakov(Independent researcher) Taras Kucherenko(National Library of Sweden) Youngwoo Yoon(Electronics and Telecommunications Research Institute, ETRI) Gustav Eje Henter(KTH Royal Institute of Technology / Motorica AB) 资助信息:RN、SAG、MT、GEH 部分受 Knut and Alice Wallenberg Foundation 的 Wallenberg AI, Autonomous Systems and Software Program (WASP) 资助;YY 和 GEH 部分受 MOTIE(韩国)资助的 Industrial Strategic Technology Development Program(资助号 20023495)支持。 💡 毒舌点评 作为第四届GENEA挑战赛的延续,本文的评估版图从“语音-动作对齐”扩展到了“副语言交流对齐”和“语义对齐”两个新维度,并首次提出文本失配(text mismatching)范式——这是评测方法论上一次实质推进。但尴尬的是,所有参赛系统在主任务(T2)上最高仅32%对齐率,距离mocap的62%相去甚远;T3和T4中参赛系统几乎全军覆没,竞技结果的意义大打折扣。这与其说是挑战赛的胜利,不如说是对现有方法能力上限的一次温和示警。论文对T3负置信区间给出的统计解释(系统级随机性与研究级随机性)是诚实且有理论依据的,但也暴露了整个评估体系面对“低响应率任务”时统计功效不足的短板——尤其只有46段stimuli的T3,结论的稳定性仍存疑。此外,论文承认此前GENEA Leaderboard上已有扩散Transformer在BEAT2上达到mocap级对齐,但这次挑战未纳入任何已有公开SOTA系统作为对比,削弱了“Seamless Interaction更复杂”这一论断的直接说服力。 ...

2026-08-12 · 更新于 2026-08-14 · 2 min · 380 words

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

📄 TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation 标签:#扩散模型 #端到端 #模型评估 6.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.6/1 | 影响 0.4/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #扩散模型 | #端到端 | #模型评估 | arxiv 👥 作者与机构 第一作者:Pengyu Zhang(University of Amsterdam, Amsterdam, The Netherlands) 通讯作者:未说明 作者列表:Pengyu Zhang(University of Amsterdam)、Yangqin Jiang(University of Hong Kong)、Klim Zaporojets(Aarhus University)、Congfeng Cao(University of Amsterdam)、Paul Groth(University of Amsterdam) 💡 毒舌点评 这篇工作的核心卖点是“模态时间尺度不匹配”——不同模态的相关性随时间以不同速率漂移,同一用户在不同时间上下文需要不同的模态融合比例。这个观察有真实场景支撑,且把时间信号同时注入模态级路由和扩散图重构,形成双层互补机制,比简单给DiffMM加时间特征更有想法。实验证据链在推荐论文中算比较完整:10种子配对t检验、时间输入vs噪声输入对照、用户分层路由分析、组件消融和噪声鲁棒性都做了。但短板也明显:时间切分实验只对比DiffMM一个基线,无法支撑“对时间分布漂移特别稳健”的强结论;关键超参数、权重取值和更多配置被放到匿名仓库和附录,正文复现信息不独立;此外本文核心是电商/短视频多模态推荐,与语音、音乐、音频方向读者的直接相关性有限。 ...

2026-08-12 · 更新于 2026-08-14 · 2 min · 290 words

Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice

📄 Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice 标签:#语音增强 #端到端 #模型评估 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:应用研究 | 评分置信度:中 | #语音增强 | #端到端 | #模型评估 | arxiv 👥 作者与机构 作者列表(按论文原文顺序):Reyhaneh Abbasi、Peter Balazs、Vincent Lostanlen、Clara Hollomey、Dustin J. Penn、Sarah M. Zala、Nicki Holighaus。 机构信息: Reyhaneh Abbasi:奥地利科学院(ÖAW)声学研究所(Acoustics Research Institute);维也纳大学维也纳认知、行为与神经科学博士学院(Vienna Doctoral School of Cognition, Behavior, and Neuroscience)。 Peter Balazs:奥地利科学院声学研究所;奥地利林茨跨学科转型大学(IT:U)。 Vincent Lostanlen:法国南特大学/南特中央理工/CNRS/LS2N UMR 6004。 Clara Hollomey:奥地利圣珀尔滕应用科学大学创意媒体技术研究所(Institute for Creative Media Technologies)。 Dustin J. Penn、Sarah M. Zala:维也纳兽医大学康拉德·洛伦兹动物行为学研究所(Konrad Lorenz Institute of Ethology)。 Nicki Holighaus:奥地利科学院声学研究所。 通讯作者:Reyhaneh Abbasi(reyhaneh.abbasi@oeaw.ac.at)。 💡 毒舌点评 用脊线自己合成干净目标,再让同一个脊线跟踪器来打分,这套“自产自销”的闭环在工程上确实漂亮——绕开了生物声学最缺的干净标注,还把脊线位置塞进 loss 里一鱼两吃。但 SI-SDR 的漂亮数字更像是系统内部的自洽证明:训练目标、测试参考和评价指标全部来源于同一套合成管线,离真实野外噪声到底有多远没有说清。再加上分类实验里 BootSnap 自带降噪没被拆除,增益归因也留了一笔糊涂账。方法对调性发声有效,但离“通用生物声学降噪”还有一层窗户纸。 ...

2026-08-12 · 更新于 2026-08-14 · 5 min · 889 words

VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

📄 VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation 标签:#语音翻译 #大语言模型 #低资源 #语音合成 6.9/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音翻译 | #大语言模型 | #低资源 #语音合成 | arxiv 👥 作者与机构 第一作者:Yejin Jeon(Mila - Quebec AI Institute、McGill University);Marie Maltais(Mila - Quebec AI Institute、McGill University,标注 equal contribution) 通讯作者:未说明 作者列表:Yejin Jeon(Mila - Quebec AI Institute、McGill University)、Marie Maltais(Mila - Quebec AI Institute、McGill University)、Virginia Ceccatelli(Mila - Quebec AI Institute、McGill University)、Min Ma(Google DeepMind)、David Ifeoluwa Adelani(Mila - Quebec AI Institute、McGill University、Canada CIFAR AI Chair) 💡 毒舌点评 亮点是给出了第一个大规模多语言长语音“联合摘要+翻译”基准 VoxSumm,703小时/24语言/10045对的规模填补了任务定义和数据空白,并做了较系统的模型与提示设置比较。短板是全部音频由 TTS 合成而非真实语音,且数据对齐依赖 CrossSum 自动语义相似度匹配,论文只承诺 release 却未给出任何可获取链接,可复现性大打折扣。 ...

2026-08-12 · 更新于 2026-08-14 · 3 min · 586 words