DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents

📄 说了像本人,不等于接得住话:角色暗示里的时机考验 英文题目:DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents 一句话:论文用同一段用户语音对比显式规则与人设暗示下的接话时机,发现全双工模型推断代价最高达 9.7 个百分点,而内容像角色的模型仍做不出打断与附和,且安全冲突下仅一例过半守住安全侧。 标签:#语音交互 | #语音大模型 | #基准测试 | #实时处理 | #模型评估 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Puneet Mathur:University of Maryland College Park, USA Dinesh Manocha:Project Page: 💬 毒舌点评 把显式打断规则换成悲伤辅导员与911接线员的人设暗示来考全双工话轮控制,这个切口抓得准且泄漏控制做了实事。遗憾在于6个系统绝对指令遵从率普遍低于50%,近零差距模型的细排名在阈值抖动下并不稳,安全层级结论更多是30例小样本警示而非定论。 📌 核心摘要 全双工语音智能体需要根据角色推断何时倾听、附和、打断、让出或保持话轮,现有评测多只给显式话轮指令。论文提出DuplexSpeechBench-IFEval(DSB-IFEval,隐式指令遵循评测),用同一用户音频搭配5种条件协议对比显式执行与人设暗示执行。方法上以8个行为对比角色、6类会话探针、程序化合成与双通道实时编排为流水线,以确定性指令遵从分数Instruction Adherence Score(IAS,指令遵从分数)与大语言模型评价的人设内容分数Persona Adherence Score(PAS,人设遵从分数)解耦内容与时机。6系统实验显示全双工架构的蕴含差距Entailment Gap(蕴含差距)达9.7个百分点,而回合制系统内容跟随强但打断与附和几乎为0。安全冲突下仅MiniCPM-o-4.5在语义层60.0%选择安全侧,且IAS非零者仅2个系统。该基准为角色化实时语音部署提供了可复现的层级检验,但局限在英语双轮合成语音与小规模安全集。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 790 words

Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR

📄 平均分好看,重度患者却依然听不懂:在 Jetson 上重算唇腭裂语音的公平账 英文题目:Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR 一句话:针对通用模型在唇腭裂不同严重度上系统性失效且云端不可靠的问题,论文用固定 280 条预算的严重度组合微调 Whisper-small 并在 Jetson 上做 FP16 端侧实测,以 NOMIMOSE 把汇总 WER 从 62.46% 降到 22.72% 且 RTF 保持 0.167 为证据,代价是重度组仍高达 54.96% 且仅在单一儿童语料上验证。 标签:#语音识别 | #迁移学习 | #低资源 评分:5.6/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Susmita Bhattacharjee:Indian Institute of Technology Guwahati, India Himashri Deka:Indian Institute of Technology Guwahati, India H.S. Shekhawat:Indian Institute of Technology Guwahati, India S.R.M. Prasanna:Indian Institute of Technology Dharwad, India 💬 毒舌点评 把严重度公平性与 Jetson 端侧实测放进同一闭环,直面了病理语音最痛的分布不均,选题切口准。短板是仅靠 280 条训练的单一儿童语料自证,重度词错误率仍在 55% 上下却被包装成均衡胜利,边缘侧也只是现成 Whisper 的半精度搬运。 ...

2026-09-04 · 更新于 2026-09-04 · 6 min · 1115 words

Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation

📄 掩蔽走不到的地方:一条直线、一个夹角与均方误差的回拉 英文题目:Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation 一句话:单通道时频掩蔽的实增益格式把估计锁死在混合方向的直线上,论文用投影几何算出精确上限与四层算子类,再以非循环高斯混合后验证明均方准则会把估计拉回直线并在 MUSDB18 上测得 11.44 dB 量级的稳定缺口。 标签:#音乐源分离 | #生成模型 | #理论分析 | #基准测试 评分:7.9/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Maxime Baelde:organization=Independent researcher, city=Lille, country=France 💬 毒舌点评 亮点在于把时频掩蔽上限写成投影几何并证明均方准则把后验均值拉回实数线,理论链条完整且可证伪。短板是所测高斯混合先验远弱于当代分离器,整篇更像用弱模型验证强定理而非逼近上限本身。 📌 核心摘要 单通道时频掩蔽长期以理想比值掩蔽等特解作为上限,无法回答实增益格式本身禁止什么。本文把单频点估计看作复平面上的实线性算子,证明最优实增益是源向量向混合线上的正交投影,残差完全由源与混合夹角决定。作者建立实掩蔽、复掩蔽、宽线性与跨频耦合四层嵌套算子类,并对应先验零均值、循环对称与频率独立三条假设。构造堆叠实虚谱上的非循环高斯混合先验,其后验均值形式上离开最小类,但证明相位后验关于混合方向对称时均值落回实线,超额误差等于 oracle 增益的后验方差。在 MUSDB18 上人声与伴奏分离实验中,拟合估计器始终大幅低于逐帧上限,且增加分量数、训练量与全协方差均未弥合差距,约七成缺口可归因于后验方差。意义在于把突破上限的希望从更宽滤波器转向帧自适应先验与非均方准则。局限是测量取自较弱的浅层生成模型,且上限经重合成传输存在数值松弛。 🔗 开源与复现资源 代码:https://github.com/mbaelde/masking-ceiling,tag v1.0.0,separator 实现导入自 https://github.com/mbaelde/generative-audio-source-models 模型权重:论文中未提及 数据集:论文中未提及 Demo:论文中未提及 复现材料:论文说明全部 figure 和 table 可由 tag v1.0.0 复现,训练配置采用 diagonal 协方差并设置 floor 为 10-6,EM 迭代为 30 次,每种配置按 K 取 8,16,32 独立拟合且使用固定 seed,训练量按每源 20000 和 150000 frames 设置两档,堆叠维度在 L 为 1024 时是 1026,在 L 为 256 时是 258 论文中引用的开源项目:masking-ceiling https://github.com/mbaelde/masking-ceiling,generative-audio-source-models https://github.com/mbaelde/generative-audio-source-models 资源可达性验证:code=temporarily_unreachable;code=temporarily_unreachable;third_party=temporarily_unreachable;third_party=temporarily_unreachable 🧭 深度解读 单通道分离为何总在时频图上做乘法 想象你只拿到一轨混音,要从中捞出人声。最省事的办法是在短时傅里叶变换后的每个小格子上乘一个实数,把混合的幅度压一压、抬一抬,相位则原样保留。这就是理想比值掩蔽、维纳滤波和无数神经网络掩蔽器的共同格式,简单、稳定、易训练。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 915 words

Is Semantics Enough for Speech Mean Opinion Score Prediction?

📄 语义听得懂内容,声学才听得出破绽:MOS 预测的双耳之争 英文题目:Is Semantics Enough for Speech Mean Opinion Score Prediction? 一句话:论文把语义自监督、纯声学编解码与语义声学统一编解码放在同一冻结与微调探针下比较,证明匹配语言下协同表征上界更高而跨语言时连续语义更稳,代价是公平性与机理证据仍不完整。 标签:#语音质量评估 | #自监督学习 | #语音合成 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Tianyu Lan:机构信息未在 arXiv HTML 中可靠披露 Yufei Shi:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Honghao Sun:机构信息未在 arXiv HTML 中可靠披露 Huipeng Du:机构信息未在 arXiv HTML 中可靠披露 Zhenhua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语义主导的自监督学习与声学重建的神经音频编解码器放在同一冻结探针下硬碰硬,问题切得准。短板在于所谓统一表征几乎全是借用现成 XCodec 与 SpeechTokenizer 的封装对比,缺少对语义声学解耦的因果验证,跨语言反转也解释得过于仓促。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 870 words

Last Translation Benchmark

📄 不再打总分:给每道翻译难题配一把专用量尺 英文题目:Last Translation Benchmark 一句话:面对饱和的机器翻译基准与失灵的整体打分,这项工作用众包难例加逐题验证规则把评价变成可复现的通过率,最强模型仅约四成通过而人工接近满分,代价是样本偏向刻意难题与英文中心。 标签:#语音翻译 | #大语言模型 | #多语言 | #基准测试 | #多模态模型 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Vilém Zouhar:机构信息未在 arXiv HTML 中可靠披露 Niyati Bafna:机构信息未在 arXiv HTML 中可靠披露 Mukund Choudhary:机构信息未在 arXiv HTML 中可靠披露 Maike Züfle:机构信息未在 arXiv HTML 中可靠披露 Sara Rajaee:机构信息未在 arXiv HTML 中可靠披露 Pinzhen Chen:机构信息未在 arXiv HTML 中可靠披露 Jannis Vamvas:机构信息未在 arXiv HTML 中可靠披露 Sara Papi:机构信息未在 arXiv HTML 中可靠披露 Ona de Gibert:机构信息未在 arXiv HTML 中可靠披露 Bhavitvya Malik:机构信息未在 arXiv HTML 中可靠披露 Eliya Habba:机构信息未在 arXiv HTML 中可靠披露 Orfeas Menis Mastromichalakis:机构信息未在 arXiv HTML 中可靠披露 Patrícia Schmidtová:机构信息未在 arXiv HTML 中可靠披露 Michelle Wastl:机构信息未在 arXiv HTML 中可靠披露 Sheriff Issaka:机构信息未在 arXiv HTML 中可靠披露 Leshem Choshen:机构信息未在 arXiv HTML 中可靠披露 Stella Biderman:机构信息未在 arXiv HTML 中可靠披露 Antonis Anastasopoulos:机构信息未在 arXiv HTML 中可靠披露 Jan Niehues:机构信息未在 arXiv HTML 中可靠披露 Rico Sennrich:机构信息未在 arXiv HTML 中可靠披露 Mrinmaya Sachan:机构信息未在 arXiv HTML 中可靠披露 Ondřej Bojar:机构信息未在 arXiv HTML 中可靠披露 Kenton Murray:机构信息未在 arXiv HTML 中可靠披露 Jörg Tiedemann:机构信息未在 arXiv HTML 中可靠披露 Alham Fikri Aji:机构信息未在 arXiv HTML 中可靠披露 Philipp Koehn:机构信息未在 arXiv HTML 中可靠披露 Christof Monz:机构信息未在 arXiv HTML 中可靠披露 Alexandra Birch:机构信息未在 arXiv HTML 中可靠披露 Sowmya Vajjala:机构信息未在 arXiv HTML 中可靠披露 Chalamalasetti Kranti:机构信息未在 arXiv HTML 中可靠披露 Cristina España-Bonet:机构信息未在 arXiv HTML 中可靠披露 Nobin Sarwar:机构信息未在 arXiv HTML 中可靠披露 David Kaczér:机构信息未在 arXiv HTML 中可靠披露 Shunta Asano:机构信息未在 arXiv HTML 中可靠披露 Malik Marmonier:机构信息未在 arXiv HTML 中可靠披露 Daban Q. Jaff:机构信息未在 arXiv HTML 中可靠披露 Vaisakhi Mishra:机构信息未在 arXiv HTML 中可靠披露 Hend Al- Khalifa:机构信息未在 arXiv HTML 中可靠披露 Gabriele Sarti:机构信息未在 arXiv HTML 中可靠披露 Sourajit Saha:机构信息未在 arXiv HTML 中可靠披露 Nils Rehlinger:机构信息未在 arXiv HTML 中可靠披露 Juan Daniel Cuervo Villa:机构信息未在 arXiv HTML 中可靠披露 Jonathan Tonglet:机构信息未在 arXiv HTML 中可靠披露 Saugata Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Dominik Macháček:机构信息未在 arXiv HTML 中可靠披露 Jagannathan Ramanujam:机构信息未在 arXiv HTML 中可靠披露 Heejin Do:机构信息未在 arXiv HTML 中可靠披露 Zuzana Nadova:机构信息未在 arXiv HTML 中可靠披露 Fred Philippy:机构信息未在 arXiv HTML 中可靠披露 Fabian Retkowski:机构信息未在 arXiv HTML 中可靠披露 Maria Lymperaiou:机构信息未在 arXiv HTML 中可靠披露 Silvia Casola:机构信息未在 arXiv HTML 中可靠披露 Hanna Yukhymenko:机构信息未在 arXiv HTML 中可靠披露 Shubhashis Roy Dipta:机构信息未在 arXiv HTML 中可靠披露 Sangwon Ryu:机构信息未在 arXiv HTML 中可靠披露 Andrés Jerez:机构信息未在 arXiv HTML 中可靠披露 Ron Keinan:机构信息未在 arXiv HTML 中可靠披露 Shuaib Shuaib Yusuf:机构信息未在 arXiv HTML 中可靠披露 Avantica Vempati:机构信息未在 arXiv HTML 中可靠披露 Maria Carmen Staiano:机构信息未在 arXiv HTML 中可靠披露 Sukannya Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Adrian Cosma:机构信息未在 arXiv HTML 中可靠披露 Vitalii Babenko:机构信息未在 arXiv HTML 中可靠披露 Erivan Inan:机构信息未在 arXiv HTML 中可靠披露 Aviral Nigam:机构信息未在 arXiv HTML 中可靠披露 Wafa Aissa:机构信息未在 arXiv HTML 中可靠披露 Fatima Haouari:机构信息未在 arXiv HTML 中可靠披露 Venkata Prasanth Kumar Gummadi:机构信息未在 arXiv HTML 中可靠披露 Mehdi Jafarzadeh:机构信息未在 arXiv HTML 中可靠披露 Valentin Scourneau:机构信息未在 arXiv HTML 中可靠披露 Lukas Edman:机构信息未在 arXiv HTML 中可靠披露 Kaiser Sun:机构信息未在 arXiv HTML 中可靠披露 Shaomu Tan:机构信息未在 arXiv HTML 中可靠披露 Mohammad Sadegh Gholizadeh:机构信息未在 arXiv HTML 中可靠披露 Johannes-Rudolf David:机构信息未在 arXiv HTML 中可靠披露 Dipankar Srirag:机构信息未在 arXiv HTML 中可靠披露 Javier García Gilabert:机构信息未在 arXiv HTML 中可靠披露 Ruta Binkyte:机构信息未在 arXiv HTML 中可靠披露 Manar Ali:机构信息未在 arXiv HTML 中可靠披露 Ana-Maria Bucur:机构信息未在 arXiv HTML 中可靠披露 Sabry E. Farrag:机构信息未在 arXiv HTML 中可靠披露 Youssef Saber:机构信息未在 arXiv HTML 中可靠披露 Yihong Liu:机构信息未在 arXiv HTML 中可靠披露 Jean Maillard:机构信息未在 arXiv HTML 中可靠披露 Cojocaru Nicoleta:机构信息未在 arXiv HTML 中可靠披露 Xiaochuang Yuan:机构信息未在 arXiv HTML 中可靠披露 Sina Ahmadi:机构信息未在 arXiv HTML 中可靠披露 Philipp Mondorf:机构信息未在 arXiv HTML 中可靠披露 Kaustubh Dhole:机构信息未在 arXiv HTML 中可靠披露 Roman Wixinger:机构信息未在 arXiv HTML 中可靠披露 Shenbin Qian:机构信息未在 arXiv HTML 中可靠披露 Manuel Tuor:机构信息未在 arXiv HTML 中可靠披露 Sergey Troshin:机构信息未在 arXiv HTML 中可靠披露 Jonathan Yahav:机构信息未在 arXiv HTML 中可靠披露 Fida Mohammad Thoker:机构信息未在 arXiv HTML 中可靠披露 Amir Arsalan Rezapour:机构信息未在 arXiv HTML 中可靠披露 Lance Calvin Lim Gamboa:机构信息未在 arXiv HTML 中可靠披露 Manon Reusens:机构信息未在 arXiv HTML 中可靠披露 Kätriin Kukk:机构信息未在 arXiv HTML 中可靠披露 Koel Dutta Chowdhury:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把评价从整体印象分改为单样本可判定验证规则,用信息不对称缓解大语言模型(Large Language Model,LLM)既当选手又当裁判的自利偏差,思路干净且可诊断。短板是众包难例天然偏向猎奇、对抗与英文中心分布,对日常翻译质量代表性不足,规则质量与跨语言可比性仍高度依赖人工复核,迁移主张偏强。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1031 words

Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions

📄 暖启动之后,基座模型还记得什么:用隐状态几何找回被遗忘的人名 英文题目:Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions 一句话:针对暖启动语音大模型对命名实体等多词元词的系统性误识,论文用语音模型与自身基座模型的层间角度与幅度几何做门控,只在约 10% 高语义依赖位置做束搜索与概率插值,以约 1.4 倍贪心代价恢复束搜索 96.4% 命名实体增益并在两遍纠错中把平均命名实体错误率从 18.29% 降到 17.69% 且总体词错误率不恶化。 标签:#语音识别 | #多模态模型 | #参数高效微调 | #鲁棒性 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Chan-Jan Hsu:机构信息未在 arXiv HTML 中可靠披露 Jaeyeon Kim:机构信息未在 arXiv HTML 中可靠披露 Chao-Han Huck Yang:NVIDIA Shinji Watanabe:机构信息未在 arXiv HTML 中可靠披露 Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露 Carlos Busso:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把适配后残留的基座大语言模型变成免费校正器,用跨模型隐状态几何做门控,避免全局融合的幻觉灾难,想法干净。短板是所谓自校正高度依赖在 YODAS 上拟合的高斯门限与延续词元规则,换模型换领域就要重标定,完整端到端只验了一个 Phi-4-Multimodal,离通用解码器还差一口气。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 937 words

Local Chord Corruption Is Not Recognizer Replay: Chord-Condition Propagation in MIDI-SAG

📄 集中一击不等于真实部署:局部和弦损坏为何夸大了伴奏生成器的反应 英文题目:Local Chord Corruption Is Not Recognizer Replay: Chord-Condition Propagation in MIDI-SAG 一句话:论文把中央四秒三全音损坏与完整识别器回放放在同一冻结渲染管线里配对比较,发现前者在三类色度特征上都显著放大了条件传播,而匹配时间支撑与关系构成后差距大幅缩小,但全部证据仍限于单一生成器检查点与客观色度指标。 标签:#音乐生成 | #生成模型 | #音乐理解 评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Weiwen Huang:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把局部三全音探针和完整识别器回放钉在同一生成器、同一轨道、同一窗口上硬碰硬,校准思路干净且在两条识别器路径上都复现了,值得肯定。但全部结论拴在一个冻结的 MIDI-SAG 检查点和 30 条配对窗口上,没有跨生成器、没有听感实验,所谓部署行为锚定更像是在自家渲染管线里自证。 📌 核心摘要 本文要回答歌声伴奏生成中局部合成和弦损坏能否代表部署时自动和弦识别输出的真实控制条件。做法是冻结人声轨道、生成器上下文、提示、种子与 12 秒评分窗,只切换和弦条件,对比中央 4 秒三全音替换与完整识别器序列回放经固定 MIDI-SAG 生成器后的输出传播,并用复制支撑掩码与关系构成计数的合成代理做校准。相对已有工作问生成器能否容忍错误和弦,本文转向评估问题,即局部探针与完整操作条件是否等价。在 30 条配对轨道上中央损坏在短时傅里叶变换色度、恒 Q 变换色度、色度能量归一化统计量三视图的变更目标效应与内部输出变化均大于卷积神经网络结合条件随机场完整回放,色度能量归一化统计量目标差距均值 0.462,29 条轨道为正。18 条独立诊断轨道上相对根音替换的整窗输出变化约为同根音质量翻转的 2.88 倍。支撑匹配与构成匹配各自大幅缩小回放距离,二者联合取得最低回放距离,并在深度色度结合条件随机场路径上复现。意义在于给出可复用的分离式评估协议,局部编辑测和声机制,完整回放锚定部署条件。局限是证据限于单一生成器检查点与有限筛选曲库,且以色度族客观特征为主而无主观听感验证。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 787 words

Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations

📄 一次解完还是逐帧死磕:在连续编解码空间里数着步子去噪 英文题目:Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations 一句话:论文把语音增强写成连续编解码隐空间上的掩码自回归块解码,用同一 Conformer 公平比较因果与非因果策略,证明 10 步迭代能在质量与可懂度之间取得可调折中,但随机非因果并未超越因果且高斯假设偏弱。 标签:#语音增强 | #自回归模型 | #语音质量评估 评分:6.4/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Yoto Fujita:机构信息未在 arXiv HTML 中可靠披露 Simon Leglaive:机构信息未在 arXiv HTML 中可靠披露 Laurent Girin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用同一 Conformer、同一 DAC 连续表征和同一训练流程把单步非自回归、块级因果自回归、帧级因果自回归和随机与 oracle 非因果放在同一标尺下比较,权衡曲线干净可信。短板是所谓统一框架只是高斯均值回归下的掩码均方误差重训,原掩码自回归 Masked Autoregressive / MAR 中的扩散头被简化为单高斯,表达力自认较弱;非因果随机策略无实用增益,oracle 增益不可落地,方法增量感偏重。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 971 words

Neural Music Enhancement with Dual Time-Frequency Spectral Representations for Prediction and Discrimination

📄 一个管重建、一个管审美:用两套频谱分工修音乐 英文题目:Neural Music Enhancement with Dual Time-Frequency Spectral Representations for Prediction and Discrimination 一句话:针对在线音乐同时被噪声和混响污染且复调泛音难保真的问题,DSME 让短时傅里叶变换负责可逆的幅度相位重建、让恒 Q 变换负责符合八度感知的判别并辅以色度损失,在单库模拟三任务上取得客观与主观领先,代价是双变换训练更重且野外高采样验证缺席。 标签:#语音增强 | #生成对抗网络 | #音乐生成 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Fei Liu:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用短时傅里叶变换做预测、恒Q变换做判别的分工直觉漂亮且贴合音乐八度结构,色度损失也算对症下药。短板在于生成器基本沿用语音增强套路、判别器与损失的因果证据单薄,消融只做混合失真且部分指标反而倒挂,说服力打了折扣。 📌 核心摘要 非职业设备在非受控环境录制的在线音乐常同时受加性噪声与混响污染,复调、宽动态与严格听感要求使语音增强方法直接迁移效果有限。本文提出双谱音乐增强模型(Dual-Spectrum Music Enhancement,DSME),在生成对抗网络(Generative Adversarial Network,GAN)框架下让生成器预测短时傅里叶变换(Short-Time Fourier Transform,STFT)幅度与相位、让判别器在恒Q变换(Constant-Q Transform,CQT)域做八度分段判别,并辅以色度谱(Chroma Spectrum)损失约束音高与和声一致性。相对已有音乐去噪与复用管线,新意在于把可逆且预测友好的线性谱用于重建、把对数频率且变窗长的音乐友好谱用于对抗引导,二者各司其职。在Medley-solos-DB构建的去噪、去混响与混合失真三项任务上,DSME在频率加权分段信噪比等多项客观指标及混合失真ABX主观偏好上整体优于3个重训基线,混合任务主观偏好领先幅度显著。实际意义是为用户生成内容打标、推荐与转录提供更干净的前端,局限是仅在单数据集模拟失真与窄带采样下验证,对真实野外录音与高采样保真度的外推尚未证明。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 803 words

Opening mind by opening architecture: analysis strategies

📄 打开黑盒之前,先学会搭一间混响小屋 英文题目:Opening mind by opening architecture: analysis strategies 一句话:这篇教学报告以 1962 年 Schroeder 混响为标本,用 Faust 先搭原型再移植到 Csound 并配脉冲响应检验链,唯一的实证只是一张反馈延迟线衰减图,代价是缺参数、缺对比与缺听感验证。 标签:#音频生成 | #端到端 | #开源工具 | #可解释性 评分:4.5/10 | 创新 0.5/2 | 技术严谨 0.8/1.5 | 实验充分 0.2/1.5 | 清晰度 0.6/1 | 影响力 0.3/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Francesco Vitucci:Conservatorio “N. Piccinni” - Bari Giuseppe Silvi:Conservatorio “N. Piccinni” - Bari Daniele Giuseppe Annese:Conservatorio “N. Piccinni” - Bari Francesco Scagliola:Conservatorio “N. Piccinni” - Bari Anthony Di Furia:Conservatorio “N. Piccinni” - Bari 💬 毒舌点评 把 1962 年 Schroeder 混响用 Faust 再抄一遍到 Csound 还能包装成开放架构宣言,教学诚意可嘉,研究增量约等于课程作业。全文无一个可核对的声学数字、无基线、无听感评估,却大谈黑盒批判与创意未来,投顶会只会被以证据不足秒拒。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 760 words