研究条目

H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation

📄 H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation 标签:#音乐理解 #多模态模型 #数据集 #实时处理 7.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐理解 | #多模态模型 | #数据集 #实时处理 | arxiv 👥 作者与机构 第一作者:Aleksandra Teng Ma(Georgia Institute of Technology, Music Informatics Group;论文标注工作完成时所属) 通讯作者:未说明 作者列表:Aleksandra Teng Ma(Georgia Institute of Technology, Music Informatics Group)、Anthony Cammarota(未说明)、Jiayi Wang(未说明)、Alexandria Smith(未说明)、Cheng-Zhi Anna Huang(未说明)、Jeffrey Albert(未说明)、Alexander Lerch(未说明) 💡 毒舌点评 亮点是把自由即兴中“演奏者意图”与“对方感知”的不对称性真正做成了一套双向标注资源,并用简明的 initiate/acknowledge 模型将前序研究中的质性讨论推进到可量化阶段。短板也很明显:离散二元动作空间和 6 小时、5 名演奏者的小样本,使得该数据集目前更像一个精挑细选的交流现象切片,而不是能直接推动生成式模型训练的大规模基准;论文也尚未用任何下游任务证明这套标注对模型改进有实际增益。协同设计过程的质性发现(如纹理优先于音高、沉默预示发起)虽有意思,但本身不构成可检验的方法贡献。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 599 字 阅读 →
研究条目

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

📄 Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation 标签:#语音识别 #语音大模型 #音频理解 #模型评估 #多模态模型 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.6/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #语音大模型 | #音频理解 #模型评估 | arxiv 👥 作者与机构 第一作者:Zhe Liu(Meta Platforms, Inc., Menlo Park, USA) 通讯作者:未说明(论文仅列一名作者,未明确标注通讯作者) 作者列表:Zhe Liu(Meta Platforms, Inc., Menlo Park, USA) 💡 毒舌点评 这篇文章的核心洞察——用被测 LALM 自身的表示作为语义协变量来消除语义混淆——在直觉上是漂亮的,也切中了公平性评估中长期存在的一个难题:外部语义嵌入与目标模型之间可能存在系统性失配。模拟实验干净地展示了在没有真实性别效应但语义难度与性别相关的情况下,传统估计会得到假阳性而本文方法可以修正到接近 1。就这个设计而言,论文确实提供了一个有价值的方法论工具。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 738 字 阅读 →
研究条目

S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling

📄 S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling 标签:#音频检索 #对比学习 #多模态模型 6.0/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频检索 | #对比学习 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Xueqi Wang(College of Computer Science, Inner Mongolia University, Hohhot, China;University of Electronic Science and Technology of China, Shenzhen Campus, Shenzhen, China) 通讯作者:Junfeng Zhao(未说明) 作者列表:Xueqi Wang(College of Computer Science, Inner Mongolia University, Hohhot, China;University of Electronic Science and Technology of China, Shenzhen Campus, Shenzhen, China)、Zhigang Wang(未说明)、Runqing Zhang(未说明)、Zhenqi Jia(未说明)、Junfeng Zhao(未说明) 💡 毒舌点评 S2Dialog 在 DailyTalk 上用专有双分支和跨模态对比学习把 Recall@10 从 25.6% 拉到 50.68%,幅度足够吸引眼球,说明 dialogue-level 建模和 Bottom-K 负样本确实起了关键作用。但方法内核仍是“冻结 backbone + GRU + 对比学习”的经典组合,且只在单个双说话人数据集上验证,关键训练配置和标签一致性都没有交代,结论的泛化性与可复现性仍欠火候。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 733 字 阅读 →
研究条目

Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A TB-CSPN Coordination Architecture with Hardware-Enforced Safety

📄 Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A TB-CSPN Coordination Architecture with Hardware-Enforced Safety 标签:#音视频理解 #多模态模型 #模型评估 4.4/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.5/1.5 | 清晰 0.7/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 4.4/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频理解 | #多模态模型 | #模型评估 | arxiv 👥 作者与机构 第一作者:Uwe M. Borghoff(University of the Bundeswehr Munich, Institute for Software Technology, 85579 Neubiberg, Germany) 通讯作者:Uwe M. Borghoff(University of the Bundeswehr Munich, Institute for Software Technology, 85579 Neubiberg, Germany) 作者列表: Uwe M. Borghoff(University of the Bundeswehr Munich, Institute for Software Technology, 85579 Neubiberg, Germany) Paolo Bottoni(Sapienza University of Rome, Department of Computer Science, 00161 Rome, Italy) Remo Pareschi(SofTware And Knowledge Engineering Lab, STAKE lab, 86100 Campobasso, Italy) 💡 毒舌点评 这篇论文的架构分层思想——语义解释、协调、执行分离,外加独立模拟安全层作为硬性防线——在抵御传感器欺骗和软件失陷方面确有洞察,尤其是“不可逆性随决策层级下移递减”的论证有一定启发性。然而,整篇文章更像一份经过精心包装的蓝图加上一个定性的案例叙事:没有一张真实数据表、没有一条基准对比、没有一个可运行的端到端系统或硬件在环验证,连TB-CSPN的所谓“sub-linear协调开销”也只停留在对旧工作的复述上。读者得到的是一堆token结构、一串协议名称和一个永远不会出错的反事实推演,而看不到系统在真实噪声、延迟和攻击下是否真的不会崩坏。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 286 字 阅读 →
研究条目

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

📄 CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation 标签:#音频分类 #自监督学习 #多模态模型 #Transformer #医疗音频 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频分类 | #自监督学习 | #多模态模型 #Transformer | arxiv 👥 作者与机构 第一作者:Hamza Shafiq(机构未明确;文中“Affiliation: Jun Hu”标注异常) 通讯作者:Aaqib Saeed(Eindhoven University of Technology, Netherlands;a.saeed@tue.nl) 作者列表:Hamza Shafiq(机构未明确)、Hung Manh Pham(Singapore Management University, Singapore)、Bin Zhu(Singapore Management University, Singapore)、Pan Zhou(Singapore Management University, Singapore)、Aaqib Saeed(Eindhoven University of Technology, Netherlands) 💡 毒舌点评 本文把 ECG、PPG、PCG 之间的生理学延迟建模为可学习的一等公民部件,延迟感知 latent prediction 加上两阶段课程在多个下游任务中确实带来显著提升,尤其对过去较弱的心音 PCG 任务贡献清楚。跨模态对齐不是简单拼接,而是通过可微高斯核和生理 anchor 监督把延迟估计嵌入训练目标,这比 naive timestamp alignment 有实质进步。但论文在无代码、无权重、部分关键训练细节未交代的前提下,仍把“统一心脏基础模型”的叙述推得较满,复现性和工业可信度明显打折;PCG 基线选择和统计显著性也仍有可诟病之处。 ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1241 字 阅读 →
研究条目

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

📄 CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model 标签:#语音质量评估 #多模态模型 #大语言模型 #参数高效微调 #教育 7.9/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音质量评估 | #多模态模型 | #大语言模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Nhan Phan(Aalto University, Department of Information and Communications Engineering) 通讯作者:未说明 作者列表: Nhan Phan(Aalto University, Department of Information and Communications Engineering) Ilona Lähteenmäki(University of Helsinki, Department of Education) Anna von Zansen(University of Helsinki, Department of Education) Olli-Pekka Pauna(Aalto University, Department of Information and Communications Engineering) Yaroslav Getman(Aalto University, Department of Information and Communications Engineering) Tamás Grósz(Aalto University, Department of Information and Communications Engineering / Walton Institute, Programmable Autonomous Systems Division) Mikko Kurimo(Aalto University, Department of Information and Communications Engineering) 💡 毒舌点评 该工作的双分支设计把"声学传达"与"文本内容"干净地拆开,并用带容差的辅助损失和 LoRA 适配 Whisper 中间层,提供了比大多数 speech-LLM 系统更少参数的可解释方案,实验透明度较好。然而,其 SOTA 声明建立在 RMSE 相差 0.002 的边际优势上,作者自己都不承认有实质改进,且没有跨数据集验证,距离真正的可泛化口语评估系统还有相当距离。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 885 字 阅读 →
研究条目

Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences

📄 Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences 标签:#音乐生成 #多模态模型 #生成模型 #智能座舱 #实时处理 5.2/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 5.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #多模态模型 | #生成模型 #智能座舱 | arxiv 👥 作者与机构 第一作者:Cosmin Dragoiu(Mercedes-Benz Research & Development North America) 通讯作者:未说明 作者列表:Cosmin Dragoiu(Mercedes-Benz Research & Development North America)、Nooshin Nabizadeh(Mercedes-Benz Research & Development North America) 邮箱信息:cosmin.dragoiu@mercedes-benz.com、nooshin.nabizadeh@mercedes-benz.com 💡 毒舌点评 该工作把 VLM、LLM、生成式音频模型和座舱氛围灯整合成一条完整的车载音乐生成流水线,组件选型基准和 safety check 清单对工业落地有参考价值。但论文最大的硬伤是 VLM 选型结论与自己的基准数据直接矛盾:Gemini 2.5 Flash Lite 延迟更低(0.6s vs 1.2s)、CLIP 分数更高(27.25 vs 26.43),最后却选了 LiquidAI,且正文没有给出任何解释;此外"实时"“个性化"“用户正向反馈"等关键声明缺少端到端延迟、真实车辆测试和任何可量化用户研究支撑。作为顶会投稿,这更像是一份工程 demo 报告而非研究论文。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 729 字 阅读 →
研究条目

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

📄 EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory 标签:#音视频问答 #大语言模型 #多模态模型 #音视频 #基准测试 7.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频问答 | #大语言模型 | #多模态模型 #音视频 | arxiv 👥 作者与机构 第一作者:Le Zhang(University of Michigan, Ann Arbor) 通讯作者:未说明 作者列表:Le Zhang(University of Michigan, Ann Arbor)、Ke Sun(University of Michigan, Ann Arbor) 💡 毒舌点评 这项工作把“索引条目本身不完整”和“检索只看语义、不看时间意图”这两个真实瓶颈讲得很清楚。EgoScheme 在写入索引前用局部多模态上下文消解指代和省略,EgoIndex 用动作、活动、言语、对话四个视图做多粒度划分,EgoRetrv 用软时间衰减和双智能体把“last / usually / this morning”从 prompt 修辞变成检索分数,三个基准上的准确率和证据命中率提升也基本连贯,成本账算得漂亮。短板是,它高度依赖 EgoLife 的人工 dense captions、身份先验,以及 GPT-5.4、Gemini-3.1-Pro 等闭源模型,不少领先数字锁定在特定 API 版本和定价结构上;对语音/音频领域读者来说,它仍更接近一个以视频多模态记忆与检索为中心的系统。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 777 字 阅读 →
研究条目

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

📄 OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 标签:#多模态模型 #大语言模型 #开源工具 7.6/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #多模态模型 | #大语言模型 | #开源工具 | arxiv 👥 作者与机构 第一作者:Bobo Li(National University of Singapore) 通讯作者:Hao Fei(University of Oxford) 作者列表:Bobo Li(National University of Singapore)、Hao Fei(University of Oxford)、Tianjie Ju(National University of Singapore)、Mong-Li Lee(National University of Singapore)、Wynne Hsu(National University of Singapore) 💡 毒舌点评 这是一套完成度较高、由代码强制审计的工程系统,但“感知具有决定性作用”的主张只建立在 5 组 blind 配对和 1 组 vision-off 配对上,个别单元甚至出现负增益(如 Cardiology 的多模态 grounding 为 -1.7)。摘要所谓“七个评估维度均提升”指宏平均,而非每个案例都改善;同时,LLM 生成的论文仍由 LLM 裁判评分,缺少人类领域专家验证。它更像可扩展的系统演示,而非已经充分验证的科学结论。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 806 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-14

语音/音乐/音频论文速递 2026-08-14 共分析 12 篇论文 ⚡ 今日概览 ✅ 筛选入选 12 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #多模态模型 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ #语音属性识别 1篇 █ #语音质量评估 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(12 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward… 8.2分 前25% 方法研究 #音频生成 🥈 CASA: Content-Acoustic Speaking Assessment with Speech… 7.9分 前25% 方法研究 #语音质量评估 🥉 Comparative Analysis of Multilingual Pre-trained… 7.6分 前25% 数据集与基准 #语音识别 4. OmniScientist: An Omni-Modal Omni-Discipline AI… 7.6分 前25% 系统技术报告 #多模态模型 5. Alignment Drift in Single-Model Speculative Decoding… 7.3分 前50% 方法研究 #语音识别 6. EgoCITE: Context-Augmented Indexing and Time-Aware… 7.2分 前50% 系统技术报告 #音视频问答 7. CardioState-JEPA: Delay-Aware Cross-Modal Learning of… 7.2分 前50% 方法研究 #音频分类 8. FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme… 7.0分 前50% 系统技术报告 #语音合成 9. Motor, Cognitive, or Corpus? What Survives Cross… 6.1分 前50% 应用研究 #语音属性识别 10. Evaluating Pre-trained Speech Encoders for Spontaneous… 6.0分 前50% 方法研究 #语音伪造检测 11. HybridSB-MoE: Dual-Domain Schrödinger Bridges with… 5.9分 前50% 方法研究 #语音增强 12. Drive-to-Music: Context-Aware Generative Audio for In… 5.2分 后50% 系统技术报告 #音乐生成 📋 论文列表 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ...

 · 更新于 2026-09-05 · 约 12 分钟 · 2527 字 阅读 →
研究条目

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

📄 CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation 标签:#语音合成 #流匹配 #歌唱生成 #多模态模型 #语音克隆 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.6/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.0/10 | 前50% | 文档类型:模型报告 | 评分置信度:中 | #语音合成 | #流匹配 | #歌唱生成 #多模态模型 | arxiv 👥 作者与机构 第一作者:Haowei Lou(UNSW Sydney) 通讯作者:未说明 作者列表:Haowei Lou(UNSW Sydney)、Hye-Young Paik(UNSW Sydney)、Dai Jia(Dolby Laboratories)、Kai Li(Dolby Laboratories)、Lina Yao(UNSW Sydney) 💡 毒舌点评 亮点是统一的 content/prosody/style 分解与 frame-level alignment 确实在风格相似度和 F0 控制指标上明显超过 Vevo2、IndexTTS 等强基线,且 43.51M 参数、RTF 0.04 的效率表现干净。短板在于论文声称支持十余种任务,但真正有数据支撑的主要只是 TTS/TTSV;TTS MOS 又低于 IndexTTS、F5-TTS 等基线,所谓 comparable quality 更像是有保留的自我评价,而开源与关键训练细节的缺失进一步削弱可信度。 ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1178 字 阅读 →
研究条目

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

📄 Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA 标签:#音视频问答 #多模态模型 #音频大模型 #参数高效微调 #鲁棒性 6.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频问答 | #多模态模型 | #音频大模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Maryam Dehdashti(Inference Matter Labs) 通讯作者:Maryam Dehdashti(Inference Matter Labs;dehdashti@inferencematter.ai) 作者列表:Maryam Dehdashti(Inference Matter Labs) 💡 毒舌点评 这篇论文最有价值的不是又一个 Qwen 变体,而是用受控消融把“音频表示是否保留局部时间细节”与 AVQA 精度强关联起来,并且单卡约 5 小时的可复现成本很吸引人。短板也同样突出:所有结论锁死在 MUSIC-AVQA 的非标准可用视频子集上,Whisper vs PANNs 的 26 点差距被架构、预训练和池化差异共同污染,作者自己也承认这不是干净的因果实验;此外,AVQA 微调会牺牲 ASR 能力,说明得到的“多模态能力”在任务迁移和通用性上仍有明显边界。因此这篇工作更像一次有洞察的系统层观察和务实的模块化适配,而非方法学突破。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 1043 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-13

语音/音乐/音频论文速递 2026-08-13 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 4篇 ████ #语音增强 3篇 ███ #音视频生成 2篇 ██ #音乐生成 1篇 █ #音视频问答 1篇 █ #音频事件检测 1篇 █ #音频生成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM 8.0分 前25% 方法研究 #音频生成 🥈 UniSwap: Streaming Audio-Visual Identity Swapping for T 7.8分 前25% 方法研究 #音视频生成 🥉 Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot 7.7分 前25% 系统技术报告 #语音合成 4. The SLT 2026 SmartGlasses Challenge: Benchmarking Egoce 7.5分 前25% 数据集与基准 #语音识别 5. Dialogue-Aware Video-to-Music Generation Using Public D 7.1分 前50% 数据集与基准 #音视频生成 6. Rethinking Language Model-Based Generative Speech Enhan 7.1分 前50% 方法研究 #语音增强 7. Easper: An Accessible ASR Pipeline for Language Documen 7.0分 前50% 系统技术报告 #语音识别 8. On-Policy Self-Distillation for Multi-Dialect ASR: Mast 7.0分 前50% 方法研究 #语音识别 9. Luna-TTS Family Technical Report 6.9分 前50% 系统技术报告 #语音合成 10. Do Text-to-Music Models Really Follow Instructions? A C 6.8分 前50% 数据集与基准 #音乐生成 11. Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-V 6.6分 前50% 方法研究 #音视频问答 12. DonorRank: Donor Language Selection for Low-Resource Cr 6.6分 前50% 方法研究 #语音识别 13. RT-SEMamba: Real-Time Speech Enhancement Mamba via Prog 6.6分 前50% 方法研究 #语音增强 14. Phoenix TTS: High-Fidelity Synthesis and Voice Conversi 6.5分 前50% 系统技术报告 #语音合成 15. MuseCritic: Learning Multi-Aspect Song Rewards through 6.5分 前50% 方法研究 #音频质量评估 16. Robust Multi-Tier Infant-Centered Audio Understanding w 6.0分 前50% 方法研究 #音频事件检测 17. CookVoice: Unified Framework for Style Controllable Mul 6.0分 前50% 模型报告 #语音合成 18. Deep Learning Based Relative Transfer Matrix Estimation 5.1分 后50% 方法研究 #语音增强 📋 论文列表 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

 · 更新于 2026-09-05 · 约 20 分钟 · 4212 字 阅读 →
研究条目

Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

📄 Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence 标签:#音视频生成 #多模态模型 #语音合成 #扩散模型 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频生成 | #多模态模型 | #语音合成 #扩散模型 | arxiv 👥 作者与机构 第一作者:Haoyu Zhang(The Chinese University of Hong Kong, Shenzhen;脚注说明工作完成于 LIGHTSPEED 实习期间) 通讯作者:Tianshu Yu(The Chinese University of Hong Kong, Shenzhen)、Yiwen Guo(Independent Researcher) 作者列表:Haoyu Zhang(The Chinese University of Hong Kong, Shenzhen)、Zhipeng Li(LIGHTSPEED)、Xiaoying Tang(The Chinese University of Hong Kong, Shenzhen)、Tianshu Yu(The Chinese University of Hong Kong, Shenzhen)、Yiwen Guo(Independent Researcher) 💡 毒舌点评 VTP+多码本语音单元+Prefix Streaming 的组合在系统层面确实打通了“对话→语音→视频”的完整链路,工程完整度明显高于同类工作,这是值得肯定的。但审稿人最想追问的是:所有关键视频条件都是自动标注或教师模型生成的,VTP first-frame grounding 只有 43%,你如何保证这个“视觉规划”不是模型自圆其说的幻觉?E2E RTF 1.293、首个视频块 3.14 秒后才出,恐怕只能叫“增量生成”而非“实时交互”,这个表达上的克制是聪明的,但离真正的交互体验还很远。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 865 字 阅读 →
研究条目

MazzikaAI: A knowledge-based performance-to-prompt compiler for real-time Arabic maqam accompaniment with a streaming text-to-music model

📄 MazzikaAI: A knowledge-based performance-to-prompt compiler for real-time Arabic maqam accompaniment with a streaming text-to-music model 标签:#音乐生成 #提示学习 #多模态模型 6.6/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #提示学习 | #多模态模型 | arxiv 👥 作者与机构 Jiaxin Du, Boulbaba Abdeljaouad, Yong Zhuang, Haoyu Li;单位均为 Grand Valley State University(美国密歇根州阿伦代尔)。论文标注投稿至 Expert Systems with Applications。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 519 字 阅读 →
研究条目

Rationale-Guided Learning for Multimodal Emotion Recognition

📄 Rationale-Guided Learning for Multimodal Emotion Recognition 标签:#语音情感识别 #对比学习 #多模态模型 7.2/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #对比学习 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Sujung Oh(按作者列表顺序;论文未单独标注) 通讯作者:未说明(论文未提供联系邮箱或通讯作者标注) 作者列表:Sujung Oh、Jung Uk Kim、Sangmin Lee 机构:未说明(论文未提供作者单位信息) 💡 毒舌点评 把MLLM离线生成的结构化rationales作为中间监督信号,以零推理开销提升多模态对话情感识别性能,这个思路有认知科学依据,实验也做到了IEMOCAP和MELD上的SOTA。但rationales是在prompt中给定ground-truth标签后生成的"事后解释",存在明显的信息泄漏与因果幻觉风险;MELD上的优势只有0.06个W-F1点,基本处于噪声范围;且代码、模型和数据均未公开,复现门槛很高。 📌 核心摘要 该论文针对多模态对话情感识别(MERC)中现有方法将情感识别视为直接的输入-输出映射、忽略人类因果推理过程的问题,提出Rationale-Guided Learning(RGL)框架。RGL基于双过程理论将情感推理分解为直觉(Intuitive)、上下文(Contextual)和整合(Integrative)三个侧面,利用GPT-4o离线生成结构化rationales并编码为rationale banks,训练时通过对比学习将模型的视觉、文本和融合特征分别与三类rationale对齐。与已有方法的关键区别在于:MLLM仅在离线准备阶段使用一次,最终模型在训练和推理阶段都不需要运行MLLM,且显式建模了"感知→情境分析→综合判断"的推理路径。在IEMOCAP上W-F1达到73.68、Acc达到73.51,在MELD上W-F1达到67.43、Acc达到68.31,均超越现有SOTA。消融实验表明上下文rationale损失贡献最大,去掉后W-F1降至68.78。主要局限是rationales依赖MLLM在给定ground-truth标签后生成,存在标签泄漏风险,且未开源代码、模型与数据。 🔗 开源详情 代码:论文中未提及代码链接,未提供GitHub、HuggingFace、ModelScope、项目主页、Demo等地址。 模型权重:论文未提及RGL模型权重的公开下载链接;仅说明使用GPT-4o、BGE-large-en-v1.5、ViT-base、RoBERTa-large、HuBERT-base等预训练模型,但未给出这些模型权重的下载地址。 数据集:论文使用IEMOCAP和MELD两个基准数据集,但未提供具体获取URL、开源协议或下载方式。 Demo:论文中未提及在线演示地址。 复现材料:论文未提及完整复现材料;仅提供部分实现细节:AdamW优化器、学习率\(1\mathrm{e}{-5}\)、batch size 4、温度系数\(\tau=0.07\)、权重系数\(\lambda=0.3\)、\(K=128\),以及使用TalkNet-ASD进行说话人面部检测。未提供配置文件、检查点或附录代码。 论文中提及的预训练模型/工具: GPT-4o:用于离线生成rationale的多模态大语言模型;论文未提供链接。 BGE-large-en-v1.5:用于将rationale文本编码为向量的预训练文本嵌入模型;论文未提供链接。 ViT-base:视觉模态编码器;论文未提供链接。 RoBERTa-large:文本模态编码器;论文未提供链接。 HuBERT-base:音频模态编码器;论文未提供链接。 TalkNet-ASD:用于检测当前说话人面部的工具;论文未提供链接。 FacialMMT:论文中提及的实验设置参考方法;论文未提供链接。 DialogueRNN、DialogueTRM、MM-DFN、SCFA、EASUM、TelME、HAUCL、BIG-FUSION、DIB-HGCN、MAGTKD等为对比方法,论文中未描述为开源项目,也未提供链接。 🏗️ 方法概述和架构 RGL整体分为两个阶段:离线rationale生成与编码、端到端训练。该方法不是端到端联合优化MLLM生成过程,而是"预生成监督信号+模型训练"的两阶段框架。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 294 字 阅读 →
研究条目

Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition

📄 Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition 标签:#语音识别 #语音大模型 #自监督学习 #多模态模型 #参数高效微调 6.1/10 | 创新 1.4/2 | 严谨 0.9/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #语音大模型 | #自监督学习 #多模态模型 | arxiv 👥 作者与机构 第一作者:Gaopeng Xu(阿里巴巴,Qwen 业务部) 通讯作者:未说明 作者列表:Gaopeng Xu(阿里巴巴,Qwen 业务部)、Zhenyu Wang(阿里巴巴,Qwen 业务部)、Zheng Xue(阿里巴巴,Qwen 业务部)、Yinfeng Xia(阿里巴巴,Qwen 业务部)、Haitao Yao(阿里巴巴,Qwen 业务部) 💡 毒舌点评 用 F0 缺失作为耳语识别不确定性的物理信号,并把“不确定时宁可不转录”的可靠性问题引入 Audio-LLM 解码,这个切入点是有价值的。但论文的核心卖点是“模型学会了感知不确定性”,却没有任何直接证据证明 UPM 输出的置信度真的对应信号质量;幻觉评测集自建且几乎未描述,英文基准又存在数据集标识不清的问题。整体像一篇有潜力的技术报告初稿,距离顶会级别的论证密度和证据链完整性还有明显差距。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 632 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-12

语音/音乐/音频论文速递 2026-08-12 共分析 27 篇论文 ⚡ 今日概览 📥 抓取 27 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 4篇 ████ #语音识别 4篇 ████ #音乐理解 4篇 ████ #扩散模型 1篇 █ #端到端 1篇 █ #语音分离 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(27 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 DuplexWorld: Can voice agents help you get through the 8.5分 前25% 数据集与基准 #语音交互 🥈 A Dataset and Benchmark for Optical Music Recognition o 8.5分 前25% 数据集与基准 #端到端 🥉 Measuring Cross-Cultural Style Diffusion Through Era Cl 8.3分 前25% 方法研究 #音乐理解 4. Training Set Synthesis for Bioacoustic Denoising: A Cas 8.0分 前25% 应用研究 #语音增强 5. Modeling and Interpreting Correlations, Null Distributi 8.0分 前25% 方法研究 #音频理解 6. Seeds Before Objectives: Rethinking Evaluation for Low- 7.9分 前25% 数据集与基准 #语音识别 7. Beyond Dry References: Learning Relative Audio Effects 7.7分 前25% 方法研究 #音乐理解 8. MAJEPPA: Morphing and Assessing in a Unified Piano Perf 7.5分 前25% 方法研究 #音乐理解 9. DIY e-HandPan: A new DIY Low-Cost Handpan Interface bas 7.2分 前50% 系统技术报告 #音频交互 10. Rationale-Guided Learning for Multimodal Emotion Recogn 7.2分 前50% 方法研究 #语音情感识别 11. The GENEA Challenge 2026: A Large-Scale Disentangled Ev 7.2分 前50% 数据集与基准 #语音交互 12. Beyond Naturalness: Probing Automated Text-To-Speech Ev 7.1分 前50% 数据集与基准 #语音质量评估 13. In Defense of Using Worst-case Privacy Disclosure as Pr 7.1分 前50% 理论研究 #说话人验证 14. Pitch Contour Tokenization using VQ-VAE and Its Applica 7.1分 前50% 方法研究 #音乐理解 15. VoxSumm: A Multilingual Corpus of Long-Form Spoken News 6.9分 前50% 数据集与基准 #语音翻译 16. myMediWhisper: Construction of Burmese Medical Speech C 6.7分 前50% 数据集与基准 #语音识别 17. MazzikaAI: A knowledge-based performance-to-prompt comp 6.6分 前50% 系统技术报告 #音乐生成 18. ASR-Roundtrip Evaluation Can Mask Context- and Conventi 6.5分 前50% 方法研究 #语音合成 19. Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with 6.5分 前50% 系统技术报告 #音视频生成 20. TimeRoute: Time-Aware Modality Routing and Diffusion fo 6.5分 前50% 方法研究 #扩散模型 21. X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint 6.4分 前50% 方法研究 #语音交互 22. Edge Phoneme Recognition for Children’s Speech through 6.3分 前50% 模型报告 #语音识别 23. DINO-A: Adapting Self-Distillation Vision Transformers 6.2分 前50% 方法研究 #音频分类 24. Whisper-Aware LLM: Self-Supervised Uncertainty Learning 6.1分 前50% 方法研究 #语音识别 25. Never Stop Speaking: a Denial-of-Service Attack on End- 5.4分 后50% 方法研究 #语音交互 26. BiTSE: Binaural Target Speaker Extraction in Noisy Mult 5.0分 后50% 方法研究 #语音分离 27. Monophonic Audio Synthesizer Using FPGAs 4.2分 后50% 系统技术报告 #音频生成 📋 论文列表 🥇 DuplexWorld: Can voice agents help you get through the day? 8.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

 · 更新于 2026-09-05 · 约 24 分钟 · 4909 字 阅读 →
研究条目

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

📄 Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs 标签:#模型剪枝 #多模态模型 #高效推理 #模型压缩 8.4/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.4/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #模型剪枝 | #多模态模型 | #高效推理 #模型压缩 | arxiv 👥 作者与机构 第一作者:Kyeongyoon Lee(标注机构1,论文未提供机构名称) 通讯作者:未说明 作者列表:Kyeongyoon Lee(机构1)、Hongyeob Kim(机构1)、Youngeun Kim(机构2)、Sungeun Hong(机构1) 说明:所有机构仅以编号形式出现,论文原文未给出机构名称。 💡 毒舌点评 把“何时压缩”和“压缩哪个模态”拆开处理是本文最值得肯定的洞察:音频保留到查询条件化之后再用 query attention 剪枝,确实比所有 pre-LLM 统一压缩更合理。短板也很明显:所有对比都限定在 training-free 方法,缺少与可学习压缩/蒸馏方案的对照;“code will be released upon acceptance”意味着当前无法直接核验实现细节。此外,全部实验只在 Qwen2.5-Omni 单一骨干上进行,跨架构泛化尚未验证。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 915 字 阅读 →
研究条目

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

📄 From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios 标签:#音视频语音识别 #多模态模型 #大语言模型 #模型比较 #会议转录 6.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.6/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频语音识别 | #多模态模型 | #大语言模型 #模型比较 | arxiv 👥 作者与机构 第一作者:Thai-Binh Nguyen(Karlsruhe Institute of Technology) 通讯作者:未说明 作者列表:Thai-Binh Nguyen(Karlsruhe Institute of Technology)、Zhaolin Li(Karlsruhe Institute of Technology)、Jan Niehues(Karlsruhe Institute of Technology)、Alexander Waibel(Carnegie Mellon University;论文中 Waibel 的邮箱显示为 zhaolin.li@kit.edu,与第二作者重复,疑似论文排版错误) 💡 毒舌点评 这篇 CHiME-9 MCoRec 系统分析把"鸡尾酒会"问题拆成目标说话人转录与对话聚类两条设计轴,给出"重叠率不能单独解释性能差异"这一反直觉结论,并指出 LLM 语义聚类在高 WER 下仍保持高 F1,对后续系统设计有实际参考价值。 但所有参赛系统都以匿名编号出现且 system paper 尚未发布;各系统在 ASD、AVTSE、AVSR、聚类多个维度上同时变化,文中对"什么策略最有效"的归因停留在相关性层面,无受控消融、无统计显著性检验,session 案例分析样本量也很小。作为挑战赛技术分析报告,定位合格,但难以支撑强因果结论。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 895 字 阅读 →