共分析 19 篇论文
⚡ 今日概览
✅ 筛选入选 19 篇 → 🔬 深度分析完成
🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #音乐理解 | 2 篇 | ██ |
| #音频分类 | 2 篇 | ██ |
| #音频问答 | 2 篇 | ██ |
| #全双工语音交互 | 1 篇 | █ |
| #强制对齐 | 1 篇 | █ |
| #文本到语音 | 1 篇 | █ |
| #病理语音评估 | 1 篇 | █ |
| #联合声音事件检测定位 | 1 篇 | █ |
📊 论文评分排行榜(19 篇,按分数降序)
📋 论文列表
🥇 长音频先检索再作答:混合检索与双模态证据如何分工
英文题目:HARP: Agentic Hybrid Retrieval and Analysis for Long-Form Audio
标签:#音频问答 | #检索增强 | #长音频处理 | #基准测试 | #音频大模型
评分:7.8/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Chin-Jou Li:Carnegie Mellon University Hippocratic AI
- Masao Someki:Carnegie Mellon University Hippocratic AI
- Woojeong Jin:Carnegie Mellon University Hippocratic AI
- Yashish M. Siriwardena:Carnegie Mellon University Hippocratic AI
- Tanmay Laud:Carnegie Mellon University Hippocratic AI
- Shanil Puri:Carnegie Mellon University Hippocratic AI
- Shinji Watanabe:Carnegie Mellon University Hippocratic AI
📌 核心摘要
长音频分析输入为数十分钟录音加文本问题与可选音频线索,输出为答案及其支撑依据,难点是语义与声学证据分散在长时程中且情感韵律等声学细节难以文本化。HARP先离线切分录音并抽取转录、说话人与音频嵌入等元数据建立索引,为后续检索提供可查结构。智能体再根据问题生成含时间窗与工具调用的检索计划,并用关键词加向量混合检索取出Top-3片段,使计划输出直接决定检索输入。最后生成器基于元数据或波形证据联合生成答案与依据,使检索到的证据直接进入推理。该机制把规划、检索与生成分离,使检索策略与证据模态可独立切换,而非绑定单一表示。在情感、临床与歌曲三域基准下,混合检索多模态证据的答案准确率为61.6%,高于关键词检索元数据证据的答案准确率51.9%。其适用边界是仅验证Qwen3-Omni单模型族且医疗对话为合成录音,开放定位与多事件聚合仍高度困难而受限。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/chinjouli/harp — 链接可访问(HTTP 200)
复现相关资源:https://github.com/chinjouli/harp — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 英语向二十八语的反向补位:CVSS-X 以合成并行语音扩大翻译方向
英文题目:CVSS-X: A Multilingual Speech-to-Speech Translation Corpus for 28 Languages
标签:#语音翻译 | #数据集构建 | #多语言 | #数据集
评分:7.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Lucas Rafael Stefanel Gris:Federal University of Goiás, Goiânia, Brazil
- Alef Iury Siqueira Ferreira:Federal University of Goiás, Goiânia, Brazil
- Frederico Santos de Oliveira:Federal University of Mato Grosso, Cuiabá, Brazil
- Augusto Seben da Rosa:São Paulo State University, São Paulo, Brazil
- Alexandre Costa Ferro Filho:Federal University of Goiás, Goiânia, Brazil
- Arlindo Rodrigues Galvão Filho:Federal University of Goiás, Goiânia, Brazil
- Anderson da Silva Soares:Federal University of Goiás, Goiânia, Brazil
📌 核心摘要
语音到语音翻译(Speech-to-Speech Translation, S2ST)需将英语口语转为多语种目标语音,难点在于平行语音稀缺且多对多对齐成本极高,非英语方向尤其缺乏可训练数据。该工作以英语常识语音(Common Voice)真实录音为源,先用神经机器翻译生成 28 语种平行文本,再用多语种语音合成统一合成为目标语音,其中正则变体使用固定男女声,迁移变体通过跨语种音色克隆保留源说话人。与仅覆盖译入英语的 CVSS 相比,关键机制差异是用已验证平行文本保证句级完美对齐,并用单一可克隆合成器实现跨语系规模化扩展。在开发集每语种 200 条抽样的 Whisper large-v3 回译评测中,正则变体在罗曼斯语族达到 ASR-BLEU 90.3,显著高于印欧伊朗语族的 63.7,显示合成保真度随语系分化。该结论仅适用于合成语音可懂度与自然度层面,未验证真实说话人跨语训练的有效性与人耳感知一致性。原文未披露合成阶段训练、推理与部署成本,仅披露翻译阶段单卡约 11 小时。
🔗 开源资源
代码相关资源:https://github.com/ErmisAI/XVSS-X — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/lgris/XVSS-X — 暂时无法访问
第三方资源:https://elevenlabs.io — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 一个小模型装不下两种语言:希腊-英语生产识别的步数前沿与绕行办法
标签:#语音识别 | #模型集成 | #多语言 | #语言识别 | #会议转录
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.4/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Christos Petrocheilos:机构信息未在 arXiv HTML 中可靠披露
- Cleopatra Papadopoulou:机构信息未在 arXiv HTML 中可靠披露
- Chris Porikis:机构信息未在 arXiv HTML 中可靠披露
- Ioakeim Perros:机构信息未在 arXiv HTML 中可靠披露
- Ayoub Kirouane:机构信息未在 arXiv HTML 中可靠披露
- Themistoklis Nikolis:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该系统输入为希腊语与英语混杂的电话与会议音频,输出为转写文本与语言归属判定,难点在于希腊语资源稀缺、语码切换频繁且噪声与重叠语音严重。方法链分为四步,数据管线先清洗与校准音频质量并组装双语均衡池,其输出进入紧凑双语模型与大会议模型的并行迭代训练,训练后冻结的异构模型再经混淆网络投票或逐句仲裁器组合,最后由语音活动检测与短语过滤等解码干预抑制幻觉。相对已有单模型微调的关键机制差异在于用路由与投票绕开容量竞争前沿,而非继续搜索训练混合比。与单模型相比,三模型投票将生产门覆盖从至多 7 of 9 提升至 9 of 9,重叠语音词错误率在 AMI 会议语料上从 53.35% 降至 37.87%。结论仅适用于所测模型规模与训练配置,不外推至更大容量、辅助目标或未测调度策略,且重叠增益只在英文会议上验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://huggingface.co/spaces/KIEFERSA/sophea-asr-k1-docs — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 记住同一条船:UniqueShip 用船舶身份隔离重测水下舰船分类
英文题目:UniqueShip: Mitigating Data Leakage in Acoustic Ship Classification Benchmark Datasets
标签:#音频分类 | #基准设计 | #数据集 | #基准测试
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Connor Hashemi:机构信息未在 arXiv HTML 中可靠披露
- Trevor Stout:机构信息未在 arXiv HTML 中可靠披露
- Anthony Hoogs:机构信息未在 arXiv HTML 中可靠披露
- Jason Parham:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
水下声学目标识别以被动水听器录音为输入,输出舰船类别,难点在于同一舰船连续辐射噪声强自相似,随机切分极易让模型记住个体而非类别。作者先融合Strait of Georgia区域双水听器2016年5月至2023年11月录音与船舶自动识别系统数据并线性插值定位,其定位输出进入下一步区间筛选。接着按单船在2 km内含半径内且4 km内无第二船、无船进入8 km则判为背景的规则抽取有效区间,得到干净的舰船与背景片段。最后按船只身份分组与背景按天分组形成无泄漏划分,直接产出训练验证测试集以评估对未见个体的泛化。相对DeepShip与VTUAD的随机切分,该机制关键差异是强制同船不跨划分,实际意义是避免记忆虚高而反映真实部署。在DeepShip基准评测设置下,无泄漏划分的准确率为0.588±0.077,低于随机泄漏划分的准确率0.710±0.029。消融进一步显示船只数翻倍带来2.4至2.6个百分点提升而时长翻倍仅带来0.8至1.3个百分点提升。该结论适用边界仅限单船主导且2 km内含半径内分类,多船重叠与跨海域迁移等尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 比较分最难,口音比说话人难:VoiceMOS 2026 三赛道技术解读
英文题目:The VoiceMOS Challenge 2026: Evaluating Speech Enhancement, Emotional TTS and Accented TTS Systems
标签:#语音质量评估 | #基准设计 | #语音 | #基准测试
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Wen-Chin Huang:机构信息未在 arXiv HTML 中可靠披露
- Wei Wang:机构信息未在 arXiv HTML 中可靠披露
- Marvin Sach:机构信息未在 arXiv HTML 中可靠披露
- Xiaoxue Gao:机构信息未在 arXiv HTML 中可靠披露
- Nicholas Sanders:机构信息未在 arXiv HTML 中可靠披露
- Erica Cooper:机构信息未在 arXiv HTML 中可靠披露
- Toda Tomoki:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文针对人工听音主观评价成本高且难以规模化预测语音质量的问题,输入为增强语音、情感TTS与口音编解码合成样本,输出为ACR绝对分、CCR比较分及自然度与情感相似度等多维MOS,难点在于跨系统跨说话人泛化、情感感知的强主观性与口音细粒度判别。方法链分三步:首先按三赛道构建说话人与系统不相交的训练开发测试划分并统一听音评分协议,前一步的划分与标签直接作为后续建模与评测的输入。其次为各赛道提供零样本或微调基线以锚定难度,基线预测分数进入下一步作为被超越的参照。最后汇总排行榜、优胜系统问卷与听众建模集成等共性技术,形成对未来方向的归纳。与上届扩展到音乐与通用音频相比,关键机制差异是回归聚焦语音并同时覆盖绝对评价与成对比较范式,实际意义在于更直接对标增强与合成系统的工程选型。在情感TTS任务评测下,QMOS条件的UTT-SRCC指标为0.785,高于EMOS条件的UTT-SRCC指标0.758。结论的适用边界在于增强比较预测明显更难且口音相似度难于说话人相似度,复杂集成与听众建模的鲁棒性与可解释性尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/voicemos-challenge/vmc2026-baselines — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/urgent-challenge/urgent-mos-f1c1m5dcorpus — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/speechbrain/spkrec-ecapa-voxceleb — 链接可访问(HTTP 200)
复现相关资源:https://www.codabench.org/competitions/16419/ — 链接不可用(HTTP 404)
复现相关资源:https://sites.google.com/view/voicemos-challenge/voicemos-challenge-2026 — 链接可访问(HTTP 200)
第三方资源:https://ai.google.dev/gemini-api/docs/models/gemini-3-flash-preview — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 把多轮对话压缩成概念令牌,再用帧对齐参考流守住不改的部分
英文题目:AURA: Unified Multimodal Framework for Conversational Music Editing
标签:#音乐生成 | #多模态学习 | #音乐 | #LoRA
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Quoc-Huy Trinh:机构信息未在 arXiv HTML 中可靠披露
- Minh-Van Nguyen:机构信息未在 arXiv HTML 中可靠披露
- Debesh Jha:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
对话式音乐编辑以多轮对话历史、可选图像与参考音频为输入,输出契合累积意图的编辑后音频,难点在于消解省略指代并在多轮演进中保持未编辑内容稳定。AURA先用Qwen2.5-Omni的Thinker部件联合编码全部历史与多模态输入,将编辑操作、目标乐器与约束蒸馏为9个EDIT_CONCEPT概念令牌隐状态。接着概念投影器与音频投影器分别把概念状态与冻结EnCodec提取的帧级参考特征映射到MusicGen条件空间,前者决定改什么,后者提供需保留的帧对齐依据。然后概念到音频模块以双向对齐融合与FiLM调制注入参考结构,再以共享概念交叉注意力注入语义记忆,驱动冻结的MusicGen-medium解码器以残差方式学习编辑增量。与每轮独立重写的单轮指令编辑器不同,该设计把理解与生成解耦并缓存参考流,使对话历史直接决定编辑状态并抑制误差累积。在MoisesDB域外移除任务评测下,AURA的指标FAD为0.72,低于Instruct-MG的指标FAD 3.55。其结论适用边界受限于生成式解码器本质,音轨提取仍不及专用分离模型,长程多轮一致性与开放乐器泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://openrb-lab.github.io/AURA-demo/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 先看到的不等于已证实:用未来可验声明管住流式音视记忆
标签:#音视频问答 | #强化学习 | #音视频 | #流式处理 | #基准测试
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Enjun Du:The University of Hong Kong;The Hong Kong University of Science and Technology (Guangzhou)
- Siyi Liu:The Hong Kong University of Science and Technology (Guangzhou)
- Ziyu Zheng:University of Sussex
- Jingyu Li:LIGHTSPEED
- Yiwen Guo:Independent ResearcherProject page:
- Yongqi Zhang:The Hong Kong University of Science and Technology (Guangzhou)
- Difan Zou:The University of Hong Kong
📌 核心摘要
流式全模态问答的输入是截至当前决策块为止的视频分块与同步音频,输出是在何时回答与回答什么,实际难点在于视觉线索常早于完整话语或声音事件成熟,若其被直接作为事实写入记忆,后续音频矛盾到达后仍会被沿用形成早熟跨模态承诺。OST首先以分离存储音频与视觉证据的结构化全模态状态组织已见证据,其输出进入预测器生成带验证模态与未来验证区间的待定断言。验证器在区间关闭时用指定模态的保留证据对断言进行核查,驳斥时经谱系衰减削弱依赖该断言的祖先状态并按判决条件重解码修正状态。修正后的状态进入答案门控,若支撑充分则作答否则继续等待,从而把未决解释与其未来检验及依赖关系显式绑定,使迟到音频可追溯修正。在SOVBench-O音视频上下文基准下,OST的平均准确率为87.8%,高于StreamOV的平均准确率81.6%。与直接写入记忆的流式基线不同,该机制不把早期视觉猜测固化为事实,而是保留待定与可证伪属性,其实质意义在于以未来可观测证据约束当前决策并保留纠错路径。该结论的适用边界受限于冻结Qwen3-Omni-30B-A3B骨干与短至中时长流式问答及未来窗口可观测假设,原文未披露训练、推理或部署成本。
🔗 开源资源
复现相关资源:https://enjundu.com/blog/ost/ — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/papers/2609 — 链接不可用(HTTP 401)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 在识别与切分之间加状态:用有序子音素与最优传输恢复帧级证据
英文题目:Subphonetic Acoustic Modeling via Optimal Transport for Pronunciation Assessment
标签:#强制对齐 | #CTC | #语音识别 | #语音 | #语音学与音系
评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Haopeng Geng:机构信息未在 arXiv HTML 中可靠披露
- Jiun-Ting Li:机构信息未在 arXiv HTML 中可靠披露
- Daisuke Saito:机构信息未在 arXiv HTML 中可靠披露
- Nobuaki Minematsu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
发音评估需从连续语音同时恢复实际发音的音素序列、音素边界与音素内部声学偏离,难点在于CTC识别灵活但后验稀疏峰化而丢失边界,文本相关强制对齐又依赖参考文本而无法做无参考分析。可训练自监督语音编码器先提取帧表示并由音素级CTC头学习单音素序列,其后验经特征级线性调制注入子音素状态头以条件化帧级隐表示。状态头在展开的有序拓扑状态序列上以最优时间传输分类损失做单调稠密判别,再经拓扑约束图解码状态路径并折叠为音素与边界。与标准CTC稀疏边缘化不同,该设计强制所有有序子音素状态接收帧证据,从而恢复初稳尾类隐马尔可夫结构并保留识别能力。在Buckeye文本无关切分评测设置下,Ours–20ms的R-value指标为73.82,高于Charsiu FC–20ms的R-value指标70.02。消融还显示同拓扑下以最优时间传输分类替代CTC可改善定位并保持误发检测证据,十毫秒帧更利于三状态转移而二十毫秒帧识别错误率更优。该结论适用边界限于英语朗读自发与二语口音语料,跨语言大规模噪声与儿童语音等场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
数据相关资源:https://huggingface.co/datasets/gilkeyio/librispeech-alignments — 暂时无法访问
第三方资源:https://github.com/k2-fsa/k2 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 边说边想:StepAudio 3 Realtime 如何协调听、说、想与做
标签:#全双工语音交互 | #多模态学习 | #语音 | #音频大模型
评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Bin Lin:机构信息未在 arXiv HTML 中可靠披露
- Bo Zhao:机构信息未在 arXiv HTML 中可靠披露
- Boyang Zhang:机构信息未在 arXiv HTML 中可靠披露
- Boyong Wu:机构信息未在 arXiv HTML 中可靠披露
- Chao Yan:机构信息未在 arXiv HTML 中可靠披露
- Chen Geng:机构信息未在 arXiv HTML 中可靠披露
- Chen Wu:机构信息未在 arXiv HTML 中可靠披露
- Cheng Yi:机构信息未在 arXiv HTML 中可靠披露
- Chengli Feng:机构信息未在 arXiv HTML 中可靠披露
- Chenglin Zhu:机构信息未在 arXiv HTML 中可靠披露
- Chengting Feng:机构信息未在 arXiv HTML 中可靠披露
- Chengyuan Yao:机构信息未在 arXiv HTML 中可靠披露
- Daijiao Liu:机构信息未在 arXiv HTML 中可靠披露
- DanNi Wan:机构信息未在 arXiv HTML 中可靠披露
- Daxin Jiang:机构信息未在 arXiv HTML 中可靠披露
- Dongjian Li:机构信息未在 arXiv HTML 中可靠披露
- Dongqing Pang:机构信息未在 arXiv HTML 中可靠披露
- Fei Tian:机构信息未在 arXiv HTML 中可靠披露
- Feng Tian:机构信息未在 arXiv HTML 中可靠披露
- Future Li:机构信息未在 arXiv HTML 中可靠披露
- Gang Yu:机构信息未在 arXiv HTML 中可靠披露
- Guanglong Yang:机构信息未在 arXiv HTML 中可靠披露
- Haoyang Zhang:机构信息未在 arXiv HTML 中可靠披露
- Hongyuan Wang:机构信息未在 arXiv HTML 中可靠披露
- Jia Peng:机构信息未在 arXiv HTML 中可靠披露
- Jiahao Song:机构信息未在 arXiv HTML 中可靠披露
- Jialong Xue:机构信息未在 arXiv HTML 中可靠披露
- Jiamin Fan:机构信息未在 arXiv HTML 中可靠披露
- Jiangjie Zhen:机构信息未在 arXiv HTML 中可靠披露
- Jianzheng Gao:机构信息未在 arXiv HTML 中可靠披露
- Jincheng Wen:机构信息未在 arXiv HTML 中可靠披露
- Jinghua Liang:机构信息未在 arXiv HTML 中可靠披露
- Jinglan Gong:机构信息未在 arXiv HTML 中可靠披露
- Jun Chen:机构信息未在 arXiv HTML 中可靠披露
- Li Xie:机构信息未在 arXiv HTML 中可靠披露
- Liang Zhao:机构信息未在 arXiv HTML 中可靠披露
- Lifang Zhang:机构信息未在 arXiv HTML 中可靠披露
- Lingli Ji:机构信息未在 arXiv HTML 中可靠披露
- Lun Cai:机构信息未在 arXiv HTML 中可靠披露
- Min Xu:机构信息未在 arXiv HTML 中可靠披露
- Peilin Li:机构信息未在 arXiv HTML 中可靠披露
- Peng Yang:机构信息未在 arXiv HTML 中可靠披露
- Pengfei Tan:机构信息未在 arXiv HTML 中可靠披露
- Qingjian Lin:机构信息未在 arXiv HTML 中可靠披露
- Qinxin Du:机构信息未在 arXiv HTML 中可靠披露
- Ruijie Xiong:机构信息未在 arXiv HTML 中可靠披露
- Runze Li:机构信息未在 arXiv HTML 中可靠披露
- Shenghua Hu:机构信息未在 arXiv HTML 中可靠披露
- Shengqian Qin:机构信息未在 arXiv HTML 中可靠披露
- Shi Qiu:机构信息未在 arXiv HTML 中可靠披露
- Siqi Tu:机构信息未在 arXiv HTML 中可靠披露
- Siyi Zhou:机构信息未在 arXiv HTML 中可靠披露
- Tianjiao Deng:机构信息未在 arXiv HTML 中可靠披露
- Wanying Lu:机构信息未在 arXiv HTML 中可靠披露
- Weiming Niu:机构信息未在 arXiv HTML 中可靠披露
- Wen Sun:机构信息未在 arXiv HTML 中可靠披露
- WenWen Qu:机构信息未在 arXiv HTML 中可靠披露
- Xiangyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Xianwei Zhang:机构信息未在 arXiv HTML 中可靠披露
- Xiaosu Su:机构信息未在 arXiv HTML 中可靠披露
- Xing Chen:机构信息未在 arXiv HTML 中可靠披露
- Xinyu Liu:机构信息未在 arXiv HTML 中可靠披露
- Xuerui Yang:机构信息未在 arXiv HTML 中可靠披露
- Yan Wu:机构信息未在 arXiv HTML 中可靠披露
- Yang Li:机构信息未在 arXiv HTML 中可靠披露
- Yang Yang:机构信息未在 arXiv HTML 中可靠披露
- Yechang Huang:机构信息未在 arXiv HTML 中可靠披露
- Yibo Zhu:机构信息未在 arXiv HTML 中可靠披露
- Yifan Zhang:机构信息未在 arXiv HTML 中可靠披露
- Yinuo Yan:机构信息未在 arXiv HTML 中可靠披露
- Youjun Chen:机构信息未在 arXiv HTML 中可靠披露
- Yu Fu:机构信息未在 arXiv HTML 中可靠披露
- Yu Luo:机构信息未在 arXiv HTML 中可靠披露
- Yu Zhou:机构信息未在 arXiv HTML 中可靠披露
- Yujie Chen:机构信息未在 arXiv HTML 中可靠披露
- Yumang Wang:机构信息未在 arXiv HTML 中可靠披露
- Yunzhou Ju:机构信息未在 arXiv HTML 中可靠披露
- Yuxiang Yang:机构信息未在 arXiv HTML 中可靠披露
- Yuxin Li:机构信息未在 arXiv HTML 中可靠披露
- Yuxin Zhang:机构信息未在 arXiv HTML 中可靠披露
- Zekai Liu:机构信息未在 arXiv HTML 中可靠披露
- Zengwei Yao:机构信息未在 arXiv HTML 中可靠披露
- Zhaoxin Yuan:机构信息未在 arXiv HTML 中可靠披露
- Zhenwei Mou:机构信息未在 arXiv HTML 中可靠披露
- Zhiquan Zhang:机构信息未在 arXiv HTML 中可靠披露
- Zhiyue Wu:机构信息未在 arXiv HTML 中可靠披露
- Zichao Li:机构信息未在 arXiv HTML 中可靠披露
- Zichao Zhou:机构信息未在 arXiv HTML 中可靠披露
- Ziqi Ren:机构信息未在 arXiv HTML 中可靠披露
- Zixuan Wang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
实时口语交互要求同时听懂说什么与怎么说,并在说话中管理轮次与推理时延。StepAudio 3 Realtime 以听见、会谈、思考、行动闭环组织全双工交互,输入为用户与模型双音频流加文本上下文,输出为流式语音与工具动作。深度感知将音频编码器表征经适配器送入语言解码器,保留词汇、副语言与环境线索。无缝双工联合双流与历史判断暂停、回声确认与打断,决定聆听、说话或让出话轮。边说边想将构思脑私密推理与表达脑分段播报并行调度,以自适应思考与多词元预测调节算量,语音智能体将异步工具执行与对话并行。与已有实时语音系统相比,差异在于推理与异步工具执行同播报进度解耦,而非等待完整链条后再开口。在 MMSU 上得 90.6 分,超次优 Gemini 3.1 Pro 的 83.6 分 7.0 分,在 Artificial Analysis 全双工评测 Overall 得 98.9 分居首,tau-Voice 宏成功率 56.0% 接近最优 56.5%。但实时交互模式 StepAudioChat 宏平均 70.4 分,指令遵循仅 54.1 分大幅落后,多轮约束修订与零售域工具任务仍弱,且基于不完整推理先开口可能引入口头错误。原文未披露训练、推理或部署成本,大规模双流与双脑并发的真实时延与算力代价尚待验证。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 继承来的跟踪头:音频模型借用文本主干的位置机制选说话人
标签:#音频问答 | #注意力机制 | #语音 | #音频大模型 | #可解释性
评分:6.7/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Bojro Das:Cornell University
📌 核心摘要
任务输入为33.5秒的6人轮流朗读录音,输出是对指定说话人内容的描述,难点是音频语言模型常归因错误或输出无法归属。方法链分三步:先对6个候选片段各跑一次前向并记录末提示词符的注意力分布,接着按选择性或质量打分排序挑选前100个注意力头,最后对选中头在目标片段键上加正偏置、在其余5个片段上加负偏置以重定向描述。与按原始注意力质量排序不同,选择性先按行归一化再平均,只奖励随提问移动的注意力,具有更强的因果针对性。文本骨干零音频挑选的100头在Qwen2-Audio上达到95.0%操控准确率,远超带匹配随机基线的12.5%,但该组转移数字测于0-19条带内发现集内,音频原生对照被高估故比较偏保守。结论边界是共享子集虽充分但非因果必需,Ultravox单臂的质量排序失效且深度混杂未解,位置混杂在音频端仅有平坦性旁证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 跨采集条件仍能判准吗:用迭代对抗自训练把源域边界搬向目标域
标签:#病理语音评估 | #领域适应 | #语音 | #鲁棒性 | #语音生物标志物
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Luqi Sun:Johns Hopkins University;Baltimore, USA
- Shreeram Suresh Chandra:Johns Hopkins University;Baltimore, USA
- Aurosweta Mahapatra:Johns Hopkins University;Baltimore, USA
- Emily Mower Provost:University of Michigan;Ann Arbor, USA
- Brian MacWhinney:Carnegie Mellon University;Pittsburgh, USA
- Berrak Sisman:Johns Hopkins University;Baltimore, USA
📌 核心摘要
本文处理以自发语音预测阿尔茨海默病状态的跨域泛化问题,输入为Cookie Theft图片描述录音,输出为阿尔茨海默病与健康对照二分类,难点是单域训练易依赖录音环境伪影而在新采集条件下失效。方法链分为三步:先用源域标注训练分类器并引入域判别器做对抗对齐以缩小特征分布差,其对齐后输出进入伪标签生成环节筛选高置信目标样本,再将伪标签样本与源域数据混合重新做对抗训练并循环迭代。相比单次域对抗训练缺乏目标类监督、单次自训练依赖初始质量的割裂做法,该交替机制让对齐改善伪标签质量而伪标签又校正决策边界。在Pitt语料库到Lu语料库的冻结XLSR设置下,目标域准确率从58.11%提升至87.50%,F1达到0.8750,显示实质泛化收益。结论仅在英语图片描述任务和两个源域与一个小规模目标域上验证,未覆盖多语言与真实临床异质性。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://sleepwalker554.github.io/IAST_website/ — 链接可访问(HTTP 200)
模型相关资源:https://sleepwalker554.github.io/IAST_website/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 粗粒度保语义、细粒度保波形:DualSpecSE 为何要双路同时增强 Mel 与复谱
英文题目:DualSpecSE: A Dual-Path Speech Enhancement Network Integrating Mel and Complex Spectrograms
标签:#语音增强 | #时频分析 | #语音 | #多任务学习
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xingchen Li:机构信息未在 arXiv HTML 中可靠披露
- Ziqian Wang:机构信息未在 arXiv HTML 中可靠披露
- Zikai Liu:机构信息未在 arXiv HTML 中可靠披露
- Yike Zhu:机构信息未在 arXiv HTML 中可靠披露
- Zihan Zhang:机构信息未在 arXiv HTML 中可靠披露
- Longshuai Xiao:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音增强(Speech Enhancement, SE)需同时满足下游语音识别(Automatic Speech Recognition, ASR)的语义保真与人耳感知的波形重建,而梅尔谱易学却丢相位细节、复数谱保真却难学是核心矛盾。该文提出双路径网络 DualSpecSE,共享编码器从幂律压缩复数谱提取时频表示,并行送入梅尔分支与复数分支分别学习粗粒度包络与细粒度细节,梅尔分支经交互模块向复数分支注入幅度先验,再由融合模块将伪逆梅尔幅度与复数残差合并,同时输出增强梅尔谱与增强复数谱,无需外部预训练声码器。在 Interspeech 2020 DNS Challenge 测试集上宽带感知语音质量评估(Wideband Perceptual Evaluation of Speech Quality, WB-PESQ)达 3.25,窄带感知语音质量评估(Narrowband PESQ, NB-PESQ)达 3.68,扩展短时客观可懂度(Extended Short-Time Objective Intelligibility, ESTOI)达 0.936。在 ChiME-4 测试集波形输出下词错误率(Word Error Rate, WER)仿真集为 14.76%、真实集为 13.21%,优于同配置 CleanMel 波形输出的 15.95%与 14.03%。该结论仅在英语为主的动态仿真训练与 DNS、ChiME-4 评测范围内验证,对低信噪比与强混响等失败边界未量化。原文仅报告参数量 1.85M 与计算量 30.0 G/s,未披露训练硬件与推理延迟实测。
🔗 开源资源
代码相关资源:https://github.com/StellanLi/SenSE-demo — 链接不可用(HTTP 404)
第三方资源:https://github.com/espnet/espnet/tree/master/egs2 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 遮挡下先听后看:用未来潜表示预训练同时数车辨车型判方向
英文题目:Predictive audio representations for early detection and tracking of hidden dynamic objects
标签:#联合声音事件检测定位 | #自监督学习 | #多任务学习 | #麦克风阵列
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Katerina Vinciguerra:M. Brandes and D. Hollosi are with the Fraunhofer Institute for Digital Media Technology IDMT, Oldenburg, Germany.
- Moritz Brandes:M. Brandes and D. Hollosi are with the Fraunhofer Institute for Digital Media Technology IDMT, Oldenburg, Germany.
- Danilo Hollosi:M. Brandes and D. Hollosi are with the Fraunhofer Institute for Digital Media Technology IDMT, Oldenburg, Germany.
- Letizia Marchegiani:M. Brandes and D. Hollosi are with the Fraunhofer Institute for Digital Media Technology IDMT, Oldenburg, Germany.
📌 核心摘要
该工作输入为车载8麦克风圆形阵列采集的48 kHz原始多通道波形,输出为每秒同步的方向、车辆数量与车辆类型,难点在于多车频谱混叠无需声源分离即可解析、遮挡下视觉失效以及驻车与运动场景分布偏移。方法先将连续音频切分为1秒非重叠帧并组成3秒滑动窗口,经通道归一化后直接送入编码器映射为潜向量,窗口三元组作为后续时序建模单元。接着以联合嵌入预测架构做自监督预训练,用过去帧经在线编码器加预测器预测未来帧的目标编码器潜表示,丢弃预测器后保留编码器权重。微调阶段将窗口内三帧潜向量经双向长短期记忆网络聚合为共享表示,再经丢弃多层感知机由三个线性头多任务输出方向、计数与类型。与直接重建波形或谱图掩码重建不同,该方法在潜空间做跨步长时间预测,避免拟合感知无关细节并学习时间稳定且可迁移的语义结构。在T-Junction静态验证集下,所提方法的方向准确率为81.8%,高于Mel谱图加卷积神经网络基线的方向准确率75.0%。其结论适用边界受限于最多2车、封闭类别与受控采集,零样本向运动接管场景迁移时方向准确率仅2.3%,右向与多车细分类仍不稳定且尚未验证更大车流外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 长语音越说越飘、难句反复打转:DiTAR+ 用扩张视野与分层遮蔽稳住自回归扩散
英文题目:DiTAR+: Dual Optimization for Robust Autoregressive Diffusion Speech Synthesis
标签:#文本到语音 | #扩散模型 | #自回归模型 | #语音克隆 | #0 样本
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ziyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Tianlun Zuo:机构信息未在 arXiv HTML 中可靠披露
- Hanzhao Li:机构信息未在 arXiv HTML 中可靠披露
- Haoyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
零样本语音克隆(Zero-shot Voice Cloning)以目标文本与短参考音频为输入,输出保留说话人音色与韵律的连续语音,难点在于长时生成的音色漂移与复杂句式下的语义幻觉。所提 DiTAR+ 延续变分自编码器(Variational Autoencoder,VAE)压缩加分块自回归规划与局部扩散重建的两阶段链条:先由因果语言模型(Language Model,LM)根据文本与历史块聚合嵌入预测语义条件向量,再由局部扩散变换器(Localized Diffusion Transformer,LocDiT)据此去噪重建当前块。膨胀上下文采样(Dilated Context Sampling,DCS)在保留近端连续块保证边界平滑的同时稀疏拼接远端历史块,在不打乱物理时序的前提下扩大宏观感受野。分层声学掩蔽(Hierarchical Acoustic Masking,HAM)在前 \(N_1\) 个浅层阻断当前噪声块对历史声学上下文的注意力,迫使模型先建立语义对齐,深层再恢复声学上下文做音色与细节渲染。与仅依赖相邻块的 DiTAR 基线相比,关键差异在于同时解耦时间覆盖范围与语义声学优化阶段。在语言复杂的 ZH-Hard 集合上 DiTAR+ 将词错误率(Word Error Rate,WER)由 12.478% 降至 9.893%,在 25 秒至 35 秒的 ZH-Long 集合上将说话人相似度(Speaker Similarity,SIM)由 0.741 提升至 0.759,同时将 WER 由 2.778% 降至 2.173%。该结论限于中英文零样本朗读场景,跨语言泛化与实时流式部署能力尚未验证,原文未披露训练与推理成本。
🔗 开源资源
- 第三方资源:https://github.com/BytedanceSpeech/seed-tts-eval — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 保住细粒度声学线索再借高层语义:CRAF 的不对称残差融合
英文题目:CRAF: Cross-View Residual-Aware Fusion for Deepfake Speech Detection
标签:#语音伪造检测 | #模型融合 | #语音 | #音频大模型 | #注意力机制
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Minh-Xuan Phan:机构信息未在 arXiv HTML 中可靠披露
- Khalid Zaman:机构信息未在 arXiv HTML 中可靠披露
- Candy Olivia Mawalim:机构信息未在 arXiv HTML 中可靠披露
- Masashi Unoki:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
伪造语音检测输入为原始波形,输出为真实与伪造的二分类判决,难点是合成方法持续演进导致评估期攻击不可见,直接拟合训练期痕迹的模型泛化急剧下降。CRAF以冻结SSL为主干、ALLM为高层指引,先用跨视角注意力以SSL为查询、ALLM为键值将上下文注入SSL时间流得到指引表示。接着用独立参数的参考估计器预测ALLM可解释的SSL参考,并经层归一化相减分离出互补残差,再以原始SSL、参考与残差联合条件门控精炼残差。最后在保留原始SSL的残差路径下,以融合权重自适应注入残差与指引表示,送入AASIST后端以加权交叉熵训练。与均匀拼接两种视角不同,该不对称设计显式区分共享信息与SSL特有细粒度信息,避免语义主导表示淹没声学伪造线索。在ASVspoof 5 Track 1开放条件评估集下,CRAF(Kimi-Audio)的等错误率为5.96%,低于XLS-R基线的等错误率9.78%。该结论适用边界受限于单一ASVspoof 5基准与三种ALLM组合验证,在A28等困难攻击上仍明显失效且尚未验证跨数据集与压缩信道外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 亲缘线索稀疏且跨库易失效时,用卷积加变换器做选择性聚合
标签:#语音属性识别 | #Transformer | #数据集 | #鲁棒性 | #可解释性
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Qiyang Sun:机构信息未在 arXiv HTML 中可靠披露
- Langqing Zhang:机构信息未在 arXiv HTML 中可靠披露
- Yupei Li:机构信息未在 arXiv HTML 中可靠披露
- Björn Schuller:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频亲属验证需判断两段语音是否来自一阶亲属亲属关系,输入为梅尔倒谱系数(Mel-Frequency Cepstral Coefficients,MFCCs)序列,输出为亲属关系二值判定,难点在于亲属线索稀疏且易被信道、语言和年龄混淆。该工作先构建日常无约束普通话数据集 ARKIN以覆盖真实手机录音条件,再提出卷积变换器注意力池化三元组网络CONVTRAP-TN,先经说话人识别(Speaker Recognition)预训练获得表征,随后冻结前端并以三元组损失(Triplet Loss)学习亲属度量空间。与纯卷积或传统i-vector加深度神经网络映射相比,该方法用变换器(Transformer)捕捉远距离稀疏线索并以注意力池化(Attention Pooling)替代均值池化以避免稀释关键帧。在ARKIN测试集上该方法取得69.9%平衡准确率与30.1%等错误率和0.53最小检测代价,显著高于最强的300维x-vector三元组基线的64.7%与35.3%与0.69。其结论仅适用于小规模普通话日常录音与随机三元组训练范式,在KAN-AV到ARKIN跨语种跨信道时已观察到跌至50.0%以下的失效且尚未验证自监督特征下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 同室共奏更齐吗:用串音痕迹反推录音方式对合奏时值稳定性的影响
标签:#音乐理解 | #统计分析 | #音乐 | #时频分析
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Konstantinos Tsioutas:Mobile Multimedia Laboratory, Department of Informatics, School of Information Sciences and Technology, Athens University of Economics and Business, Greece
- George Xylomenos:Mobile Multimedia Laboratory, Department of Informatics, School of Information Sciences and Technology, Athens University of Economics and Business, Greece
📌 核心摘要
本研究输入为无录制日志的391首多轨分轨波形,输出为声部对起音时间差统计与录制环境是否同室同期的关系判定,难点在于共处不等同于串音且串音自动检测本身不完美易受同节奏齐奏混淆。方法链分三步:先对全曲所有分轨对计算应同时起音的Δt并汇总歌曲级均值中位与标准差以刻画timing稳定性,其输出的歌曲级波动分布进入下一步分组对照。再计算分轨对均方根能量包络皮尔逊相关与梅尔频谱图相似矩阵以刻画全时程共享声学内容,其输出的相似矩阵汇总统计量作为串音代理分数。接着以人工听辨校准0.45阈值划分串音组与隔离组并检验组间timing差异,人工核验结果回流确认高相似确由串音引起。相对实验室二重奏同步研究的关键机制差异在于用声学串音作为同室同期代理变量,把表演协调问题转写为可大规模筛查的信号相似性问题,其实质意义是无需provenance即可在现有曲库上检验同室效应。在区分可听串音与隔离录音的评测设置下,梅尔谱判据的中位相关效应量指标Cohen’s d为2.78,高于能量包络判据的效应量指标Cohen’s d 1.61。该结论适用边界受限于串音与同室的非对等对应,隔离booth同奏与电声直录无串音会被误判,且未控制风格编制混杂与未做同批乐手对照实验而尚待验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 把被遮住的频谱块合并掉:SpecAugment-Patch Merging 如何省算力
英文题目:From Masking to Merging: Rethinking SpecAugment for Efficient Audio Spectrogram Transformer
标签:#音频分类 | #数据增强 | #高效推理 | #关键词检测
评分:5.0/10 | 创新 0.8/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后 50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Minhee Park:机构信息未在 arXiv HTML 中可靠披露
- Hyowon Ahn:机构信息未在 arXiv HTML 中可靠披露
- Chanwoo Kim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频谱Transformer以二维语谱图分块为输入并输出类别标签,自注意力计算随Token数量二次增长,而频谱增强产生的掩膜区域信息稀疏却仍被全量编码,造成不必要的开销。为此方法先将时频掩膜对齐到分块网格并扫描记录全零块位置,生成二值候选矩阵并随掩膜语谱图进入分块嵌入阶段。随后在加入位置嵌入后且进入编码器前形成已含位置线索的Token序列,使后续压缩仍保留可被编码器解释的时频位置信息。最后从候选块中随机抽取两倍合并数个块组成不交对并逐维度取最大合并为一个Token,将序列长度压缩后送入编码器分类。与随机丢弃不同,该方法仅合并已知冗余的增强块并保留位置信息,与相似度合并不同,其无需额外计算相似度而以增强结构为线索降低计算量。在Balanced AudioSet基准下,合并100对后方法的mAP为34.08,高于未合并基线的mAP34.07。该结论适用边界受限于掩膜候选充足的中低合并率与掩膜面积硬约束,尚未验证推理时短音频泛化,在单张硬件上训练吞吐为49.3样本每秒且峰值显存为21.50GB。
🔗 开源资源
- 代码相关资源:https://github.com/slp-lab-research/specaug_patch_merge — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 先分析再说话:ScorePrompts 把乐谱解读固定在可检查的证据上
英文题目:ScorePrompts: Natural-Language Exploration of Symbolic Music Scores through Analysis
标签:#音乐理解 | #检索增强 | #音乐 | #音乐信息检索
评分:4.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:后 50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Emmanouil Karystinaios:机构信息未在 arXiv HTML 中可靠披露
- Gerhard Widmer:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该系统面向可机读乐谱的自然语言探索,输入为 MusicXML 乐谱,输出为分级技术描述、针对指定小节的问答以及与五线谱联动的分析依据,难点在于和声与曲式推断易错且语言模型易幻觉。流程先由专用音乐信息检索(Music Information Retrieval,MIR)模型栈构建音符、拍、小节与乐曲四级对齐证据,再经模式约束的语言阶段将分析行转写为规范小节事实与三档描述,随后确定性路由器按小节范围与主题词裁剪证据作答,最后由 Verovio 渲染将回答回链到谱面与音符属性。与直接把标记送入语言模型的做法不同,该设计拒绝由模型推断结构,只允许其转述已解码的分析表示并保留中间表格与跨层分歧。原文未提供可核对的关键定量结果,演示仅以单个乐谱走通流程说明可行。适用边界限于西方调性可机读乐谱,且依赖上游分析模型的曲目与标注假设,未验证生成语句与字段的语义忠实度。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。