共分析 36 篇论文
⚡ 今日概览
✅ 筛选入选 36 篇 → 🔬 深度分析完成
🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #语音识别 | 5 篇 | █████ |
| #文本到语音 | 3 篇 | ███ |
| #语音情感识别 | 3 篇 | ███ |
| #音乐理解 | 3 篇 | ███ |
| #音频分类 | 3 篇 | ███ |
| #音频深度伪造检测 | 3 篇 | ███ |
| #全双工语音交互 | 2 篇 | ██ |
| #语音质量评估 | 2 篇 | ██ |
📊 论文评分排行榜(36 篇,按分数降序)
📋 论文列表
🖼️ 有图的论文会在这里展示首张原论文图;点击图片可打开 arXiv 原图。
🥇 不动 ASR 模型,如何把田间嘈杂的多人农问转写做准
英文题目:Model-Agnostic and Language-Agnostic Voice Pipeline Improvement for the Agriculture Domain
标签:#语音识别 | #模型融合 | #说话人分离标注 | #语音增强 | #多语言
评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Aakash Singh:Digital Green
- Lakshmi Pedapudi:Digital Green
- Chandrashekar M S:Digital Green
- Sanyam Singh:Digital Green
- Naga Ganesh:Digital Green
- Vineet Singh:Digital Green
📌 核心摘要
田间咨询语音输入为低端手机采集的印地语、泰卢固语与奥里亚语问询,输出应为仅含提问农户话语的转写文本,难点在于机械与背景噪声、多人同时说话以及作物与农药等领域词稀缺。系统先由音频分析与门控增强判断噪声层级并决定是否做轻量去噪,净化后音频进入语音活动检测与说话人分离标注环节并按响度与时长规则保留农户片段,再送入未改动的自动语音识别模型得到初稿,最后由领域词表纠错修复生造词并预留质量门控做拒识与改写路由。与直接微调识别模型或端到端音频问答方案不同,该设计保持识别模型可替换且全程保留可评分转写文本。在2673条人工质检语料上全流程使3个云端模型的词错误率相对下降16%到23%,多说话人子集下降幅度更大且4个模型均显著。奥里亚语高噪与三人以上群聊仍是主要失效区,泰卢固语与奥里亚语词表纠错尚未建成。增强实时率约0.02且多数流量可跳过,分离标注在单张A10G上实时率约0.019,纠错为纯文本规则无模型调用。
🔗 开源资源
代码相关资源:https://github.com/aakashdg/agri-voice-pipeline — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/DigiGreen/pyannote-segmentation-agri-indic — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/DigiGreen/agri-voice-eval — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/DigiGreen/agri-lexicon-hindi — 链接可访问(HTTP 200)
演示资源:https://huggingface.co/spaces/DigiGreen/farmerchat-voice-pipeline-demo — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 用圆环记时间:CircleMatch 以千级参数做关键词识别
英文题目:CircleMatch: Prototype Matching with Circular Temporal Statistics for Tiny Keyword Spotting
标签:#关键词检测 | #信号处理 | #语音 | #高效推理 | #多语言
评分:8.3/10 | 创新 1.4/2 | 技术严谨 1.4/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jiajun Sun:机构信息未在 arXiv HTML 中可靠披露
- Zhe Gao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
关键词识别需从 1 秒语音中判别预定义词,难点在于极小参数预算下同时保留频带判别性与时序事件结构。本文提出 CircleMatch 方法链分四步推进:声学编码器(Acoustic Encoder)先分频带压缩并建模上下文输出帧特征,该输出进入原型匹配(Prototype Matching)计算帧与每类 5 个原型的缩放余弦响应,再由圆周聚合(Circular Aggregation)将时间映射为角度求加权矩幅度与交叉矩,最后由有序路径评分与共享线性读出融合强度与时序证据输出类别。与深度可分离卷积等纯压缩结构不同,该方法以无参数固定圆基保留分布集中度与原型相对时序,并用有序路径软聚合显式约束事件顺序。在 Google Speech Commands v2 12 类测试集上 Circle-D32 以 6694 参数达到 96.23% 准确率,优于同量级微型基线并逼近更大模型的精度。该结论限于固定词表闭集识别与离线整句输入,未验证流式检测、开放词表与真实噪声部署。原文披露了优化器与增强等训练配置,但未披露训练硬件、推理延迟与片上部署成本。
🔗 开源资源
代码相关资源:https://github.com/ora942878/CircleMatch — 链接可访问(HTTP 200)
模型相关资源:https://github.com/ora942878/CircleMatch — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 把帧率压到八分之一:TurboCTC 如何用块内降采样换速度
标签:#语音识别 | #Conformer | #CTC | #知识蒸馏 | #高效推理
评分:8.3/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Brian Kingsbury:机构信息未在 arXiv HTML 中可靠披露
- George Saon:机构信息未在 arXiv HTML 中可靠披露
- Masayuki Suzuki:机构信息未在 arXiv HTML 中可靠披露
- Hong-Kwang J. Kuo:机构信息未在 arXiv HTML 中可靠披露
- Takashi Fukuda:机构信息未在 arXiv HTML 中可靠披露
- Samuel Thomas:机构信息未在 arXiv HTML 中可靠披露
- Vishal Sunder:机构信息未在 arXiv HTML 中可靠披露
- Avihu Dekel:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
英文短语音转写需要在噪声、口音与领域偏移下输出准确文本,同时满足低延迟与高吞吐部署约束,纯编码器方案长期受二次注意力开销与高帧率解码拖累。该工作先以堆叠降采样加前两层步长卷积将声学帧率逐级压缩并用大词表补偿信息密度,再以块对角注意力限制感受野实现线性复杂度并引入中间层自条件增强单调对齐,接着用三阶段训练依次完成大规模CTC预训练、文本大模型蒸馏与多条件鲁棒微调加参数插值。相对全注意力FastConformer类方案,其差异在于下采样内嵌于Conformer卷积路径并配合残差池化,同时用高效注意力内核与线性层替换实现推理加速。在公开OpenASR短语音集合上最终平均词错率降至5.72%,推理加速带来约49%的逆实时因子提升并保持精度不变。该结论限于英文短语音公开切分与单卡大批量贪婪解码测速,远场噪声榜单、多语言与流式长音频外推尚未充分验证。训练使用8卡H100节点与约60k小时公开加合成语音,推理成本主要为470M参数编码器的一次前向加CTC贪婪搜索。
🔗 开源资源
- 模型相关资源:https://huggingface.co/ibm-granite/granite-speech-5.0-470m-turboctc — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 在可疑话术相同的情况下靠后续动作定标签:TeleAntiFraud 2.0 的混合树与月度冻结评测
标签:#音频分类 | #基准设计 | #基准测试 | #语音
评分:8.0/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Huiyuan Liu:机构信息未在 arXiv HTML 中可靠披露
- Zhiming Ma:机构信息未在 arXiv HTML 中可靠披露
- Yanxing Liu:机构信息未在 arXiv HTML 中可靠披露
- Shun Zhang:机构信息未在 arXiv HTML 中可靠披露
- Qifan Wang:机构信息未在 arXiv HTML 中可靠披露
- Di Liu:机构信息未在 arXiv HTML 中可靠披露
- Yifan Wang:机构信息未在 arXiv HTML 中可靠披露
- Yuyang Deng:机构信息未在 arXiv HTML 中可靠披露
- Haoyang Meng:机构信息未在 arXiv HTML 中可靠披露
- Yijin Zhou:机构信息未在 arXiv HTML 中可靠披露
- Yuxi Zhao:机构信息未在 arXiv HTML 中可靠披露
- Chengxian Hu:机构信息未在 arXiv HTML 中可靠披露
- Peidong Wang:机构信息未在 arXiv HTML 中可靠披露
- Peng Chen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频电信诈骗检测(Audio-Based Fraud Detection)输入为完整中文通话波形或其转写文本,输出为 FRAUD 与 NONFRAUD 二分类,难点在于诈骗话术刻意模仿合法客服、风险通知与核验流程且随时间演化。该工作先将线上诈骗案例摘要解析为包含接听者背景、来电者伪装身份与说服策略、分阶段目标、风险实体与风险节点的场景画像(Profile),再经混合树(Mixed-Tree)展开生成共享开场但结局分叉的欺诈与合法路径,随后由角色与功能六智能体协作实现话术与终止控制,最后经角色匹配语音合成与信号校验冻结为月度音频快照。与依赖无关负例的固定基准相比,机制差异在于标签由完成轨迹中的取证动作决定而非话题线索,并以不可变清单(Manifest)支撑刷新与审计。在pro_test五次平衡重采样评测设置下,近域同胞负例的Macro-F1为0.680 [0.643, 0.716],低于无关负例的Macro-F1 1.000 [1.000, 1.000]。当前结论仅适用于合成中文近域场景与 6 月 V1、7 月 V2 两期快照,跨真实通话与长期时序外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://anonymous.4open.science/r/TeleAntiFraud-2_0-EEB2/ — 链接可访问(HTTP 200)
数据相关资源:https://anonymous.4open.science/r/TeleAntiFraud-2_0-EEB2/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 被点名才开口:全双工语音模型为何听得见内容却不干预
英文题目:Full-Duplex Speech Models Take the Floor When Asked, Not When Needed
标签:#全双工语音交互 | #基准设计 | #轮次切换 | #模型评估 | #语音
评分:7.9/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Linkai Peng:机构信息未在 arXiv HTML 中可靠披露
- Baorian Nuchged:机构信息未在 arXiv HTML 中可靠披露
- Kaiqi Fu:机构信息未在 arXiv HTML 中可靠披露
- Yuyang Yao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音模型需在用户持续说话时判断是否主动接管话轮,输入为连续用户语音流,输出为是否起音及回应内容,难点在于区分说话理由与静音提供的说话机会。本文构建40组话题内匹配独白并压缩词间静音,先以10种触发条件测量4秒窗内起音率,再用帧级文本概率探测未越阈的生成倾向,最后以10秒静音释放话轮检验回应内容。与已有评测只看暂停处理或用户打断不同,该设计把被寻址、静音、词间停顿与虚假事实和危险动作严格对照。在压缩词间暂停的主实验条件下,PPlex在直接提问下的起音率指标为.34,高于中性基线Neutral的起音率指标.10。同一框架下虚假事实与危险动作起音率始终贴近中性基线,即使释放话轮后干预性纠错与警告比例仍仅为.14–.15与.04–.07,表明瓶颈在内容理解而非抢话机会。结论仅适用于英语独白合成语音与受试的7种配置,外推至多轮对话与真实噪声仍待验证。该结论的适用边界受限于合成独白场景,多轮交互与真实噪声等外推范围尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/vocaliodmiku/take-the-floor — 链接可访问(HTTP 200)
数据相关资源:https://github.com/vocaliodmiku/take-the-floor — 链接可访问(HTTP 200)
复现相关资源:https://github.com/vocaliodmiku/take-the-floor — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 野外波斯语音不够用:用韵律完整切分与双模型互认造出 2400 小时语料
英文题目:PersianVox: A Prosody-Aware Approach for Speech Dataset Generation from In-the-Wild Data
标签:#文本到语音 | #数据集构建 | #语音质量评估 | #韵律 | #低资源
评分:7.8/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Saeedreza Zouashkiani:机构信息未在 arXiv HTML 中可靠披露
- Soheil Khalesi:机构信息未在 arXiv HTML 中可靠披露
- Saman Soleimani Roudi:机构信息未在 arXiv HTML 中可靠披露
- Sajjad Amini:机构信息未在 arXiv HTML 中可靠披露
- Shahrokh Ghaemmaghami:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
低资源波斯语零样本语音合成面临海量无标注网络音频,目标是可训练的长上下文单说话人语句对,难点在于转写不准、静音切分截断韵律以及质量过滤跨语言失效。本文方法链为预处理标准化与音乐分离输出干净长录音,接着说话人分离标注与声学轮次检测合并生成语义完整语句,再经语音修复与语言加质量过滤剔除劣质样本,最后由两种解码机制不同的识别模型一致性校验保留可靠转写。与 Emilia 类静音切分加单模型转写的差异在于以轮次完整性替代静音阈值,并以跨架构一致替代单点置信,从而保留长程韵律并抑制相关误差。在 564 条人工平均意见分(Mean Opinion Score,MOS)子集上 SCOREQ 的皮尔逊相关为 0.6658,优于 DNSMOS 的 0.5590,同时流水线最终产出 2408.67 小时多说话人语料。结论仅在波斯语 YouTube 系数据与所用修复和识别组合下成立,换语言、换噪声类型或强口音场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
数据相关资源:https://huggingface.co/datasets/saeedzou/persianvox — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/saeedzou/persianvox_mos — 链接可访问(HTTP 200)
演示资源:https://saeedzou.github.io/persianvox-demo → https://saeedzou.github.io/persianvox-demo/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 放宽切分、收紧词典:用格子上的条件随机场做日语读音选择
英文题目:Dictionary-Constrained Grapheme-to-Phoneme for Unsegmented Languages from LLM-Annotated Data
标签:#文本到语音 | #Transformer | #数据增强 | #语音学与音系 | #低资源
评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Rui Hu:机构信息未在 arXiv HTML 中可靠披露
- Zhenpeng Zhan:机构信息未在 arXiv HTML 中可靠披露
- Xiaolong Lin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
日语字形到音素转换需把未切分文本映射为全句读音,难点是切分与多音字歧义耦合,且单汉字可对应变长音节并在复合时发生音变。该方法先用词典构造词格,再用字符级编码器提取上下文表示,随后对格节点表层形与读音分别编码并经注意力融合打分,最后在有向无环图上做条件随机场解码。与传统形态分析器依赖局部代价和硬切分不同,该框架只监督读音序列并将切分边缘化,同时用间隔损失区分同跨度竞争读音。从结构上看,词典保证输出合法,神经模型负责长程语境消歧。在Joyo-Kanji-Yomi修订基准13536句上,目标词读音准确率达99.62%,目标词音素错误率0.32%,整句音素错误率0.14%,明显高于形态分析器与序列基线。该结论目前仅在常用汉字读音场景验证,对专有名词、阿拉伯数字与外来语仍需外推检验,原文未披露推理时延与部署开销。
🔗 开源资源
数据相关资源:https://github.com/Parakeet-Inc/Joyo-Kanji-Yomi-Benchmark-Parakeet-Edition — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/singletongue/wikipedia-utils — 链接可访问(HTTP 200)
复现相关资源:https://huggingface.co/ku-nlp/deberta-v2-base-japanese-char-wwm — 链接可访问(HTTP 200)
第三方资源:https://deepmind.google/models/gemini/pro/ — 链接可访问(HTTP 200)
第三方资源:https://deepmind.google/models/gemini/ — 链接可访问(HTTP 200)
第三方资源:https://openai.com/index/gpt-5-6/ — 链接不可用(HTTP 403)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 历史转写不可靠时,为何还要保留历史语音:多模态对话上下文 ASR 的构造与训练
英文题目:Multimodal Conversational Context for LLM-Based ASR: Data Construction, Training, and Benchmark
标签:#语音识别 | #多模态学习 | #数据集构建 | #基准测试
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Longhao Li:机构信息未在 arXiv HTML 中可靠披露
- Jian Tang:机构信息未在 arXiv HTML 中可靠披露
- Yuxiang Kong:机构信息未在 arXiv HTML 中可靠披露
- Jie Chen:机构信息未在 arXiv HTML 中可靠披露
- Binbin Zhang:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
- Xiangang Li:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该任务输入为历史用户语音及其识别文本与助理文本回复加当前用户语音,输出为当前轮转写,实际难点在于历史转写错误会向后传播且文本化会丢弃发音与说话人线索,同时无关历史还会干扰识别。方法先从普通话实体词库挖掘同音近音混淆对,再用大语言模型按无关、隐含、显式、纠正与重复错误五种场景生成一轮历史对话,其输出直接作为后续语音合成的文本脚本。接着用语音合成生成历史与当前语音并经识别校验过滤低质合成,保证文本与语音对齐可用,最后按对话顺序交错拼接历史语音与助理文本回复加当前语音做监督微调,仅对当前转写计算交叉熵损失。与仅用文本历史的关键差异在于同时保留原始声学证据,使模型能联合语义、发音与音色线索实现纠错与口音及说话人自适应。在 MM-ContextASR Bench 上 Qwen3-Omni 经上下文微调后语音加文本总体实体召回率达 87.84%,优于纯文本的 86.48% 与无上下文的 76.80%,在重复错误场景领先纯文本约 5.20 个百分点。结论限于单轮历史、中文实体密集问答与合成训练分布,口音与会议实验亦为受控配对,未验证长程多轮与强噪声泛化。训练用 8 卡 NVIDIA A100 做 LoRA 微调,未披露推理时延与部署成本。
🔗 开源资源
代码相关资源:https://github.com/llh666521/MM-ContextASR — 链接可访问(HTTP 200)
数据相关资源:https://github.com/llh666521/MM-ContextASR — 链接可访问(HTTP 200)
第三方资源:https://github.com/modelscope/ms-swift — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 泰卢固语先出声再作答:VākQA 如何把语音、转写与评测分开检验
英文题目:VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering
标签:#音频问答 | #基准设计 | #基准测试 | #低资源 | #人类参与评测
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Bhavana Akkiraju:机构信息未在 arXiv HTML 中可靠披露
- Ravi Sastry Kolluru:机构信息未在 arXiv HTML 中可靠披露
- Sri Charan D:机构信息未在 arXiv HTML 中可靠披露
- Srihari Bandarupalli:机构信息未在 arXiv HTML 中可靠披露
- Santosh Kesiraju:机构信息未在 arXiv HTML 中可靠披露
- Anil Vuppala:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
泰卢固语口语事实问答(Spoken Question Answering,SQA)以原始语音为输入并要求直接输出简短事实答案,难点在于口语声学变异、低资源识别错误与双语转写歧义会同时污染问题理解与答案判定。本文构建可复用的基准研究形态,先从问答类视频抽取语音片段并转写合并,再用大模型抽取候选问答并做词级对齐切分,最后由母语者校验音频文本一致性并翻译为英文形成双语对照。与已有合成语音或段落抽取式口语问答不同,该链条保留真实 quiz 交互的发音混淆与文化特指,并把评测可靠性本身作为研究对象。在人类评分为金的对照下,Gemini 作为评判(LLM-as-a-judge)与人类平均分的相关性达到 Spearman 相关 0.86,显著高于词重叠与嵌入基线,而口语输入相对纯净文本仍造成可观退化。结论仅适用于2001对简短事实型问答与六个知识域,未验证长答案推理、多方言与噪声场景的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://hf.co/datasets/Bhavanaakkiraju/VakQA → https://huggingface.co/datasets/Bhavanaakkiraju/VakQA — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 生成式读标签为何不稳:用同一隐状态对比判别式读法
英文题目:Reading Emotions in the Token Space: Discriminative Adaptation of SpeechLLMs for Emotion Recognition
标签:#语音情感识别 | #LoRA | #语音 | #可解释性
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hasindri Watawana:机构信息未在 arXiv HTML 中可靠披露
- Sergio Burdisso:机构信息未在 arXiv HTML 中可靠披露
- Esaú Villatoro-Tello:机构信息未在 arXiv HTML 中可靠披露
- Manjunath K E:机构信息未在 arXiv HTML 中可靠披露
- Kadri Hacioglu:机构信息未在 arXiv HTML 中可靠披露
- Petr Motlicek:机构信息未在 arXiv HTML 中可靠披露
- Andreas Stolcke:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音情感识别需从语音声学证据与转写文本推断Angry、Happy、Sad和Neutral四类标签,难点在于生成式语音大模型解码偏向高频类别并可能输出非法标签。本文冻结语音编码器与大语言模型主干,先由可训练语音投影器将语音帧映射为大语言模型输入提示,再用低秩适配适配大语言模型并取末尾提示词元隐状态做统一读出。生成式读出经解词矩阵自回归解码标签,判别式读出则经单层线性分类头在一次前向中输出类别,训练目标均为交叉熵。线性约束使每类对应输出空间一个方向,可经解词矩阵投影回词元从而暴露关联词汇,这是非线性头不具备的机制优势。在IEMOCAP含ASR转写文本与上下文的评测设置下,单编码器判别式读出的Macro F1为76.50,高于单编码器生成式读出的Macro F1 74.47。该结论限于英语表演式IEMOCAP四分类与所用Whisper与LLaMA组合,未验证跨语种、自发情感与开放标签外推。跨语种自发情感等外推适用边界尚未验证,受限于当前语料与架构组合。原文未披露训练、推理或部署成本
🔗 开源资源
模型相关资源:https://huggingface.co/openai/whisper-medium — 链接可访问(HTTP 200)
模型相关资源:https://github.com/microsoft/unilm/tree/master/beats — 链接可访问(HTTP 200)
第三方资源:https://github.com/emo-box/EmoBox — 链接可访问(HTTP 200)
第三方资源:https://emo-box.github.io/leaderboard1.html — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 已知录音、未知变速:谐波打击分离如何在 Python 里做到逐帧可变速实时播放
英文题目:Variable-Rate Harmonic-Percussive Time-Scale Modification with Real-Time Playback in Python
标签:#音频生成 | #时频分析 | #实时处理 | #开源工具 | #主观评测
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Sayema Lubis:机构信息未在 arXiv HTML 中可靠披露
- Clark Peng:机构信息未在 arXiv HTML 中可靠披露
- Jared Carreño:机构信息未在 arXiv HTML 中可靠披露
- TJ Tsai:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理可变速率播放下的时间尺度修正问题,输入为事先已知的完整录音,输出为速率因子可逐帧变化的实时音频流,难点在于离线谐波打击乐分离依赖整段分析而无法直接应对动态变速。所提流水线先离线对全曲做中值滤波分离得到谐波分量与打击乐分量,再分别用相位声码器与叠加相加做实时合成,最后将两路输出混音写入环形缓冲并分块送放。近似家族在离线阶段以固定小跳长预计算谐波幅度谱与瞬时频率表,在线阶段以最近邻查表替代分析端快速傅里叶变换与频率校正,从而把相位声码器主导的开销减半。与已有离线工具只能固定变速离线输出相比,该方法把分离前置而合成后置,实现了逐帧可变的实时交互,其实际意义在于可直接嵌入以Python为主的研究生态做伴奏跟随实验。在GTZAN音乐评测设置下,HPS Approx β=0.25的运行时指标为4.03 ms/sec,低于HPS-TSM-Realtime基线的运行时指标8.15 ms/sec。该近似在成对听测中进入感知不可区分区间,说明减半开销并未损失感知质量。该结论适用边界仅在22050 Hz单声道音乐片段与0.5至2.0倍固定变速范围内得到验证,尚未验证立体声、高采样率与连续手势变速下的延迟抖动,且其推理开销主要体现为预计算量与查找表内存对硬件的占用。
🔗 开源资源
- 代码相关资源:https://github.com/HMC-MIR/TSMRealTime — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 音乐幻觉不是一句话说错,而是五层感知逐层失守
英文题目:Music Hallucination in Audio-Language Models: A Hierarchical Formulation and Empirical Study
标签:#音乐理解 | #评测协议 | #音乐 | #音频大模型
评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yu Liu:Institute of Information Engineering, CASSchool of Cyber Security, UCASBeijingChina
- Jiahui Liu:Central Conservatory of MusicBeijingChina
- Zhilin Liu:University of Electronic Science and Technology of ChinaChengduChina
- Cong Cao:Institute of Information Engineering, CASBeijingChina
- Fangfang Yuan:Institute of Information Engineering, CASBeijingChina
- Yuling Yang:Institute of Information Engineering, CASSchool of Cyber Security, UCASBeijingChina
- Pin Xu:Institute of Information Engineering, CASSchool of Cyber Security, UCASBeijingChina
- Yanbing Liu:Institute of Information Engineering, CASSchool of Cyber Security, UCASBeijingChina
📌 核心摘要
该研究处理音频语言模型面对音乐片段与文本提示时生成无依据描述的问题,输出为含乐器、人声、速度、调性、风格与情感断言的文本,难点在于五层属性可验证性不同且参考字幕存在选择性省略。诊断框架MuseDiag先以判别式探针、自由描述与结构化问询三范式采集模型输出,并按声事件、时间属性、调性、风格与情感五层路由断言。其次硬层断言送入信号工具验证而软层断言送入语义裁判验证,上一步的层标签决定证据通道与矛盾判定阈值。再以与参考字幕矛盾而非缺失作为幻觉判定并附带覆盖率与不可判定态,避免把未提及的有效属性误判为幻觉。相对通用音频幻觉基准的关键差异在于按可验证性划分证据通道并设置不可判定态,从而使层间不可比的验证特异性得以显式隔离。在MusicCaps片段的结构化调性任务评测下,Qwen2.5-Omni的准确率为68.6%,高于MiMo-V2-Omni的准确率0.0%。结论仅适用于短片段与可审计属性,对复调密集、长结构与表演细节等现象尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 小容量不靠看得远:固定感受野与梅尔细节约束的紧凑合成
英文题目:GrainSpeech: Less Context, More Detail for Compact Speech Synthesis
标签:#文本到语音 | #CNN | #语音 | #端侧运行 | #高效推理
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Zitao Liang:机构信息未在 arXiv HTML 中可靠披露
- Chang Gao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
紧凑声学建模需将音素序列映射为梅尔频谱图,再经声码器还原波形,难点在于容量受限时易出现韵律预测不准与频谱过平滑。GrainSpeech先以固定感受野卷积编码器从音素嵌入提取局部上下文并预测基频、能量与时长,再将预测特征与编码输出拼接并按时长上采样,最后经空洞时序混合与通道瓶颈多层感知机生成梅尔频谱图,训练则由逐点损失、结构相似性与梅尔梯度方差联合约束细节。与全局自注意力及图像域梯度方差相比,该链条分别用有限上下文替代冗余长程依赖、用轴向差分与对数域局部统计替代空间Sobel与非重叠块匹配。在LJSpeech的128句评测上,GrainSpeech以0.265M参数达到4.086的UTMOS,与20.060M的MixerTTS的4.087在置信区间上重叠,并在STM32H747XI上实现17.9倍实时梅尔生成。结论目前仅适用于单说话人英语与自动客观指标,跨说话人、跨语言与主观听感尚未验证。原文未披露训练硬件与训练时长,推理成本仅给出微控制器端的吞吐与内存占用。
🔗 开源资源
代码相关资源:https://github.com/lab-emi/GrainSpeech — 链接可访问(HTTP 200)
演示资源:https://github.com/lab-emi/GrainSpeech — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 不等电话挂断:只用通话级标签从原始语音做增量诈骗打分
英文题目:Before the Warning Comes Too Late: Incremental Phone-Scam Detection from Speech
标签:#音频分类 | #RNN | #语音 | #流式处理 | #弱监督学习
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Khang Nhat Hoang Vo:机构信息未在 arXiv HTML 中可靠披露
- Anh Trac Duc Dinh:机构信息未在 arXiv HTML 中可靠披露
- Tai Tien Ta:机构信息未在 arXiv HTML 中可靠披露
- Tho Quan:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
电话诈骗检测(phone-scam detection)的输入是原始电话语音,输出是随通话推进不断更新的欺诈风险,难点在于训练仅有通话级二值标签而推理需在证据零散出现时提前预警。所提 StreamFraudNet 先将已观测音频切分为重叠有界窗口并用冻结语音编码器提取帧表示,注意力池化将帧压缩为块向量后由双向循环网络建模窗口内时序依赖,窗口分类器输出隐式风险分再由可学习聚合器加权为当前通话级预测。在320个测试通话的合成英文基准上,该模型取得通话级判别效果受试者工作特征曲线下面积(Receiver Operating Characteristic-Area Under Curve,ROC-AUC)为0.9953,显著优于声学与均值池化对照而略低于匹配的全局循环基线。机制差异在于保留窗口内有序上下文并允许前缀推理,而非传统多示例学习(Multiple-Instance Learning,MIL)的置换不变聚合。适用边界是脚本化合成语音与普通话电话数据的受控验证,尚未证明在真实噪声信道和欺诈起始延迟上的优势。训练成本较低而推理包含冻结编码器,服务器端实测处理速度快于实时。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/BothBosu/scam-dialogue — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 冻结大模型不动,只改外部技能:FRAUDSkill 如何把开放生成压进三段式反诈闭集决策
英文题目:FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection
标签:#音频分类 | #提示学习 | #音频大模型 | #语音
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Chengxian Hu:机构信息未在 arXiv HTML 中可靠披露
- Zhiming Ma:机构信息未在 arXiv HTML 中可靠披露
- Mingjun Pan:机构信息未在 arXiv HTML 中可靠披露
- Yifan Wang:机构信息未在 arXiv HTML 中可靠披露
- Shun Zhang:机构信息未在 arXiv HTML 中可靠披露
- Qifan Wang:机构信息未在 arXiv HTML 中可靠披露
- Zhilei Zhao:机构信息未在 arXiv HTML 中可靠披露
- Yijin Zhou:机构信息未在 arXiv HTML 中可靠披露
- Yuxi Zhao:机构信息未在 arXiv HTML 中可靠披露
- Huiyuan Liu:机构信息未在 arXiv HTML 中可靠披露
- Peidong Wang:机构信息未在 arXiv HTML 中可靠披露
- Peng Chen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
电信反欺诈要求对语音输入依次输出服务场景、是否欺诈及条件欺诈类型,难点是开放式生成常产生本体外标签、漏检必选路由并沿决策链传播错误。该工作提出外部技能优化框架,离线阶段用冻结音频语言模型回放轨迹并经文本评论家诊断改写根指令与路由技能,再经验证集选留互补程序集。在线阶段各保留程序独立驱动冻结模型生成多条轨迹,经标签投影映射到官方本体并做路由归一化修复协议违例,最后用校准集拟合的可靠性加权与类别均衡选择器聚合。与通用文档级技能进化不同,该方法将知识表达与闭集约束解耦,把一致性控制移出单次生成。在 TeleAntiFraud 音频级去重完整测试集(2677条音频,其中1453条含类型标注)上完整系统任务平均 Macro-F1 达到73.50%,较同冻结模型共享基线提升31.96个百分点且无效输出率降至1.94%。结论仅在该基准的音频级协议与官方标签下成立,未验证跨模型、跨语种与演进欺诈的泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://anonymous.4open.science/r/FRAUDSKILL-114514 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 先分离重叠与特有,再用共识引导融合:三视图语音情感识别
英文题目:Consensus-Guided Shared-Specific Tri-View Learning for Speech Emotion Recognition
标签:#语音情感识别 | #模型融合 | #语音 | #正则化
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Bing Huang:机构信息未在 arXiv HTML 中可靠披露
- Yujian Ma:机构信息未在 arXiv HTML 中可靠披露
- Xikun Lu:机构信息未在 arXiv HTML 中可靠披露
- Xianquan Jiang:机构信息未在 arXiv HTML 中可靠披露
- Jinqiu Sang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音情感识别输入为语音话语、输出为愤怒、悲伤、高兴、中性等离散情绪类别,难点在于同一话语派生的频谱图、梅尔频率倒谱系数与自监督表示既重叠又互补,直接融合易重复传播公共证据并淹没弱互补线索。该文将三视角先编码为同维度话语级向量,再分别投影为公共分支与视角特有分支,把三路公共分支拼接映射为全局共识向量,最后用视角独立门控逐元素权衡共识与特有信息后拼接分类,同时以软正交差分正则约束同视角公共与特有以及不同视角特有之间的线性相关。与已有跨视角交互或对比对齐方法不同,该机制在融合前显式组织共享与特有信息,并以共识为参考自适应回灌细节。在IEMOCAP五折说话人无关评测设置下,TriCGF的加权准确率为74.19%,高于CA-MSER的加权准确率69.80%。在EmoDB五折说话人无关评测下该方法加权准确率与非加权准确率为94.36%与94.28%,消融实验验证了共识学习、门控融合与差分正则各自的贡献。该结论未覆盖噪声、跨语种与连续情绪外推,原文未披露推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Luxikun669/TriCGF — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 目标缺席要稳、声纹漂移要跟:流式提取中启发式前沿为何卡住,可学习的说话人状态如何跨过
英文题目:Beyond the Stability–Plasticity Frontier in Streaming Target Speaker Extraction
标签:#目标说话人提取 | #测试时自适应 | #流式处理 | #元学习
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yuesheng Ma:机构信息未在 arXiv HTML 中可靠披露
- Linyang He:机构信息未在 arXiv HTML 中可靠披露
- Nima Mesgarani:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
流式目标说话人提取需以注册语音为条件从混合声中持续提取目标,难点是目标缺席时应保持身份而声学漂移时又需适应,固定状态与启发式更新难以兼顾。本文冻结分离主干与说话人编码器,只学习说话人状态动力学,先以指数滑动平均及其置信门控与oracle活动门控刻画启发式前沿,再提出锚定快权记忆进行闭环元训练。快权记忆以注册向量为锚,用键值增量规则在线写入方向性残差并读出修正后状态,分离器输出被重编码为证据形成自举回路。相比已有方法,关键差异是从控制写入时机转向学习写入内容的方向,使更新能区分目标偏移与干扰污染。在LibriSpeech严重失配评测条件下,AFW记忆的SI-SNRi指标为10.9 dB,高于oracle活动门控启发式的SI-SNRi指标7.9 dB。该结论限于单次改变一因子的受控混合与合成失配族,对未见混响与极长缺席的外推仍有限。其适用边界受限于单因子受控混合,尚未验证未见混响族与极长缺席的外推。推理开销方面,论文报告相对静态条件的实测运行时间差异在5%以内。
🔗 开源资源
- 代码相关资源:https://github.com/ym2976/anchor-fast-weight — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 把四部和声写作变成层图上的最短路:局部谓词如何决定多项式可解性
标签:#符号音乐生成 | #状态空间模型 | #形式化分析 | #音乐 | #理论分析
评分:7.0/10 | 创新 0.8/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 0.5/1.5 | 开源 1.5/1.5 | 可复现 0.5/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:理论研究 | arXiv 原文
👥 作者与机构
- Evan Unit Lim:National Taiwan Normal University
📌 核心摘要
本文处理数字低音考试风格任务,输入为给定低音与数字标记序列,输出为满足音域与和声规则的男高音、女中音与女高音三上声部,难点在于加倍与禁进等规则同时耦合四个声部。先把拼写音高与和弦成员等纵向条件过滤为每拍合法完整和声配置状态集合,该集合直接构成后续分层图的层节点。再把旋律进行与连续五八度等横向条件编码为相邻层之间的允许边并叠加 movement 偏好代价,边的输出即为带权的可行转移集合。最后在该分层构形图上前向动态规划按层保留同终态最优前缀,由前层最优前缀递推出全局最小代价路径。与把音符当独立旅行者的直觉不同,该文把四元组整体当节点从而让联合约束变为普通边权,相对已有和声约束求解的关键机制差异在于显式固定声部数与记忆长度并给出参数化多项式界。在两拍C3–F3任务下,最优实现的总 movement 代价指标为3,低于次优合法voicing的总 movement 代价指标7。结论仅适用于固定声部数与相邻事件规则的模型,不覆盖挂留与长程恢复等需更大记忆的判断。该适用边界意味着超出固定记忆的长程规则尚未验证且模型受限。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 前景语音检测:只跟主讲人,靠监督而不是靠更长记忆学会挑人
英文题目:Foreground Voice Activity Detection: Learning Speaker Selectivity from Supervision
标签:#语音活动检测 | #数据增强 | #流式处理 | #语音 | #基准测试
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Guangzhao Yang:R&D Team, Recho Inc., Tokyo, Japan
- Muhammad Huzaifah:R&D Team, Recho Inc., Tokyo, Japan
- Yu Pan:R&D Team, Recho Inc., Tokyo, Japan
- Jinya Sakurai:R&D Team, Recho Inc., Tokyo, Japan
- Ningjie Bai:R&D Team, Recho Inc., Tokyo, Japan
📌 核心摘要
前景语音活动检测(Foreground VAD,FVAD)以后景中持续占优的前景说话人为唯一正类,输入为连续音频流,输出为 31.25 Hz 逐帧二值判决,单说话人时退化为传统检测。难点是在无注册条件下区分持续占优者与瞬时大声竞争者,且不能依赖能量门限或级联分离标注。首先伪标签流水线用 Silero-v6 对干净话语生成帧标签,再做能量自适应起止精修,把阈值放在局部噪声基底到语音能量之间的固定比例,起止用非对称系数吸收基检测器边界滞后;接着动态增强以 0.2 概率混入 1 至 3 段覆盖 10%至50% 时长的干扰说话人,目标干扰比按语音激活帧计为 0至15 dB,干扰经 DNS-Challenge 房间脉冲响应卷积加 1至4 kHz 随机低通模拟远场,标签保持前景独占,迫使竞争语音学为负类;最后可学习 LEAF 前端接 Mamba 状态空间骨干输出逐帧后验。与注册式个人语音活动检测及能量门限相比,该机制以内生伪注册替代外部嵌入,无需分离前端或说话人分离标注级联。在 Mix-Interference 上全量 Mamba-FVAD 前景 F1 为 0.88至0.92,17 dB 时背景误报率约 0.05,9 dB 时升至约 0.40,显著低于基线超过 0.8 的退化。方法假设每段仅 1 个占优前景,负信噪比语音形噪声与多人轮流情形未解决,延迟摘要称 1至2 ms,正文称 AWS t2.micro 上 11至22 ms,训练硬件与轮数原文未披露。
🔗 开源资源
第三方资源:https://github.com/pirxus/personalVAD — 链接可访问(HTTP 200)
第三方资源:https://github.com/wiseman/py-webrtcvad — 链接可访问(HTTP 200)
第三方资源:https://github.com/amsehili/auditok — 链接可访问(HTTP 200)
第三方资源:https://github.com/jtkim-kaist/VAD — 链接可访问(HTTP 200)
第三方资源:https://github.com/TEN-framework/ten-vad/tree/main/testset — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 只看谱面判乐器:词序列加预训练的取舍与边界
标签:#音乐理解 | #迁移学习 | #音乐 | #数据增强 | #基准测试
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kevin Ji:机构信息未在 arXiv HTML 中可靠披露
- Daniel Yang:机构信息未在 arXiv HTML 中可靠披露
- TJ Tsai:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该任务输入为国际乐谱库计划International Music Score Library Project即IMSLP的独奏乐谱页图像,输出为8类乐器标签,涵盖小提琴、中提琴、大提琴、长笛、单簧管、双簧管、小号、吉他,难点在于单谱表以单声部为主,纵向和声线索稀少且不同乐器音高分布高度重叠。方法链由三段构成,图像到伪乐谱Bootleg Score转换负责抽取填充符头相对谱线位置并形成二值矩阵,分词Tokenization负责把矩阵列映射为语言模型可读序列,语言模型预训练加分类微调负责先学记谱统计规律再学乐器判别边界。相对直接在声学频谱上做卷积或循环分类,该机制差异在于把乐器识别重构为文本分类并复用掩码与自回归预训练,实际意义是可用含伴奏噪声的未标注数据扩大语言建模规模。RoBERTa在片段长度为64的代理任务上经未标注预训练后准确率达到42.9%,显著高于同设置下无预训练的34.5%。叠加训练与测试时移调增强后代理准确率进一步升至58.8%,整页宏F1从0.611升至0.691。结论仅适用于8种主要单声部乐器的独奏页,对多乐器总谱、谱号变化与极端移调的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/HMC-MIR/InstrumentID — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 用非流式大模型的注意力路径重排流式训练序列:对齐、logit 与隐状态三路蒸馏
英文题目:Alignment-Path Distillation from Non-streaming ASR-LLMs for Streaming Speech Recognition
标签:#语音识别 | #知识蒸馏 | #流式处理 | #大语言模型
评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yan Jia:机构信息未在 arXiv HTML 中可靠披露
- Kai Huang:机构信息未在 arXiv HTML 中可靠披露
- Junjie Chen:机构信息未在 arXiv HTML 中可靠披露
- Feng-Long Xie:机构信息未在 arXiv HTML 中可靠披露
- Xu Tang:机构信息未在 arXiv HTML 中可靠披露
- Yao Hu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文针对交错式大语言模型(Large Language Model, LLM)流式语音识别中外部强制对齐(Forced Alignment, FA)与模型自身注意力不一致,导致文本令牌被分到错误音频块的问题,研究输入为分块语音流、输出为增量转写文本的低延迟识别任务。方法冻结非流式教师,取其末层LLM全部注意力头平均并在音频维做Softmax得到文本到音频对齐矩阵,对峰值低于0.30的行以MMS强制对齐分布替换,再经全局单调锚点搜索为每个文本单元选严格递增音频锚点并换算为时间戳,以此构造学生交错训练序列。随后在该序列上联合优化交叉熵、温度为2的逻辑分布(Logit)蒸馏与经辅助解码块变换后的隐藏状态余弦蒸馏,使学生同时学习对齐结构、输出分布与内部表示。与依赖外部CTC对齐的已有交错系统不同,该机制复用教师内生文本到音频注意力作为时序监督,允许跳过冗余音频位置。在AISHELL等6个中英文测试集上,无Logit与隐藏蒸馏时聚合错误率从9.35%降至8.86%,相对降低5.2%;叠加两路蒸馏后从8.12%降至7.80%,相对降低3.9%,完整框架相对无蒸馏FA基线降低16.6%。适用边界是教师注意力可靠且经置信度回退校正的场景,无回退时聚合恶化至11.55%,在WeNetSpeech会议集与LibriSpeech上显著退化,与非流式教师3.99%仍有约一倍差距,且延迟相近但闪烁(Flicker)更高。训练在32卡上进行5轮并联合更新编码器与Qwen2-1.5B,推理仅用因果流式学生,每240 ms音频块最多生成7个令牌。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 冻住检测器再多算一遍:CoReLoop 如何把循环输入做对
英文题目:CoRELoop: Parameter-Efficient Controlled Recurrent Refinement for Audio Deepfake Detection
标签:#音频深度伪造检测 | #LoRA | #语音 | #鲁棒性 | #高效推理
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kunyu Feng:机构信息未在 arXiv HTML 中可靠披露
- Yuxiang Wang:机构信息未在 arXiv HTML 中可靠披露
- Li Wang:机构信息未在 arXiv HTML 中可靠披露
- Wan Lin:机构信息未在 arXiv HTML 中可靠披露
- Zhizheng Wu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频深度伪造检测以原始波形为输入并输出真伪二分类,难点在于合成与转换攻击持续演进导致未见攻击泛化困难。CoReLoop冻结已训练检测器并在首遍保持原预测不变,随后由循环桥基于首遍锚点偏差构造适配循环输入,接着共享编码器在循环特定低秩适配下生成候选状态并经更新门融合,最后由退出桥对齐冻结分类器并由停机头逐样本选择深度。与直接复用编码器输出的朴素循环及单遍适配不同,该方法将输入适配、状态控制与输出对齐解耦,使冻结自监督学习编码器可做受控迭代精炼而不破坏原前向计算。在14个跨域测试集的混合评估中24层模型混合等错误率从4.85%降至3.74%,自适应停机以平均1.18遍达到3.73%。增益主要集中在第2遍,第3遍提升微弱且在不同域上存在修正与回退并存的失败条件,其适用边界受限于原训练数据分布与冻结分类器兼容性。固定多遍推理代价随遍数线性增长,而自适应推理仅增加约18.1%实时率开销即保留大部分收益。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 两个老师教一个流式编码器:在保住健康语音的同时听懂电子喉
英文题目:Multi-Teacher Distillation for Cross-Domain Streaming Electrolaryngeal Speech Encoding
标签:#语音识别 | #知识蒸馏 | #流式处理 | #高效推理 | #言语障碍
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Benedikt Mayrhofer:Signal Processing and Speech Communication Laboratory, Graz University of Technology Dept. of Otolaryngology, Head & Neck Surgery, Div. of Phoniatrics-Logopedics, Speech & Hearing Sci. Lab, Med. Univ. of Vienna Comprehensive Center for AI in Medicine, Medical University of Vienna
- Enrique Orozco Olivares:Signal Processing and Speech Communication Laboratory, Graz University of Technology Dept. of Otolaryngology, Head & Neck Surgery, Div. of Phoniatrics-Logopedics, Speech & Hearing Sci. Lab, Med. Univ. of Vienna Comprehensive Center for AI in Medicine, Medical University of Vienna
- Franz Pernkopf:Signal Processing and Speech Communication Laboratory, Graz University of Technology Dept. of Otolaryngology, Head & Neck Surgery, Div. of Phoniatrics-Logopedics, Speech & Hearing Sci. Lab, Med. Univ. of Vienna Comprehensive Center for AI in Medicine, Medical University of Vienna
- Philipp Aichinger:Signal Processing and Speech Communication Laboratory, Graz University of Technology Dept. of Otolaryngology, Head & Neck Surgery, Div. of Phoniatrics-Logopedics, Speech & Hearing Sci. Lab, Med. Univ. of Vienna Comprehensive Center for AI in Medicine, Medical University of Vienna
- Martin Hagmüller:Signal Processing and Speech Communication Laboratory, Graz University of Technology Dept. of Otolaryngology, Head & Neck Surgery, Div. of Phoniatrics-Logopedics, Speech & Hearing Sci. Lab, Med. Univ. of Vienna Comprehensive Center for AI in Medicine, Medical University of Vienna
📌 核心摘要
电子喉语音因机械激励噪声与单调基频与健康语音严重失配,大型自监督模型零样本迁移失效,任务要求轻量因果编码器输出跨域可用的内容表示并满足流式部署。第一阶段以冻结mHuBERT-147聚类离散音素目标在健康语料上训练学生,学习语言内容结构并经余弦分类器计算交叉熵损失。第二阶段引入电喉微调识别模型的连续瓶颈特征回归,使学生对齐病理教师以恢复电喉可懂度,健康锚点固定且梯度仅流经电喉分支以避免遗忘健康表示。第三阶段利用平行语料上Whisper编码器的动态时间规整路径做显式跨域对齐,将声学 disparate但音素等价的电喉帧向脱离计算图的健康帧拉近。在电喉与健康德语语料下游识别探针上,最优学生电喉词错率(Word Error Rate,WER)为21.2%,相对最强零样本基线WavLM large的39.3%降低约46%,健康域性能基本保持。在电喉与健康德语语料下游识别探针任务下,Mel-Conformer学生的WER为21.2%,低于WavLM large基线的WER 39.3%。该编码器以Mel-Conformer最优,含21.94M参数,在单核CPU的ONNX Runtime下20ms帧同步实时率为0.30,算法延迟为140ms。其显式对齐仅改变几何分布而未进一步提升识别的结论适用边界受限,全部验证仅在德语电喉健康语料完成,跨语言与实时语音转换自然度的外推尚未验证。
🔗 开源资源
第三方资源:https://github.com/iver56/torch-audiomentations — 链接可访问(HTTP 200)
第三方资源:https://github.com/state-spaces/mamba — 链接可访问(HTTP 200)
第三方资源:https://github.com/snakers4/silero-vad — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 能接收多模态不等于会联合推理:MiniMax-H3 物理世界推理的隐式评估
英文题目:Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model
标签:#音视频生成 | #基准设计 | #人类参与评测 | #模型评估
评分:6.6/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Haoyu Zhao:National University of Singapore
- Zihao Zhao:National University of Singapore
- Tianyu Deng:National University of Singapore
- Ziqin Xu:National University of Singapore
- Zihao Zhang:Fudan University
- Xudong Wang:National University of Singapore
- Jinxiang Guo:National University of Singapore
- Chen Gao:National University of Singapore
- Ziyi Ye:Fudan University
- Yeying Jin:Tencent
- Jiaxi Gu:机构信息未在 arXiv HTML 中可靠披露
- Zuxuan Wu:机构信息未在 arXiv HTML 中可靠披露
- Shuicheng Yan:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是检验全模态生成模型能否从各自不完备但互补的多模态观测中推断潜在物理事件,并以视频延续或编辑形式输出,难点在于文本提示故意隐去关键语义且单模态证据欠定。方法是构建隐式条件提示对的评测流水线:采集图像、视频与音频并构造跨模态互补的输入,经10轮专家评审保证场景复杂度与条件对齐,再以MiniMax-H3为被测床生成视频并由3名专家按任务语义准则判定成功。与提示显式描述目标的VBench和WorldModelBench相比,关键差异是要求模型先建立跨视角对应与声视关联以补全缺失语义,而非忠实渲染已知描述。在517个实例的人工评测任务下,MiniMax-H3在视频决策推理场景的成功率为56.00%,高于音频消歧场景的成功率27.40%,总体成功率为41.97%。结论仅适用于所覆盖的4类29个子类的家庭操作与视听场景,外推至开放物理常识与长时因果仍未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/gulucaptain/MiniMax-H3-Reason — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 总体偏好裹挟维度打分:直播语音评测如何把四个韵律维度拆开判
英文题目:Multi-Dimensional Prosody Judgment For Live Streaming Speech Synthesis
标签:#语音质量评估 | #知识蒸馏 | #韵律 | #语音 | #强化学习
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zifan Guan:机构信息未在 arXiv HTML 中可靠披露
- Longyu Lu:机构信息未在 arXiv HTML 中可靠披露
- Junan Zhang:机构信息未在 arXiv HTML 中可靠披露
- Zhizheng Wu:机构信息未在 arXiv HTML 中可靠披露
- Meiguang Jin:机构信息未在 arXiv HTML 中可靠披露
- Junfeng Ma:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
直播带货语音合成要求对同一转写文本的两段候选音频做成对韵律优劣判断,难点在于流利度、语调、情感、直播表现力等高表达力差异细微,且名义多维打分易坍缩为总体偏好。该工作先以双序一致蒸馏把 Gemini-3.1-pro-preview 的判断迁入 Qwen3-Omni 得到耦合基线直播韵律评测器 Live-ProsodyJudge,简称 LPJ,再以分维独立查询重建监督并在监督微调中屏蔽不确定配对维度,最后以跨度局部组相对策略优化将各维优势只回传至对应论述片段,得到解耦版本 Decoupled-Live-ProsodyJudge,简称 D-LPJ。相对广播总体奖励的做法,关键机制差异在于取消总体结论目标并实现分维信用分配,使各维可输出不一致 verdict 而非盲从总体胜者。在T4测试集下,LPJ v1+GRPO十样本均衡顺序的准确率为83.50%,高于Gemini-3.1-pro-preview单次调用的准确率58.00%。在维度标签测试集下,D-LPJ跨度局部GRPO十样本均衡顺序的准确率为86.10%,高于SFT基线的准确率84.10%。在400组Best-of-8采集中经双标注者有序前三一致筛选保留的136组高置信子集上,锦标赛胜者落入人类前三的比例为85.29%。该结论仅适用于高表达直播风格与四个常评核心维度,稀疏条件维度与向量奖励驱动合成器优化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 一个因果音频到脑电模型如何同时复现脑干、皮层与双耳整合响应
标签:#音频理解 | #CNN | #脑信号 | #严格因果
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Thomas J Stoll:机构信息未在 arXiv HTML 中可靠披露
- Ross K Maddox:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是以双耳声波形为输入直接预测连续高采样头皮脑电,难点在于统一脑干毫秒级瞬态与皮层数百毫秒慢波的多尺度、多发生源映射。因果滤波器组先将40 kHz波形转为对数压缩时频表示并降采样至5 kHz,其输出送入九层因果WaveNet编码器提取长时依赖。编码特征经四层1×1卷积瓶颈压缩为16维潜在神经成分,再经蒙太奇特异空间投影与被试条件映射为多导联脑电。训练期并行线性伪迹通路吸收刺激锁定电磁伪迹并与神经预测相加,评估期关闭该通路,且损失先求时域误差再取对数STFT以同时惩罚相位与幅度,避免低频主导。在pABR 2000 Hz评测条件下,模型预测的Pearson相关为0.944,高于人类被试均值的Pearson相关0.84±0.08。结论限于年轻正常听力人群与已见刺激大类内的群体预测,未验证年龄、听损外推与个体化条件效果。原文未披露训练推理成本与代码权重数据链接。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 只看等错误率会误判匿名语音:五维泄漏评估如何拆开隐私与可懂度
英文题目:Beyond EER: Multi-Dimensional Evaluation of Information Leakage in Speaker De-Identification
标签:#说话人匿名化 | #评测协议 | #隐私保护 | #说话人验证 | #语音属性识别
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Seungmin Seo:Contractor Associate, National Institute of Standards and Technology, Gaithersburg, MD, USA;Chakra Consulting Inc., Clarksburg, MD, USA
- Oleg Aulov:机构信息未在 arXiv HTML 中可靠披露
- P. Jonathon Phillips:机构信息未在 arXiv HTML 中可靠披露
- Kevin Mangold:机构信息未在 arXiv HTML 中可靠披露
- Jonathan Eskin:National Institute of Standards and Technology, Gaithersburg, MD, USA
📌 核心摘要
说话人去标识输入为携带身份与人口统计线索的语音,输出为保持可懂的匿名语音,难点是单一验证指标无法暴露属性残留与结构相似导致的错误安全感。方法链分四步:先在Mixer 3、Mixer 6、Mixer 7多口音电话访谈语料上构造五类试次,区分攻击抵抗与伪身份一致性;再用四个说话人识别后端测等错误率并聚合伪身份画像,其输出进入下一步属性与结构分析。接着用冻结VoxProfile作零样本属性攻击计算软生物泄漏分数并做图库检索与典型相关及普氏对齐,其结果与识别结果共同进入可懂度评估;最后用双自动语音识别系统测词错误率与语义相似度以量化隐私效用代价。相对VoicePrivacy以验证为中心的范式,关键差异是把人口统计可预测性、图库检索秩与嵌入几何线性可预测性纳入同一比较口径,其实质是将不可链接与不可逆作为独立维度检验。在Mixer多口音电话访谈评测设置下,PHORTRESS的WER为0.70,高于VOXLET的WER 0.24。结论仅适用于闭集英语与西班牙语及印地口音英语电话访谈场景,未验证开放集与自适应攻击,未做主观自然度听测。该结论适用边界受限于闭集电话访谈场景,开放集与自适应攻击等外推尚未验证。原文未披露训练、推理与部署成本
🔗 开源资源
- 第三方资源:https://www.iarpa.gov/research-programs/arts — 链接不可用(HTTP 403)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 不抢前端的麦:用委派记号把工具调用交给后端大模型
英文题目:A frontend-backend architecture for tool calls in full-duplex speech models
标签:#全双工语音交互 | #模型融合 | #语音 | #流式处理
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Ke Hu:机构信息未在 arXiv HTML 中可靠披露
- Slyne Deng:机构信息未在 arXiv HTML 中可靠披露
- Chen Chen:机构信息未在 arXiv HTML 中可靠披露
- Elena Rastorgueva:机构信息未在 arXiv HTML 中可靠披露
- Edresson Casanova:机构信息未在 arXiv HTML 中可靠披露
- Punit Kumar:机构信息未在 arXiv HTML 中可靠披露
- Dharmendra Choudhary:机构信息未在 arXiv HTML 中可靠披露
- Nikhil Srihari:机构信息未在 arXiv HTML 中可靠披露
- Ameya Sunil Mahabaleshwarkar:机构信息未在 arXiv HTML 中可靠披露
- Viet Anh Trinh:机构信息未在 arXiv HTML 中可靠披露
- Slim Essid:机构信息未在 arXiv HTML 中可靠披露
- Oluwatobi Olabiyi:机构信息未在 arXiv HTML 中可靠披露
- Zhehuai Chen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音到语音交互要求在用户说话的同时监听、抢答与被打断,而工具调用又需精确参数解析与多轮状态追踪,两者在建模容量与时延上冲突。先由双工语音到文本前端接收用户语音编码、智能体文本与流式识别文本,负责交互与委派判决,检测到工具需求时输出委派标记与安抚话术并保持静默监听。再将端点检测后的流式识别文本送入基于LangGraph的后端文本大模型,由其维持多轮状态并执行工具调用与推理,输出自然语言结果。最后把后端结果经预填充注入前端智能体文本通道,前端逐字复述该文本并经流式语音合成播报,之后恢复常态双工行为。与把工具建模进音频通道的原生方案不同,该机制仅增加工具调用控制标记,几乎不占用前端建模容量并保持原有打断与轮转行为。在BFCL单轮评测下,Ours-7B-intASR的平均分数为71.7,高于Ultravox-v0.6 Llama-3.1-8B的平均分数43.3。该结论适用边界限于单轮与中等长度多轮语音任务,在6步以上工具链与强噪声口音下仍会退化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://huggingface.co/spaces/frontend-backend-duplex/demo — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 年轻听众能分开的增强差别,为何在年长听众组平均中变平
标签:#语音质量评估 | #主观评测 | #语音增强 | #助听器 | #言语感知
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Matteo Torcoli:机构信息未在 arXiv HTML 中可靠披露
- Chih-Wei Wu:机构信息未在 arXiv HTML 中可靠披露
- Andrea Esposito:机构信息未在 arXiv HTML 中可靠披露
- Phillip A. Williams:机构信息未在 arXiv HTML 中可靠披露
- Katrien Cambier:机构信息未在 arXiv HTML 中可靠披露
- William Wolcott:机构信息未在 arXiv HTML 中可靠披露
- Antonio Curci:机构信息未在 arXiv HTML 中可靠披露
- Nicholas S. Reed:机构信息未在 arXiv HTML 中可靠披露
- Mark Laureyns:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文研究语音增强(Speech Enhancement,SE)系统输出的语音质量(Speech Quality,SQ)如何被不同年龄与听力损失程度的听众感知,输入为带真实背景的自然影视对白片段,输出为0到100绝对质量分,难点在于年轻正常听力人眼中显著的系统差异能否外推到老年人。方法链分三步:先按年龄与参考听力图将被试分为30-N0与60+N0到N3共5组,再用9种条件含4种核心SE系统与3种助听器模式及2个锚点收集评分,最后以线性混合效应模型分离条件与年龄听损交互并拟合个体收缩斜率。与以往只招募年轻正常听力人或只关注可懂度的工作不同,本文引入老年大样本与生态化影视对白及个体斜率建模,揭示感知压缩而非单纯整体下移。在4种核心SE系统两两对比条件下,30-N0组最大EMM对比的得分为21.9分,高于任一60+组最大对比的得分8.4分。结论仅适用于输出信噪比不低于11 dB的高信噪比影视类材料与绝对评分范式,未验证母语材料、低信噪比与直接比较法的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 攻击者数据与架构谁更难:持续学习下伪造音频检测的受控拆解
标签:#音频深度伪造检测 | #持续学习 | #语音 | #模型比较
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yixuan Xiao:机构信息未在 arXiv HTML 中可靠披露
- Ngoc Thang Vu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
伪造音频检测输入为待判语音波形或声学特征,输出为真伪二分类结果,现实难点在于文本转语音与语音转换技术持续演进导致测试分布不断漂移。作者构建持续学习框架,先在ASVSpoof 2019 LA上训练基座检测模型,再按任务序列依次适配,每个新任务仅含单一已知架构与已知训练数据的攻击者及已知多样性的真音频,前序任务模型作为下一任务起点并叠加防遗忘约束。该工作对比轻量到重量级的Light CNN、ResNet与wav2vec2AASIST三种检测模型及直接微调、单类分类、随机回放与不遗忘学习四种训练策略,以分离模型容量与策略效应。与以往把整库视为任务并混合多种攻击因素的做法不同,该设计将攻击者训练数据、攻击者架构、任务顺序和说话人多样性解耦为可独立操纵变量。在包含19个攻击者任务的持续学习评测设置下,相同训练数据不同架构子集条件的平均错误率在不超过2个任务后接近零错误率,低于不同训练数据相同架构子集条件下在T6处仍偏高的平均错误率。趋势上任务顺序与说话人多样性对不同模型策略影响不一致,随机回放整体更稳健,而不遗忘学习在小模型上对顺序敏感、单类方法在大模型与高多样性下不稳定。结论适用边界受限于仅验证英语有声书域与上述模型策略组合,尚未验证重放攻击、跨信道与多语场景的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/XIAOYixuan/tomatoDD/tree/icassp25-cl-factors — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
31. 只传内容不传声音:DECAF 把压缩本身做成匿名化
标签:#语音编码 | #向量量化 | #说话人匿名化 | #隐私保护
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Md Shakhrul Iman Siam:机构信息未在 arXiv HTML 中可靠披露
- Dushyant Sharma:机构信息未在 arXiv HTML 中可靠披露
- Stanislav Yu. Kruchinin:机构信息未在 arXiv HTML 中可靠披露
- Peter Skala:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为需经云端传输与存储的原始语音,输出为剥离说话人音色但保留语言内容的重建语音,难点在于极低码率下同时满足抗说话人验证攻击、可懂度与传输效率。说话人解耦模块(Speaker Disentangler Module,SDM)先将自监督表示压缩为低维内容嵌入并附加联接时序分类(Connectionist Temporal Classification,CTC)约束,再由神经音频编解码器(Neural Audio Codec,NAC)仅对该内容流做残差向量量化(Residual Vector Quantization,RVQ)与传输,最后接收端用预共享的规范说话人嵌入驱动波形生成器重建。与先匿名化再编码的两段式管线不同,该设计以瓶颈维度从架构上限制可透传的说话人信息且只付一次带宽代价。在LibriSpeech test-clean与test-other上,0.5 kbps的DECAF-small相对最优匿名化基线Spk Anon规范模式将微调后词错误率(Word Error Rate,WER)从8.22%降至5.49%,相对降低33.2%,同时等错误率(Equal Error Rate,EER)均值达43.48%。该结论限于英语朗读语音、ECAPA-TDNN攻击者与Whisper-medium评测条件,未验证跨语言、自发对话、强自适应攻击或内容层身份泄露。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
32. 矛盾本身就是信号:用差异建模识别犹豫与矛盾
英文题目:Modality Discrepancy Transformer for Ambivalence and Hesitancy Recognition
标签:#语音情感识别 | #Transformer | #多模态学习 | #LoRA | #音视频
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Shiyu Luo:机构信息未在 arXiv HTML 中可靠披露
- Yu Wang:机构信息未在 arXiv HTML 中可靠披露
- Jiawen Huang:机构信息未在 arXiv HTML 中可靠披露
- Zhaoxiang Xiao:机构信息未在 arXiv HTML 中可靠披露
- Chenxi Huang:机构信息未在 arXiv HTML 中可靠披露
- Qi Zhang:机构信息未在 arXiv HTML 中可靠披露
- Bin Liu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
矛盾与犹豫识别输入为临床视频及其音频与转录文本,输出为视频级二分类标签,难点在于阳性由跨通道矛盾定义而非一致情绪表达,常规融合放大一致性反而会抑制关键证据。该方法先用三个冻结编码器提取视听文嵌入并经软注意力池化为全局向量,再由文本经特征线性调制对视听嵌入做通道级缩放与平移,接着构造绝对差与哈达玛积投影两类成对差异特征。九个 token 送入两层 Transformer 自注意力建模模态与差异关系,全模态头与文本辅助头在训练时联合优化并在推理时加权融合。在 BAH 标注测试集上全模型 Macro F1 达到 0.7408,超出最强已发表基线 10.7 个点,且私有集保持相近水平,表明差异建模与参数高效适配改善了小样本下的类别校准。结论仅适用于视频级弱标签与参与者无关划分下的英语临床访谈场景,未验证细粒度时序定位与跨文化跨病种外推。训练在单张 RTX 4090 上约 20 分钟收敛,推理需多窗口平均,原文未披露延迟与吞吐等部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
33. 先取证再打分:E-AVI 把面试录像变成可核查的证据池
英文题目:E-AVI: Evidence-Grounded Multimodal Assessment for Automated Video Interviews
标签:#音视频理解 | #多模态学习 | #音视频 | #注意力机制 | #可解释性
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Haoshen Wang:机构信息未在 arXiv HTML 中可靠披露
- Dongbo Che:机构信息未在 arXiv HTML 中可靠披露
- Zeyi Xie:机构信息未在 arXiv HTML 中可靠披露
- Yuanjie Du:机构信息未在 arXiv HTML 中可靠披露
- Shicheng Hua:机构信息未在 arXiv HTML 中可靠披露
- Xingyu Wang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动视频面试(Automated Video Interview, AVI)需从视频、音频与转录文本预测多维表现分,难点是流利解释常与录像脱钩且不参与打分。本文提出 E-AVI,先以教师蒸馏的统一抽取器生成带时间戳的结构化多模态证据,再用维度条件注意力(Dimension-conditioned Attention)联合检索证据嵌入与源级多模态嵌入完成各维度回归,同一证据池被缓存复用于反馈生成与追问问答。与直接映射到分数的微调多模态基线相比,该设计把可读支撑变成参与预测的显式记忆并接受弱注意力监督。在 RecruitView 公开集上相对最强微调基线 MiniCPM-o-9B 的斯皮尔曼秩相关(Spearman’s rho)从 0.440 提升至 0.541,平均绝对误差(Mean Absolute Error, MAE)从 0.641 降至 0.607;在 101 名员工的私有酒店集上 MAE 为 0.503,rho 为 0.639。证据瓶颈仍集中在抽取正确性与完备性,困难残差分析中 83.3%案例归因于抽取阶段,私有集跨站点泛化尚未验证,适用边界受限于抽取器跨域迁移与小规模私有测试集。推理开销方面,单卡批量为1且模型预加载时抽取延迟约需15秒,问答复检延迟约需18秒,硬件约需28GB显存,打分本身仅约需0.01秒。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
34. 单语能分开慢阻肺,换语言就失灵:用疾病方向一致性筛出 26 个跨语言声学特征
标签:#病理语音评估 | #统计分析 | #跨语言 | #语音 | #语音生物标志物
评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Roksana Khanom:机构信息未在 arXiv HTML 中可靠披露
- Raghib Asfak Tasnim:机构信息未在 arXiv HTML 中可靠披露
- Bodrun Nahar Bithi:机构信息未在 arXiv HTML 中可靠披露
- Shafia Shirin Supty:机构信息未在 arXiv HTML 中可靠披露
- Saiful Islam Raju:机构信息未在 arXiv HTML 中可靠披露
- Ashok Agrawala:机构信息未在 arXiv HTML 中可靠披露
- Nirupam Roy:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理自发语音到慢性阻塞性肺疾病状态映射,输入为英语与孟加拉语自然对话录音,输出为受试者级患病判别,难点在于病理声学变化与语言相关音系韵律变化相互混叠。跨语言疾病对齐框架先将双语录音统一为相同272维声学表示,再在每种语言内独立估计有符号秩二列疾病效应并计算语言不变性得分,最后仅保留方向一致且双语均有强度的26维特征子空间用于跨语言分类。与追求单语判别力的传统筛选不同,该机制以病理方向稳定性为选择标准,直接剔除跨语言极性反转维度,因而更强调病理而非语言变异。在英语到孟加拉语转移评测设置下,26维对齐表示的AUC为0.825,高于全量272维特征的AUC 0.663。该表示同时在反向转移中保持优势并分离出133维符号反转负对照子集,目标留出验证进一步支持对未见目标说话人的泛化。该结论适用边界受限于双语双队列与逻辑回归验证,尚未验证可外推至更多语言、采集设备与疾病严重程度分层。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
35. 不换单个检测器,而是让智能体在扰动下现搭检测流水线
英文题目:Robust Workflow Generation via Adversarial Learning for Audio Deepfake Detection
标签:#音频深度伪造检测 | #对抗训练 | #鲁棒性 | #大语言模型
评分:5.7/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xiang Li:机构信息未在 arXiv HTML 中可靠披露
- Pin-Yu Chen:机构信息未在 arXiv HTML 中可靠披露
- Wenqi Wei:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频深度伪造检测输入为待验语音波形,输出为真伪二分类标签,难点在于噪声、压缩、滤波与神经编解码等真实传输退化会导致单检测器显著失效,且不同检测器在不同声学条件下各有所长。所提ROGUE将工作流生成建模为扰动下的序列决策,分三步衔接:第一步由扰动智能体在扰动工具集上维持可学习分布W并采样主导变换生成退化音频x’=p(x);第二步由大语言模型策略控制器接收退化音频与历史工具观测逐步选择下一个检测工具或终止,按轻量粗筛、谱特征分析、时谱建模到基础模型精判的由粗到精顺序执行,前步观测并入下步状态;第三步由f_LLM综合全部观测判决,以正确示性减计算代价为奖励。两智能体按最大最小目标交替优化,扰动方以1-R暴露短板,策略方在最坏扰动批量上学习自适应编排。与固定多检测器流水线和仅在干净样本优化的DSPy流程相比,关键差异是将鲁棒性从单模型增强提升为工作流级自适应编排。在 WaveFake 测试划分的 15 种扰动评测中 GPT-5 版 ROGUE 平均准确率达 0.91,超越 DSPy 的 0.88 和 DF_Arena_1B_V1 的 0.89,尤其在 EnCodec 上达 0.67,较 HuBERT 的 0.56 提升明显。跨数据集干净评测平均为 0.95,高于 DSPy 的 0.92 但低于 DF_Arena 系列的 0.97,在 CodecFake 上 0.87 对 DSPy 的 0.78 提升约 9 个百分点。该结论限于 WaveFake 训练、固定阈值准确率与所列扰动,未验证开放域自适应攻击、阈值无关指标与显著性。原文未披露训练推理成本与代码权重。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
36. 从测到的声音倒推乐器本身:十类逆问题的统一分类与难点
英文题目:Inverse Problems in Musical Instrument Modeling: A Structured Taxonomy and Review
标签:#音乐理解 | #文献综述方法 | #音乐 | #声场重建
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后 50% | 文档类型:综述 | arXiv 原文
👥 作者与机构
- Xinmeng Luan:机构信息未在 arXiv HTML 中可靠披露
- Gary Scavone:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文输入为乐器声压与振动观测及描述波传播的物理正向模型,输出为覆盖机械参数、几何形状、阻尼损耗、边界条件、模态激励等十类隐变量的统一分类体系,难点在于传递与传播算子病态且对测量噪声高度敏感致使直接求逆不稳定。本文先以正向传播算子求逆与正则化约束为公分母建立统一分析框架,再按十个任务逐一切分文献并归纳各任务观测类型与求逆目标及其典型求解思路,最后串联近场声全息与波分离等任务间重叠关系并以管弦乐器实例形成综述闭环。与既有按乐器家族组织的分散式乐器声学综述相比,该文以任务导向分类替代乐器导向组织,关键机制差异在于揭示不同反问题共享的病态机制与稳定化需求,其实质意义在于为建模合成与设计优化提供可导航的文献框架。在覆盖十类反问题任务的综述基准设置下,本文分类框架的任务覆盖指标为10类,高于既有按乐器家族组织的分散综述的任务覆盖指标0类。结论仅适用于概念组织与文献导航,不支持方法选型优劣或性能外推,跨乐器与跨测量条件的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


![原论文 Figure 1:An example of a word lattice (adapted from \\[17\\]).](https://arxiv.org/html/2609.19805v1/lattice.png)


















